词汇篇:从眼熟到在真实任务中调用
最早维护这份指南时,我也喜欢收集词表。列表每增加一页,进步仿佛就多了一层可以看见的刻度。可语言不会因为被收藏而在需要时自动出现。真正到了邮件、会议、代码评审或一次艰难的解释里,人缺的往往不是“见过这个词”,而是能否在有限时间里选对义项、搭配、语气和责任。
比如 delay、block、risk 都可以出现在项目更新里,却不是同一件事。一个任务已经停住、可能受影响,还是只是比计划晚,决定了谁需要行动、何时升级、是否等待。句子即使语法正确,词选错了,协作仍会走向错误的决定。
所以,词汇量不是仓库盘点。词汇能力是:在真实输入里认出一个表达,在上下文中判断它此刻的意思,在需要时迅速调用,并让另一个人据此理解、回应或继续工作。
本章给出一条可追踪的路径:先保存不查词的首遇样本,再决定哪些词应该放过、推断、查证或学习;把声音、词形、义项、搭配、语域和概念分开核对;最后撤掉原句与卡片,在新主题、新模态和真实任务里复测。
本章速览
- 先定义真实任务,不用孤立词汇量替代场景能力;
- 保存首遇基线,区分“不认识词”和“认识却没有解析句子”;
- 对未知项做放过、推断、速查、学习或专业核验的决定;
- 把词形、声音、当前义项、搭配、语法行为、语域和概念分别学习;
- 用无提示回忆、限时调用和真实受众结果验收,而不是看答案后的熟悉感;
- 让间隔随错误和使用结果调整,不把固定日期冒充记忆定律;
- 用词典、语料、现行文档与领域人员核对 AI 生成的候选;
- 十四天只追踪一个主题、一个首遇样本和一次平行任务。
1. 先定义任务,不先追求总量
“扩大词汇量”不能告诉你今天该学什么。先写清楚语言将在什么条件下工作:
| 任务 | 需要的词汇能力 | 可观察结果 |
|---|---|---|
| 听会议 | 在自然语速里切分关键词块与责任关系 | 能复述决定、风险、负责人和期限 |
| 读文档 | 识别当前版本里的术语、动作和限制 | 能完成最小验证并指出来源位置 |
| 口头解释 | 在时间压力下调用合适的词块并修复 | 听众能复述主旨,不靠稿件猜测 |
| 写邮件 | 选择准确义项、搭配与关系语气 | 收件人知道要做什么、何时回应 |
| 参加考试 | 按题型辨认或产出规定范围 | 在新题中完成,而不只认出旧卡 |
同一个人可以读懂某领域的术语,却在会议里叫不出来;也可以会说日常词,却无法分辨合同中的近义项。先确定受众、材料、时间限制、允许工具和完成标准,才知道该测接受还是产出、广度还是精度。
使用词汇证据卡,把任务、首遇、查证、调用、反馈和延迟迁移放在同一页。
2. 保存一次未经修饰的首遇
选择一份与你真实任务相近的材料:150-300 词短文、60-90 秒音频、一封邮件、一段接口文档或一次简短说明。先记录允许的字幕、词典、翻译、搜索和 AI,然后在不查词的条件下完成第一次输入或输出。
材料、版本与来源:
真实任务与完成标准:
首遇时间与时限:
允许的帮助:
我理解的主旨、关系和下一步:
我确定的词块:
让我停住的原句/时间段:
我当时如何处理未知项:不要立刻把所有失败归因于词汇。一个句子可能因为声音没有切分、句法范围不清、背景知识不足、版面复杂或注意力下降而失败。把原始填空、复述、录音或写作样本留下,后面才知道查词究竟改变了什么。
首遇基线也不是羞耻清单。它只是回答:在工具介入前,哪些意义已经到达,哪些地方需要猜,哪个词真正阻断了任务。
3. 为未知项做五种决定
不是每个生词都值得进入长期复习。读到或听到未知项时,先决定:
| 决定 | 适用条件 | 最低记录 |
|---|---|---|
| 放过 | 不影响主旨、决定和安全,只是一次性细节 | 为什么可以跳过 |
| 语境推断 | 有足够句法、对比、例子或上下文线索 | 候选义项与置信度 |
| 快速查阅 | 阻断当前理解,但未来使用价值低 | 当前义项与来源 |
| 主动学习 | 重复出现、任务关键,未来两周会使用 | 声音、搭配、检索线索与复测 |
| 专业核验 | 涉及安全、法律、医学、财务、版本或业务责任 | 一手定义、适用范围与责任人 |
先推断再查证,可以练习上下文判断;但不要为了“坚持不查词”牺牲安全和事实。低风险阅读可以容忍不确定,高风险操作必须回到现行的一手文档或合格人员。
一轮只选 5-8 个高价值词块进入主动学习。选择依据不是它看起来高级,而是:它反复出现、阻断任务、能和已有语言连接,并且很快有调用场景。
4. 一个词至少包含八个问题
“英文 = 中文”只记录了一个候选对应。更完整的词汇知识包括:
| 维度 | 要问的问题 | 例子或证据 |
|---|---|---|
| 词形 | 怎样拼写、屈折和派生? | analyse → analysis → analytical |
| 声音 | 重音、音素和连读里怎样出现? | 无字幕听出并定位 |
| 当前义项 | 它在这句话里到底指什么? | 用自己的话解释,不罗列全部释义 |
| 搭配/词块 | 它通常与哪些词共同完成意思? | pose a risk to, meet a deadline |
| 语法行为 | 后面接什么结构,谁能作主语? | 原句与一个结构对比 |
| 语域与语用 | 正式度、礼貌、立场和身份是否合适? | kids / children / minors |
| 概念与指代 | 现实中所指对象或制度是否真的相同? | 版本、领域定义或反例 |
| 调用条件 | 多久能想起,需不需要首字母或原句? | 限时无提示说写 |
词族是估算工具,不是自动掌握。help, helps, helped, helpful, helpless 可以在某些研究里归为一个词族,学习者却未必知道每个派生形式的意义、搭配和语气。专业领域里的缩写、接口名和固定表达更需要按当前版本核对。
词也很少独自工作。优先学习能够承担任务的组合:搭配、句块、构词关系、句型槽位和语域对比。它们减少现场重新拼装的负担,却仍需要在新句子中保持可变,而不是整段背稿。
5. 义项不是列表中的第一行
多义词最容易制造“明明认识却读错”的错觉。查词时先保留原句,再比较:
原句与位置:
我第一次推断的义项:
词典中符合当前句法与语境的义项:
支持它的搭配、例句或反例:
若换成近义词,责任、确定性或语气怎样改变:不要把词典第一页的中文释义机械搬进每个场景。学习者词典适合看常见义项、发音、语法标记、搭配和例句;真实语料可以检查表达是否在相似场景出现;技术名词则应回到当前官方文档、标准或代码。
翻译可以帮助比较,但要警惕一个母语词覆盖多个英文概念,或两个制度词看似对应却适用范围不同。高风险文本中,“大致同义”不是可接受的验收标准。
6. 接受性词汇不等于产出性词汇
接受性阅读是看到后理解,接受性听力是声音出现时切分并理解;产出性口语和写作则要求在没有答案展示时主动调用,并处理词形、搭配与语域。
Webb(2008)使用相互对应的接受性与产出性翻译测试研究二语学习者,报告接受性词汇规模总体大于产出性规模,而且在较低频词段,完整知识评分下的差距扩大。它说明“看见会认”不能直接推成“需要时会用”,但具体差距仍受到测试形式、评分、学习者和词频范围影响。
把一个新词块从接受推向产出,可以经过四步:
- 在原句中解释当前义项;
- 合上原句,根据情境线索完成填空或复述;
- 保留功能,改变人物、时间、主题或语气;
- 在真实邮件、会议、说明、代码评审或对话里调用,并观察对方反应。
若只能复现训练句,不算迁移;若能表达意思却搭配生硬,说明概念已到达但形式仍需修复。把错误定位到具体维度,不要一律写成“没背熟”。
7. 正确理解覆盖率数字
旧版曾写“1000 词理解 75%”“7000 词接近 90%”。这些无条件等式混合了计数单位、语料、模态和“理解”的定义,本版不再保留。
词汇研究常讨论 95% 和 98% 的运行词覆盖率。作为直觉,95% 约等于每 20 个词有 1 个未知项,98% 约每 50 个有 1 个;但未知项是否集中在关键位置、背景是否熟悉、句法是否复杂,会显著改变实际难度。
Schmitt、Jiang 与 Grabe(2011)让来自 8 个国家的 661 名参与者阅读两篇文本并完成词汇与理解测量,发现已知词比例与理解大致呈线性关系,没有出现某个比例之后理解突然跃升的明确阈值;作者认为 98% 是学术文本更合理的目标。它是群体关系,不是个人通行证。
Nation(2006)基于英国国家语料库构建的 1000 词族列表,并在“无辅助理解需要 98% 覆盖”的前提下,估计书面文本约需 8000-9000 词族、口语文本约需 6000-7000 词族。数字依赖词族定义、语料和前提,不能直接变成所有学习者、领域和任务的统一目标。
覆盖率适合帮助选材料:未知项太密且每个都关键,就降低难度、缩短文本或补背景;大多数未知项不影响主线,则继续阅读,不必把每页变成词表。
8. 高质量词卡只测试一个决定
卡片正面应要求回忆,而不是重新阅读答案:
场景:项目依赖可能影响进度,需要表达“构成风险”。
留空:The dependency may ____ a risk to the schedule.背面保留:
pose a risk to与可靠来源位置;- 当前义项、发音、词性和语域;
- 自己的第二个场景;
- 一个易混表达及差异;
- 下次复测要撤掉的提示。
卡片过长会把复习重新变成阅读。若一次失败同时涉及发音、义项和搭配,拆成不同线索;若一张卡永远靠原句才答对,改用更接近真实任务的提示。
双向翻译卡可以是起点,却不应是终点。真实调用需要从意图、场景或对象走向表达,而不是永远从另一个语言标签开始。
9. 让间隔服从表现
遗忘是真实的,不存在适合所有词和所有人的固定“记忆曲线日历”。可以在当天、第 1 天、第 3-7 天、第 14 天和第 30 天设置检查点,再根据证据调整:
- 秒答且能在新句中准确使用:延长间隔;
- 回忆费力但正确:保持或小幅延长;
- 义项或近义词反复混淆:增加对比与反例;
- 听不出但看得懂:加入无文字音频线索;
- 卡片答对但真实任务用不出:暂停新增,改做限时说写;
- 连续失败:拆卡、降低数量,或补概念、声音和背景;
- 已不再与任务相关:归档,不因“沉没成本”永久复习。
Webb、Yanagisawa 与 Uchihara(2020)的元分析纳入 22 项研究、100 个效应量,考察词卡、词表、写作和填空等有意词汇活动。摘要报告即时意义/形式回忆平均增益为 60.1%/58.5%,延迟测验降至 39.4%/25.1%,不同活动结果差异很大。它支持“有意练习可能有效,也会遗忘”,不支持任何卡组、间隔或个人结果的保证。
Anki 可以执行间隔安排,但工具不是方法本身。卡片数量、连续打卡和成熟词数只有在能够改变“继续、拆分、迁移或停止”的决定时才值得记录。
10. 用错误决定下一轮练习
每次低分先分类:
| 错误 | 可能缺口 | 下一次最小修复 |
|---|---|---|
| 看不出词形 | 拼写、派生或屈折 | 标词根和词性,放入新句 |
| 听不出 | 音素、重音、连读或边界 | 对照短音频,再撤掉文字 |
| 义项误判 | 只记第一义或忽略上下文 | 做义项对比与反例 |
| 搭配生硬 | 只学孤立词 | 学完整词块并查相似语料 |
| 语域不合 | 忽略关系、正式度或立场 | 同一意图写两种受众版本 |
| 调用过慢 | 线索与真实意图不匹配 | 设 3-5 秒情境提示并口头回答 |
| 迁移失败 | 依赖原句、主题或模态 | 换主题、声音或任务重新产出 |
让真实读者或听众先复述收到的意思,再讨论“是否自然”。词汇反馈应区分会改变事实或关系的必要修复、可以接受的变体、语域选择和个人风格。不是每个更像母语者的表达都更适合作者和场景。
11. AI 可以生成候选,不能替词负责
AI 适合:按情境生成填空、比较近义表达、模拟不同受众、提供反例、把错误分类、生成平行任务。使用顺序:
- 先保存首遇和自己的候选;
- 让 AI 说明每个建议改变了哪一层意义;
- 要求标出不确定、地区或语域差异;
- 回到词典、真实语料、现行文档或领域人员核验;
- 关闭 AI,在新情境中限时调用;
- 记录采纳、拒绝与理由。
模型可能生成并不存在的搭配、错误词源、伪造引语或过时的技术定义。不要把客户数据、未公开文档、考试答案或无权限的第三方内容交给模型。高风险术语由当前一手来源和责任人裁决。
12. 技术词表是索引,不是课程
本仓库的词表用于从任务进入,不是每天必须完成的数量目标:
| 词表 | 任务入口 |
|---|---|
| Common | 日常沟通与跨主题工作 |
| Prompt | AI 任务、限制和验收语言 |
| Vibe Coding | 代理协作与代码审查 |
| JavaScript | 浏览器、前端与异步流程 |
| Python | 数据、自动化和脚本 |
| Go | 服务端、并发与部署 |
| Java | JVM 与企业系统 |
| PHP | Web 后端和旧系统维护 |
| Rust | 所有权、性能与系统编程 |
| Swift | Apple 平台与应用开发 |
从当前任务选 5-8 个词块,记录文档版本与来源;脱离列表完成一次说写;一周后在平行任务里复测。语言、框架和产品会更新,列表不能替代官方文档或当前运行结果。
13. 一个 35 分钟训练单元
- 5 分钟:写清真实任务、受众、材料和完成标准;
- 7 分钟:完成不查词的首遇或无提示输出;
- 6 分钟:为未知项决定放过、推断、查阅、学习或核验;
- 7 分钟:核对 5-8 个词块的义项、声音、搭配和语域;
- 7 分钟:合上材料,在改变后的情境里说或写;
- 3 分钟:记录一个主要错误和下一次撤掉的提示。
完成比数量重要。若当天容量不足,只保留一份首遇、一个高价值词块和一个无提示句子;不要为了维护卡片系统耗尽真正使用语言的时间。
14. 十四天词汇实验
| 天数 | 动作 | 留下的证据 |
|---|---|---|
| 1 | 选择真实主题与任务,完成首遇 | 原始理解/输出、条件和阻断点 |
| 2 | 为未知项做五类决定 | 放过、推断、查阅、学习、核验清单 |
| 3 | 核对高价值词块的八个维度 | 义项、声音、搭配、语域与来源 |
| 4 | 制作只测试一个决定的线索 | 词卡与撤架条件 |
| 5 | 无提示完成填空、复述或短写 | 调用时间与错误类型 |
| 6 | 在听读说写中更换一种模态 | 接受/产出差距 |
| 7 | 用真实材料或受众验收 | 理解、回应与修复 |
| 8 | 归档低价值项,保留 5-8 个 | 选择理由与容量变化 |
| 9 | 对比近义项、反例或常见误用 | 意义边界与拒绝理由 |
| 10 | 同一主题更换受众与语域 | 关系和语气迁移 |
| 11 | 同一任务更换主题 | 词块结构迁移 |
| 12 | 让 AI/同伴提出候选,再查证 | 来源核验与采纳记录 |
| 13 | 在时间压力下完成真实输出 | 邮件、录音、说明或评审结果 |
| 14 | 关闭旧卡和提示完成平行任务 | 保留、拆分、归档或转向依据 |
十四天不是词汇速成期限。它只回答:原句、卡片和即时提示离开以后,你能否在改变后的任务里认出、选对并及时调用这些词块?
15. 怎样判断词汇正在变成能力
- 首遇时能保留主线,不被每个未知词劫持;
- 能判断一个词该放过、推断、速查、学习还是专业核验;
- 能说明当前义项、来源、搭配、语域和反例,而不是只背翻译;
- 在自然声音里能切分,在文字中能识别词形;
- 合上答案后能在有限时间里调用;
- 真实读者或听众收到的意思、关系和下一步与意图一致;
- 错误能被定位并进入下一次练习,而不是只增加卡量;
- 换主题、受众、模态或任务后仍然能够迁移;
- 能归档不再重要的词,把注意力还给当前生活。
词汇增长不总是列表变长。有时,它表现为阅读时知道哪个词可以先放过,会议里知道哪个词必须说准确,写邮件时知道一句更华丽的表达并不适合当前关系。你不再被所有未知项同时拖住,也不再用熟悉感掩盖调用失败。
来源与边界
- Nation (2006), How Large a Vocabulary Is Needed for Reading and Listening?:基于英国国家语料库的词族列表与 98% 覆盖假设估算无辅助理解所需规模;计数单位、语料、专名处理和理解标准限制外推。
- Schmitt, Jiang & Grabe (2011), The Percentage of Words Known in a Text and Reading Comprehension:661 名、8 国样本显示覆盖率与阅读理解大致呈线性关系,未发现清晰突变阈值;它不构成个人或其他体裁的保证。
- Webb (2008), Receptive and Productive Vocabulary Sizes of L2 Learners:以对应翻译测试比较接受与产出知识;结果受到测试方向、评分、词频和样本条件限制。
- Webb, Yanagisawa & Uchihara (2020), How Effective Are Intentional Vocabulary-Learning Activities?:元分析汇总 22 项研究、100 个效应量,显示即时与延迟回忆及不同活动间存在明显差异;平均结果不是固定间隔或个人学习保证。
- Pashler et al. (2008), Learning Styles:综述未发现足够证据支持按所谓视觉型/听觉型匹配教学,同时明确未测试的所有版本不能被一概否定。
- 词义、技术术语、语料频率、产品与词典会更新。重要任务应回到当前版本、一手来源、真实受众和具名责任人验收。
相关入口:语法篇 | 听力篇 | 阅读篇 | 口语篇 | 写作篇 | 用 AI 学英语 | 词汇证据卡 | 证据链模板
结语:让词在需要时抵达
记忆里真正留下来的,常常不是词典里的第一行释义,而是你曾在什么时刻需要它:向同伴解释一个风险,向陌生人请求帮助,向亲近的人道歉,或终于读懂一页过去只能绕开的文字。
词表可以替你保存秩序,不能替你生活。一个词只有进入声音、句子、关系和后果,才从收藏变成能力。它也不必永远留下;有些词完成一段工作便可以归档,有些词会因为你反复使用,慢慢长进自己的语气里。
不必急着拥有整门语言。先让几个真正需要的词,在没有答案展示的时候仍然来到你身边。它们不负责证明你聪明,只负责在意思将要中断的地方,帮你再向世界走近一步。