你让 AI 调研一个问题,它很快给出一份结构完整的答案。你把回答存进笔记库,顺手再收藏三篇网页。两周后,项目真的要做决定时,你却仍要从头查起。
问题不是没有资料,而是你已经忘了:当时为什么相信其中一个数字?哪个结论只适用于特定场景?哪条建议被你否掉了?最后又是什么证据改变了决定?
所以,AI 时代仍然需要知识体系。但它不该继续以“保存更多答案”为目标。对需要反复判断的工作,更有价值的系统应该保存判断路径:来源、条件、反证、人工修改、决定,以及以后在什么情况下重新检查。
这不是说所有问题都要做复杂记录。一次性、低风险的检索,问完就走完全合理。真正值得沉淀的是那些会被重复使用、会影响真实决定,或者答错代价不低的问题。
先别搬家:这些东西不值得默认永久保存
重建知识库时,最容易做错的是把全部 AI 对话、网页全文和旧摘要搬到一个新工具里。这样只是换了一个更大的仓库。
我会先停止默认保存四类内容:
- 可以随时重新生成的通用答案:概念解释、普通大纲和没有个人上下文的建议,通常没有长期稀缺性。
- 没有来源的漂亮摘要:文字很顺,却无法回到原始证据,下一次仍然不能放心引用。
- 重复的网页全文:除非原文可能消失或需要合规留档,否则保存链接、日期和与决定有关的短笔记通常更实用。
- 没有后续动作的收藏:如果它既不改变判断,也不进入项目,就不必假装“以后会看”。
一项 2023 年发表在 Science 的随机实验解释了为什么“保存所有初稿”的价值正在下降。Noy 与 Zhang 让 453 名受过大学教育的专业人士完成短时职业写作任务。使用 ChatGPT 的一组,平均完成时间约下降 40%,独立评审的质量约提高 18%。
这个结果只适用于实验中的特定写作任务,不能外推到所有知识工作,也没有证明事实准确性或理解深度同步提高。它能支持的有限结论是:**生成一版看起来可用的文本,确实比以前便宜了。**当初稿可以再次生成,知识库就不必把每一版回答都当成资产。
速度收益是真的,能力边界也是真的
AI 让你变快,不代表每一步都更可靠。
Dell’Acqua 等人与 BCG 合作,对 758 名顾问开展了预注册随机实验。在 18 项处于当时 GPT-4 能力边界内的咨询任务中,使用 AI 的参与者平均多完成 12.2% 的任务,速度快 25.1%,质量也显著提高。
但在一项预先选定、位于能力边界外的复杂任务中,使用 AI 的参与者得出正确答案的可能性比不用 AI 的人低 19%。这里的 19% 不是 AI 的总体错误率,也不能代表今天所有模型和职业。研究使用的是 2023 年 6 月版 GPT-4 和特定咨询任务。
真正有用的启示是“锯齿边界”:在人看来难度相近、甚至属于同一工作流的任务,AI 可能在一项上明显帮忙,在另一项上反而拉低结果。你通常无法只凭回答是否流畅,提前知道自己站在边界哪一侧。
Microsoft Research 在 2025 年发表的另一项研究也给出了相似边界。研究者调查了 319 名每周在工作中使用生成式 AI 的知识工作者,收集 936 个真实用例。对 AI 完成任务越有信心,与更少的自报批判性思考相关;对自己完成任务越有信心,则与更多的自报批判性思考相关。参与者描述的高价值工作,更多转向核验信息、整合回答和对结果负责。
这是一项自报调查,只能说明相关性,不能写成“AI 导致思考能力下降”。但它提醒我们:当生成和整理越来越便宜,人的责任没有消失,只是移到了回答之后。
| 研究回答了什么 | 能说什么 | 不能说什么 |
|---|---|---|
| 短时专业写作 | AI 可降低部分初稿的时间成本并提高评审质量 | 所有工作都提高 40%,或理解同步加深 |
| 锯齿能力边界 | AI 的帮助会随任务变化,边界外可能拉低表现 | AI 总体有 19% 错误率 |
| 知识工作者自报 | 核验、整合和责任把关仍是人的工作 | AI 必然让人变笨或失去批判性思维 |
真正值得保存的是七种资产
如果最终答案不是最稀缺的东西,个人知识系统应该保存什么?下面这七项是我的实践建议,不是上述研究直接验证过的标准。
- 问题:你当时究竟要做什么决定,而不是泛泛研究什么主题。
- 证据:原始来源、发布日期、数据口径,以及你实际使用了哪一段。
- 适用条件:结论成立需要哪些前提,适用于哪个版本、地区、用户或时间段。
- 反证与替代方案:什么材料挑战了当前判断,为什么暂时没有采用另一个方案。
- 人工核验:AI 做了什么,你又亲自检查了什么。
- 决定与理由:最后选了什么,最关键的两三个理由是什么。
- 结果与复查时间:后来发生了什么;什么信号出现时必须重新判断。
这种记录与“把聊天记录全部归档”的差别很大。聊天记录按对话顺序保存,决策记录按未来复用来组织。前者告诉你 AI 说过什么,后者告诉未来的你为什么可以相信、暂时相信或拒绝它。
如果你也在把 AI 接入更大的工作流,可以同时参考站内的 个人 AI Agent 工作栈边界清单;如果你想先盘点哪些判断已经交给 AI,可以看 Claude 使用反思与 AI 素养清单。
用 30 分钟重建一个最小版本
不要迁移整个旧知识库。选一个本周正在推进、最后必须由你拍板的项目。
**前 5 分钟:写清决定。**不要写“研究 AI 写作工具”,要写“是否在下个月的客户报告流程中使用某个 AI 工具生成第一版摘要”。决定越具体,后面的证据越容易筛选。
**接下来的 10 分钟:只放关键证据。**保留两到四个真正影响决定的原始来源,记录日期和口径。AI 可以帮助找线索、对比和起草,但链接必须能回到原文。
**再用 5 分钟:写条件与反证。**什么情况下这个方案有效?哪项证据最可能推翻它?如果你只写支持材料,记录卡会变成给既定结论找理由。
**再用 5 分钟:写决定与人工接管点。**明确 AI 可以做哪一步,哪一步必须由人核验。高风险或不可逆动作,不要把“模型看起来很确定”当成放弃复核的理由。
**最后 5 分钟:设复查触发器。**不要只写“以后再看”。写成可观察条件,例如价格变化、模型版本更换、原始政策更新,或实际结果连续两次偏离预期。
可复制的决策记录卡
# 决策:一句话写清要决定什么
- 日期:
- 截止时间:
- 决定负责人:
## 关键证据
- 来源 / 日期 / 口径:
- 这条证据支持或挑战什么:
## 条件与反证
- 结论成立的前提:
- 最强反证:
- 暂未采用的方案及原因:
## AI 与人工分工
- AI 生成或整理了什么:
- 人工核验了什么:
- 哪一步必须人工接管:
## 决定
- 选择:
- 核心理由:
- 仍然未知:
## 结果与复查
- 实际结果:
- 复查日期或触发条件:
例如,你要决定是否让 AI 参与客户报告的第一版摘要。记录卡不需要保存完整的二十轮对话,只需留下:允许处理的资料范围、用来判断质量的几份样本、发现过的错误类型、哪些内容必须人工对照原文、最终是否采用,以及一个月后用什么结果复查。
下次再评估同类工具时,你不必重读所有聊天。你可以直接看到上次的边界在哪里、哪些风险已经发生、什么条件改变后旧结论会失效。
三条边界比工具选择更重要
第一,低风险的一次性问题不必过度记录。查一个快捷键、改一句普通文案,临时答案通常已经够用。记录成本也是真实成本。
第二,不要把秘密写进所谓的“第二大脑”。密码、API 密钥、客户敏感数据、未公开商业信息,以及个人健康和财务细节,都应先遵守资料分级和最小暴露原则。能记录决定的边界,就不要复制原始敏感内容。
第三,会过期的结论必须带日期。模型能力、价格、产品功能、法规和市场数据都可能变化。没有日期与复查触发器的“知识”,很容易只是看起来可靠的旧答案。
AI 时代的知识体系,不需要证明你收藏得多。它真正应该做到的是:当下一次必须作出决定时,你能看见自己基于什么、忽略了什么、在哪个边界接管,以及什么新证据足以让你改变主意。
答案可以重新生成。判断路径不应该每次都从零开始。
如果你正在使用带 AI 研究和定时提醒的金融信息工具,可以把Google Finance AI 的核验矩阵作为一张具体示例:先记来源、日期、口径和范围,再决定是否继续行动。
来源说明
- Microsoft Research:生成式 AI 对知识工作者批判性思考的影响:用于自报调查、信心相关性以及核验与责任迁移;不作为因果结论。
- MIT Economics:ChatGPT 对部分写作任务生产率的实验:用于 453 人实验、时间与质量结果及任务边界。
- Organization Science:锯齿技术边界实验:用于 758 名 BCG 顾问、能力边界内外的结果和研究限制。