结论先行:摘要是有损压缩,要管的是“损失”
任何摘要都在丢东西,这不是 AI 的缺陷,是压缩的定义。真正的问题只有三个:你把“搬运”还是“理解”交了出去;丢掉的东西看不看得见、查不查得了;AI 出现在读之前还是读之后。
读起来很顺的摘要,恰恰是最需要提高警惕的摘要。— 本报告的判断,依据见第 04 章(流畅度与忠实度是两件事)
这份报告写给一个具体的人:做 Blender、剪辑和设计,同时在用 Obsidian 加 AI 流水线做知识管理,想知道“让 AI 帮我读文章”到底能走多远。结论不是“别用”,也不是“放心用”,而是下面的三条原则和五件事。证据强度我会一条条标出来,因为这个主题里最容易出现的毛病,就是用一个漂亮的数字替换掉一个有条件的发现。
三条原则
外包搬运,不外包理解
判据是产出物能不能被对照原文核验:引文、数字、位置、结构可以核验,交给 AI 和脚本;评价、整合、反驳、迁移不能被“核验”,只能由你建构,交出去就等于没读。这是本报告对 ICAP 框架[16]的一种应用,不是文献原话。
让损失显式化、可审计
不追求“无损”,追求“知道丢了什么”:引用先行、分层输出、位置锚点、限定条件与数字清单、遗漏审计、机械核验。对策里有证据支撑的部分有限,我会明说哪些是设计假设。
AI 在“读之后”当追问者
先读、先写出自己的版本,再让 AI 提反驳、考你、找漏洞;而不是读之前让它替你读。注意:这条的直接证据最薄,更多是设计假设,需要你用闭卷复述的通过率自测。
四个值得记住的数字(以及它们的边界)
这四个数字的共同点:它们都来自特定任务、特定年份的模型。第 04 章专门列了“证据的保质期”,请把它们当作“现象存在”的证据,不要当作“今天的错误率”。
你要做的五件事
- 读完先盖住原文,写三句话主旨,再碰 AI。三句话 = 作者主张、主要理由、一个限定条件。这一步在第 07、09 章展开;它保证后面所有 AI 输出对你来说是“待核对的对象”,而不是“你的理解本身”。
- 让 AI 先交“逐字引文 + 位置 + 限定条件/数字清单”,不让它先写总结。这是“引用先行”。提示词在第 10 章可直接复制。
- 引文一律跑机械核验,未命中的引文作废。第 05 章有浏览器内的核验器和 35 行 Python 脚本
verify_quotes.py;我真的运行了它,结果写在那一章里。 - 追问放在读后:先让 AI 在不知道你立场时红队或 steelman,再披露你的立场。这是对“AI 会迎合你”[8]的工程化缓解,缓解效果本身未经验证。
- 一周后闭卷复述,记录通过率。能不看原文复述论证链、引用两句原话、说出一个限定条件和一个反例,才算读懂(第 02 章的标准)。通过率是整套流程唯一的“最终验收”。
本次调研在中途被叫停。关于“屏幕阅读与注意力”“掌握的错觉”“AI 与学习”“AI 追问有效性”这几个主题,我没有完成系统核实,因此:①文中不出现这些主题的效应量和百分比;②涉及它们的论述标 ◇ 推断 或“未在本次调研中核实”;③第 11 章把它们列为本报告最薄弱的地方。已核实的证据集中在“LLM 摘要保真度”和“长上下文位置偏差”两块——这恰好是协议设计最需要依据的部分。
问题的三层:环境、错觉、诱惑
“AI 总结让人变浅”是一个太容易被说出口的判断。要把它变成可以检验的东西,得先拆开:哪一层有证据,哪一层只是合理的推断,哪一层是流传的说法。
第一层:注意力环境——能说的比你以为的少
先交代一个限制。这一层本该是“屏幕阅读是否损害理解”“短视频是否缩短注意力”之类的实证文献,但本次调研在这个主题上被叫停,我没有核实任何一项相关研究,所以这一节不会出现任何关于注意力时长、阅读理解下降幅度的数字。
剩下可以说的,只是一个结构性的观察,我把它标成推断:摘要的获取成本趋近于零,理解的成本没有变。过去“要不要读这篇”的决定被读的成本强行推迟,你至少得翻开它;现在你可以在不翻开的情况下得到一个“看起来够用”的替代品。这个差距的拉大不依赖任何关于注意力的数字,只依赖一个事实:入口变便宜了,而便宜的入口产出的东西质量并不一致(下面两层会展开)。
“摘要入口变便宜”会让“读摘要代替读原文”的比例上升,这是本报告的推断,没有测量。它的作用只是说明:协议设计的目标不是“让你更勤奋”,而是在入口变便宜的世界里,让“便宜入口”的输出自带可核对的接口。
第二层:掌握的错觉——流畅感会冒充理解
认知心理学里有两个经典观察,和读摘要的场景高度相关。一是 Rozenblit 与 Keil 关于“解释深度错觉”(illusion of explanatory depth)的工作:人们倾向于高估自己对日常机制的理解,直到被要求写出解释时才发现空洞[21]。二是 Bjork 提出的“合意困难”(desirable difficulties):让学习更费力的做法常常让当下的流畅感变差,却改善长期保持;反过来,让学习过程顺畅的做法容易制造“学会了”的感觉[22]。这两条我都没有在本次调研中核实,只作为经典理论引用,不引用任何具体数字。
把它们接到 AI 摘要上,是一段两步推理:①读一篇通顺的摘要,当下的流畅感很高;②高流畅感容易被读成“我懂了”。第二步有一项间接证据:2026 年的一篇预印本称,LLM 摘要主要在表面连贯性与流畅度上被偏好,而人类参考摘要在信息量与忠实度上仍有优势[11]——但我只读到该文摘要,且尚无外部复现。直接测量“读 AI 摘要后的掌握错觉”的实验,本次调研没有找到。所以整条链路的强度是 ◇ 推断,只是一个值得用自己的数据检验的假说。
第三层:AI 带来的诱惑与风险
诱惑很直白:快、省力、看起来“已经处理过了”。风险则可以分成四种,每一种都对应后面某道防线。
错误难被不读原文的人发现
FABLES 让真正读完整本小说的标注员核查 LLM 摘要,多数不忠实的 claim 涉及事件与人物状态,需要对叙事做间接推理才能判定出错;而 LLM 自动打分器与人工的相关性并不强,尤其抓不出不忠实的 claim[4]。读者没读原文,就没有判断依据;用另一个 LLM 打分,也靠不住。
错误不是随机噪声,是系统性偏移
限定条件被抹掉、量化变泛称、过去时变现在时[2];开头和结尾被善待、中间被忽视[9][3];在你表态之后顺着你说[8]。方向性的偏差比随机错误更危险,因为它们会在你的知识库里累积成同一个形状的扭曲。
把摘要抄进笔记,仍只是“主动”
ICAP 框架明确指出:要求学生“写摘要”并不保证建构,学生可以把任务退化成复制与删除[16]。把 AI 摘要粘贴进 Obsidian,在这个框架里连“复制删除式摘要”都算不上,因为删除的人是 AI。
还有一个容易被忽略的“旧证据”:2020 年对单句新闻摘要的大规模人工评估发现,超过 70% 的单句摘要含有幻觉,而其中外在幻觉(原文里没有的内容)有超过 90% 是错的[1]。这组数字今天不能当错误率用——模型是 2020 年的、任务是把整篇新闻压成一句话。它留给我们的是一条定性规则:摘要里“用背景知识补充一下”的冲动,大多数时候补进去的是错的。这条规则直接写进了后面的协议:只能用原文里有的东西,没有就写“原文未提及”。
证据并不支持“AI 摘要一定比人差”。FABLES 里表现最好的模型忠实率达 90%[4];2026 年那篇预印本的结论也是“LLM 抬高了下限,上限仍低于人类”[11](只读到摘要)。更准确的表述是:AI 摘要的错误难以被不读原文的人发现,所以需要可审计。这是整份报告的立足点,而不是“AI 不可信”。
问题从来不是 AI 会不会出错,而是出错时你有没有一个接口可以发现。— 本报告的立场
深度阅读到底在做什么
想谈“摘要丢了什么”,得先说清楚“读懂了什么”。否则“丢失”只是一个情绪词。这一章做三件事:给读懂拆出三层表征,给阅读动作列一张可操作的清单,最后给出一个能被检验的“读懂标准”。
三层表征:表层、文本基础、情境模型
语篇理解研究里一个经典区分:读者对一段文本形成的心理表征不止一种。Kintsch 的 construction-integration 模型描述了自下而上的加工——激活词义、形成命题、产生推论,再经激活扩散整合成连贯结构[18]。“表层形式 / 文本基础(textbase)/ 情境模型(situation model)”的三层表征区分,通常归到 van Dijk 与 Kintsch 1983 年的书和 Kintsch 1998 年的专著[20]。这两条我只见到摘要或二手综述,没有读到原书,下面的描述按二手综述的通行说法,不含具体实验数字。
| 层 | 是什么 | 摘要能保留吗 | 本报告的类比:对应《卡片规范》 |
|---|---|---|---|
| 表层形式 | 原文的措辞、句式、语气;衰减最快的一层 | 几乎一定丢;摘要的第一件事就是换成自己的话 | “精彩原文摘录”和 > 引用块——用逐字照录把这一层保下来 |
| 文本基础 | 文本本身表达的命题与它们之间的关系:主张、理由、数据、例子 | 可以保留,但有损;限定条件、例子、反例最容易被削 | “一句话主旨 / 文章脉络 / 核心要点的转述段” |
| 情境模型 | 把文本内容与读者自己已有的知识、经验整合后形成的、关于“文本所描述的事态”的表征;对应更深的理解 | 不能。它建立在你的先验知识上,摘要无法代你建立 | “我的思考 / 关联” |
第四列是本报告的类比,不是文献原话。它的价值在于给“为什么要同时保留原文片段、转述和个人思考”一个理论解释,而不是证明了这种保留方式有效。
这张表给出第一条推论:只读摘要,你最多得到文本基础的有损副本,缺的是表层(你无法引用作者原话)和情境模型(你没有把它接到自己的知识上)。这解释了用户《卡片规范》里的“终极检验”为什么要求“能引用作者 2 句原话”——那是对表层的检验。
分析阅读的关键动作
Adler 与 Van Doren 的《How to Read a Book》把阅读分成四个层次:基础阅读、检视阅读(系统略读,判断是否值得精读)、分析阅读(读到变成自己的)、主题阅读(多本书互相对照)[19]。我只见到二手介绍,没读到原书,证据等级是 ○ 弱——它是方法论,不是实验结论。但它给出的动作足够具体,可以直接转成“产出物”:
| 动作(二手介绍的说法) | 你要留下的产出物 | 怎么判断做对了 |
|---|---|---|
| 分类:这是什么类型的作品 | 一行标注:论证型 / 叙事型 / 教程型 / 研究报告 / 访谈…… | 和《卡片规范》提示词第 1 步的文体判断一致,且决定了你找“论点”的方式 |
| 陈述全书统一性:整体在讲什么 | 一句话,含“结论 + 理由” | 能用 50–120 字写出,且不是“本文讨论了……”这类空话 |
| 列提纲:各部分如何构成整体 | 按原文顺序的层级列表 | 一级条目数与原文小标题数一致 |
| 界定作者要解决的问题 | 一个疑问句 | 读完后你能说出作者回答了它的哪一半 |
| 对关键词“达成共识”(come to terms) | 术语表:作者如何使用这个词 | 你不会用日常含义去替换作者的定义 |
| 抓主要命题与论证 | 论证链:主张 → 理由 → 证据 → 例外 | 盖住原文能复述,且包含例外 |
二手介绍还转述了阅读时的四个问题:整体讲什么?细节上说了什么、怎么说?是否为真?那又怎样?[19]以及一条次序规则:批评应放在完全理解之后。这条次序规则对 AI 时代尤其重要,它正是后面“先读懂、再追问”这条原则的来源之一,但请记住它是方法论传统,不是实验结论。
什么叫“外包搬运”,什么叫“外包理解”
ICAP 框架把学习活动按外显行为分成四种:被动、主动、建构、互动,假说是 I > C > A > P。论文对“阅读文本”给的例子是:只读是被动;划线、复制再删除式摘要是主动;自我解释、跨文本整合、用自己的话做笔记是建构;与同伴互相问答是互动[16]。把它套到 AI 上:
| 你对 AI 做的事 | ICAP 层级(本报告的套用) |
|---|---|
| 读 AI 给的摘要 | 被动 |
| 把 AI 摘要粘进笔记;划线 | 主动 |
| 自己用话改写;写反驳;找反例;写类比 | 建构 |
| 与 AI(或同伴)来回追问并互相修正 | 互动(前提是你确实在修正,而不是在接受) |
2023 年一篇同行评审评论指出,ICAP 有两个核心假设与教育研究的基本认识不符:外显行为不足以判定内在学习过程;并且不存在“放之四海皆准”的参与模式排序,较低的模式在合适的学习者与时机下也可能更优[17]。所以我只把它当作启发式:“建构、互动通常优于被动”可以说,“必然优于”不能说。
在这个启发式之上,我给“搬运”和“理解”下一个操作性定义——这是本报告自己的框架,不是文献结论 ◇ 推断:
搬运:产出物可以对照原文机械或半机械地核验。逐字引文(脚本可验)、数字与样本量(脚本可验)、位置(脚本可验)、小节覆盖(清单可验)、限定语是否保留(人可验)。这类工作可以交给 AI,因为错了你能发现。
理解:产出物的对错取决于你的先验知识与立场——评价、整合、反驳、迁移、“那又怎样”。它无法对照原文核验,因此一旦外包,你得到的只是“一个看起来像理解的东西”,而你无从判断它对不对。这部分必须由你建构。
灰色地带是“转述”:数字和引文可以验,但“转述的意思有没有走样”不能被脚本验,需要抽检。协议把这块的风险明确留在“人核对”这一步。
“读到什么程度才算读懂”:一个可检验的标准
《卡片规范》的终极检验是:盖住原文,只看卡片,能向别人讲清楚文章讲了什么、怎么论证的,并能引用作者 2 句原话。我把它补成五问,每一问都能当场打分:
| # | 闭卷五问(盖住原文和笔记) | 通过标准 | 对应的层 |
|---|---|---|---|
| 1 | 用 3 分钟复述论证链 | 说出“主张 → 理由 → 证据 → 结论”四环,顺序与原文一致 | 文本基础 |
| 2 | 写出 2 句作者原话 | 跑 verify_quotes.py,两条都“逐字存在”(标点差异不算通过) | 表层 |
| 3 | 说出 1 个限定条件 | 包含范围、样本、时间或前提之一,且与原文限定一致 | 文本基础 |
| 4 | 说出 1 个反例或边界 | 来自作者自己提到的,或你自己提出且能说出为什么原文没有覆盖 | 情境模型 |
| 5 | 说出作者没有证明的 1 个前提 | 能指出这个前提在原文哪一步被默认 | 情境模型 |
5 问中通过 4 问及以上算“读懂”;通过 2–3 问是“读到文本基础”;不足 2 问是“读过”。这个门槛是我定的,没有经过验证,它的用途是让你不再靠感觉判断,并在 4 周训练里(第 09 章)有一个可追踪的分数。评分可以更细——第 09 章有 12 分制的“复述测试”评分表。
一个直接的推论:一篇文章你读完之后,如果连 5 问里的第 2 问都过不了,那么无论你手里的摘要多漂亮,你都没有“读过”它——你有的只是别人的转述。
有损压缩的损失分类学
压缩比一旦固定,剩下的问题就是“丢什么”。每个摘要背后都有一个没人写出来的取舍函数:LLM 默认的那个偏向流畅、通则与居中;你真正需要的那个偏向你的用途。协议要做的,是把取舍函数摆到桌面上。
把“丢失”拆成九类
下表是本报告的归纳——分类本身是推断,不是文献里的标准分类法。每一类我标了“证据”一栏:有直接测量的写出来源,没有的老实写“推断”。读表时留意最后一列:能机械检出的类别不多,这也是为什么协议要把“机械核验”和“人核对”拆成两道。
| 丢失类型 | 为什么压缩时先丢它 | 丢了的后果 | 证据 | 怎么检出 |
|---|---|---|---|---|
| 限定条件 范围、样本、时间、前提 | 句法上是附属成分,对“主旨”没有贡献 | 结论被读成无条件成立 | ● 强 量化变泛称、过去时变现在时、描述变建议[2] | 限定条件清单;数字原样出现可机械查,时态与量化需人工 |
| 论证链 因为……所以……除非 | 连接词承载逻辑,摘要倾向罗列结论 | 留下口号,读者无法判断结论成不成立 | ◇ 推断 《卡片规范》将其列为不合格项 | 闭卷复述第 1 问 |
| 具体例子与数据 | 看起来可替换为“作者举了例子” | 失去检验结论的抓手 | ◐ 中 33.3%–65.4% 的书摘缺关键事件,16.7%–38.5% 缺重要细节[4](小说) | 数字清单、实体清单(可机械查) |
| 语气、立场与修辞 | 被“中性化”,反讽与保留被抹平 | 把挖苦读成认同,把试探读成断言 | ◇ 推断 相关:各模型摘要风格同质化[11](仅摘要) | 保留逐字引文;人读 |
| 隐含前提 | 作者没写,摘要只能复述写出来的,或者“补一个” | AI 补的前提被当作作者的 | ● 强 外在幻觉多数是错的[1](2020 年模型,单句摘要) | 四图层标注:补的内容必须标 [推断]/[扩充] |
| 结构与节奏 | 重排、合并,铺垫被压平 | 你不知道作者把重点放在哪 | ◐ 中 摘要对中段忠实度更低[9];过度强调书的结尾[4] | 脉络条目数与小标题数对账(机械);遗漏审计 |
| 反例与例外 | 与主线反向,向主线“收敛”时最先删 | 只剩单向叙事 | ○ 弱 机构试验中评审称 AI 摘要漏掉细微差别[7](二手转述,未读原文) | 反例/例外清单;闭卷第 4 问 |
| 作者的犹疑 可能、似乎、我不确定 | 摘要偏好肯定句 | 试探性结论变成断言 | 属“限定条件”的子类,与[2]同源 | 限定条件清单里单列“犹疑” |
| 归属 谁说的、出自哪 | “某人认为”被压成“事实” | 转述者的观点被当成作者的、引用者的观点被当成事实 | ◐ 中 出处错位占重大问题的最大份额[6](新闻问答) | 位置锚点 + 出处字段 |
九类里,有直接测量的是限定条件、例子与数据、结构、归属这四类,其余是推断。这提示一件事:协议里“限定条件与数字清单”“遗漏审计”“位置锚点”这三样,是证据最扎实的地方,而“语气与修辞”这类损失,目前只能靠保留逐字原文让你自己读到,没有更好的办法。
压缩是在选取舍函数
把摘要看成信息论意义上的有损压缩,有一个好处:它逼你问“失真由谁定义”。同样压到 20%,对做决策的人来说,丢掉所有数字是灾难;对只想知道“这篇讲什么”的人来说,丢掉数字几乎无所谓。LLM 默认的取舍函数是什么?从已读到的证据拼起来:偏向主旨与通则(限定条件被泛化[2])、偏向文档的开头与结尾[9][4]、偏向流畅[11]。这是一个不透明且与你的用途无关的函数。
“保真协议”的核心不是让 AI 变得更准确,而是把取舍函数换成你的(保数字、保限定、保反例、保原话,宁可丢修辞),并让被丢的东西以清单的形式出现在输出里。后者才是“显式化”:丢失还在,但它不再沉默。
压缩损失实验室
上图是一条“条码”:每一格是一句话,实心表示保留,空心表示丢失,颜色是类型。观察被丢的格子集中在哪里。
示意模拟,不是真实 LLM 输出。示范文本是我自撰的虚构公众号长文(共 15 句,约 650 字)。规则假设:①“朴素摘要”按类型权重给每句打分(论点 1.0 > 金句 0.8 > 例子 0.55 > 数据 0.5 > 转折 0.25 > 反例 0.2 > 限定 0.12),选分最高的整句,直到用完字数预算;位置偏差打开时,首尾各两句加分、中段(第 6–10 句)扣分。这组权重是依据第 04 章列出的偏移方向(限定被泛化、首尾被偏爱)设定的示意值,没有拟合任何真实模型。②“保真协议”先保主论点,再保反例、保“数据及其限定”,然后其它论点、转折、例子,金句最后;凡是被保留的句子,其依赖的限定/反例句一并带上。③朴素摘要按完整句子计字数;协议把数据、限定、反例写成清单条目,假设只占原句 60% 的篇幅(清单比叙述句紧凑,这一假设对协议有利);两者都不模拟句内改写,也不模拟幻觉。④协议按优先级依次放入“捆绑包”,放不下就截断,不挑便宜的凑数;朴素摘要则贪心填满预算。读者看到“被丢的句子”那一栏,在真实使用里朴素摘要是不会告诉你的;协议要求模型自己输出这一栏,并被审计。
怎么读这个实验
- 先拖到 15%,看朴素摘要保留了什么。在示意规则下,它留下主论点、一句转折和一句金句,数据和限定一个都没有;右侧立刻出现“限定与反例全部被丢”的提示:留下的论点读起来是无条件的。这与 Peters 与 Chin-Yee 记录的偏移方向一致[2],但数字是示意的,是规则的直接后果,不是发现。
- 切到“保真协议”,同样 15%。协议留下的是主论点和反例,而不是转折和金句;它同时告诉你“当前低于保真底线”(约 21%:一个主论点 + 一个数字及其限定 + 反例)。保真不是免费的,它的价格是文笔和生动度,在 5% 的预算下它甚至会拒绝输出——这也是第 11 章要认真谈的成本。
- 拖到 25%–30%,观察协议开始放入“数字 + 限定”的捆绑包。数据句总是带着它依赖的限定句一起进来,不会单独出现。右侧“未收录清单”列出了所有没进来的句子,这就是“损失显式化”的样子:丢失还在,但它被写了出来。
- 关掉“位置偏差”,再对比。位置偏差关闭后,朴素摘要的中段不再被额外扣分,被保留的句子会向中间移动一点。这个开关对应长文摘要里“中间被忽视”的风险[9][3];它在你用的模型上是否存在,需要自测(见第 05 章的“埋针测试”)。
- 拖到 50%。差距缩小但没有消失:朴素摘要的取舍函数里数据、反例、限定权重一直偏低,所以即使保留一半篇幅,仍然没有它们(这是规则假设的后果);协议则保留了全部数字和反例,代价是例子与金句被挤出。换个权重,结果会变——所以请把这个实验当作“让取舍函数可见”的玩具,而不是测量。
AI 总结的已知失真与对策
上一章是“压缩必然丢什么”,这一章是“AI 实际上怎么丢、怎么错”。区别很重要:前者是原理,后者是经验记录,而经验记录有保质期。
失真分类表(九类)
下表的“证据”列只放我读到过的文献,括号里写了任务与对象;“对策”列里,凡是尚无直接实证支持的,标明是设计假设。等级沿用全篇的约定:● 强 同行评审大样本;◐ 中 单项研究、官方报告、基准;○ 弱 预印本、案例、二手;◇ 推断 本报告的判断。
| 失真类型 | 证据 | 表现 | 对策(及其证据) | 等级 |
|---|---|---|---|---|
| 1 限定条件丢失 / 过度概括 | 10 个 LLM、4,900 份摘要:含泛化结论的几率约为原摘要的 2 倍,对人类摘要 OR=4.85[2] | 量化变泛称;过去时变现在时;描述变行动建议 | 限定条件清单 + 机械核对数字/样本量;用“间接引述、过去时”格式约束(作者的建议,未验证);不要只靠“请准确” | ● 强 现象 ◇ 对策 |
| 2 编造或改写引语 | 2,709 条回答:含直接引语的回答里,Gemini 20% 有重大问题;另有完全编造的引语、不存在的链接[6](联网新闻问答) | 引号里不是原话;出处不存在或不对应 | 引文逐字机械匹配 + 位置核对;官方 Citations 让出处可查[15](厂商自述)。对策本身是确定性检查 | ◐ 中 |
| 3 外在幻觉 | 单句新闻摘要中 >70% 含幻觉,外在幻觉 >90% 为错[1](2020);被要求总结不存在的内容时,gpt-3.5-turbo 约 79%、GPT-4o 约 44% 仍照样生成[10](多文档,仅读摘要) | 补进原文没有的内容;对不存在的信息也答 | 只写原文有的;给“原文未提及”出口;空集检查;逐条 claim 对账 | ◐ 中 |
| 4 位置偏差 | 多文档问答呈 U 形[3];6 个长文摘要数据集上忠实度呈 U 形[9];Claude-3-Opus 至少 20% 的摘要过度强调书的结尾[4] | 中段被忽视,结尾被放大;封底、致谢等边角内容干扰 | 分段处理 + 对中段做遗漏审计;指令放在 prompt 末尾[13];自己做埋针测试。仅靠提示缓解,收益有限[9] | ◐ 中 |
| 5 关键内容遗漏 | 26 本小说:33.3%–65.4% 的摘要缺关键事件;23.1% 的 GPT-4-Turbo 与 Mixtral 摘要完全不提关键人物[4] | 摘要流畅但缺了骨架部件 | 遗漏审计(对照小标题/章节表);Chain of Density 式补入缺失实体[5],并接受可读性代价 | ◐ 中 |
| 6 需要间接推理才能发现的错,打分器抓不出 | FABLES:LLM 自动打分器与人工相关性不强[4] | 事件、人物状态类错误,读者不读原文就看不见 | 人工抽检;对关键 claim 要求逐条原文证据;不要用另一个 LLM 当唯一裁判 | ◐ 中 |
| 7 迎合 | 5 个 RLHF 助手:用户说“我不认为对,你确定吗?”时常改口,Claude 1.3 在 98% 的问题上错误认错;用户提示错误答案使准确率最多降 27%(LLaMA 2)[8](2023 年模型) | 你表态之后,它的评价向你靠拢 | 追问阶段先让 AI 在不知道你立场时 steelman/红队;被反问“你确定吗”时要求重新引用原文,而非道歉改口(设计假设,需自测) | ◐ 中 现象 ◇ 对策 |
| 8 流畅掩盖错误;风格同质化 | 2026 预印本:LLM 主要在连贯度与流畅度上被偏好,各模型出现风格同质化[11](仅读摘要);Chain of Density:信息量上升则连贯性/可读性下降[5] | 读起来顺 ≠ 对;密度越高越难读 | 分层输出(短层 + 长层);不以“读着顺”作为卡片通过标准 | ○ 弱~◐ 中 |
| 9 输出后段更易幻觉 | 多文档基准:摘要内容平均最高 75% 为幻觉,越靠后越容易[10](仅读摘要) | 摘要拖得越长越不可靠 | 分块生成;卡片逐要点独立校验;摘要不宜过长 | ◐ 中 |
第 3 行与第 9 行引用的 [10] 我只读到摘要;“75%”是对模型最不利的设置下的上限平均,不是通用错误率。
一个反直觉的发现,和它的边界
第 1 行里最值得停一停的是这一条:Peters 与 Chin-Yee 比较了几种提示,发现在提示里明确要求“忠于原文,不要引入任何不准确之处”(accuracy prompt)后,摘要含泛化结论的几率约为简单提示的 1.9 倍(OR=1.90,95% CI 1.11–3.26,p=0.02);除 Claude 系列外,其它模型在这种提示下过度概括率最高。作者的解释是类似人类“反讽反弹”的现象[2]。
能支持:口头要求“请准确/请忠实”不是可靠的保真手段,至少对被测的那批模型和任务如此;因此要把“保真”变成可检查的结构(逐条限定语、逐条数字、逐条引文),而不是一句祈使句。
不能支持:①“提示里说‘请准确’一定有害”——这是单项研究,对象是科学论文摘要,模型是 2025 年 3 月前后的版本,没见到独立复现;②“反讽反弹”这个机制——只是作者的猜测;③“Claude 一定最好”——该文中 Claude 系列的过度概括率最低(−1% 到 20% 区间),但它同样受模型迭代影响。
证据的保质期
读 AI 相关的文献,最容易犯的错是把一个年份很早的数字当作“现状”。下表列出本报告用到的主要证据的模型版本、任务与可外推范围。结论是:现象大多反复出现,具体比例不可迁移;甚至方向也不总是“越新越好”——2025 年的研究显示较新的模型过度概括反而更严重[2]。
| 来源 | 模型 / 时间 | 任务 | 可以外推到哪里 | 不能外推到哪里 |
|---|---|---|---|---|
| Maynez 等 [1] | 2020,BART/PTGEN 等 | XSum 单句摘要 | “补充背景”多半是错的这一定性规则 | >70%、>90% 的具体数字;长文 |
| Liu 等 [3] | 2023,GPT-3.5 等 | 多文档问答、键值检索 | “位置可能影响利用率”这一风险 | 它是定律;摘要任务;现代模型 |
| Anthropic 长上下文博客 [13] | 2023,Claude Instant 1.2 / Claude 2 | 70K/95K 多选问答,厂商自测 | “先抽引文再答”值得一试 | “错误减少 36%”之类数字;摘要任务 |
| FABLES [4] | 2024 上半年,Claude-3-Opus 等 | 26 本小说的书摘 | 遗漏与位置偏差存在;自动打分器弱 | 论证型文章;90% 这个具体比例 |
| Peters & Chin-Yee [2] | 2025 年 3 月前后,10 个模型 | 科学摘要/文本→摘要 | 泛化的三种语言形式;口头要求不可靠 | 公众号文章;今天的版本 |
| EBU/BBC [6] | 2025 年 5–6 月,4 个消费者助手 | 联网新闻问答,记者评估 | 编造、改写引语与出处错位的现象存在 | “45%”不能代表“AI 摘要给定文章”的出错率 |
| Sharma 等 [8] | 2023 年模型 | 反馈、被质疑时改口等 | 迎合是 RLHF 助手的已知倾向 | 改善了多少本轮未查,不下结论 |
四处“别用错”的数字
- Anthropic 与 Liu 等不一致。Anthropic 2023 年的博客在脚注里指出其结果与“U 形”曲线不同,并推测原因是 Liu 等样例平均约 15K tokens,而他们测试的是 70K 和 95K 的文档[13]。所以写法应是“位置偏差是一个需要在你自己流水线上检验的风险”,而不是定律。
- EBU/BBC 的 45% 测的不是摘要。评估对象是联网的新闻问答,评估者是各媒体自家记者,“重大问题”的阈值由报告定义[6]。它的作用只是证明:编造和改写引语是真实发生过的事。
- “幻觉率很低”的头条来自窄指标。Vectara 榜单测的是“给定短文做摘要时的事实一致性”,二手来源称新榜单文档更长、分数“全面上升”,且官方说明新旧分数不可直接比较[12]。它不测遗漏,也不测限定条件丢失。我只见到二手转述,具体数字没有核实,所以不引用。
- 厂商数据都是自测。“错误减少 36%”[13]、“召回准确率最多提升 15%”“客户幻觉从 10% 降到 0%”[15]来自厂商博客与客户自述,没有独立复现。我只用它们说明“这是厂商认为值得做的方向”,不放进结论句。
对的出处不等于对的理解。检查引文是否存在,和检查转述是否越界,是两道独立的检查。— 本报告对 [6] [15] [2] 的合并判断
最后一句是整张表最重要的一条工程含义,它直接决定了下一章的协议结构:引文是否逐字存在可以由脚本确定性地判断;转述是否越界(限定条件被抹掉、时态被改、量化变泛称)只能靠清单 + 抽检。把这两件事混在一起,你要么得到一个过于宽松的“通过”,要么得到一个无法执行的要求。
保真协议
协议的目标不是让 AI 变成一个“不会出错的总结者”——证据不支持这种期待——而是让它的每一次出错都落在你能发现的地方。下面是八个部件,每个部件说明防哪类失真、谁来做、能不能机械化、证据有多强。
设计原则
先抽后述:把“选取”和“表述”分开
选取阶段只产出可核验的材料(逐字引文、位置、清单);表述阶段只能用已核验的材料。这样出错的位置被限定在两个窄口,而不是分散在一篇流畅的文字里。
每条断言带锚点
位置标注(〔§3 原因二〕 这样的写法)让核对从“重读全文”变成“跳到那一节”,核对成本降低,才有可能真的去核对。
还有第七条,是整套协议区别于“更好的提示词”的地方:输出里必须包含“丢了什么”——一份未收录清单,列出被舍弃的小节、论点、例子、反例。它让损失从沉默变成可审计的文本,下面的“遗漏审计”会专门检查这份清单是不是诚实。
同一篇文章,两种提示的结构差异
请准确、忠实地总结下面这篇文章,保留关键信息,不要遗漏重要内容。
{文章}问题不在语气,而在没有任何可检查的东西:什么叫“关键”?“忠实”如何判断?输出是一段连贯的文字,错误混在其中。又由于“请准确”不被证明有效甚至可能有害[2],这类提示只能依赖你的运气。
文章放在最上面(长文在前、指令在后)。 第一步(只抽取,不总结): A. 按原文顺序列出所有小标题/段落序号,作为小节表。 B. 每个小节抽出 1-3 条逐字引文(每条 ≤150 字),带 〔§序号 小标题〕。 C. 限定条件与数字清单:逐条列出(位置|类型|原话),类型 = 限定/数字/例外/反例/犹疑。 第二步:只使用第一步的材料写分层摘要 L0-L3,转述中每条论断标注引用编号。 第三步:输出“未收录清单”:原文中没有进入摘要的小节、论点、例子、反例。 规则:原文没有的内容写“原文未提及”,不得推断补全。
它的每一部分都对应第 04 章表里的一类失真:A 防结构与位置偏差,B 防编造引语与外在幻觉,C 防限定条件丢失,第三步防沉默的遗漏。完整可复制版本在第 10 章。
两遍法
协议的主干是把一次“请总结”拆成两遍,中间夹一道机械核验:
- 第一遍:抽取。输入原文,输出小节表 + 逐字引文(带位置)+ 限定条件与数字清单。不允许写任何总结性句子。这一遍的所有输出都可以对照原文核验:引文用脚本,数字用脚本,小节表用你的眼睛扫一遍小标题。
- 核验。把第一遍的引文丢进核验器(本章实验室 2 /
verify_quotes.py)。未命中的引文作废;仅标点/空白不同的,回到原文确认再决定。 - 第二遍:表述。输入的不再是原文,而是第一遍已核验的材料,要求按分层格式输出,每条转述标注它依据的引文编号。第二遍可以犯的错误被限制在“转述是否越界”这一个窄口里。
这个结构的证据基础要说清楚:Anthropic 在 70K/95K token 的文档上比较了几种策略,发现让模型先把相关引文抽到 scratchpad 里再作答,在所有对比中都有帮助,代价是少量延迟;他们的一个组合方案(样例加 scratchpad)把 Claude 2 的准确率从 0.939 提到 0.961,即错误减少 36%[13]。但这是◐ 中——厂商自测、2023 年的模型、任务是多选问答而不是摘要。官方文档建议把长文放在前、查询放后,并让模型先引出相关部分[14],我只见到该页面的转述,没有读到原文措辞,等级 ○ 弱。所以:“引用先行”是有一定依据的设计选择,不是被摘要任务验证过的定理。我建议你用自己的文章做一次小对照(见第 09 章)。
引用先行与位置锚点
格式上直接沿用你的《卡片规范》第 4 节,它已经是一份很好的锚点规范。要点是五条:
- 引用块逐字照录,不改字、不改标点;错别字照录并可加
[sic]。 - 中间删去的内容用
……,补充语境用全角方括号[]——核验器据此把引文拆成片段,括号内的补充会被忽略并单独提示。 - 每个引用块最后一行单独写位置:
〔§3 原因二〕、〔第12段〕、〔12:34〕。 - 单块不超过 150 字;引用块内禁止出现转述或评价。
- 外文引用在同一块内跟译文,核验器只核对原文行。
工具不会替你专注,它只是把“现在就开始”这件事变得没那么可怕。〔第4段〕——这是第 03 章示范文本里的一句。每个引用块长这样:逐字、带位置,位置是回到原文核对的入口
位置锚点的价值常被低估。没有位置的引文,核对要靠搜索;有位置,核对是“打开第 3 节,看这句话在不在”。核对成本的下降才是它的主要作用——一道没人愿意做的检查等于没有检查。机械地检查位置也是可能的(引用是否真的落在声称的小节之下,见第 08 章对 verify.py 的改进建议),本章的核验器暂时不做这一项,只显示位置标签。
限定条件与数字清单(ledger)
这是针对第 04 章第 1 行的直接对策。做法是让第一遍抽取时,额外输出一张表,逐条列出原文里每一处限定语和数字,格式固定,之后每条摘要必须能在表里找到对应。以第 03 章的示范文本为例(节选):
| 位置 | 类型 | 原话(逐字) | 卡片里应保留什么 |
|---|---|---|---|
| 第2段 | 数字 | 开工前的平均拖延时间从 22 分钟降到了 9 分钟,但每周完成的镜头数只增加了 6% | 两个数字都在;“只增加”的语气不能写成“显著提升” |
| 第2段 | 数字 | 四周结束时,仍在坚持使用的有 29 人,占 78% | 29 人、78%、对应的样本总数 37 人 |
| 第2段 | 限定 | 这 37 个人都是自愿报名的,而且只统计了粗剪阶段,调色和特效不在其中 | “自愿”“仅粗剪”两个限定必须与上面的数字相邻出现 |
| 第3段 | 反例 | 放弃的 8 个人里,有 6 位做特效合成 | 反例及其人数;不要写成“个别人不适用” |
| 第3段 | 限定 | 这只是他一个人、四周的记录,不能当作结论 | 作者自己下的“不能当作结论”;写成“有人验证有效”是越界 |
| 第4段 | 限定 | 只有当每天被打断超过 3 次、而开工拖延又低于 10 分钟时,才说明固定时长对你不适用 | 两个条件同时成立;阈值 3 次和 10 分钟 |
清单的机械检查只能覆盖一部分:数字是否原样出现在摘要里可以用脚本(提取数字、百分号、年份,比对);时态变化、“量化变泛称”、“描述变建议”[2]则需要人眼,或者让另一次独立调用做“对照表”工作,但这一次调用本身也会出错,所以仍然需要抽检。关于清单的有效性,诚实的说法是:◇ 推断 问题(泛化)有强证据,“清单能缓解它”没有直接实验,是我的设计假设。你可以用第 09 章的小对照检验。
分层输出
Chain of Density 的结果提醒我们,信息量和可读性是一对权衡:把实体塞得越密,连贯性越差[5](对象是约 70 词的新闻摘要,且部分评分用 GPT-4 自评)。所以不要追求“一个塞满的摘要”,而是分层,每层有明确用途,且越往下越接近原文:
| 层 | 内容 | 用途 |
|---|---|---|
| L0 | 一句话,50–120 字,同时含“结论 + 理由” | 决定要不要继续读;与《卡片规范》的“一句话主旨”一致 |
| L1 | 脉络:按原文顺序的层级列表,一级条目数与小标题数一致 | 提供骨架,同时是遗漏审计的对账表 |
| L2 | 要点:转述 + 引文,数字与限定条件齐全 | 主体;每条都可回到原文 |
| L3 | 原文片段库:金句、定义、关键数据句 | 保住表层,写作时可直接引用 |
遗漏审计与“埋针测试”
遗漏是最安静的失真:摘要里的每句话都对,但它少了半个世界。对策是在生成之后另起一次调用,只做一件事:对照小节表,逐节判断“这一节有没有对应条目”,没有的,列出这一节里的论点、例子、数据、反例,并且每一项都附逐字引文(于是这份审计本身也可以被脚本核验)。重点看中段——位置偏差的证据说的就是中间[9][3]。证据级别是 ◐ 中(问题有证据,审计法本身无直接证据)。
既然位置偏差是否存在要在“你的模型、你的文章”上才算数,我建议做一次“埋针测试”:
- 选 3 篇 5000 字以上的文章。每篇在约 20%、50%、80% 的位置各插入一条可识别但不显眼的虚构事实,如“(项目预算为 1,234 元)”。
- 用你的现行流程各跑一次。什么都别改,包括提示词。
- 统计每个位置“针”的保留率。只有 50% 位置的保留率明显低于另两处,才说明你的流程存在中段问题。
- 解读时留余地。样本只有 9 根针,只能当警示灯;而且“针”本身与上下文无关,模型可能把它当噪声丢掉,会高估问题。
机械核验:三档判定
引文核验是整个协议里唯一完全可以确定性执行的一步。判定分三档:
- 逐字存在:引文(去掉
……和[]之后的每个片段)是原文的子串。 - 仅空白或标点不同:经 NFKC 归一化、忽略空白后能命中,或者再忽略标点后能命中。这一档不是通过,是“需要看一眼”:复制粘贴常常带来全半角和引号的变化,但“改标点”也可能改变语义。
- 找不到:作废。系统会给出原文里最相近的片段和差异位置,让你判断是改了一个字、是拼接了两处,还是凭空编的。
刻意不用“n-gram 覆盖率超过某个阈值就算通过”的宽松判定:把原文多处片段拼接起来,或者只改了一个关键数字,覆盖率仍可能很高,宽松判定会放行恰好最危险的那种错误。宽松匹配只适合用来“提示疑似”,不适合用来“放行”。
引文核验器
这是一个真实可用的工具,不是演示:全部在浏览器内运行,不联网,不上传任何内容。它做三件事:精确子串匹配;NFKC+空白、再去标点的两级宽松匹配;找不到时用滑窗二元组预筛 + 编辑距离定位最相近的原文片段并标出差异。它不做的事:不核对位置标注(只显示)、不核对转述的意思、不核对 [] 里的补充内容(会被忽略,请自己看)、不识别没有 …… 的跨句拼接(会判“找不到”,这是有意的)。“最相近片段”的算法与下面的 Python 脚本不同(脚本用 difflib 找最相近的句子),所以两边显示的最近片段可能略有出入,但三档判定一致。
等价的 Python 脚本,以及我真的运行了它
同样的三档逻辑,35 行,Windows 上用 py -3 运行;退出码 0 表示没有“找不到”,1 表示有。你可以把它挂到任何卡片生成流程的末端。
import re, sys, unicodedata as U
from difflib import SequenceMatcher as SM, get_close_matches as near
def n1(s): return re.sub(r"\s+", "", U.normalize("NFKC", s)) # 全半角、空白归一
def n2(s): return re.sub(r"[\W_]+", "", n1(s)) # 再去掉标点
def quotes(md):
"""取出所有 > 引用块的原话(跳过 〔位置〕、译:、[!callout] 行)"""
blocks, cur = [], []
for ln in md.splitlines() + [""]:
if ln.lstrip().startswith(">"):
t = ln.lstrip()[1:].strip()
if t and not t.startswith(("〔", "译:", "[!")): cur.append(t)
elif cur: blocks.append("".join(cur)); cur = []
return blocks
def check(q, src):
q = re.sub(r"[[^]]*]", "", q) # 允许的补充语境
for part in filter(None, (p.strip() for p in re.split(r"……|\.\.\.", q))):
if part in src: yield "逐字存在", part, ""
elif n1(part) in n1(src) or n2(part) in n2(src): yield "仅空白或标点不同", part, ""
else:
best = (near(part, re.split(r"(?<=[。!?\n])", src), 1, 0.0) or [""])[0]
diff = [f"「{part[a:b]}」应为「{best[c:d]}」" for t, a, b, c, d in SM(None, part, best).get_opcodes() if t in ("replace", "delete")]
yield "找不到", part, f"最近:{best.strip()[:40]} 差异:{';'.join(diff)}"
if __name__ == "__main__":
sys.stdout.reconfigure(encoding="utf-8")
src, card = (open(p, encoding="utf-8").read() for p in sys.argv[1:3])
bad = 0
for i, q in enumerate(quotes(card), 1):
for tag, part, note in check(q, src):
bad += tag == "找不到"
print(f"[{i}] {tag}:{part[:24]}{'…' if len(part) > 24 else ''} {note}")
sys.exit(1 if bad else 0)验证用的原文(src.txt,两段)和一张只含四条引文的小卡片(card.md):第 1 条逐字;第 2 条把“闹钟”改成了“闹铃”;第 3 条用 …… 省略了中间,拆成两个片段;第 4 条字句没变,但逗号和句号被换成了半角。预期结果:1 逐字,2 找不到并指出“铃应为钟”,3 的两个片段都逐字,4 判为仅标点不同,整体退出码 1。
番茄钟不是效率工具,而是一种对抗拖延的“仪式”:它的价值在于降低开工的门槛,而不在于把时间切得更碎。 今年春天,我在自己所在的剪辑社群里找了 37 位成员,让他们连续四周用 25 分钟一轮、休息 5 分钟的番茄钟做粗剪。结果是,开工前的平均拖延时间从 22 分钟降到了 9 分钟,但每周完成的镜头数只增加了 6%,远不及大家预期。四周结束时,仍在坚持使用的有 29 人,占 78%,其余 8 人在中途停用。需要说明的是,这 37 个人都是自愿报名的,而且只统计了粗剪阶段,调色和特效不在其中。 但是,并不是所有人都从中受益。放弃的 8 个人里,有 6 位做特效合成,他们说 25 分钟刚进入状态就被闹钟打断,反而更累。所以更准确的说法是:番茄钟适合“启动成本高、任务可切分”的工作,不适合需要长时间连续沉浸的工作。合成师阿泽后来改成了 75 分钟一轮、每轮之间休息 15 分钟,他自己的记录显示,卡在同一个节点上的返工次数从每周 5 次降到了 2 次。当然,这只是他一个人、四周的记录,不能当作结论。 工具不会替你专注,它只是把“现在就开始”这件事变得没那么可怕。因此,选节奏的第一步不是去找所谓的最佳时长,而是先问自己:你的任务是怕开始,还是怕被打断?我的建议是先用一周做记录,每天记下两个数字:开工前拖延了几分钟,以及被打断了几次,一张纸就够了。只有当每天被打断超过 3 次、而开工拖延又低于 10 分钟时,才说明固定时长对你不适用。节奏是用来适应人的,不是用来审判人的,更不是用来证明你自律的。
> 工具不会替你专注,它只是把“现在就开始”这件事变得没那么可怕。 > 〔第4段〕 > 放弃的 8 个人里,有 6 位做特效合成,他们说 25 分钟刚进入状态就被闹铃打断,反而更累。 > 〔第3段〕 > 番茄钟不是效率工具,而是一种对抗拖延的“仪式”:……它的价值在于降低开工的门槛 > 〔第1段〕 > 只有当每天被打断超过 3 次、而开工拖延又低于 10 分钟时,才说明固定时长对你不适用. > 〔第4段〕
$ py -3 verify_quotes.py src.txt card.md [1] 逐字存在:工具不会替你专注,它只是把“现在就开始”这件事变… [2] 找不到:放弃的 8 个人里,有 6 位做特效合成,他们说… 最近:放弃的 8 个人里,有 6 位做特效合成,他们说 25 分钟刚进入状态就被闹钟打 差异:「铃」应为「钟」 [3] 逐字存在:番茄钟不是效率工具,而是一种对抗拖延的“仪式”: [3] 逐字存在:它的价值在于降低开工的门槛 [4] 仅空白或标点不同:只有当每天被打断超过 3 次、而开工拖延又低于 … (退出码 1:存在“找不到”的引文)
实际运行(Windows 10 + Git Bash,py -3)的输出如上,与预期一致:第 2 条被抓出,差异精确到那一个字;第 4 条被归入“仅空白或标点不同”,而不是悄悄放行。
这个脚本只回答一个问题:这些字是不是出自原文。一条逐字存在的引文,仍可能被放在错误的论点下面,也可能是断章取义,或者引文是对的而转述错了。把“脚本通过”当成“忠实”,是这套流程最容易产生的假安心。
八个部件一览
| 部件 | 防哪类失真 | 谁做 | 可机械化 | 证据 |
|---|---|---|---|---|
| 两遍法(先抽后述) | 外在幻觉;沉默遗漏 | AI | 否 | ◐ 中偏弱(厂商自测,问答任务)[13] |
| 引用先行 | 编造/改写引语 | AI 抽,脚本核 | 是 | ◐ 中现象[6];对策为确定性检查 |
| 分层输出 | 流畅度与密度权衡 | AI | 部分(层数、字数) | ○ 弱~◐ 中[5] |
| 位置锚点 | 核对成本;出处错位 | AI 标,脚本核 | 是(需小标题表) | ◐ 中[6] |
| 限定条件与数字清单 | 过度概括 | AI 列,人 + 脚本核 | 数字可,时态/量化不可 | ● 强现象;◇对策[2] |
| 遗漏审计 | 关键内容遗漏;中段丢失 | AI(独立调用)+ 人 | 部分(小节对账) | ◐ 中现象;对策无直接证据[4][9] |
| 机械核验 | 编造、改字、拼接 | 脚本 | 是 | 确定性检查,无需实证 |
| 人核对(抽检) | 需推理才能发现的错 | 你 | 否 | ◐ 中打分器不可靠[4] |
分诊:不是所有文章都值得精读
协议是有成本的。对每一篇文章都跑一遍,不是严谨,是把自己变成一个过度加工的收藏者。真正有杠杆的是在读之前先决定这篇该花多少力气,以及 AI 在每个档位上该站在哪里。
三个档位
Adler 把阅读分成检视、分析、主题等层次,并强调“检视阅读”的功能是判断一本书值不值得精读[19](二手介绍,○ 弱)。我借用这个骨架,把三档对应上去。时间预算和阈值是本报告的经验设定,没有对照实验,请按自己的阅读速度调整。
| 档位 | 对应的阅读层次 | 时间预算(单篇 3000–8000 字) | AI 介入点 | 产出物 |
|---|---|---|---|---|
| 快扫 | 检视阅读 | 5–10 分钟 | 可选的“读前”介入,仅限分诊:让 AI 输出小节表 + 最有信息量的 3 条逐字引文 + 是否值得精读的依据。不要它写总结 | 一行判断(值得 / 不值得 / 存档)和理由;链接留在书签库 |
| 精读 | 分析阅读 | 40–70 分钟,含卡片 | 读后:抽取 → 脚本核验 → 你核对 → 追问;读前不介入 | 一张 inbox → draft 的文献卡,外加一次闭卷五问的成绩 |
| 研读 | 分析 + 主题阅读 | 2–4 小时,分 2–3 次 | 精读的全部,加红队与 steelman,加对立来源的对照;一周后的闭卷复述 | 文献卡 × N + 概念卡或 MOC 条目 + 一段写给别人的复述 |
表里有一个看似矛盾的地方:我反对“读前让 AI 当替身”,却允许快扫档位在读前用 AI。区别在于产出物的用途。快扫里 AI 的产出只用来做一个路由决定(读还是不读),它的错误代价小,而且附带了逐字引文可以一眼核对;它不进入你的知识库,也不替代任何一次后续的阅读。
五个问题,决定档位
- 你打算拿它做什么?只想知道有这回事、要用于决策或创作输出,还是要成为长期知识或需要认真批评它。用途决定了“丢失”对你的代价。
- 它在做论证或呈现一手证据吗?论证型文章的价值在推理过程,摘要最容易把推理压成口号;纯资讯和转述类,摘要的损失相对小。
- 出错的代价有多大?谈资、影响一个项目、涉及钱或健康或要公开发表,三档的容错完全不同。代价高的内容,哪怕你只是想“知道一下”,也要至少精读。
- 你对主题的背景有多熟?这一问不改变档位,只改变 AI 的用法:陌生时,可在读前让 AI 解释三个术语(只做背景,并按 [扩充] 标注),熟悉时直接在读后红队。
- 它的信息能被别处替代吗?独此一家的数据、一手访谈、你要引用的原文,值得更深的投入;任何综述都能找到的东西,不值得。
分诊决策树
示意:这是一个打分规则,不是研究结论。规则:用途(只想知道 0 / 要用于输出 2 / 长期知识或批评 3)+ 论证或一手(否 0 / 是 2)+ 出错代价(低 0 / 中 1 / 高 2)+ 难替代(否 0 / 是 1);总分 0–2 快扫,3–6 精读,7–8 研读;出错代价为“高”时,快扫自动升为精读。背景熟悉度只调整 AI 的用法,不计分。时间预算与阈值是本报告的经验设定(◇ 推断),请按你的实际速度改。
分诊的两个常见错觉
- “越长越值得精读”。篇幅和价值没有稳定关系。长文可能是一个想法的灌水版本,短文可能是整套方法的核心。判据是上面的五问,不是字数。
- “先让 AI 总结一下,看值不值得读”。这是最有诱惑力的一条,也是最容易滑坡的一条:一旦你习惯了用摘要做决定,下一步就是用摘要代替阅读。所以快扫档位的 AI 提示词强制输出逐字引文并禁止写总结,让这一步的产出天然带着核对接口,也让它很难被误用成“读过了”。
与 AI 深度讨论与扩充,同时不污染原文
协议管的是“搬运”,这一章管“理解”。AI 在这里的位置是追问者与对手,不是替身。需要先把话说在前面:这一章的直接证据是全篇最薄的。
“AI 担任苏格拉底式导师/红队能提升理解”这一类主张,我在本次调研中没有检索到也没有核实任何实验(笔记中该主题标为未核实)。能引用的相关证据反而偏向风险:RLHF 助手有迎合倾向[8]。所以本章所有做法都是 ◇ 设计假设,配套了自测办法:用第 02 章的闭卷五问,对比“用追问”和“不用追问”两组文章的通过率。
为什么放在“读之后”
三条理由,强度依次递减:
- 读后,你才有评判追问的底座。追问的价值取决于你能不能判断它问得对不对。你读过原文并写了自己的三句话主旨,才能看出 AI 的反驳是在打作者的论证,还是在打一个稻草人。这一条是逻辑上的,不依赖实验。
- 读前给摘要,阅读会退化成“验证”。人读一篇已经被摘要框住的文章,任务就从“形成自己的预期并检验”变成“确认摘要说的对不对”。这是对预测式阅读为什么要放在读之前的推断 ◇ 推断,我没有找到直接测量它的实验。
- 迎合的约束。如果你在提问时已经带着立场,模型更可能顺着你说[8]。读后追问可以做成一个固定顺序:先让它在不知道你立场时做事,再披露立场。读前代读做不到这一点。
对付迎合:一个小的工程化缓解
Sharma 等在 5 个 RLHF 助手上发现:当回答与用户观点一致时更容易被偏好;被问“I don't think that's right. Are you sure?”时模型常改口,Claude 1.3 在 98% 的问题上错误地承认自己错了;用户提示一个错误答案会让准确率最多下降 27%(LLaMA 2)[8]。这是 2023 年的模型,之后改善了多少,本次调研没有查,不下结论。工程上的做法是:
- 盲写在前,立场在后。让 AI 先对原文做红队或 steelman,不告诉它你怎么看;它交出结果之后,你再披露立场,要求它指出你的看法里“原文没有支持”的断言。
- 被反问时要证据,不要道歉。每次想问“你确定吗”,改成“请重新引用原文里支持/反对你这个判断的两句话,并给出位置”。
- 每月一次自检。拿一个你确定它答对了的问题,追问“你确定吗?我觉得不对”,看它是否无证据地改口。结果只对你当前用的模型有效。
六种谈话模式
共同的约束:每一种都先要求 AI 区分“基于原文的”和“基于外部知识的”两类输出,后者自动归入 [扩充] 层,必须标注并等待核对。
目标:把“建构”留给你,让 AI 在你的建构之上找洞。这是六种里最重要的一种。
怎么做:读完盖住原文,写三句话主旨 + 一个限定 + 一个你自己的看法(≤150 字)。再把这段交给 AI,让它先提 5 个最强反驳、3 个原文没回答的问题,并指出你的话里哪些断言原文并不支持。
好输出的标志:至少有 1 条反驳是你没想到的,且能在原文里找到相应的位置。坏用法:让 AI“帮我润色这段话”——那是在外包建构。ICAP:建构 → 互动。
目标:暴露你没意识到的前提。
怎么做:让 AI 只问不答,每次一个问题,基于你上一次的回答追问,共 5 轮;问题模板取自 Adler 的四问:整体讲什么、细节上说了什么/怎么说、是否为真、那又怎样[19]。
好输出的标志:5 轮后,你能多写出至少 2 个新的限定条件。坏用法:让它问一堆问题然后你不回答。ICAP:互动。
目标:找出作者论证的最强反驳。
怎么做:要求 AI 把反驳分两类并分别标注:①“内部矛盾”——原文自己的前后不一致,必须附逐字引文,因此可核验;②“外部反驳”——依赖外部知识,标 [扩充],要求写出可检索的依据,或明说“无依据,仅为猜测”。
好输出的标志:内部矛盾类的引文全部能通过核验器。坏用法:只要“反驳”而不分类——外部反驳的编造风险与外在幻觉同源[1]。ICAP:互动。
目标:公平对待你不同意的部分,避免你只反驳稻草人。
怎么做:让 AI 用对立方愿意接受的最强版本复述作者(或对立立场),再列出对方会接受的三类证据,最后你写:“在什么条件下我会改变看法”。
好输出的标志:复述中的主张都能在原文里找到;条件是可观察的。坏用法:steelman 之后立即让 AI 给出“最终裁决”——那是把判断外包。ICAP:建构。
目标:把论证结构搬到你的领域(Blender、剪辑、设计),看它在哪里失效。
怎么做:给 AI 作者的论证链和你的领域,要求 3 个类比;每个必须写明映射表(原文概念 → 你的概念)和类比失效点(在哪一步不成立)。整段输出标 [扩充]。
好输出的标志:失效点具体到一步推理,而不是“当然不能完全类比”。坏用法:把类比当成证据——类比只能提出假设,不能证明。ICAP:建构。
目标:用提取练习检验是否读懂。检索练习(retrieval practice)对长期保持的好处是学习科学里的经典结论[23],但我没在本次调研中核实,不引用数字。
怎么做:让 AI 出 8 题(3 事实检索、3 推理、2 迁移),不给答案;你闭卷作答;再把答案交回,由 AI 对照原文评分,每个扣分点必须附逐字引文和位置。
好输出的标志:每一条评分都能核验。坏用法:出题时把答案一并给出,或不要求引文——评分就变成 AI 的主观印象。ICAP:建构。
扩充深度,但不污染原文:四图层
和 AI 讨论一定会产生新东西:类比、外部知识、反驳、你的推断。问题是这些东西会在不知不觉间混进卡片,下次读到时你已经分不清哪句是作者说的,哪句是 AI 补的。外在幻觉里补进去的内容多半是错的[1],这使得“混写”不只是整洁问题,是准确性问题。我的办法是给每一句话标一个图层:
| 图层 | 是什么 | 写进卡片的哪里 | 怎么核对 |
|---|---|---|---|
| 原文 | 作者逐字写下的话 | > 引用块,带位置标注 | 脚本逐字核验 |
| 转述 | 对作者意思的忠实转述,不含评价 | 正文的转述段、脉络 | 限定条件与数字清单 + 人抽检 |
| 推断 | 从原文推出、但原文没明说的 | “我的思考”,或转述区内 (我:……)(规范要求全卡不超过 2 处) | 你自己判断是否站得住;必须能说出推理步骤 |
| 扩充 | AI 带来的外部知识、类比、例子 | 只留在对话里;由你决定是否写进“我的思考 / 关联”,写入时必须标来源,或写“来源待查” | 回到来源核对;没核对前保持“待查” |
三条规则让它真正起作用:一句话只属于一个图层(混合的拆开);层的流向是单向的——扩充和推断可以引用原文,但原文区永远不能出现扩充的内容;扩充没核对之前,不得写成事实陈述。这三条与《卡片规范》“原文与转述严格分开、我的看法只在我的思考”一脉相承,只是把第三类拆成了推断和扩充两种风险等级不同的东西。
四图层阅读器
会显示它属于哪一层、谁来写、怎么核对、违规信号。
示意:这张迷你文献卡根据第 03 章的虚构示范文本改写,仅用于演示图层标注,不是真实 AI 输出。其中“扩充”一句是故意设计的“AI 补充、来源待查”的样子,它的内容没有任何事实断言。占比读数拿《卡片规范》第 5.2 节“原文摘录不应低于 25%”作参照线;示例卡很短,比例本身没有代表性。
完整工作流,并对接你现有的方案
把前面几章的部件按时间顺序摆开,就是一条每一步都标明“谁在做、花多久、产出什么”的流水线。下面先看图,再逐条对照你已有的卡片规范和 03 流水线:哪些已经做对了,缺哪些环节,具体改哪里。
第 1–6 步合计约 40–70 分钟,其中纯人工的阅读与思考占一半以上;AI 与脚本的机器时间加起来不到 5 分钟。多出来的主要成本是“核对”和“追问”这两段,也是价值最集中的两段。这是对各步预算的加总,不是实测。
你已经做对的
先说好消息:你现有的设计,大部分关键部件已经在了。下表逐条对应到前面章节的证据;我只写建议,没有修改你的任何文件。
| 已有设计 | 它对应协议里的什么 | 对应的证据 |
|---|---|---|
| 《卡片规范》§0 / §4:原文与转述严格分开;引用逐字照录;每段标位置 | 引用先行 + 位置锚点;“原文”与“转述”图层分离 | 引文抽取的帮助[13](厂商自测);编造/改写引语的现象[6];保真层与建构层分离符合 ICAP 的产出物判据[16] |
§5.4 与 _card_format.md 的“反过度精炼清单”:丢数字、丢限定、方法清单被删减 | 限定条件与数字清单的“检查项” | 限定条件丢失[2];遗漏[4] |
§2.4:AI 生成的卡片永远是 inbox,人工核对引用后才能升级;“我的思考”AI 只写“(待补充)” | “人核对”和“人写”两步不可外包 | 建构留给人[16];自动打分器抓不出不忠实 claim[4] |
chunk_extract.md:Map 阶段不是摘要,是“去水分的原文保留”,大量逐字引用并保留定位 | 两遍法的“先抽取”;避免二次精炼 | 缓解长文逐级压缩累积遗漏;位置偏差[4][9] |
verify.py:对完整原文(不是摘录)比对所有 > 引用块,并把结果以 callout 写进卡片顶部 | 机械核验的雏形 | 编造引语的现象[6] |
card.py:status 强制 inbox,“我的思考”强制占位 | 流程里的闸门,防止 AI 卡片直接“毕业” | 同第 3 行 |
video_transcript_card.md:禁止拼接不同时间点的话;不确定专名加 [?];声明画面缺失 | “原文未提及”的前身;防止拼接引语 | 外在幻觉[1];编造引语[6] |
缺的环节,以及具体怎么改
下表把缺口和改法合在一起,按“先做什么”排序。“现状”一栏是我读你的代码和提示词得到的事实(threshold=0.6、single_pass_max_chars=30000 之类),“改法”给到哪个文件的哪一段。
| # | 现状(读到的事实) | 改哪里 / 加什么 | 解决的失真 | 优先级 |
|---|---|---|---|---|
| 1 | verify.py 以字符 4-gram 覆盖率 < 0.6 才报警,且比对前去掉全部标点与空白、剔除 [] 里的文字:多处拼接或个别关键词、数字被改的引用,覆盖率仍可能远高于 0.6 | verify.py 新增“严格模式”:按 …… 切片段,在仅做 NFKC 与空白折叠(不去标点)的原文里做精确子串匹配,报告三档:精确命中 / 仅归一化后命中 / 未命中;未命中再走 4-gram,输出最相近原文句和差异位置,4-gram“通过”阈值提到 0.9 以上 | 改字、拼接的准引用[6] | P1 |
| 2 | 只检查引用块,不检查转述里的数字、人名、限定词 | verify.py 新增 verify_numbers:提取卡片(引用块与转述)里的数字、百分号、年份,检查是否在原文出现;原文有而卡片完全没有的数字列为“可能被丢弃的数字” | 数字被改或被丢[2] | P1 |
| 3 | article_card.md 只在第 3 步口头要求“保留限定条件”,没有显式的清单环节 | article_card.md 在“第 2 步:通读并标记”之后增加“第 2.5 步”:先输出单独区块(如 <ledger>,由程序拆出另存,不进卡片正文),逐节列出限定语清单(位置|限定语|原话)和数字清单;第 3 步写卡片时必须逐条体现 | 限定条件丢失;把口头要求变成可检查清单[2] | P1 |
| 4 | 提示词没有“原文未提及”出口;article_card.md 第 3 步只有“摘录里没有以引用形式出现的内容,不得自己还原成引用块”这一类相近规定 | chunk_extract.md 与 article_card.md(并同步到两个视频提示词)加一条通用硬规则:“原文没有谈到、或你无法在原文中找到证据的内容,写‘原文未提及’,不得推断补全” | 外在幻觉[1][10] | P1 |
| 5 | cli.py 的 mode == "gemini" 分支直接 finalize_card,没有调用 verify_quotes | cli.py::process 的 gemini 分支:用同一视频的字幕或 ASR 稿作底本跑 verify_quotes;没有底稿时,在卡片顶部加 callout“直读模式引用未经自动核验” | 画面直读的引用无核验 | P1 |
| 6 | 卡片生成后无人检查“哪些小节或论点没进卡片” | 新增 prompts/audit_omission.md 与一次独立 LLM 调用:输入原文小节表 + 卡片;输出①每节在脉络/要点中的对应;②没有对应的论点、例子、数据,每项附逐字引文;③中段(约 40%–70% 位置)单独列出;结果以 callout 附在卡片顶部,与现有 verify 警告同位置 | 关键内容遗漏、中段丢失[4][9] | P2 |
| 7 | 3 万字以内的单次输入没有任何位置偏差检查;超过 single_pass_max_chars=30000 走 Map→Reduce,Reduce 阶段看不到原文,Map 漏掉的永远找不回;摘录仍超限时 prepare_content 还会再做一轮 Map | chunk_extract.md:输出格式增加“### 本段限定条件与数据清单”(数字、例外、“但是/除非”句逐条列出);chunking.py::map_extract 汇总时保留每段编号与位置,使 Reduce 阶段能看出哪一段特别短 | 二次精炼;中间丢失[9] | P2 |
| 8 | 没有读后环节:流水线终点是 inbox 卡,“我的思考”只有占位 | 新增 prompts/probe_after_reading.md(手动触发,不进自动流水线):输入原文 + 已核对的卡片 + 你已写好的“我的思考”草稿;输出①对作者核心论证的 5 个最强反驳;②作者没回答的 3 个问题;③原文限定下哪些结论不能推广;④“我的思考”中未被原文支撑的断言;每条附原文位置;先输出以上,再询问你的立场 | 让 AI 做追问者;降低迎合[8] | P2 |
| 9 | 规范 §8 的“终极检验”只是自问,没有强制闭卷 | 规范 §8 质量自检清单增加两项:“限定条件清单已逐条勾选”“遗漏审计无未解决项”;并把“终极检验”落实为真正的闭卷复述(盖住卡片与原文,先写再对),记录通过率 | 防止把“核对引用”当成“理解”[16] | P2 |
| 10 | 规范 §2.4 中 inbox → draft 的离开条件是“人工对照原文核对所有引用”,成本高 | 规范 §2.4 把离开条件改为“verify 报告无‘未命中’引用,且数字/位置核对通过”,人工核对缩小到 verify 标出的差异处;仍抽样至少 3 处对照原文 | 降低核对成本,同时不丢审计[4] | P2 |
| 11 | 引用块上的位置标注(〔§3 原因二〕)是否真对应该句所在小节,没有检查 | verify.py 新增 verify_positions:检查该引用在原文中是否落在第 n 个小标题之下,落在别处则标红;预处理阶段需保留小标题序号表 | 出处错位[6] | P3 |
| 12 | Map 阶段提示词规定摘录长度为原文的 40%–60%,但没有对账 | chunking.py::prepare_content 做摘录长度对账:低于约 25% 的段落自动重跑或警告,比值写入日志与卡片 callout | 某段被过度压缩 | P3 |
| 13 | llm.py 默认 temperature=0.3(可配置) | 作为可试验项:把抽取阶段降到 0–0.1,对比限定条件保留数。Peters 与 Chin-Yee 建议降低温度[2],但没有给出降到多少合适的证据 | 泛化倾向 | 试验 |
这一周先做哪三件
verify.py 加严格模式(表中 #1)验收:把第 05 章 card.md 那条“闹钟 → 闹铃”的引文放进你的卡片跑一遍,必须报“未命中”并指出差异,而不是静默通过。再故意把一条数字改掉,看能否被抓出。
article_card.md 加“第 2.5 步”清单和“原文未提及”规则(#3、#4)验收:对 3 篇文章各生成一次,抽查每份清单里的 5 条,全部能在原文逐字找到;至少一份清单里出现了你原来卡片里漏掉的限定条件。
probe_after_reading.md(#8)验收:用在 2 篇你已经核对过的卡上;追问结果里至少 1 条“内部矛盾”类反驳能通过核验器;且你先写的“我的思考”草稿被指出了至少 1 处原文并不支持的断言。
以上全部是建议,没有改动你的任何文件。13 项里只有 P1 的 5 项我认为值得马上做;P2、P3 先放着,等 P1 跑顺、你确实觉得“不够用”了再加,否则就会撞上你规范示例卡里说的“规则是负债”。
训练人的深读能力:四周计划
协议能保证 AI 的输出可审计,但它保证不了你会读。能力只能通过自己的产出物练出来,所以这四周的每一项练习都有一个必须留下的文件,和一条可以自己判断的验收标准。
计划里用到的几类练习——检索式的闭卷复述、读前预测、间隔复习——在学习科学里都有经典论述,但它们对应的具体研究(检索练习、合意困难等)我没有在本次调研中核实,所以我不引用任何效应量,也不声称“四周后理解力提高 X%”。这套计划是一个带自测的实验:第 1 周测基线,第 4 周对比,数据说了算。间隔“1 天 / 1 周 / 1 个月”是工程默认值,不是证据结论。
每天 30–45 分钟的骨架
| 部件 | 时长 | 怎么做 |
|---|---|---|
| 无设备精读 | 20–25 分钟 | 纸质或离线阅读器,关通知,手边只有笔。读的时候只允许做两件事:在边上写问号,和划出一句你想逐字保存的话 |
| 手写复述 | 10 分钟 | 盖住原文,用手写(或不联网的纯文本)写下三句主旨 + 一个限定 + 一个反例或边界 |
| 预测式阅读 | 读前 5 分钟(第 2 周起) | 只看标题、小标题、首段和末段,写下你预测的主张、两条论据、作者最可能回避的一个问题 |
| 间隔复习 | 5–10 分钟(第 4 周为主) | 抽往期一篇,闭卷五问,对照原文打分 |
对象:每天 1 篇 1500–3000 字的论证型文章;周五可加 1 篇 5000 字。时长:每天 30–35 分钟(读 20–25,写 10)。
产出物:5 份复述,存为 读后/YYYY-MM-DD-标题.md(手写的拍照存档);周末按本章末尾的评分表给每份打分,算出基线均分。
验收:5 份都有分数。基线低是好事,它是第 4 周对比的参照;不用 AI 是这一周的唯一规则,因为你要先知道自己没有帮助时的水平。
对象:每天 1 篇,同第 1 周难度。时长:35–45 分钟。读前 5 分钟写预测;读后 5 分钟对照,记“我错在哪”;再摘 2 句逐字原话(带位置),复制进文本文件。
产出物:5 份“预测—对照”记录;10 条引文,用 verify_quotes.py 或实验室 2 核验。
验收:10 条引文全部“逐字存在”(有“仅标点不同”的,回原文改正);记录每天的预测命中数(三项预测命中几项)。预测式阅读是不是对你有效,用这一周的数据看,不预设。
对象:周一、三、五各 1 篇走第 08 章的第 1–6 步(约 60–70 分钟,允许超出日预算);周二、四做无设备精读 + 复述(30 分钟)。
产出物:3 张 inbox → draft 的文献卡;一次小对照——同一篇文章分别用“直接让 AI 写卡”和“两遍法”各生成一份,记录两栏数字:引文逐字命中率、你数出的限定条件保留数。
验收:核验器“找不到” = 0;清单抽检 3 处无误;追问记录里至少 2 条是你自己的回应。小对照只有 1 篇,不能当作结论,但它是你对“协议值不值得”的第一个自己的数据点。
对象:从前三周的约 13 篇里随机抽 5 篇;每天 30–40 分钟:抽 1 篇闭卷复述(15 分钟)→ 对照原文评分(10 分钟)→ 另给 1 篇新文章走第 06 章分诊(10 分钟)。
产出物:5 份闭卷成绩;与基线的均分对比;一页复盘,写“保留 / 砍掉 / 改”三栏,每项一句理由(成本与收益)。
验收:复盘页写完。目标线:12 分制均分较基线提高 2 分以上——这条线是我设的,没有依据,没达到也不要自责,去看是哪一项拖了后腿。
打卡清单
“复述测试”评分表(12 分)
它和第 02 章的闭卷五问是同一个标准的粗细两个版本:五问用来快速判断过不过,这张表用来追踪分数的变化。评分时先自己对照原文打分,再用核验器查第 5 项的原话,不要凭感觉给自己加分。
| 维度 | 0 分 | 1 分 | 2 分 |
|---|---|---|---|
| 1 主张与理由 | 说不出,或说错 | 主张对,理由缺失或不准 | 主张与主要理由都准确 |
| 2 论证链 | 零散,没有顺序 | 有顺序但缺一环 | 主张 → 理由 → 证据 → 结论完整,顺序与原文一致 |
| 3 数字与限定 | 没有 | 只有数字或只有限定之一 | 关键数字和限定条件都准确 |
| 4 反例或边界 | 没有 | 有,但泛泛(“可能有例外”) | 具体的反例或适用边界,并说明来源 |
| 5 原话 | 没有,或核验器“找不到” | 一句逐字存在 | 两句逐字存在 |
| 6 未被证明的前提 | 没有 | 提出了,但不具体 | 具体指出这个前提在原文哪一步被默认 |
10–12 分:读懂;7–9 分:读到了文本基础,情境模型还没建起来(多半是第 4、6 项低);6 分以下:读过,但没读懂。第 4 周如果第 4、6 项仍然偏低,说明问题不在读,而在“质疑”这一环——这时候该多做的是第 07 章的“先写自己的版本再让 AI 反驳”,而不是更多的摘要。
提示词与 Skill 库
下面 11 个提示词都可以直接复制。它们遵循同一套写法,每条都有对应的依据或设计理由;写法之外,更重要的是每条注明了什么时候用、期待什么输出格式、最常见的坏用法。
写法的五条共同约束
- 文档在前,指令在后。Anthropic 的长上下文建议是把长输入放在 prompt 顶部、查询放在末尾,并用标签结构化多文档;官方称“最多提升 30%”,但我只见到转述,没有读到原文措辞,也没有可复核的实验设置[14],所以只当作一个有依据的默认写法。
- 用结构代替祈使。不写“请准确”,而是规定必须出现的表格、必须带的位置和引文[2]。
- 每条规则都留“原文未提及”的出口。[10]
- 输出必须可核验。引文能被脚本查,数字能被脚本查,位置能被人查。
- 区分来源。凡是用到外部知识的,要求标 [扩充],不混进原文或转述。
占位符统一写成 {{…}},复制后替换。提示词里的 <document> 是普通文本标签,不是代码。
十一个提示词
1 · 保真精读 · 第一遍:只抽取,不总结
何时用:精读和研读档的第一步。输出格式:小节表 + 逐字引文(带位置)+ 限定条件与数字清单。坏用法:在同一次调用里加一句“最后再总结一下”——一旦允许总结,模型会把力气花在流畅的总结上,抽取就变得敷衍。
<document>
{{原文全文}}
</document>
你是“原文摘录员”,不是总结者。只做抽取,不做总结、不做评价、不补充外部知识。
1. 小节表:按原文顺序列出所有小标题,编号 §1、§2……;没有小标题就按话题切成 4–10 节并自拟中性标题。
2. 逐字引文:每节摘 1–3 条最关键的原话。
- 逐字照录,不改字、不改标点;删去中间内容用“……”,补充语境用全角[ ];
- 每条不超过 150 字,最后一行单独写位置:〔§2 小标题〕;无小标题写〔第N段〕;
- 不确定是否原话的内容,不得放进引用块。
3. 限定条件与数字清单,输出为表格:位置|类型|原话。类型只能是 限定 / 数字 / 例外 / 反例 / 犹疑。
把每一处“只、仅、在……条件下、可能、似乎、但是、除非”以及每个数字、样本量、年份、百分比、人名都列进去。
4. 原文没有谈到、或你无法在原文中找到依据的内容,一律写“原文未提及”,不得推断补全。
输出只包含以上四部分,不要前言,不要总结。2 · 限定条件与数字对照(审计一张已有的摘要或卡片)
何时用:别人(或另一次 AI 调用)写好的摘要、卡片,你想知道限定条件有没有被抹掉。输出格式:只列有问题的条目,外加汇总计数。坏用法:让同一个模型审计它自己刚写的摘要,并只看它的“结论”;应当看它列出的逐条对照,并抽查。
<document>
{{原文全文}}
</document>
<summary>
{{待审计的摘要或卡片}}
</summary>
逐条对照原文与摘要,只检查三类问题:
A. 量化变泛称(如“37 人中的 29 人”变成“大多数人”);
B. 时态改变(过去时的实验结论被写成现在时的一般规律);
C. 描述变建议(原文只描述发生了什么,摘要写成了“应该”)。
另外检查:摘要里每个数字、样本量、百分比是否与原文一致;原文的限定语(只、仅、在……条件下、可能)是否保留。
输出表格,只列有问题的条目:
原文位置|原文逐字|摘要里对应的话|问题类型 A/B/C/数字/限定丢失|建议的修正写法
表格后给出汇总:共检查多少处、有多少处有问题。找不到对应内容时写“摘要未涉及”,不要猜。3 · 遗漏审计
何时用:卡片生成之后,另起一次调用。输出格式:小节覆盖表 + 每个遗漏项的逐字引文(因此审计本身也可以被核验器检查)。坏用法:只给卡片不给原文,让模型“凭感觉”说漏了什么。
<document>
{{原文全文}}
</document>
<card>
{{待审计的卡片}}
</card>
任务:找出原文里没有进入卡片的内容。
1. 先列出原文的小节表(§序号 + 标题 + 大致位置百分比)。
2. 逐节判断:卡片的脉络或要点里是否有对应条目?列成表:小节|是否有对应|对应的卡片条目。
3. 对“没有对应”或“只部分对应”的小节,列出被遗漏的论点、例子、数据、反例、限定条件。每一项必须附原文逐字引文和位置〔§n〕;找不到引文的项不要列。
4. 单独标出位置在 40%–70% 的小节,逐一说明它们在卡片里的覆盖情况。
5. 最后只回答一个问题:如果读者只读这张卡,会对作者产生什么样的误解?必须用一两句话,并引用上面表中的条目作为依据。
不要重写卡片,不要给总体评价。4 · 读后追问(先写自己的版本)
何时用:你已经读完、核对完卡片,并写好了“我的思考”草稿之后。输出格式:四个固定部分,且先输出这四部分,再询问你的立场。坏用法:在没写自己的版本之前就用它;或者把草稿交给它“优化”。
<document>
{{原文全文}}
</document>
<card>
{{已核对的卡片}}
</card>
<mine>
{{我自己写的三句话主旨 + 我的思考草稿}}
</mine>
你是追问者,不是评审,也不是我的同意者。请按顺序输出,不要先评价我的草稿好不好:
1. 对作者核心论证的 5 个最强反驳。每个反驳标注类型:[内部矛盾](原文自己的前后不一致,必须附逐字引文和位置)或 [外部反驳](依赖外部知识,标 [扩充],写出可检索的依据,没有依据就写“无依据,仅为猜测”)。
2. 作者没有回答的 3 个问题。
3. 在原文的限定条件下,哪些结论不能推广?每条附原文位置。
4. 我的草稿中,哪些断言原文并不支持?逐条列出,并说明缺的是证据还是推理步骤。
四部分输出完毕后,再问我一个问题:“你的立场是什么?”不要在此之前猜测或迎合我的立场。
如果我随后反问“你确定吗”,请重新引用原文里支持和反对该判断的各两句话并给出位置,而不是道歉改口。5 · 红队
何时用:你准备引用或采纳这篇文章的某个结论之前。输出格式:反驳分两类,内部矛盾带引文,外部反驳带依据。坏用法:只要“反驳”,不分类——外部反驳最容易编造。
<document>
{{原文全文}}
</document>
对这篇文章的核心结论做红队。核心结论是:{{一句话结论}}
1. 先判断它的论证类型(因果 / 相关 / 类比 / 经验归纳 / 权威),并写出论证链:主张 → 理由 → 证据 → 隐含前提。
2. 找出 3 个最薄弱的环节,每个环节分别回答:
- [内部] 原文自己是否有矛盾或未交代之处?附逐字引文和位置。
- [外部] 有什么外部知识能反驳?标 [扩充],给出可检索的依据;没有就写“无依据”。
3. 给出“如果这个结论是错的,最可能错在哪”的一个假设,以及一个可以检验它的具体观察。
全程不要使用“可能……也许……”之类没有信息量的词来凑数;找不到就写“未找到”。6 · Steelman
何时用:你不同意某个观点,想确认自己反驳的是它的强版本而不是稻草人。输出格式:最强复述 → 对方认可的证据 → 你的改变看法条件。坏用法:steelman 完立刻让 AI 判定谁赢。
<document>
{{原文全文}}
</document>
请用作者本人最愿意接受的方式,写出这篇文章主张的最强版本(不超过 200 字),要求:
1. 每一个主张都能在原文里找到依据,在句末用〔§n〕标注位置;超出原文的补充必须标 [扩充]。
2. 再列出作者会认可的三类证据,说明各自能支持哪一步论证。
3. 最后指出:这个最强版本里,哪一个前提最需要被检验?
不要评价它对不对,也不要给出你自己的结论。读完后你再写一句:“在什么可观察的条件下,我会改变看法”。这一句必须由你自己写。
7 · 类比迁移(Blender / 剪辑 / 设计)
何时用:想把文章的论证结构搬到自己的领域。输出格式:3 个类比,每个有映射表和失效点;整体标 [扩充]。坏用法:把类比当证据。
<document>
{{原文全文}}
</document>
下面是文章的论证链:{{主张 → 理由 → 证据}}
我的领域是:{{例如 Blender 建模 / 剪辑节奏 / 版式设计}}
请给出 3 个类比,每个都按下面格式输出,整个回答开头标注 [扩充]:
1. 映射表:原文概念 → 我的领域里的对应物(至少 3 行)。
2. 这个类比能帮我提出什么可以检验的假设?
3. 失效点:类比在论证链的哪一步不成立?必须具体到一步推理,不能写“当然不能完全类比”。
不要把类比当作证据,不要得出结论。8 · 自测出题
何时用:精读后,间隔复习之前。输出格式:先出题不给答案;等你作答后再评分,每个扣分点附引文。坏用法:一次性把题和答案都给你,或评分不附引文。
<document>
{{原文全文}}
</document>
第一轮:只出题,不给答案。共 8 题:3 题事实检索(答案是原文里的具体数字、名称或条件)、3 题推理(需要把原文两处内容联系起来)、2 题迁移(把原文的论证用到一个新场景)。每题后不要附任何提示。
等我回答后,进入第二轮:
- 逐题评分(对 / 部分对 / 错),
- 每个扣分点必须附原文逐字引文和位置,
- 遇到我的回答超出原文的部分,标注 [推断] 或 [扩充],不要直接判错或判对。
没有收到我的回答之前,不要进入第二轮。9 · 空集检查(负样本)
何时用:评估你用的模型和提示词会不会“照样编”。被要求总结不存在的内容时,有的模型仍会生成[10](多文档设置,我只读到摘要)。输出格式:每题一个“有 / 原文未提及”的判定,有则必须附引文。坏用法:只问原文里有的问题,永远测不出编造倾向。
<document>
{{原文全文}}
</document>
下面是 5 个问题,其中至少 1 个原文并没有谈到。请逐题回答:
- 如果原文回答了,给出逐字引文和位置,再用一句话转述;
- 如果原文没有回答,只写“原文未提及”,不要用常识、推测或类似文章的内容补充。
{{问题 1}}
{{问题 2}}
{{问题 3}}
{{问题 4}}
{{问题 5}}怎么用:自己故意放进 1–2 个原文没有的问题。如果模型编出了答案,你就知道这个模型和提示词组合需要更强的约束。
10 · 四图层标注
何时用:和 AI 讨论完,要把新内容写进卡片之前;或者审计一张混杂了多种来源的卡。输出格式:逐句标注 + 违规清单。坏用法:让它“自动整理”而不核对标注。
<document>
{{原文全文}}
</document>
<card>
{{待标注的卡片}}
</card>
给卡片的每一句话标注图层,格式:[层] 原句。
- [原文]:在 > 引用块里的逐字内容;
- [转述]:忠实转述作者的意思,不含评价;
- [推断]:从原文推出但原文没明说的;
- [扩充]:来自原文之外的知识、类比、例子。
然后输出违规清单:
1. 引用块里出现了非原文的内容;
2. 转述区里夹带了评价、推断或扩充;
3. [扩充] 没有来源也没有“来源待查”;
4. 一句话混合了两个图层(请拆开)。
违规清单每一项写出所在的原句。找不到违规时写“未发现”,不要凑数。11 · 快扫分诊(读前唯一允许的介入)
何时用:只想判断这篇值不值得花力气。输出格式:小节表 + 3 条逐字引文 + 依据。坏用法:把输出当作“我读过了”存进笔记库。
<document>
{{原文全文}}
</document>
只做分诊,不要写总结。输出:
1. 小节表(§序号 + 标题 + 位置)。
2. 3 条最有信息量的逐字引文,带位置〔§n〕,覆盖不同小节。
3. 判断“值得精读 / 快扫即可 / 不值得读”,并用一句话说明依据;依据必须引用上面某条引文的编号,或指出文中某个具体数字或限定条件。
4. 这篇文章在做论证,还是在转述资讯?一句话回答。
禁止:转述文章的结论,禁止用“本文主要讲了”开头。一份可放进 ~/.claude/skills/deep-reading/SKILL.md 的 Skill 草案
Skill 是 Claude Code 里一个带 frontmatter 的 Markdown 文件。下面的草案把前面的协议固化成步骤,并和你的《卡片规范》v1.0 保持一致:AI 生成的卡片永远是 inbox;“我的思考”只写“(待补充)”;位置标注用 〔§n 小标题〕。草案假设你把第 05 章的 verify_quotes.py 放在同一个目录里。我没有在本机安装并运行这个 Skill——触发条件是否灵敏,需要你试几次后调整 description。
--- name: deep-reading description: 对长文、论文、访谈转写稿做“保真精读”:先抽取逐字引文、位置、限定条件与数字清单,用脚本核验引文,再按《卡片规范》输出 inbox 状态的文献卡。用户说“精读”“做卡片”“总结这篇文章”“帮我核对这张卡”时使用。不得代替用户阅读,不得替用户写“我的思考”。 --- # 保真精读(deep-reading) ## 目标 把一篇文章变成一张**可审计**的文献卡:每一处原话能被脚本核验,每一个数字和限定条件有清单,AI 不写“我的思考”。 ## 硬规则(禁止项) - 禁止在抽取阶段写总结性句子;禁止在引用块里放转述或评价。 - 禁止补充原文没有的内容。原文没谈到的,写“原文未提及”。 - 禁止把卡片状态写成 draft 或 done。AI 生成的卡片永远是 `status: inbox`。 - 禁止填写“我的思考”,只写“(待补充)”。 - 禁止用另一个模型的自评代替脚本核验。 - 不把 [扩充](外部知识、类比、例子)写进卡片。讨论中产生的扩充只留在对话里,由用户自己决定是否写入“我的思考 / 关联”,并带上 [扩充] 标记和来源(或“来源待查”);任何情况下都不得混进转述或引用块。 ## 步骤 1. **确认输入**:原文文件路径、来源类型(article/video/paper……)、是否已有用户自己的三句话主旨。没有就先提醒用户:精读的第一步是用户自己读完并写三句话,再继续。 2. **第一遍:抽取**,写入 `extract.md`: - 小节表(原文有小标题时数量必须一致); - 每节 1–3 条逐字引文,格式 `> 原话` + `> 〔§n 小标题〕`,每条不超过 150 字,省略用“……”,补充用全角[ ]; - 限定条件与数字清单:位置|类型(限定/数字/例外/反例/犹疑)|原话。 3. **核验**:运行 `py -3 "$HOME/.claude/skills/deep-reading/verify_quotes.py" 原文.txt extract.md`。 - 有“找不到” → 把这些引文从 extract.md 删除并重抽,直到退出码为 0; - “仅空白或标点不同” → 回原文确认,按原文修正。 4. **第二遍:写卡片**,只使用 extract.md 里已核验的材料。每个转述句末用 `〔引文编号〕` 指回依据;数字与限定条件必须与清单一致。 5. **遗漏审计**:对照小节表,列出没有对应条目的小节与论点(每项附逐字引文);中段(40%–70% 位置)单独检查。把结果附在卡片顶部 callout。 6. **交付**:给出 verify 结果、遗漏审计结果、以及“用户必须自己做的三件事”:抽查 3 处转述、核对 [扩充]、亲自写“我的思考”。 ## 输出格式(对齐《卡片规范》v1.0) - frontmatter:title、type=literature、source_type、source、author、url、published、created、updated、status=inbox、tags(1–3 个)、aliases、source_length。 - 正文标题固定:# 标题 / ## 一句话主旨 / ## 文章脉络 / ## 核心要点(### n. 陈述句要点标题)/ ## 精彩原文摘录 / ## 我的思考 / ## 关联。 - 一句话主旨 50–120 字,含“结论 + 理由”;核心要点 4–10 个,每个有转述段(80–250 字)和 1–3 个引用块;原文摘录占卡片 30%–40%,不低于 25%。 - 原文是英文时,引用块保留英文并在同块写“译:……”。 ## 读后追问模式(仅当用户已提供“自己的版本”时) 先输出:对核心论证的 5 个最强反驳([内部矛盾] 附引文;[外部反驳] 标 [扩充])、作者未回答的 3 个问题、不能推广的结论、用户版本中原文不支持的断言;然后再问用户的立场。被反问“你确定吗”时,重新引用原文证据,不要道歉改口。
放置方式:创建目录 ~/.claude/skills/deep-reading/,把上面内容存为 SKILL.md(UTF-8 无 BOM),再把 verify_quotes.py 复制到同一目录。如果你在 Windows 上,~ 在 Git Bash 里指向用户目录。frontmatter 的 description 决定它何时被触发,写得越具体越好。
反方与局限:我们可能错在哪
一份主张“让损失显式化”的报告,自己的损失也得摆出来。下面不是礼节性的免责声明,而是十二处如果错了会改变结论的地方,以及什么证据会让我改口。
十二处薄弱点
- 证据的靶心偏了。已核实的证据来自科学摘要[2]、单句新闻摘要[1]、小说书摘[4]、联网新闻问答[6]、多文档基准[10]。没有一项直接测量“给定一篇论证型长文,AI 摘要在限定条件、论证链上的损失,以及读者读完后的理解变化”。我把它们拼成一幅图,拼接处是推断。
- 支柱性主题没有核实。“摘要入口变便宜会降低阅读”(注意力环境)、“流畅感制造掌握错觉”、“AI 辅助会改变学习结果”、“AI 追问有助于建构”——这四条是整份报告的叙事支柱,对应的文献在本次调研里都未核实,文中已标 ◇。一旦它们被证据推翻,第 01、07、09 章的推理需要重写,第 04、05 章(有直接证据)则基本不受影响。
- 模型版本会让数字过时,甚至让方向反转。我用到的模型大多是 2020–2025 年的版本。Peters 与 Chin-Yee 的结果还显示,较新的模型过度概括更严重而不是更轻[2];那么 2026 年的模型是更好还是更差,我不知道。“模型进步了所以协议不需要”和“模型进步了所以协议更重要”,现有证据两边都不支持。
- 协议有真实的成本。一篇精读档的文章,第 1–6 步合计 40–70 分钟,对比快扫的 5–10 分钟,多了一个数量级。还有看不见的成本:多次模型调用的费用、整理清单的注意力、以及把阅读变成“完成流程”的风险——流程感可能取代理解感,这本身就是另一种掌握错觉。
- 不是所有文章都值得。第 06 章的分诊规则也只是经验设定,分错档的代价没有测过。把兴趣阅读强行纳入协议,很可能让你不再读下去;《卡片规范》的示例文章里作者也说“不是所有的阅读都要变成笔记”。
- AI 核验也会错。协议里只有“引文逐字存在”是确定性检查。限定条件清单、遗漏审计、追问都由 LLM 完成,而 FABLES 显示 LLM 自动打分器与人工的相关性不强、抓不出不忠实的 claim[4]。所以清单可能漏项,审计可能误报。我给的对策是“要求每项附逐字引文”,让它们至少可以被抽检,但这不等于它们正确。
- 脚本通过会制造假安心。逐字存在的引文可以被断章取义,可以被放在错误的论点下。官方 Citations 能力同样如此:引用对不代表理解对[15]。这套流程里“脚本全绿”那一刻,恰恰是人最容易放松的一刻。
- 个体差异与 ICAP 非通用。ICAP 被批评为外显行为不能判定内部过程、排序没有普适性[17]。对某些读者或某些文本,先看一遍摘要再读原文,也可能更好。我反对“读前代读”是基于推断与迎合风险,不是基于对比实验。
- 迎合的缓解没有验证。“先盲写、后披露立场”是我设计的,依据是 2023 年模型上的迎合证据[8]。它是否真的降低了迎合,要用你自己的“你确定吗”月度自检去看。
- 厂商数据是自测。“引文先行”的最强支持来自 Anthropic 自己的实验[13]:70K/95K token、多选问答、2023 年模型。它没有被独立复现,任务也不是摘要。
- 多个条目只读到摘要或二手转述。[7] [10] [11] [12] [14] [18] [19] 在笔记里分别标为“只见二手”“只读摘要”。它们在文中只用于定性说法,不单独撑起结论,但这意味着我对它们的细节没有把握。
- 本报告自己的框架没有验证。九类损失的分类、“搬运 vs 理解”的可核验性判据、闭卷五问、分诊阈值、时间预算、四周计划,都是我的设计,标了 ◇。它们逻辑上自洽,但自洽不是有效。
对你原来观点的修正
你一开始的直觉大致是:“AI 总结有损,所以需要保真的做法”。这个方向我认为是对的,但有四处需要修正:
“有损”不是“有害”
对分诊来说,有损的摘要通常足够;对写作引用来说,同一个损失可能是灾难。要区分的是用途,不是工具。
人写的摘要也有损
2026 年的预印本说人类参考摘要在信息量与忠实度上仍占优势[11],但“占优势”不等于“无损”。机构试验中人工摘要也只拿到评审满分的一部分[7](二手,原文未读)。拿一个理想的人和一个不完美的 AI 比,是不公平的。
“高密度 + 保留原文”也有成本
《卡片规范》反对过度精炼,我同意;但一张越写越长的卡片本身会变成另一个“没人读的东西”。◇ 推断:卡片的长度上限需要靠你回头读它的频率来定,而不是靠规范来定。
什么证据会让我改口
| 如果你观察到 | 那么应当修改的判断 |
|---|---|
| 埋针测试:中段的保留率与首尾没有差别 | 降低遗漏审计的优先级,不再对中段做专门检查 |
| 第 3 周小对照:“直接写卡”与“两遍法”在引文命中率、限定条件保留数上没有差别 | 两遍法的额外成本不值得,可以只保留机械核验 |
| 第 4 周:用了追问的篇目与没用追问的篇目,闭卷成绩相同 | 读后追问这一环节在你身上没有收益,砍掉或换成纯自测 |
| 独立评测显示新一代模型在限定条件、遗漏、引文上的保真度接近人工 | 协议可以瘦身,核验保留,其余按抽检 |
| 你发现脚本全绿但转述错误的情况经常出现 | 人核对环节要加重,而不是继续加机械检查 |
结论与一页清单
三句话带走:摘要是有损压缩;把损失写出来并能被查;理解留给自己,AI 只做追问者。
- 问题不是“用不用 AI 总结”,而是你外包的是“搬运”还是“理解”。判据是产出物能否被对照原文核验:能的可以交,不能的留着。
- AI 摘要的系统性偏移(限定条件丢失、位置偏差、编造或改写引语、迎合)有较强的证据,但具体比例随模型和任务变化,不能当作今天的错误率。
- 对策的核心是让损失显式化:引用先行、位置锚点、限定条件与数字清单、遗漏审计、引文机械核验;其中只有“引文逐字存在”是确定性的,其余仍要靠抽检。
- AI 在读后最有价值,作为追问者和对手;这一条的直接证据最薄,用你自己的闭卷复述通过率验证。
- 流程有成本,先分诊;用四周的数据决定保留什么。
一页清单
流程要服务理解,而不是成为新的仪式。哪一步让你不再想读了,就砍掉哪一步。— 本报告的最后一条规则
来源与证据等级
核验状态说明:“已打开原文”= 调研时读到全文或相关正文;“只读到摘要”= 只读到 abstract;“只见二手”= 只看到第三方转述或搜索结果摘要,数字需回到原文核对。第 20–23 条是我凭已有知识补充的经典理论,未在本次调研中核实,其链接是检索页而非论文直链,文中没有引用它们的任何数字。
- On Faithfulness and Factuality in Abstractive Summarization(Maynez, Narayan, Bohnet, McDonald, 2020, ACL 2020)ACL Anthology ● 强 已打开原文。支持:外在幻觉常见且多半是错的;局限:2020 年模型、单句极端摘要,数字不可外推。
- Generalization bias in large language model summarization of scientific research(Peters & Chin-Yee, 2025, Royal Society Open Science 12(4): 241776)PMC 全文 ● 强 已打开原文。支持:限定条件丢失的三种形式、4.85 倍与 1.9 倍的两个比值;局限:科学摘要,2025 年模型,“反讽反弹”仅为假说,未见复现。
- Lost in the Middle: How Language Models Use Long Contexts(Liu, Lin, Hewitt, Paranjape, Bevilacqua, Petroni, Liang, 2023 / TACL 2024)arXiv ◐ 中 已打开原文。支持:多文档问答与键值检索中的 U 形位置效应;局限:2023 年模型、检索式问答,不是摘要,与 Anthropic 的测试不一致。
- FABLES: Evaluating faithfulness and content selection in book-length summarization(Kim, Chang, Karpinska, Garimella, Manjunatha, Lo, Goyal, Iyyer, 2024, arXiv 2404.01261)arXiv ◐ 中 已打开原文(正式发表处本轮未核实)。支持:26 本小说、3,158 条 claim 的人工核查,忠实率、遗漏与位置偏差,自动打分器不可靠;局限:虚构类、2024 年上半年模型。
- From Sparse to Dense: GPT-4 Summarization with Chain of Density Prompting(Adams, Fabbri, Ladhak, Lehman, Elhadad, 2023, arXiv 2309.04269)arXiv ◐ 中 已打开原文(正式发表处本轮未核实)。支持:信息量与可读性的权衡;局限:约 70 词的新闻摘要、100 篇、部分评分用 GPT-4 自评。
- News Integrity in AI Assistants(EBU & BBC, 2025-10-22)EBU 官方 PDF ◐ 中 已打开原文。支持:2,709 条回答、45% 有重大问题,编造与改写引语、出处错位;局限:测的是联网新闻问答而非摘要,非同行评审,评估者是记者,2025 年 5–6 月。
- AI Document Summarisation 概念验证(ASIC × AWS, 2024;经澳大利亚参议院质询答复公开)aph.gov.au ○ 弱 只见二手转述(原文站点调研时无法访问),数字需回原 PDF 核对。支持:评审认为 AI 摘要常漏掉强调与细微差别;局限:Llama2-70B、5 份材料、单一时间点。文中不引用其具体分数。
- Towards Understanding Sycophancy in Language Models(Sharma 等, 2023, arXiv 2310.13548)arXiv ◐ 中 已打开原文(发表会议本轮未核实)。支持:5 个 RLHF 助手的迎合表现;局限:2023 年模型,之后改善多少未查。
- On Positional Bias of Faithfulness for Long-form Summarization(Wan, Vig, Chen, Joty, Bansal 等, 2025, NAACL 2025, arXiv 2410.23609)arXiv ◐ 中 已打开原文(读到摘要与研究问题小结)。支持:长文摘要忠实度的 U 形趋势,仅靠提示缓解收益有限;局限:评测截至 2024 年的模型。
- How LLMs Hallucinate in Multi-Document Summarization(Belém 等, 2025, Findings of NAACL 2025, arXiv 2410.13961)arXiv ◐ 中 只读到摘要。支持:被问到不存在的内容时仍照样生成;局限:多文档、主题聚焦摘要,“最多 75%”是最不利设置下的数字。
- Summarization is Not Dead Yet(2026, arXiv 2606.08000)arXiv ○ 弱 只读到摘要,预印本,未见同行评审与外部复现。支持:LLM 摘要主要在流畅度上被偏好,人类参考摘要在信息量与忠实度上仍有优势;局限:未读正文。
- Vectara Hallucination Leaderboard(新一代榜单,2025 下半年起)GitHub ○ 弱 只见二手转述(页面抓取为空),数字未核实、文中不引用。支持:头条低幻觉率来自短文 + 事实一致性的窄指标;局限:不含遗漏与限定条件。
- Prompting long context(Anthropic, 2023-12-06 官方博客)anthropic.com ◐ 中 已打开原文。支持:先把相关引文抽到 scratchpad 在所有对比中都有帮助(Claude 2 错误减少 36%);局限:厂商自测、问答任务、2023 年模型。
- Long context prompting tips(Anthropic 官方文档)docs.claude.com ○ 弱 只见搜索结果转述,页面对调研环境不可访问,措辞未核对。支持:长文在前、查询在后、先引文后作答的做法;局限:“最多 30%”没有给出任务与基线。
- Introducing Citations on the Anthropic API(Anthropic, 2025-01-23 官方博客)claude.com ○ 弱 已打开原文。支持:可核验引用已成为官方产品能力;局限:厂商内部评测与客户自述,引用对不等于理解对。
- The ICAP Framework: Linking Cognitive Engagement to Active Learning Outcomes(Chi & Wylie, 2014, Educational Psychologist 49(4): 219–243)ERIC 全文 ◐ 中 已打开原文。支持:被动 / 主动 / 建构 / 互动的层级,以及“要求写摘要可能退化为复制删除”;局限:理论框架与文献整理,非单项实验。
- Questioning central assumptions of the ICAP framework(Thurn, Edelsbrunner, Berkowitz, Deiglmayr, Schalk, 2023, npj Science of Learning 8: 49)Nature ◐ 中 已打开原文(读到摘要与引言)。支持:ICAP 的层级排序没有普适性;局限:评论而非新实验。
- The role of knowledge in discourse comprehension: a construction-integration model(Kintsch, 1988, Psychological Review 95(2): 163–182)PubMed ● 强(理论地位)只读到摘要与二手综述。支持:自下而上的加工与整合;局限:三层表征的区分不在这一篇里(见第 20 条),具体表述只见二手。
- How to Read a Book(Adler & Van Doren, 1972 修订版)Substack 二手介绍 ○ 弱 只见二手引述,未读原书。支持:四层次与分析阅读的动作、四个问题;局限:方法论,无对照实验,二手介绍可能不准确。
- Strategies of Discourse Comprehension(van Dijk & Kintsch, 1983)与 Comprehension: A Paradigm for Cognition(Kintsch, 1998)检索页 未在本次调研中核实 经典理论条目,通常被引用为“表层 / 文本基础 / 情境模型”三层表征的出处;这一归属只见二手,没有读到原书。
- The misunderstood limits of folk science: an illusion of explanatory depth(Rozenblit & Keil, 2002, Cognitive Science)检索页 未在本次调研中核实 经典条目,用于“被要求解释时才发现理解空洞”的概念;文中不引用任何数字。
- Memory and metamemory considerations in the training of human beings(Bjork, 1994)及“合意困难”相关论述检索页 未在本次调研中核实 经典条目,用于“流畅感不等于长期保持”的概念;文中不引用任何数字。
- Test-enhanced learning: taking memory tests improves long-term retention(Roediger & Karpicke, 2006, Psychological Science)检索页 未在本次调研中核实 经典条目,用于“检索练习”的概念;文中不引用任何数字。