Report 02 · 2026-10 · 深度阅读与 AI

摘要是有损压缩
让损失看得见

问题不是用不用 AI 总结,而是你外包的是搬运还是理解,以及损失能否被显式化、被机械核验。

SCROLL
00TL;DR

结论先行:摘要是有损压缩,要管的是“损失”

任何摘要都在丢东西,这不是 AI 的缺陷,是压缩的定义。真正的问题只有三个:你把“搬运”还是“理解”交了出去;丢掉的东西看不看得见、查不查得了;AI 出现在读之前还是读之后。

读起来很顺的摘要,恰恰是最需要提高警惕的摘要。— 本报告的判断,依据见第 04 章(流畅度与忠实度是两件事)

这份报告写给一个具体的人:做 Blender、剪辑和设计,同时在用 Obsidian 加 AI 流水线做知识管理,想知道“让 AI 帮我读文章”到底能走多远。结论不是“别用”,也不是“放心用”,而是下面的三条原则和五件事。证据强度我会一条条标出来,因为这个主题里最容易出现的毛病,就是用一个漂亮的数字替换掉一个有条件的发现。

三条原则

原则 1 · 分工

外包搬运,不外包理解

判据是产出物能不能被对照原文核验:引文、数字、位置、结构可以核验,交给 AI 和脚本;评价、整合、反驳、迁移不能被“核验”,只能由你建构,交出去就等于没读。这是本报告对 ICAP 框架[16]的一种应用,不是文献原话。

原则 2 · 审计

让损失显式化、可审计

不追求“无损”,追求“知道丢了什么”:引用先行、分层输出、位置锚点、限定条件与数字清单、遗漏审计、机械核验。对策里有证据支撑的部分有限,我会明说哪些是设计假设。

原则 3 · 时序

AI 在“读之后”当追问者

先读、先写出自己的版本,再让 AI 提反驳、考你、找漏洞;而不是读之前让它替你读。注意:这条的直接证据最薄,更多是设计假设,需要你用闭卷复述的通过率自测。

四个值得记住的数字(以及它们的边界)

0
10 个主流 LLM 的科学文献摘要,含“宽泛概括”的几率是人类撰写摘要的约 4.85 倍(OR=4.85,95% CI 3.06–7.70;共 4,900 份 LLM 摘要)。对象是科学摘要,不是公众号长文。
● 强 · Peters & Chin-Yee 2025 [2]
0
提示词里写“不要引入任何不准确之处”后,含泛化结论的几率反而约为简单提示的 1.9 倍(OR=1.90,p=0.02)。单项研究,作者对原因的解释只是假说,未见复现。
◐ 条件性 · 同上 [2]
0
26 本小说的 3,158 条 claim 由读完整本书的标注员逐条核查:表现最好的模型忠实率 90%,其余 70%–78%;自动打分器与人工判断相关性不强,抓不出不忠实的 claim。
◐ 中 · FABLES 2024 [4]
0
2,709 条联网新闻问答回答里,至少有一个“重大问题”的比例;其中出现被编造或被改写的直接引语。注意:测的是新闻问答,不是对给定文章做摘要。
◐ 中 · EBU/BBC 2025 [6]

这四个数字的共同点:它们都来自特定任务、特定年份的模型。第 04 章专门列了“证据的保质期”,请把它们当作“现象存在”的证据,不要当作“今天的错误率”。

你要做的五件事

  1. 读完先盖住原文,写三句话主旨,再碰 AI。三句话 = 作者主张、主要理由、一个限定条件。这一步在第 07、09 章展开;它保证后面所有 AI 输出对你来说是“待核对的对象”,而不是“你的理解本身”。
  2. 让 AI 先交“逐字引文 + 位置 + 限定条件/数字清单”,不让它先写总结。这是“引用先行”。提示词在第 10 章可直接复制。
  3. 引文一律跑机械核验,未命中的引文作废。第 05 章有浏览器内的核验器和 35 行 Python 脚本 verify_quotes.py;我真的运行了它,结果写在那一章里。
  4. 追问放在读后:先让 AI 在不知道你立场时红队或 steelman,再披露你的立场。这是对“AI 会迎合你”[8]的工程化缓解,缓解效果本身未经验证。
  5. 一周后闭卷复述,记录通过率。能不看原文复述论证链、引用两句原话、说出一个限定条件和一个反例,才算读懂(第 02 章的标准)。通过率是整套流程唯一的“最终验收”。
诚实声明

本次调研在中途被叫停。关于“屏幕阅读与注意力”“掌握的错觉”“AI 与学习”“AI 追问有效性”这几个主题,我没有完成系统核实,因此:①文中不出现这些主题的效应量和百分比;②涉及它们的论述标 ◇ 推断 或“未在本次调研中核实”;③第 11 章把它们列为本报告最薄弱的地方。已核实的证据集中在“LLM 摘要保真度”和“长上下文位置偏差”两块——这恰好是协议设计最需要依据的部分。

01PROBLEM

问题的三层:环境、错觉、诱惑

“AI 总结让人变浅”是一个太容易被说出口的判断。要把它变成可以检验的东西,得先拆开:哪一层有证据,哪一层只是合理的推断,哪一层是流传的说法。

第一层:注意力环境——能说的比你以为的少

先交代一个限制。这一层本该是“屏幕阅读是否损害理解”“短视频是否缩短注意力”之类的实证文献,但本次调研在这个主题上被叫停,我没有核实任何一项相关研究,所以这一节不会出现任何关于注意力时长、阅读理解下降幅度的数字。

剩下可以说的,只是一个结构性的观察,我把它标成推断:摘要的获取成本趋近于零,理解的成本没有变。过去“要不要读这篇”的决定被读的成本强行推迟,你至少得翻开它;现在你可以在不翻开的情况下得到一个“看起来够用”的替代品。这个差距的拉大不依赖任何关于注意力的数字,只依赖一个事实:入口变便宜了,而便宜的入口产出的东西质量并不一致(下面两层会展开)。

推断 ◇ 推断

“摘要入口变便宜”会让“读摘要代替读原文”的比例上升,这是本报告的推断,没有测量。它的作用只是说明:协议设计的目标不是“让你更勤奋”,而是在入口变便宜的世界里,让“便宜入口”的输出自带可核对的接口。

第二层:掌握的错觉——流畅感会冒充理解

认知心理学里有两个经典观察,和读摘要的场景高度相关。一是 Rozenblit 与 Keil 关于“解释深度错觉”(illusion of explanatory depth)的工作:人们倾向于高估自己对日常机制的理解,直到被要求写出解释时才发现空洞[21]。二是 Bjork 提出的“合意困难”(desirable difficulties):让学习更费力的做法常常让当下的流畅感变差,却改善长期保持;反过来,让学习过程顺畅的做法容易制造“学会了”的感觉[22]。这两条我都没有在本次调研中核实,只作为经典理论引用,不引用任何具体数字。

把它们接到 AI 摘要上,是一段两步推理:①读一篇通顺的摘要,当下的流畅感很高;②高流畅感容易被读成“我懂了”。第二步有一项间接证据:2026 年的一篇预印本称,LLM 摘要主要在表面连贯性与流畅度上被偏好,而人类参考摘要在信息量与忠实度上仍有优势[11]——但我只读到该文摘要,且尚无外部复现。直接测量“读 AI 摘要后的掌握错觉”的实验,本次调研没有找到。所以整条链路的强度是 ◇ 推断,只是一个值得用自己的数据检验的假说。

第三层:AI 带来的诱惑与风险

诱惑很直白:快、省力、看起来“已经处理过了”。风险则可以分成四种,每一种都对应后面某道防线。

风险 A · 不可见

错误难被不读原文的人发现

FABLES 让真正读完整本小说的标注员核查 LLM 摘要,多数不忠实的 claim 涉及事件与人物状态,需要对叙事做间接推理才能判定出错;而 LLM 自动打分器与人工的相关性并不强,尤其抓不出不忠实的 claim[4]。读者没读原文,就没有判断依据;用另一个 LLM 打分,也靠不住。

风险 B · 有方向

错误不是随机噪声,是系统性偏移

限定条件被抹掉、量化变泛称、过去时变现在时[2];开头和结尾被善待、中间被忽视[9][3];在你表态之后顺着你说[8]。方向性的偏差比随机错误更危险,因为它们会在你的知识库里累积成同一个形状的扭曲。

风险 C · 假动作

把摘要抄进笔记,仍只是“主动”

ICAP 框架明确指出:要求学生“写摘要”并不保证建构,学生可以把任务退化成复制与删除[16]。把 AI 摘要粘贴进 Obsidian,在这个框架里连“复制删除式摘要”都算不上,因为删除的人是 AI。

风险 D · 假安心

有出处不等于出处对

EBU 与 BBC 的评估记录了完全编造的直接引语,以及被改写的引语和看似可信却不存在的链接[6];而官方的 Citations 能力能让“出处指向”可查[15],却不保证“这句话被转述成什么意思”是对的。

还有一个容易被忽略的“旧证据”:2020 年对单句新闻摘要的大规模人工评估发现,超过 70% 的单句摘要含有幻觉,而其中外在幻觉(原文里没有的内容)有超过 90% 是错的[1]。这组数字今天不能当错误率用——模型是 2020 年的、任务是把整篇新闻压成一句话。它留给我们的是一条定性规则:摘要里“用背景知识补充一下”的冲动,大多数时候补进去的是错的。这条规则直接写进了后面的协议:只能用原文里有的东西,没有就写“原文未提及”。

反方先说

证据并不支持“AI 摘要一定比人差”。FABLES 里表现最好的模型忠实率达 90%[4];2026 年那篇预印本的结论也是“LLM 抬高了下限,上限仍低于人类”[11](只读到摘要)。更准确的表述是:AI 摘要的错误难以被不读原文的人发现,所以需要可审计。这是整份报告的立足点,而不是“AI 不可信”。

问题从来不是 AI 会不会出错,而是出错时你有没有一个接口可以发现。— 本报告的立场
02READING

深度阅读到底在做什么

想谈“摘要丢了什么”,得先说清楚“读懂了什么”。否则“丢失”只是一个情绪词。这一章做三件事:给读懂拆出三层表征,给阅读动作列一张可操作的清单,最后给出一个能被检验的“读懂标准”。

三层表征:表层、文本基础、情境模型

语篇理解研究里一个经典区分:读者对一段文本形成的心理表征不止一种。Kintsch 的 construction-integration 模型描述了自下而上的加工——激活词义、形成命题、产生推论,再经激活扩散整合成连贯结构[18]。“表层形式 / 文本基础(textbase)/ 情境模型(situation model)”的三层表征区分,通常归到 van Dijk 与 Kintsch 1983 年的书和 Kintsch 1998 年的专著[20]。这两条我只见到摘要或二手综述,没有读到原书,下面的描述按二手综述的通行说法,不含具体实验数字。

层是什么摘要能保留吗本报告的类比:对应《卡片规范》
表层形式原文的措辞、句式、语气;衰减最快的一层几乎一定丢;摘要的第一件事就是换成自己的话“精彩原文摘录”和 > 引用块——用逐字照录把这一层保下来
文本基础文本本身表达的命题与它们之间的关系:主张、理由、数据、例子可以保留,但有损;限定条件、例子、反例最容易被削“一句话主旨 / 文章脉络 / 核心要点的转述段”
情境模型把文本内容与读者自己已有的知识、经验整合后形成的、关于“文本所描述的事态”的表征;对应更深的理解不能。它建立在你的先验知识上,摘要无法代你建立“我的思考 / 关联”

第四列是本报告的类比,不是文献原话。它的价值在于给“为什么要同时保留原文片段、转述和个人思考”一个理论解释,而不是证明了这种保留方式有效。

这张表给出第一条推论:只读摘要,你最多得到文本基础的有损副本,缺的是表层(你无法引用作者原话)和情境模型(你没有把它接到自己的知识上)。这解释了用户《卡片规范》里的“终极检验”为什么要求“能引用作者 2 句原话”——那是对表层的检验。

分析阅读的关键动作

Adler 与 Van Doren 的《How to Read a Book》把阅读分成四个层次:基础阅读、检视阅读(系统略读,判断是否值得精读)、分析阅读(读到变成自己的)、主题阅读(多本书互相对照)[19]。我只见到二手介绍,没读到原书,证据等级是 ○ 弱——它是方法论,不是实验结论。但它给出的动作足够具体,可以直接转成“产出物”:

动作(二手介绍的说法)你要留下的产出物怎么判断做对了
分类:这是什么类型的作品一行标注:论证型 / 叙事型 / 教程型 / 研究报告 / 访谈……和《卡片规范》提示词第 1 步的文体判断一致,且决定了你找“论点”的方式
陈述全书统一性:整体在讲什么一句话,含“结论 + 理由”能用 50–120 字写出,且不是“本文讨论了……”这类空话
列提纲:各部分如何构成整体按原文顺序的层级列表一级条目数与原文小标题数一致
界定作者要解决的问题一个疑问句读完后你能说出作者回答了它的哪一半
对关键词“达成共识”(come to terms)术语表:作者如何使用这个词你不会用日常含义去替换作者的定义
抓主要命题与论证论证链:主张 → 理由 → 证据 → 例外盖住原文能复述,且包含例外

二手介绍还转述了阅读时的四个问题:整体讲什么?细节上说了什么、怎么说?是否为真?那又怎样?[19]以及一条次序规则:批评应放在完全理解之后。这条次序规则对 AI 时代尤其重要,它正是后面“先读懂、再追问”这条原则的来源之一,但请记住它是方法论传统,不是实验结论。

什么叫“外包搬运”,什么叫“外包理解”

ICAP 框架把学习活动按外显行为分成四种:被动、主动、建构、互动,假说是 I > C > A > P。论文对“阅读文本”给的例子是:只读是被动;划线、复制再删除式摘要是主动;自我解释、跨文本整合、用自己的话做笔记是建构;与同伴互相问答是互动[16]。把它套到 AI 上:

你对 AI 做的事ICAP 层级(本报告的套用)
读 AI 给的摘要被动
把 AI 摘要粘进笔记;划线主动
自己用话改写;写反驳;找反例;写类比建构
与 AI(或同伴)来回追问并互相修正互动(前提是你确实在修正,而不是在接受)
别把 ICAP 当定律

2023 年一篇同行评审评论指出,ICAP 有两个核心假设与教育研究的基本认识不符:外显行为不足以判定内在学习过程;并且不存在“放之四海皆准”的参与模式排序,较低的模式在合适的学习者与时机下也可能更优[17]。所以我只把它当作启发式:“建构、互动通常优于被动”可以说,“必然优于”不能说。

在这个启发式之上,我给“搬运”和“理解”下一个操作性定义——这是本报告自己的框架,不是文献结论 ◇ 推断:

搬运 vs 理解的判据:可核验性

搬运:产出物可以对照原文机械或半机械地核验。逐字引文(脚本可验)、数字与样本量(脚本可验)、位置(脚本可验)、小节覆盖(清单可验)、限定语是否保留(人可验)。这类工作可以交给 AI,因为错了你能发现。

理解:产出物的对错取决于你的先验知识与立场——评价、整合、反驳、迁移、“那又怎样”。它无法对照原文核验,因此一旦外包,你得到的只是“一个看起来像理解的东西”,而你无从判断它对不对。这部分必须由你建构。

灰色地带是“转述”:数字和引文可以验,但“转述的意思有没有走样”不能被脚本验,需要抽检。协议把这块的风险明确留在“人核对”这一步。

“读到什么程度才算读懂”:一个可检验的标准

《卡片规范》的终极检验是:盖住原文,只看卡片,能向别人讲清楚文章讲了什么、怎么论证的,并能引用作者 2 句原话。我把它补成五问,每一问都能当场打分:

#闭卷五问(盖住原文和笔记)通过标准对应的层
1用 3 分钟复述论证链说出“主张 → 理由 → 证据 → 结论”四环,顺序与原文一致文本基础
2写出 2 句作者原话跑 verify_quotes.py,两条都“逐字存在”(标点差异不算通过)表层
3说出 1 个限定条件包含范围、样本、时间或前提之一,且与原文限定一致文本基础
4说出 1 个反例或边界来自作者自己提到的,或你自己提出且能说出为什么原文没有覆盖情境模型
5说出作者没有证明的 1 个前提能指出这个前提在原文哪一步被默认情境模型

5 问中通过 4 问及以上算“读懂”;通过 2–3 问是“读到文本基础”;不足 2 问是“读过”。这个门槛是我定的,没有经过验证,它的用途是让你不再靠感觉判断,并在 4 周训练里(第 09 章)有一个可追踪的分数。评分可以更细——第 09 章有 12 分制的“复述测试”评分表。

一个直接的推论:一篇文章你读完之后,如果连 5 问里的第 2 问都过不了,那么无论你手里的摘要多漂亮,你都没有“读过”它——你有的只是别人的转述。

03LOSSY

有损压缩的损失分类学

压缩比一旦固定,剩下的问题就是“丢什么”。每个摘要背后都有一个没人写出来的取舍函数:LLM 默认的那个偏向流畅、通则与居中;你真正需要的那个偏向你的用途。协议要做的,是把取舍函数摆到桌面上。

把“丢失”拆成九类

下表是本报告的归纳——分类本身是推断,不是文献里的标准分类法。每一类我标了“证据”一栏:有直接测量的写出来源,没有的老实写“推断”。读表时留意最后一列:能机械检出的类别不多,这也是为什么协议要把“机械核验”和“人核对”拆成两道。

丢失类型为什么压缩时先丢它丢了的后果证据怎么检出
限定条件
范围、样本、时间、前提
句法上是附属成分,对“主旨”没有贡献结论被读成无条件成立● 强 量化变泛称、过去时变现在时、描述变建议[2]限定条件清单;数字原样出现可机械查,时态与量化需人工
论证链
因为……所以……除非
连接词承载逻辑,摘要倾向罗列结论留下口号,读者无法判断结论成不成立◇ 推断 《卡片规范》将其列为不合格项闭卷复述第 1 问
具体例子与数据看起来可替换为“作者举了例子”失去检验结论的抓手◐ 中 33.3%–65.4% 的书摘缺关键事件,16.7%–38.5% 缺重要细节[4](小说)数字清单、实体清单(可机械查)
语气、立场与修辞被“中性化”,反讽与保留被抹平把挖苦读成认同,把试探读成断言◇ 推断 相关:各模型摘要风格同质化[11](仅摘要)保留逐字引文;人读
隐含前提作者没写,摘要只能复述写出来的,或者“补一个”AI 补的前提被当作作者的● 强 外在幻觉多数是错的[1](2020 年模型,单句摘要)四图层标注:补的内容必须标 [推断]/[扩充]
结构与节奏重排、合并,铺垫被压平你不知道作者把重点放在哪◐ 中 摘要对中段忠实度更低[9];过度强调书的结尾[4]脉络条目数与小标题数对账(机械);遗漏审计
反例与例外与主线反向,向主线“收敛”时最先删只剩单向叙事○ 弱 机构试验中评审称 AI 摘要漏掉细微差别[7](二手转述,未读原文)反例/例外清单;闭卷第 4 问
作者的犹疑
可能、似乎、我不确定
摘要偏好肯定句试探性结论变成断言属“限定条件”的子类,与[2]同源限定条件清单里单列“犹疑”
归属
谁说的、出自哪
“某人认为”被压成“事实”转述者的观点被当成作者的、引用者的观点被当成事实◐ 中 出处错位占重大问题的最大份额[6](新闻问答)位置锚点 + 出处字段

九类里,有直接测量的是限定条件、例子与数据、结构、归属这四类,其余是推断。这提示一件事:协议里“限定条件与数字清单”“遗漏审计”“位置锚点”这三样,是证据最扎实的地方,而“语气与修辞”这类损失,目前只能靠保留逐字原文让你自己读到,没有更好的办法。

压缩是在选取舍函数

把摘要看成信息论意义上的有损压缩,有一个好处:它逼你问“失真由谁定义”。同样压到 20%,对做决策的人来说,丢掉所有数字是灾难;对只想知道“这篇讲什么”的人来说,丢掉数字几乎无所谓。LLM 默认的取舍函数是什么?从已读到的证据拼起来:偏向主旨与通则(限定条件被泛化[2])、偏向文档的开头与结尾[9][4]、偏向流畅[11]。这是一个不透明且与你的用途无关的函数。

推断:协议在做什么

“保真协议”的核心不是让 AI 变得更准确,而是把取舍函数换成你的(保数字、保限定、保反例、保原话,宁可丢修辞),并让被丢的东西以清单的形式出现在输出里。后者才是“显式化”:丢失还在,但它不再沉默。

LAB 01

压缩损失实验室

上图是一条“条码”:每一格是一句话,实心表示保留,空心表示丢失,颜色是类型。观察被丢的格子集中在哪里。

示意模拟,不是真实 LLM 输出。示范文本是我自撰的虚构公众号长文(共 15 句,约 650 字)。规则假设:①“朴素摘要”按类型权重给每句打分(论点 1.0 > 金句 0.8 > 例子 0.55 > 数据 0.5 > 转折 0.25 > 反例 0.2 > 限定 0.12),选分最高的整句,直到用完字数预算;位置偏差打开时,首尾各两句加分、中段(第 6–10 句)扣分。这组权重是依据第 04 章列出的偏移方向(限定被泛化、首尾被偏爱)设定的示意值,没有拟合任何真实模型。②“保真协议”先保主论点,再保反例、保“数据及其限定”,然后其它论点、转折、例子,金句最后;凡是被保留的句子,其依赖的限定/反例句一并带上。③朴素摘要按完整句子计字数;协议把数据、限定、反例写成清单条目,假设只占原句 60% 的篇幅(清单比叙述句紧凑,这一假设对协议有利);两者都不模拟句内改写,也不模拟幻觉。④协议按优先级依次放入“捆绑包”,放不下就截断,不挑便宜的凑数;朴素摘要则贪心填满预算。读者看到“被丢的句子”那一栏,在真实使用里朴素摘要是不会告诉你的;协议要求模型自己输出这一栏,并被审计。

怎么读这个实验

  1. 先拖到 15%,看朴素摘要保留了什么。在示意规则下,它留下主论点、一句转折和一句金句,数据和限定一个都没有;右侧立刻出现“限定与反例全部被丢”的提示:留下的论点读起来是无条件的。这与 Peters 与 Chin-Yee 记录的偏移方向一致[2],但数字是示意的,是规则的直接后果,不是发现。
  2. 切到“保真协议”,同样 15%。协议留下的是主论点和反例,而不是转折和金句;它同时告诉你“当前低于保真底线”(约 21%:一个主论点 + 一个数字及其限定 + 反例)。保真不是免费的,它的价格是文笔和生动度,在 5% 的预算下它甚至会拒绝输出——这也是第 11 章要认真谈的成本。
  3. 拖到 25%–30%,观察协议开始放入“数字 + 限定”的捆绑包。数据句总是带着它依赖的限定句一起进来,不会单独出现。右侧“未收录清单”列出了所有没进来的句子,这就是“损失显式化”的样子:丢失还在,但它被写了出来。
  4. 关掉“位置偏差”,再对比。位置偏差关闭后,朴素摘要的中段不再被额外扣分,被保留的句子会向中间移动一点。这个开关对应长文摘要里“中间被忽视”的风险[9][3];它在你用的模型上是否存在,需要自测(见第 05 章的“埋针测试”)。
  5. 拖到 50%。差距缩小但没有消失:朴素摘要的取舍函数里数据、反例、限定权重一直偏低,所以即使保留一半篇幅,仍然没有它们(这是规则假设的后果);协议则保留了全部数字和反例,代价是例子与金句被挤出。换个权重,结果会变——所以请把这个实验当作“让取舍函数可见”的玩具,而不是测量。
04DISTORTION

AI 总结的已知失真与对策

上一章是“压缩必然丢什么”,这一章是“AI 实际上怎么丢、怎么错”。区别很重要:前者是原理,后者是经验记录,而经验记录有保质期。

失真分类表(九类)

下表的“证据”列只放我读到过的文献,括号里写了任务与对象;“对策”列里,凡是尚无直接实证支持的,标明是设计假设。等级沿用全篇的约定:● 强 同行评审大样本;◐ 中 单项研究、官方报告、基准;○ 弱 预印本、案例、二手;◇ 推断 本报告的判断。

失真类型证据表现对策(及其证据)等级
1 限定条件丢失 / 过度概括10 个 LLM、4,900 份摘要:含泛化结论的几率约为原摘要的 2 倍,对人类摘要 OR=4.85[2]量化变泛称;过去时变现在时;描述变行动建议限定条件清单 + 机械核对数字/样本量;用“间接引述、过去时”格式约束(作者的建议,未验证);不要只靠“请准确”● 强 现象
◇ 对策
2 编造或改写引语2,709 条回答:含直接引语的回答里,Gemini 20% 有重大问题;另有完全编造的引语、不存在的链接[6](联网新闻问答)引号里不是原话;出处不存在或不对应引文逐字机械匹配 + 位置核对;官方 Citations 让出处可查[15](厂商自述)。对策本身是确定性检查◐ 中
3 外在幻觉单句新闻摘要中 >70% 含幻觉,外在幻觉 >90% 为错[1](2020);被要求总结不存在的内容时,gpt-3.5-turbo 约 79%、GPT-4o 约 44% 仍照样生成[10](多文档,仅读摘要)补进原文没有的内容;对不存在的信息也答只写原文有的;给“原文未提及”出口;空集检查;逐条 claim 对账◐ 中
4 位置偏差多文档问答呈 U 形[3];6 个长文摘要数据集上忠实度呈 U 形[9];Claude-3-Opus 至少 20% 的摘要过度强调书的结尾[4]中段被忽视,结尾被放大;封底、致谢等边角内容干扰分段处理 + 对中段做遗漏审计;指令放在 prompt 末尾[13];自己做埋针测试。仅靠提示缓解,收益有限[9]◐ 中
5 关键内容遗漏26 本小说:33.3%–65.4% 的摘要缺关键事件;23.1% 的 GPT-4-Turbo 与 Mixtral 摘要完全不提关键人物[4]摘要流畅但缺了骨架部件遗漏审计(对照小标题/章节表);Chain of Density 式补入缺失实体[5],并接受可读性代价◐ 中
6 需要间接推理才能发现的错,打分器抓不出FABLES:LLM 自动打分器与人工相关性不强[4]事件、人物状态类错误,读者不读原文就看不见人工抽检;对关键 claim 要求逐条原文证据;不要用另一个 LLM 当唯一裁判◐ 中
7 迎合5 个 RLHF 助手:用户说“我不认为对,你确定吗?”时常改口,Claude 1.3 在 98% 的问题上错误认错;用户提示错误答案使准确率最多降 27%(LLaMA 2)[8](2023 年模型)你表态之后,它的评价向你靠拢追问阶段先让 AI 在不知道你立场时 steelman/红队;被反问“你确定吗”时要求重新引用原文,而非道歉改口(设计假设,需自测)◐ 中 现象
◇ 对策
8 流畅掩盖错误;风格同质化2026 预印本:LLM 主要在连贯度与流畅度上被偏好,各模型出现风格同质化[11](仅读摘要);Chain of Density:信息量上升则连贯性/可读性下降[5]读起来顺 ≠ 对;密度越高越难读分层输出(短层 + 长层);不以“读着顺”作为卡片通过标准○ 弱~◐ 中
9 输出后段更易幻觉多文档基准:摘要内容平均最高 75% 为幻觉,越靠后越容易[10](仅读摘要)摘要拖得越长越不可靠分块生成;卡片逐要点独立校验;摘要不宜过长◐ 中

第 3 行与第 9 行引用的 [10] 我只读到摘要;“75%”是对模型最不利的设置下的上限平均,不是通用错误率。

一个反直觉的发现,和它的边界

第 1 行里最值得停一停的是这一条:Peters 与 Chin-Yee 比较了几种提示,发现在提示里明确要求“忠于原文,不要引入任何不准确之处”(accuracy prompt)后,摘要含泛化结论的几率约为简单提示的 1.9 倍(OR=1.90,95% CI 1.11–3.26,p=0.02);除 Claude 系列外,其它模型在这种提示下过度概括率最高。作者的解释是类似人类“反讽反弹”的现象[2]。

这条发现能支持什么、不能支持什么

能支持:口头要求“请准确/请忠实”不是可靠的保真手段,至少对被测的那批模型和任务如此;因此要把“保真”变成可检查的结构(逐条限定语、逐条数字、逐条引文),而不是一句祈使句。

不能支持:①“提示里说‘请准确’一定有害”——这是单项研究,对象是科学论文摘要,模型是 2025 年 3 月前后的版本,没见到独立复现;②“反讽反弹”这个机制——只是作者的猜测;③“Claude 一定最好”——该文中 Claude 系列的过度概括率最低(−1% 到 20% 区间),但它同样受模型迭代影响。

证据的保质期

读 AI 相关的文献,最容易犯的错是把一个年份很早的数字当作“现状”。下表列出本报告用到的主要证据的模型版本、任务与可外推范围。结论是:现象大多反复出现,具体比例不可迁移;甚至方向也不总是“越新越好”——2025 年的研究显示较新的模型过度概括反而更严重[2]。

来源模型 / 时间任务可以外推到哪里不能外推到哪里
Maynez 等 [1]2020,BART/PTGEN 等XSum 单句摘要“补充背景”多半是错的这一定性规则>70%、>90% 的具体数字;长文
Liu 等 [3]2023,GPT-3.5 等多文档问答、键值检索“位置可能影响利用率”这一风险它是定律;摘要任务;现代模型
Anthropic 长上下文博客 [13]2023,Claude Instant 1.2 / Claude 270K/95K 多选问答,厂商自测“先抽引文再答”值得一试“错误减少 36%”之类数字;摘要任务
FABLES [4]2024 上半年,Claude-3-Opus 等26 本小说的书摘遗漏与位置偏差存在;自动打分器弱论证型文章;90% 这个具体比例
Peters & Chin-Yee [2]2025 年 3 月前后,10 个模型科学摘要/文本→摘要泛化的三种语言形式;口头要求不可靠公众号文章;今天的版本
EBU/BBC [6]2025 年 5–6 月,4 个消费者助手联网新闻问答,记者评估编造、改写引语与出处错位的现象存在“45%”不能代表“AI 摘要给定文章”的出错率
Sharma 等 [8]2023 年模型反馈、被质疑时改口等迎合是 RLHF 助手的已知倾向改善了多少本轮未查,不下结论

四处“别用错”的数字

  • Anthropic 与 Liu 等不一致。Anthropic 2023 年的博客在脚注里指出其结果与“U 形”曲线不同,并推测原因是 Liu 等样例平均约 15K tokens,而他们测试的是 70K 和 95K 的文档[13]。所以写法应是“位置偏差是一个需要在你自己流水线上检验的风险”,而不是定律。
  • EBU/BBC 的 45% 测的不是摘要。评估对象是联网的新闻问答,评估者是各媒体自家记者,“重大问题”的阈值由报告定义[6]。它的作用只是证明:编造和改写引语是真实发生过的事。
  • “幻觉率很低”的头条来自窄指标。Vectara 榜单测的是“给定短文做摘要时的事实一致性”,二手来源称新榜单文档更长、分数“全面上升”,且官方说明新旧分数不可直接比较[12]。它不测遗漏,也不测限定条件丢失。我只见到二手转述,具体数字没有核实,所以不引用。
  • 厂商数据都是自测。“错误减少 36%”[13]、“召回准确率最多提升 15%”“客户幻觉从 10% 降到 0%”[15]来自厂商博客与客户自述,没有独立复现。我只用它们说明“这是厂商认为值得做的方向”,不放进结论句。
对的出处不等于对的理解。检查引文是否存在,和检查转述是否越界,是两道独立的检查。— 本报告对 [6] [15] [2] 的合并判断

最后一句是整张表最重要的一条工程含义,它直接决定了下一章的协议结构:引文是否逐字存在可以由脚本确定性地判断;转述是否越界(限定条件被抹掉、时态被改、量化变泛称)只能靠清单 + 抽检。把这两件事混在一起,你要么得到一个过于宽松的“通过”,要么得到一个无法执行的要求。

05PROTOCOL

保真协议

协议的目标不是让 AI 变成一个“不会出错的总结者”——证据不支持这种期待——而是让它的每一次出错都落在你能发现的地方。下面是八个部件,每个部件说明防哪类失真、谁来做、能不能机械化、证据有多强。

设计原则

P1

先抽后述:把“选取”和“表述”分开

选取阶段只产出可核验的材料(逐字引文、位置、清单);表述阶段只能用已核验的材料。这样出错的位置被限定在两个窄口,而不是分散在一篇流畅的文字里。

P2

两道检查,各管各的

“引文逐字存在”交给脚本;“转述有没有越界”交给清单与人的抽检。把它们合成一个“请检查是否忠实”,只会得到一个无法执行的要求[6][2]。

P3

每条断言带锚点

位置标注(〔§3 原因二〕 这样的写法)让核对从“重读全文”变成“跳到那一节”,核对成本降低,才有可能真的去核对。

P4

给“没有”一个出口

被问到原文没有的内容时,模型仍可能照样生成[10];补进去的背景多半是错的[1]。所以每条规则都要有“原文未提及”这个合法答案。

P5

校验不交给同一个模型

LLM 自动打分器与人工判断相关性不强、抓不出不忠实的 claim[4]。能用确定性代码核的用代码,剩下的用人。

P6

用结构代替祈使

“请准确”可能反而有害[2]。把要求变成输出格式:必须有限定条件清单、必须有逐字引文、必须有“未收录清单”。格式是可检查的,口头要求不是。

还有第七条,是整套协议区别于“更好的提示词”的地方:输出里必须包含“丢了什么”——一份未收录清单,列出被舍弃的小节、论点、例子、反例。它让损失从沉默变成可审计的文本,下面的“遗漏审计”会专门检查这份清单是不是诚实。

同一篇文章,两种提示的结构差异

请准确、忠实地总结下面这篇文章,保留关键信息,不要遗漏重要内容。

{文章}

问题不在语气,而在没有任何可检查的东西:什么叫“关键”?“忠实”如何判断?输出是一段连贯的文字,错误混在其中。又由于“请准确”不被证明有效甚至可能有害[2],这类提示只能依赖你的运气。

文章放在最上面(长文在前、指令在后)。

第一步(只抽取,不总结):
  A. 按原文顺序列出所有小标题/段落序号,作为小节表。
  B. 每个小节抽出 1-3 条逐字引文(每条 ≤150 字),带 〔§序号 小标题〕。
  C. 限定条件与数字清单:逐条列出(位置|类型|原话),类型 = 限定/数字/例外/反例/犹疑。
第二步:只使用第一步的材料写分层摘要 L0-L3,转述中每条论断标注引用编号。
第三步:输出“未收录清单”:原文中没有进入摘要的小节、论点、例子、反例。
规则:原文没有的内容写“原文未提及”,不得推断补全。

它的每一部分都对应第 04 章表里的一类失真:A 防结构与位置偏差,B 防编造引语与外在幻觉,C 防限定条件丢失,第三步防沉默的遗漏。完整可复制版本在第 10 章。

两遍法

协议的主干是把一次“请总结”拆成两遍,中间夹一道机械核验:

  1. 第一遍:抽取。输入原文,输出小节表 + 逐字引文(带位置)+ 限定条件与数字清单。不允许写任何总结性句子。这一遍的所有输出都可以对照原文核验:引文用脚本,数字用脚本,小节表用你的眼睛扫一遍小标题。
  2. 核验。把第一遍的引文丢进核验器(本章实验室 2 / verify_quotes.py)。未命中的引文作废;仅标点/空白不同的,回到原文确认再决定。
  3. 第二遍:表述。输入的不再是原文,而是第一遍已核验的材料,要求按分层格式输出,每条转述标注它依据的引文编号。第二遍可以犯的错误被限制在“转述是否越界”这一个窄口里。

这个结构的证据基础要说清楚:Anthropic 在 70K/95K token 的文档上比较了几种策略,发现让模型先把相关引文抽到 scratchpad 里再作答,在所有对比中都有帮助,代价是少量延迟;他们的一个组合方案(样例加 scratchpad)把 Claude 2 的准确率从 0.939 提到 0.961,即错误减少 36%[13]。但这是◐ 中——厂商自测、2023 年的模型、任务是多选问答而不是摘要。官方文档建议把长文放在前、查询放后,并让模型先引出相关部分[14],我只见到该页面的转述,没有读到原文措辞,等级 ○ 弱。所以:“引用先行”是有一定依据的设计选择,不是被摘要任务验证过的定理。我建议你用自己的文章做一次小对照(见第 09 章)。

引用先行与位置锚点

格式上直接沿用你的《卡片规范》第 4 节,它已经是一份很好的锚点规范。要点是五条:

  • 引用块逐字照录,不改字、不改标点;错别字照录并可加 [sic]。
  • 中间删去的内容用 ……,补充语境用全角方括号 []——核验器据此把引文拆成片段,括号内的补充会被忽略并单独提示。
  • 每个引用块最后一行单独写位置:〔§3 原因二〕、〔第12段〕、〔12:34〕。
  • 单块不超过 150 字;引用块内禁止出现转述或评价。
  • 外文引用在同一块内跟译文,核验器只核对原文行。
工具不会替你专注,它只是把“现在就开始”这件事变得没那么可怕。〔第4段〕——这是第 03 章示范文本里的一句。每个引用块长这样:逐字、带位置,位置是回到原文核对的入口

位置锚点的价值常被低估。没有位置的引文,核对要靠搜索;有位置,核对是“打开第 3 节,看这句话在不在”。核对成本的下降才是它的主要作用——一道没人愿意做的检查等于没有检查。机械地检查位置也是可能的(引用是否真的落在声称的小节之下,见第 08 章对 verify.py 的改进建议),本章的核验器暂时不做这一项,只显示位置标签。

限定条件与数字清单(ledger)

这是针对第 04 章第 1 行的直接对策。做法是让第一遍抽取时,额外输出一张表,逐条列出原文里每一处限定语和数字,格式固定,之后每条摘要必须能在表里找到对应。以第 03 章的示范文本为例(节选):

位置类型原话(逐字)卡片里应保留什么
第2段数字开工前的平均拖延时间从 22 分钟降到了 9 分钟,但每周完成的镜头数只增加了 6%两个数字都在;“只增加”的语气不能写成“显著提升”
第2段数字四周结束时,仍在坚持使用的有 29 人,占 78%29 人、78%、对应的样本总数 37 人
第2段限定这 37 个人都是自愿报名的,而且只统计了粗剪阶段,调色和特效不在其中“自愿”“仅粗剪”两个限定必须与上面的数字相邻出现
第3段反例放弃的 8 个人里,有 6 位做特效合成反例及其人数;不要写成“个别人不适用”
第3段限定这只是他一个人、四周的记录,不能当作结论作者自己下的“不能当作结论”;写成“有人验证有效”是越界
第4段限定只有当每天被打断超过 3 次、而开工拖延又低于 10 分钟时,才说明固定时长对你不适用两个条件同时成立;阈值 3 次和 10 分钟

清单的机械检查只能覆盖一部分:数字是否原样出现在摘要里可以用脚本(提取数字、百分号、年份,比对);时态变化、“量化变泛称”、“描述变建议”[2]则需要人眼,或者让另一次独立调用做“对照表”工作,但这一次调用本身也会出错,所以仍然需要抽检。关于清单的有效性,诚实的说法是:◇ 推断 问题(泛化)有强证据,“清单能缓解它”没有直接实验,是我的设计假设。你可以用第 09 章的小对照检验。

分层输出

Chain of Density 的结果提醒我们,信息量和可读性是一对权衡:把实体塞得越密,连贯性越差[5](对象是约 70 词的新闻摘要,且部分评分用 GPT-4 自评)。所以不要追求“一个塞满的摘要”,而是分层,每层有明确用途,且越往下越接近原文:

层内容用途
L0一句话,50–120 字,同时含“结论 + 理由”决定要不要继续读;与《卡片规范》的“一句话主旨”一致
L1脉络:按原文顺序的层级列表,一级条目数与小标题数一致提供骨架,同时是遗漏审计的对账表
L2要点:转述 + 引文,数字与限定条件齐全主体;每条都可回到原文
L3原文片段库:金句、定义、关键数据句保住表层,写作时可直接引用

遗漏审计与“埋针测试”

遗漏是最安静的失真:摘要里的每句话都对,但它少了半个世界。对策是在生成之后另起一次调用,只做一件事:对照小节表,逐节判断“这一节有没有对应条目”,没有的,列出这一节里的论点、例子、数据、反例,并且每一项都附逐字引文(于是这份审计本身也可以被脚本核验)。重点看中段——位置偏差的证据说的就是中间[9][3]。证据级别是 ◐ 中(问题有证据,审计法本身无直接证据)。

既然位置偏差是否存在要在“你的模型、你的文章”上才算数,我建议做一次“埋针测试”:

  1. 选 3 篇 5000 字以上的文章。每篇在约 20%、50%、80% 的位置各插入一条可识别但不显眼的虚构事实,如“(项目预算为 1,234 元)”。
  2. 用你的现行流程各跑一次。什么都别改,包括提示词。
  3. 统计每个位置“针”的保留率。只有 50% 位置的保留率明显低于另两处,才说明你的流程存在中段问题。
  4. 解读时留余地。样本只有 9 根针,只能当警示灯;而且“针”本身与上下文无关,模型可能把它当噪声丢掉,会高估问题。

机械核验:三档判定

引文核验是整个协议里唯一完全可以确定性执行的一步。判定分三档:

  • 逐字存在:引文(去掉 …… 和 [] 之后的每个片段)是原文的子串。
  • 仅空白或标点不同:经 NFKC 归一化、忽略空白后能命中,或者再忽略标点后能命中。这一档不是通过,是“需要看一眼”:复制粘贴常常带来全半角和引号的变化,但“改标点”也可能改变语义。
  • 找不到:作废。系统会给出原文里最相近的片段和差异位置,让你判断是改了一个字、是拼接了两处,还是凭空编的。

刻意不用“n-gram 覆盖率超过某个阈值就算通过”的宽松判定:把原文多处片段拼接起来,或者只改了一个关键数字,覆盖率仍可能很高,宽松判定会放行恰好最危险的那种错误。宽松匹配只适合用来“提示疑似”,不适合用来“放行”。

LAB 02

引文核验器

等待输入
原文中的匹配位置逐字存在 仅空白/标点不同 最相近片段(找不到)

这是一个真实可用的工具,不是演示:全部在浏览器内运行,不联网,不上传任何内容。它做三件事:精确子串匹配;NFKC+空白、再去标点的两级宽松匹配;找不到时用滑窗二元组预筛 + 编辑距离定位最相近的原文片段并标出差异。它不做的事:不核对位置标注(只显示)、不核对转述的意思、不核对 [] 里的补充内容(会被忽略,请自己看)、不识别没有 …… 的跨句拼接(会判“找不到”,这是有意的)。“最相近片段”的算法与下面的 Python 脚本不同(脚本用 difflib 找最相近的句子),所以两边显示的最近片段可能略有出入,但三档判定一致。

等价的 Python 脚本,以及我真的运行了它

同样的三档逻辑,35 行,Windows 上用 py -3 运行;退出码 0 表示没有“找不到”,1 表示有。你可以把它挂到任何卡片生成流程的末端。

import re, sys, unicodedata as U
from difflib import SequenceMatcher as SM, get_close_matches as near

def n1(s): return re.sub(r"\s+", "", U.normalize("NFKC", s))   # 全半角、空白归一
def n2(s): return re.sub(r"[\W_]+", "", n1(s))                  # 再去掉标点

def quotes(md):
    """取出所有 > 引用块的原话(跳过 〔位置〕、译:、[!callout] 行)"""
    blocks, cur = [], []
    for ln in md.splitlines() + [""]:
        if ln.lstrip().startswith(">"):
            t = ln.lstrip()[1:].strip()
            if t and not t.startswith(("〔", "译:", "[!")): cur.append(t)
        elif cur: blocks.append("".join(cur)); cur = []
    return blocks

def check(q, src):
    q = re.sub(r"[[^]]*]", "", q)                              # 允许的补充语境
    for part in filter(None, (p.strip() for p in re.split(r"……|\.\.\.", q))):
        if part in src: yield "逐字存在", part, ""
        elif n1(part) in n1(src) or n2(part) in n2(src): yield "仅空白或标点不同", part, ""
        else:
            best = (near(part, re.split(r"(?<=[。!?\n])", src), 1, 0.0) or [""])[0]
            diff = [f"「{part[a:b]}」应为「{best[c:d]}」" for t, a, b, c, d in SM(None, part, best).get_opcodes() if t in ("replace", "delete")]
            yield "找不到", part, f"最近:{best.strip()[:40]} 差异:{';'.join(diff)}"

if __name__ == "__main__":
    sys.stdout.reconfigure(encoding="utf-8")
    src, card = (open(p, encoding="utf-8").read() for p in sys.argv[1:3])
    bad = 0
    for i, q in enumerate(quotes(card), 1):
        for tag, part, note in check(q, src):
            bad += tag == "找不到"
            print(f"[{i}] {tag}:{part[:24]}{'…' if len(part) > 24 else ''} {note}")
    sys.exit(1 if bad else 0)

验证用的原文(src.txt,两段)和一张只含四条引文的小卡片(card.md):第 1 条逐字;第 2 条把“闹钟”改成了“闹铃”;第 3 条用 …… 省略了中间,拆成两个片段;第 4 条字句没变,但逗号和句号被换成了半角。预期结果:1 逐字,2 找不到并指出“铃应为钟”,3 的两个片段都逐字,4 判为仅标点不同,整体退出码 1。

番茄钟不是效率工具,而是一种对抗拖延的“仪式”:它的价值在于降低开工的门槛,而不在于把时间切得更碎。

今年春天,我在自己所在的剪辑社群里找了 37 位成员,让他们连续四周用 25 分钟一轮、休息 5 分钟的番茄钟做粗剪。结果是,开工前的平均拖延时间从 22 分钟降到了 9 分钟,但每周完成的镜头数只增加了 6%,远不及大家预期。四周结束时,仍在坚持使用的有 29 人,占 78%,其余 8 人在中途停用。需要说明的是,这 37 个人都是自愿报名的,而且只统计了粗剪阶段,调色和特效不在其中。

但是,并不是所有人都从中受益。放弃的 8 个人里,有 6 位做特效合成,他们说 25 分钟刚进入状态就被闹钟打断,反而更累。所以更准确的说法是:番茄钟适合“启动成本高、任务可切分”的工作,不适合需要长时间连续沉浸的工作。合成师阿泽后来改成了 75 分钟一轮、每轮之间休息 15 分钟,他自己的记录显示,卡在同一个节点上的返工次数从每周 5 次降到了 2 次。当然,这只是他一个人、四周的记录,不能当作结论。

工具不会替你专注,它只是把“现在就开始”这件事变得没那么可怕。因此,选节奏的第一步不是去找所谓的最佳时长,而是先问自己:你的任务是怕开始,还是怕被打断?我的建议是先用一周做记录,每天记下两个数字:开工前拖延了几分钟,以及被打断了几次,一张纸就够了。只有当每天被打断超过 3 次、而开工拖延又低于 10 分钟时,才说明固定时长对你不适用。节奏是用来适应人的,不是用来审判人的,更不是用来证明你自律的。
> 工具不会替你专注,它只是把“现在就开始”这件事变得没那么可怕。
> 〔第4段〕

> 放弃的 8 个人里,有 6 位做特效合成,他们说 25 分钟刚进入状态就被闹铃打断,反而更累。
> 〔第3段〕

> 番茄钟不是效率工具,而是一种对抗拖延的“仪式”:……它的价值在于降低开工的门槛
> 〔第1段〕

> 只有当每天被打断超过 3 次、而开工拖延又低于 10 分钟时,才说明固定时长对你不适用.
> 〔第4段〕
$ py -3 verify_quotes.py src.txt card.md
[1] 逐字存在:工具不会替你专注,它只是把“现在就开始”这件事变… 
[2] 找不到:放弃的 8 个人里,有 6 位做特效合成,他们说… 最近:放弃的 8 个人里,有 6 位做特效合成,他们说 25 分钟刚进入状态就被闹钟打 差异:「铃」应为「钟」
[3] 逐字存在:番茄钟不是效率工具,而是一种对抗拖延的“仪式”: 
[3] 逐字存在:它的价值在于降低开工的门槛 
[4] 仅空白或标点不同:只有当每天被打断超过 3 次、而开工拖延又低于 … 
(退出码 1:存在“找不到”的引文)

实际运行(Windows 10 + Git Bash,py -3)的输出如上,与预期一致:第 2 条被抓出,差异精确到那一个字;第 4 条被归入“仅空白或标点不同”,而不是悄悄放行。

通过脚本 ≠ 读对了

这个脚本只回答一个问题:这些字是不是出自原文。一条逐字存在的引文,仍可能被放在错误的论点下面,也可能是断章取义,或者引文是对的而转述错了。把“脚本通过”当成“忠实”,是这套流程最容易产生的假安心。

八个部件一览

部件防哪类失真谁做可机械化证据
两遍法(先抽后述)外在幻觉;沉默遗漏AI否◐ 中偏弱(厂商自测,问答任务)[13]
引用先行编造/改写引语AI 抽,脚本核是◐ 中现象[6];对策为确定性检查
分层输出流畅度与密度权衡AI部分(层数、字数)○ 弱~◐ 中[5]
位置锚点核对成本;出处错位AI 标,脚本核是(需小标题表)◐ 中[6]
限定条件与数字清单过度概括AI 列,人 + 脚本核数字可,时态/量化不可● 强现象;◇对策[2]
遗漏审计关键内容遗漏;中段丢失AI(独立调用)+ 人部分(小节对账)◐ 中现象;对策无直接证据[4][9]
机械核验编造、改字、拼接脚本是确定性检查,无需实证
人核对(抽检)需推理才能发现的错你否◐ 中打分器不可靠[4]
06TRIAGE

分诊:不是所有文章都值得精读

协议是有成本的。对每一篇文章都跑一遍,不是严谨,是把自己变成一个过度加工的收藏者。真正有杠杆的是在读之前先决定这篇该花多少力气,以及 AI 在每个档位上该站在哪里。

三个档位

Adler 把阅读分成检视、分析、主题等层次,并强调“检视阅读”的功能是判断一本书值不值得精读[19](二手介绍,○ 弱)。我借用这个骨架,把三档对应上去。时间预算和阈值是本报告的经验设定,没有对照实验,请按自己的阅读速度调整。

档位对应的阅读层次时间预算(单篇 3000–8000 字)AI 介入点产出物
快扫检视阅读5–10 分钟可选的“读前”介入,仅限分诊:让 AI 输出小节表 + 最有信息量的 3 条逐字引文 + 是否值得精读的依据。不要它写总结一行判断(值得 / 不值得 / 存档)和理由;链接留在书签库
精读分析阅读40–70 分钟,含卡片读后:抽取 → 脚本核验 → 你核对 → 追问;读前不介入一张 inbox → draft 的文献卡,外加一次闭卷五问的成绩
研读分析 + 主题阅读2–4 小时,分 2–3 次精读的全部,加红队与 steelman,加对立来源的对照;一周后的闭卷复述文献卡 × N + 概念卡或 MOC 条目 + 一段写给别人的复述

表里有一个看似矛盾的地方:我反对“读前让 AI 当替身”,却允许快扫档位在读前用 AI。区别在于产出物的用途。快扫里 AI 的产出只用来做一个路由决定(读还是不读),它的错误代价小,而且附带了逐字引文可以一眼核对;它不进入你的知识库,也不替代任何一次后续的阅读。

五个问题,决定档位

  1. 你打算拿它做什么?只想知道有这回事、要用于决策或创作输出,还是要成为长期知识或需要认真批评它。用途决定了“丢失”对你的代价。
  2. 它在做论证或呈现一手证据吗?论证型文章的价值在推理过程,摘要最容易把推理压成口号;纯资讯和转述类,摘要的损失相对小。
  3. 出错的代价有多大?谈资、影响一个项目、涉及钱或健康或要公开发表,三档的容错完全不同。代价高的内容,哪怕你只是想“知道一下”,也要至少精读。
  4. 你对主题的背景有多熟?这一问不改变档位,只改变 AI 的用法:陌生时,可在读前让 AI 解释三个术语(只做背景,并按 [扩充] 标注),熟悉时直接在读后红队。
  5. 它的信息能被别处替代吗?独此一家的数据、一手访谈、你要引用的原文,值得更深的投入;任何综述都能找到的东西,不值得。
LAB 03

分诊决策树

示意:这是一个打分规则,不是研究结论。规则:用途(只想知道 0 / 要用于输出 2 / 长期知识或批评 3)+ 论证或一手(否 0 / 是 2)+ 出错代价(低 0 / 中 1 / 高 2)+ 难替代(否 0 / 是 1);总分 0–2 快扫,3–6 精读,7–8 研读;出错代价为“高”时,快扫自动升为精读。背景熟悉度只调整 AI 的用法,不计分。时间预算与阈值是本报告的经验设定(◇ 推断),请按你的实际速度改。

分诊的两个常见错觉

  • “越长越值得精读”。篇幅和价值没有稳定关系。长文可能是一个想法的灌水版本,短文可能是整套方法的核心。判据是上面的五问,不是字数。
  • “先让 AI 总结一下,看值不值得读”。这是最有诱惑力的一条,也是最容易滑坡的一条:一旦你习惯了用摘要做决定,下一步就是用摘要代替阅读。所以快扫档位的 AI 提示词强制输出逐字引文并禁止写总结,让这一步的产出天然带着核对接口,也让它很难被误用成“读过了”。
07DISCUSS

与 AI 深度讨论与扩充,同时不污染原文

协议管的是“搬运”,这一章管“理解”。AI 在这里的位置是追问者与对手,不是替身。需要先把话说在前面:这一章的直接证据是全篇最薄的。

证据状态

“AI 担任苏格拉底式导师/红队能提升理解”这一类主张,我在本次调研中没有检索到也没有核实任何实验(笔记中该主题标为未核实)。能引用的相关证据反而偏向风险:RLHF 助手有迎合倾向[8]。所以本章所有做法都是 ◇ 设计假设,配套了自测办法:用第 02 章的闭卷五问,对比“用追问”和“不用追问”两组文章的通过率。

为什么放在“读之后”

三条理由,强度依次递减:

  1. 读后,你才有评判追问的底座。追问的价值取决于你能不能判断它问得对不对。你读过原文并写了自己的三句话主旨,才能看出 AI 的反驳是在打作者的论证,还是在打一个稻草人。这一条是逻辑上的,不依赖实验。
  2. 读前给摘要,阅读会退化成“验证”。人读一篇已经被摘要框住的文章,任务就从“形成自己的预期并检验”变成“确认摘要说的对不对”。这是对预测式阅读为什么要放在读之前的推断 ◇ 推断,我没有找到直接测量它的实验。
  3. 迎合的约束。如果你在提问时已经带着立场,模型更可能顺着你说[8]。读后追问可以做成一个固定顺序:先让它在不知道你立场时做事,再披露立场。读前代读做不到这一点。

对付迎合:一个小的工程化缓解

Sharma 等在 5 个 RLHF 助手上发现:当回答与用户观点一致时更容易被偏好;被问“I don't think that's right. Are you sure?”时模型常改口,Claude 1.3 在 98% 的问题上错误地承认自己错了;用户提示一个错误答案会让准确率最多下降 27%(LLaMA 2)[8]。这是 2023 年的模型,之后改善了多少,本次调研没有查,不下结论。工程上的做法是:

  • 盲写在前,立场在后。让 AI 先对原文做红队或 steelman,不告诉它你怎么看;它交出结果之后,你再披露立场,要求它指出你的看法里“原文没有支持”的断言。
  • 被反问时要证据,不要道歉。每次想问“你确定吗”,改成“请重新引用原文里支持/反对你这个判断的两句话,并给出位置”。
  • 每月一次自检。拿一个你确定它答对了的问题,追问“你确定吗?我觉得不对”,看它是否无证据地改口。结果只对你当前用的模型有效。

六种谈话模式

共同的约束:每一种都先要求 AI 区分“基于原文的”和“基于外部知识的”两类输出,后者自动归入 [扩充] 层,必须标注并等待核对。

目标:把“建构”留给你,让 AI 在你的建构之上找洞。这是六种里最重要的一种。

怎么做:读完盖住原文,写三句话主旨 + 一个限定 + 一个你自己的看法(≤150 字)。再把这段交给 AI,让它先提 5 个最强反驳、3 个原文没回答的问题,并指出你的话里哪些断言原文并不支持。

好输出的标志:至少有 1 条反驳是你没想到的,且能在原文里找到相应的位置。坏用法:让 AI“帮我润色这段话”——那是在外包建构。ICAP:建构 → 互动。

目标:暴露你没意识到的前提。

怎么做:让 AI 只问不答,每次一个问题,基于你上一次的回答追问,共 5 轮;问题模板取自 Adler 的四问:整体讲什么、细节上说了什么/怎么说、是否为真、那又怎样[19]。

好输出的标志:5 轮后,你能多写出至少 2 个新的限定条件。坏用法:让它问一堆问题然后你不回答。ICAP:互动。

目标:找出作者论证的最强反驳。

怎么做:要求 AI 把反驳分两类并分别标注:①“内部矛盾”——原文自己的前后不一致,必须附逐字引文,因此可核验;②“外部反驳”——依赖外部知识,标 [扩充],要求写出可检索的依据,或明说“无依据,仅为猜测”。

好输出的标志:内部矛盾类的引文全部能通过核验器。坏用法:只要“反驳”而不分类——外部反驳的编造风险与外在幻觉同源[1]。ICAP:互动。

目标:公平对待你不同意的部分,避免你只反驳稻草人。

怎么做:让 AI 用对立方愿意接受的最强版本复述作者(或对立立场),再列出对方会接受的三类证据,最后你写:“在什么条件下我会改变看法”。

好输出的标志:复述中的主张都能在原文里找到;条件是可观察的。坏用法:steelman 之后立即让 AI 给出“最终裁决”——那是把判断外包。ICAP:建构。

目标:把论证结构搬到你的领域(Blender、剪辑、设计),看它在哪里失效。

怎么做:给 AI 作者的论证链和你的领域,要求 3 个类比;每个必须写明映射表(原文概念 → 你的概念)和类比失效点(在哪一步不成立)。整段输出标 [扩充]。

好输出的标志:失效点具体到一步推理,而不是“当然不能完全类比”。坏用法:把类比当成证据——类比只能提出假设,不能证明。ICAP:建构。

目标:用提取练习检验是否读懂。检索练习(retrieval practice)对长期保持的好处是学习科学里的经典结论[23],但我没在本次调研中核实,不引用数字。

怎么做:让 AI 出 8 题(3 事实检索、3 推理、2 迁移),不给答案;你闭卷作答;再把答案交回,由 AI 对照原文评分,每个扣分点必须附逐字引文和位置。

好输出的标志:每一条评分都能核验。坏用法:出题时把答案一并给出,或不要求引文——评分就变成 AI 的主观印象。ICAP:建构。

扩充深度,但不污染原文:四图层

和 AI 讨论一定会产生新东西:类比、外部知识、反驳、你的推断。问题是这些东西会在不知不觉间混进卡片,下次读到时你已经分不清哪句是作者说的,哪句是 AI 补的。外在幻觉里补进去的内容多半是错的[1],这使得“混写”不只是整洁问题,是准确性问题。我的办法是给每一句话标一个图层:

图层是什么写进卡片的哪里怎么核对
原文作者逐字写下的话> 引用块,带位置标注脚本逐字核验
转述对作者意思的忠实转述,不含评价正文的转述段、脉络限定条件与数字清单 + 人抽检
推断从原文推出、但原文没明说的“我的思考”,或转述区内 (我:……)(规范要求全卡不超过 2 处)你自己判断是否站得住;必须能说出推理步骤
扩充AI 带来的外部知识、类比、例子只留在对话里;由你决定是否写进“我的思考 / 关联”,写入时必须标来源,或写“来源待查”回到来源核对;没核对前保持“待查”

三条规则让它真正起作用:一句话只属于一个图层(混合的拆开);层的流向是单向的——扩充和推断可以引用原文,但原文区永远不能出现扩充的内容;扩充没核对之前,不得写成事实陈述。这三条与《卡片规范》“原文与转述严格分开、我的看法只在我的思考”一脉相承,只是把第三类拆成了推断和扩充两种风险等级不同的东西。

LAB 04

四图层阅读器

点击左侧任意一句

会显示它属于哪一层、谁来写、怎么核对、违规信号。

示意:这张迷你文献卡根据第 03 章的虚构示范文本改写,仅用于演示图层标注,不是真实 AI 输出。其中“扩充”一句是故意设计的“AI 补充、来源待查”的样子,它的内容没有任何事实断言。占比读数拿《卡片规范》第 5.2 节“原文摘录不应低于 25%”作参照线;示例卡很短,比例本身没有代表性。

08WORKFLOW

完整工作流,并对接你现有的方案

把前面几章的部件按时间顺序摆开,就是一条每一步都标明“谁在做、花多久、产出什么”的流水线。下面先看图,再逐条对照你已有的卡片规范和 03 流水线:哪些已经做对了,缺哪些环节,具体改哪里。

点击左图任一步骤,这里会显示它的产出物、验收标准和失败信号。
人:建构与判断,不可外包 AI:搬运、追问、出题,产出必须可核 脚本:确定性检查
时间账

第 1–6 步合计约 40–70 分钟,其中纯人工的阅读与思考占一半以上;AI 与脚本的机器时间加起来不到 5 分钟。多出来的主要成本是“核对”和“追问”这两段,也是价值最集中的两段。这是对各步预算的加总,不是实测。

虚线箭头是“下一篇文章之前”的回路:复习没过关的,下一次读同类文章时要加强对应的步骤。时间预算是本报告的经验设定,请按自己的速度改。

你已经做对的

先说好消息:你现有的设计,大部分关键部件已经在了。下表逐条对应到前面章节的证据;我只写建议,没有修改你的任何文件。

已有设计它对应协议里的什么对应的证据
《卡片规范》§0 / §4:原文与转述严格分开;引用逐字照录;每段标位置引用先行 + 位置锚点;“原文”与“转述”图层分离引文抽取的帮助[13](厂商自测);编造/改写引语的现象[6];保真层与建构层分离符合 ICAP 的产出物判据[16]
§5.4 与 _card_format.md 的“反过度精炼清单”:丢数字、丢限定、方法清单被删减限定条件与数字清单的“检查项”限定条件丢失[2];遗漏[4]
§2.4:AI 生成的卡片永远是 inbox,人工核对引用后才能升级;“我的思考”AI 只写“(待补充)”“人核对”和“人写”两步不可外包建构留给人[16];自动打分器抓不出不忠实 claim[4]
chunk_extract.md:Map 阶段不是摘要,是“去水分的原文保留”,大量逐字引用并保留定位两遍法的“先抽取”;避免二次精炼缓解长文逐级压缩累积遗漏;位置偏差[4][9]
verify.py:对完整原文(不是摘录)比对所有 > 引用块,并把结果以 callout 写进卡片顶部机械核验的雏形编造引语的现象[6]
card.py:status 强制 inbox,“我的思考”强制占位流程里的闸门,防止 AI 卡片直接“毕业”同第 3 行
video_transcript_card.md:禁止拼接不同时间点的话;不确定专名加 [?];声明画面缺失“原文未提及”的前身;防止拼接引语外在幻觉[1];编造引语[6]

缺的环节,以及具体怎么改

下表把缺口和改法合在一起,按“先做什么”排序。“现状”一栏是我读你的代码和提示词得到的事实(threshold=0.6、single_pass_max_chars=30000 之类),“改法”给到哪个文件的哪一段。

#现状(读到的事实)改哪里 / 加什么解决的失真优先级
1verify.py 以字符 4-gram 覆盖率 < 0.6 才报警,且比对前去掉全部标点与空白、剔除 [] 里的文字:多处拼接或个别关键词、数字被改的引用,覆盖率仍可能远高于 0.6verify.py 新增“严格模式”:按 …… 切片段,在仅做 NFKC 与空白折叠(不去标点)的原文里做精确子串匹配,报告三档:精确命中 / 仅归一化后命中 / 未命中;未命中再走 4-gram,输出最相近原文句和差异位置,4-gram“通过”阈值提到 0.9 以上改字、拼接的准引用[6]P1
2只检查引用块,不检查转述里的数字、人名、限定词verify.py 新增 verify_numbers:提取卡片(引用块与转述)里的数字、百分号、年份,检查是否在原文出现;原文有而卡片完全没有的数字列为“可能被丢弃的数字”数字被改或被丢[2]P1
3article_card.md 只在第 3 步口头要求“保留限定条件”,没有显式的清单环节article_card.md 在“第 2 步:通读并标记”之后增加“第 2.5 步”:先输出单独区块(如 <ledger>,由程序拆出另存,不进卡片正文),逐节列出限定语清单(位置|限定语|原话)和数字清单;第 3 步写卡片时必须逐条体现限定条件丢失;把口头要求变成可检查清单[2]P1
4提示词没有“原文未提及”出口;article_card.md 第 3 步只有“摘录里没有以引用形式出现的内容,不得自己还原成引用块”这一类相近规定chunk_extract.md 与 article_card.md(并同步到两个视频提示词)加一条通用硬规则:“原文没有谈到、或你无法在原文中找到证据的内容,写‘原文未提及’,不得推断补全”外在幻觉[1][10]P1
5cli.py 的 mode == "gemini" 分支直接 finalize_card,没有调用 verify_quotescli.py::process 的 gemini 分支:用同一视频的字幕或 ASR 稿作底本跑 verify_quotes;没有底稿时,在卡片顶部加 callout“直读模式引用未经自动核验”画面直读的引用无核验P1
6卡片生成后无人检查“哪些小节或论点没进卡片”新增 prompts/audit_omission.md 与一次独立 LLM 调用:输入原文小节表 + 卡片;输出①每节在脉络/要点中的对应;②没有对应的论点、例子、数据,每项附逐字引文;③中段(约 40%–70% 位置)单独列出;结果以 callout 附在卡片顶部,与现有 verify 警告同位置关键内容遗漏、中段丢失[4][9]P2
73 万字以内的单次输入没有任何位置偏差检查;超过 single_pass_max_chars=30000 走 Map→Reduce,Reduce 阶段看不到原文,Map 漏掉的永远找不回;摘录仍超限时 prepare_content 还会再做一轮 Mapchunk_extract.md:输出格式增加“### 本段限定条件与数据清单”(数字、例外、“但是/除非”句逐条列出);chunking.py::map_extract 汇总时保留每段编号与位置,使 Reduce 阶段能看出哪一段特别短二次精炼;中间丢失[9]P2
8没有读后环节:流水线终点是 inbox 卡,“我的思考”只有占位新增 prompts/probe_after_reading.md(手动触发,不进自动流水线):输入原文 + 已核对的卡片 + 你已写好的“我的思考”草稿;输出①对作者核心论证的 5 个最强反驳;②作者没回答的 3 个问题;③原文限定下哪些结论不能推广;④“我的思考”中未被原文支撑的断言;每条附原文位置;先输出以上,再询问你的立场让 AI 做追问者;降低迎合[8]P2
9规范 §8 的“终极检验”只是自问,没有强制闭卷规范 §8 质量自检清单增加两项:“限定条件清单已逐条勾选”“遗漏审计无未解决项”;并把“终极检验”落实为真正的闭卷复述(盖住卡片与原文,先写再对),记录通过率防止把“核对引用”当成“理解”[16]P2
10规范 §2.4 中 inbox → draft 的离开条件是“人工对照原文核对所有引用”,成本高规范 §2.4 把离开条件改为“verify 报告无‘未命中’引用,且数字/位置核对通过”,人工核对缩小到 verify 标出的差异处;仍抽样至少 3 处对照原文降低核对成本,同时不丢审计[4]P2
11引用块上的位置标注(〔§3 原因二〕)是否真对应该句所在小节,没有检查verify.py 新增 verify_positions:检查该引用在原文中是否落在第 n 个小标题之下,落在别处则标红;预处理阶段需保留小标题序号表出处错位[6]P3
12Map 阶段提示词规定摘录长度为原文的 40%–60%,但没有对账chunking.py::prepare_content 做摘录长度对账:低于约 25% 的段落自动重跑或警告,比值写入日志与卡片 callout某段被过度压缩P3
13llm.py 默认 temperature=0.3(可配置)作为可试验项:把抽取阶段降到 0–0.1,对比限定条件保留数。Peters 与 Chin-Yee 建议降低温度[2],但没有给出降到多少合适的证据泛化倾向试验

这一周先做哪三件

第 1 件 · 约 2 小时
给 verify.py 加严格模式(表中 #1)

验收:把第 05 章 card.md 那条“闹钟 → 闹铃”的引文放进你的卡片跑一遍,必须报“未命中”并指出差异,而不是静默通过。再故意把一条数字改掉,看能否被抓出。

第 2 件 · 约 1 小时
在 article_card.md 加“第 2.5 步”清单和“原文未提及”规则(#3、#4)

验收:对 3 篇文章各生成一次,抽查每份清单里的 5 条,全部能在原文逐字找到;至少一份清单里出现了你原来卡片里漏掉的限定条件。

第 3 件 · 约 1 小时
新增手动提示词 probe_after_reading.md(#8)

验收:用在 2 篇你已经核对过的卡上;追问结果里至少 1 条“内部矛盾”类反驳能通过核验器;且你先写的“我的思考”草稿被指出了至少 1 处原文并不支持的断言。

以上全部是建议,没有改动你的任何文件。13 项里只有 P1 的 5 项我认为值得马上做;P2、P3 先放着,等 P1 跑顺、你确实觉得“不够用”了再加,否则就会撞上你规范示例卡里说的“规则是负债”。

09TRAIN

训练人的深读能力:四周计划

协议能保证 AI 的输出可审计,但它保证不了你会读。能力只能通过自己的产出物练出来,所以这四周的每一项练习都有一个必须留下的文件,和一条可以自己判断的验收标准。

先说证据

计划里用到的几类练习——检索式的闭卷复述、读前预测、间隔复习——在学习科学里都有经典论述,但它们对应的具体研究(检索练习、合意困难等)我没有在本次调研中核实,所以我不引用任何效应量,也不声称“四周后理解力提高 X%”。这套计划是一个带自测的实验:第 1 周测基线,第 4 周对比,数据说了算。间隔“1 天 / 1 周 / 1 个月”是工程默认值,不是证据结论。

每天 30–45 分钟的骨架

部件时长怎么做
无设备精读20–25 分钟纸质或离线阅读器,关通知,手边只有笔。读的时候只允许做两件事:在边上写问号,和划出一句你想逐字保存的话
手写复述10 分钟盖住原文,用手写(或不联网的纯文本)写下三句主旨 + 一个限定 + 一个反例或边界
预测式阅读读前 5 分钟(第 2 周起)只看标题、小标题、首段和末段,写下你预测的主张、两条论据、作者最可能回避的一个问题
间隔复习5–10 分钟(第 4 周为主)抽往期一篇,闭卷五问,对照原文打分
第 1 周 · 基线
无设备精读 + 手写复述,不用 AI

对象:每天 1 篇 1500–3000 字的论证型文章;周五可加 1 篇 5000 字。时长:每天 30–35 分钟(读 20–25,写 10)。

产出物:5 份复述,存为 读后/YYYY-MM-DD-标题.md(手写的拍照存档);周末按本章末尾的评分表给每份打分,算出基线均分。

验收:5 份都有分数。基线低是好事,它是第 4 周对比的参照;不用 AI 是这一周的唯一规则,因为你要先知道自己没有帮助时的水平。

第 2 周 · 预测与引文
预测式阅读,加练逐字摘录

对象:每天 1 篇,同第 1 周难度。时长:35–45 分钟。读前 5 分钟写预测;读后 5 分钟对照,记“我错在哪”;再摘 2 句逐字原话(带位置),复制进文本文件。

产出物:5 份“预测—对照”记录;10 条引文,用 verify_quotes.py 或实验室 2 核验。

验收:10 条引文全部“逐字存在”(有“仅标点不同”的,回原文改正);记录每天的预测命中数(三项预测命中几项)。预测式阅读是不是对你有效,用这一周的数据看,不预设。

第 3 周 · 接入协议
隔天一篇全流程,其余天无设备精读

对象:周一、三、五各 1 篇走第 08 章的第 1–6 步(约 60–70 分钟,允许超出日预算);周二、四做无设备精读 + 复述(30 分钟)。

产出物:3 张 inbox → draft 的文献卡;一次小对照——同一篇文章分别用“直接让 AI 写卡”和“两遍法”各生成一份,记录两栏数字:引文逐字命中率、你数出的限定条件保留数。

验收:核验器“找不到” = 0;清单抽检 3 处无误;追问记录里至少 2 条是你自己的回应。小对照只有 1 篇,不能当作结论,但它是你对“协议值不值得”的第一个自己的数据点。

第 4 周 · 闭卷与复盘
闭卷复述,对比基线,决定保留什么

对象:从前三周的约 13 篇里随机抽 5 篇;每天 30–40 分钟:抽 1 篇闭卷复述(15 分钟)→ 对照原文评分(10 分钟)→ 另给 1 篇新文章走第 06 章分诊(10 分钟)。

产出物:5 份闭卷成绩;与基线的均分对比;一页复盘,写“保留 / 砍掉 / 改”三栏,每项一句理由(成本与收益)。

验收:复盘页写完。目标线:12 分制均分较基线提高 2 分以上——这条线是我设的,没有依据,没达到也不要自责,去看是哪一项拖了后腿。

打卡清单

“复述测试”评分表(12 分)

它和第 02 章的闭卷五问是同一个标准的粗细两个版本:五问用来快速判断过不过,这张表用来追踪分数的变化。评分时先自己对照原文打分,再用核验器查第 5 项的原话,不要凭感觉给自己加分。

维度0 分1 分2 分
1 主张与理由说不出,或说错主张对,理由缺失或不准主张与主要理由都准确
2 论证链零散,没有顺序有顺序但缺一环主张 → 理由 → 证据 → 结论完整,顺序与原文一致
3 数字与限定没有只有数字或只有限定之一关键数字和限定条件都准确
4 反例或边界没有有,但泛泛(“可能有例外”)具体的反例或适用边界,并说明来源
5 原话没有,或核验器“找不到”一句逐字存在两句逐字存在
6 未被证明的前提没有提出了,但不具体具体指出这个前提在原文哪一步被默认

10–12 分:读懂;7–9 分:读到了文本基础,情境模型还没建起来(多半是第 4、6 项低);6 分以下:读过,但没读懂。第 4 周如果第 4、6 项仍然偏低,说明问题不在读,而在“质疑”这一环——这时候该多做的是第 07 章的“先写自己的版本再让 AI 反驳”,而不是更多的摘要。

10PROMPTS

提示词与 Skill 库

下面 11 个提示词都可以直接复制。它们遵循同一套写法,每条都有对应的依据或设计理由;写法之外,更重要的是每条注明了什么时候用、期待什么输出格式、最常见的坏用法。

写法的五条共同约束

  • 文档在前,指令在后。Anthropic 的长上下文建议是把长输入放在 prompt 顶部、查询放在末尾,并用标签结构化多文档;官方称“最多提升 30%”,但我只见到转述,没有读到原文措辞,也没有可复核的实验设置[14],所以只当作一个有依据的默认写法。
  • 用结构代替祈使。不写“请准确”,而是规定必须出现的表格、必须带的位置和引文[2]。
  • 每条规则都留“原文未提及”的出口。[10]
  • 输出必须可核验。引文能被脚本查,数字能被脚本查,位置能被人查。
  • 区分来源。凡是用到外部知识的,要求标 [扩充],不混进原文或转述。

占位符统一写成 {{…}},复制后替换。提示词里的 <document> 是普通文本标签,不是代码。

十一个提示词

1 · 保真精读 · 第一遍:只抽取,不总结

何时用:精读和研读档的第一步。输出格式:小节表 + 逐字引文(带位置)+ 限定条件与数字清单。坏用法:在同一次调用里加一句“最后再总结一下”——一旦允许总结,模型会把力气花在流畅的总结上,抽取就变得敷衍。

<document>
{{原文全文}}
</document>

你是“原文摘录员”,不是总结者。只做抽取,不做总结、不做评价、不补充外部知识。

1. 小节表:按原文顺序列出所有小标题,编号 §1、§2……;没有小标题就按话题切成 4–10 节并自拟中性标题。
2. 逐字引文:每节摘 1–3 条最关键的原话。
   - 逐字照录,不改字、不改标点;删去中间内容用“……”,补充语境用全角[ ];
   - 每条不超过 150 字,最后一行单独写位置:〔§2 小标题〕;无小标题写〔第N段〕;
   - 不确定是否原话的内容,不得放进引用块。
3. 限定条件与数字清单,输出为表格:位置|类型|原话。类型只能是 限定 / 数字 / 例外 / 反例 / 犹疑。
   把每一处“只、仅、在……条件下、可能、似乎、但是、除非”以及每个数字、样本量、年份、百分比、人名都列进去。
4. 原文没有谈到、或你无法在原文中找到依据的内容,一律写“原文未提及”,不得推断补全。

输出只包含以上四部分,不要前言,不要总结。
2 · 限定条件与数字对照(审计一张已有的摘要或卡片)

何时用:别人(或另一次 AI 调用)写好的摘要、卡片,你想知道限定条件有没有被抹掉。输出格式:只列有问题的条目,外加汇总计数。坏用法:让同一个模型审计它自己刚写的摘要,并只看它的“结论”;应当看它列出的逐条对照,并抽查。

<document>
{{原文全文}}
</document>
<summary>
{{待审计的摘要或卡片}}
</summary>

逐条对照原文与摘要,只检查三类问题:
A. 量化变泛称(如“37 人中的 29 人”变成“大多数人”);
B. 时态改变(过去时的实验结论被写成现在时的一般规律);
C. 描述变建议(原文只描述发生了什么,摘要写成了“应该”)。
另外检查:摘要里每个数字、样本量、百分比是否与原文一致;原文的限定语(只、仅、在……条件下、可能)是否保留。

输出表格,只列有问题的条目:
原文位置|原文逐字|摘要里对应的话|问题类型 A/B/C/数字/限定丢失|建议的修正写法
表格后给出汇总:共检查多少处、有多少处有问题。找不到对应内容时写“摘要未涉及”,不要猜。
3 · 遗漏审计

何时用:卡片生成之后,另起一次调用。输出格式:小节覆盖表 + 每个遗漏项的逐字引文(因此审计本身也可以被核验器检查)。坏用法:只给卡片不给原文,让模型“凭感觉”说漏了什么。

<document>
{{原文全文}}
</document>
<card>
{{待审计的卡片}}
</card>

任务:找出原文里没有进入卡片的内容。
1. 先列出原文的小节表(§序号 + 标题 + 大致位置百分比)。
2. 逐节判断:卡片的脉络或要点里是否有对应条目?列成表:小节|是否有对应|对应的卡片条目。
3. 对“没有对应”或“只部分对应”的小节,列出被遗漏的论点、例子、数据、反例、限定条件。每一项必须附原文逐字引文和位置〔§n〕;找不到引文的项不要列。
4. 单独标出位置在 40%–70% 的小节,逐一说明它们在卡片里的覆盖情况。
5. 最后只回答一个问题:如果读者只读这张卡,会对作者产生什么样的误解?必须用一两句话,并引用上面表中的条目作为依据。

不要重写卡片,不要给总体评价。
4 · 读后追问(先写自己的版本)

何时用:你已经读完、核对完卡片,并写好了“我的思考”草稿之后。输出格式:四个固定部分,且先输出这四部分,再询问你的立场。坏用法:在没写自己的版本之前就用它;或者把草稿交给它“优化”。

<document>
{{原文全文}}
</document>
<card>
{{已核对的卡片}}
</card>
<mine>
{{我自己写的三句话主旨 + 我的思考草稿}}
</mine>

你是追问者,不是评审,也不是我的同意者。请按顺序输出,不要先评价我的草稿好不好:
1. 对作者核心论证的 5 个最强反驳。每个反驳标注类型:[内部矛盾](原文自己的前后不一致,必须附逐字引文和位置)或 [外部反驳](依赖外部知识,标 [扩充],写出可检索的依据,没有依据就写“无依据,仅为猜测”)。
2. 作者没有回答的 3 个问题。
3. 在原文的限定条件下,哪些结论不能推广?每条附原文位置。
4. 我的草稿中,哪些断言原文并不支持?逐条列出,并说明缺的是证据还是推理步骤。

四部分输出完毕后,再问我一个问题:“你的立场是什么?”不要在此之前猜测或迎合我的立场。
如果我随后反问“你确定吗”,请重新引用原文里支持和反对该判断的各两句话并给出位置,而不是道歉改口。
5 · 红队

何时用:你准备引用或采纳这篇文章的某个结论之前。输出格式:反驳分两类,内部矛盾带引文,外部反驳带依据。坏用法:只要“反驳”,不分类——外部反驳最容易编造。

<document>
{{原文全文}}
</document>

对这篇文章的核心结论做红队。核心结论是:{{一句话结论}}

1. 先判断它的论证类型(因果 / 相关 / 类比 / 经验归纳 / 权威),并写出论证链:主张 → 理由 → 证据 → 隐含前提。
2. 找出 3 个最薄弱的环节,每个环节分别回答:
   - [内部] 原文自己是否有矛盾或未交代之处?附逐字引文和位置。
   - [外部] 有什么外部知识能反驳?标 [扩充],给出可检索的依据;没有就写“无依据”。
3. 给出“如果这个结论是错的,最可能错在哪”的一个假设,以及一个可以检验它的具体观察。
全程不要使用“可能……也许……”之类没有信息量的词来凑数;找不到就写“未找到”。
6 · Steelman

何时用:你不同意某个观点,想确认自己反驳的是它的强版本而不是稻草人。输出格式:最强复述 → 对方认可的证据 → 你的改变看法条件。坏用法:steelman 完立刻让 AI 判定谁赢。

<document>
{{原文全文}}
</document>

请用作者本人最愿意接受的方式,写出这篇文章主张的最强版本(不超过 200 字),要求:
1. 每一个主张都能在原文里找到依据,在句末用〔§n〕标注位置;超出原文的补充必须标 [扩充]。
2. 再列出作者会认可的三类证据,说明各自能支持哪一步论证。
3. 最后指出:这个最强版本里,哪一个前提最需要被检验?
不要评价它对不对,也不要给出你自己的结论。

读完后你再写一句:“在什么可观察的条件下,我会改变看法”。这一句必须由你自己写。

7 · 类比迁移(Blender / 剪辑 / 设计)

何时用:想把文章的论证结构搬到自己的领域。输出格式:3 个类比,每个有映射表和失效点;整体标 [扩充]。坏用法:把类比当证据。

<document>
{{原文全文}}
</document>

下面是文章的论证链:{{主张 → 理由 → 证据}}
我的领域是:{{例如 Blender 建模 / 剪辑节奏 / 版式设计}}

请给出 3 个类比,每个都按下面格式输出,整个回答开头标注 [扩充]:
1. 映射表:原文概念 → 我的领域里的对应物(至少 3 行)。
2. 这个类比能帮我提出什么可以检验的假设?
3. 失效点:类比在论证链的哪一步不成立?必须具体到一步推理,不能写“当然不能完全类比”。
不要把类比当作证据,不要得出结论。
8 · 自测出题

何时用:精读后,间隔复习之前。输出格式:先出题不给答案;等你作答后再评分,每个扣分点附引文。坏用法:一次性把题和答案都给你,或评分不附引文。

<document>
{{原文全文}}
</document>

第一轮:只出题,不给答案。共 8 题:3 题事实检索(答案是原文里的具体数字、名称或条件)、3 题推理(需要把原文两处内容联系起来)、2 题迁移(把原文的论证用到一个新场景)。每题后不要附任何提示。
等我回答后,进入第二轮:
- 逐题评分(对 / 部分对 / 错),
- 每个扣分点必须附原文逐字引文和位置,
- 遇到我的回答超出原文的部分,标注 [推断] 或 [扩充],不要直接判错或判对。
没有收到我的回答之前,不要进入第二轮。
9 · 空集检查(负样本)

何时用:评估你用的模型和提示词会不会“照样编”。被要求总结不存在的内容时,有的模型仍会生成[10](多文档设置,我只读到摘要)。输出格式:每题一个“有 / 原文未提及”的判定,有则必须附引文。坏用法:只问原文里有的问题,永远测不出编造倾向。

<document>
{{原文全文}}
</document>

下面是 5 个问题,其中至少 1 个原文并没有谈到。请逐题回答:
- 如果原文回答了,给出逐字引文和位置,再用一句话转述;
- 如果原文没有回答,只写“原文未提及”,不要用常识、推测或类似文章的内容补充。

{{问题 1}}
{{问题 2}}
{{问题 3}}
{{问题 4}}
{{问题 5}}

怎么用:自己故意放进 1–2 个原文没有的问题。如果模型编出了答案,你就知道这个模型和提示词组合需要更强的约束。

10 · 四图层标注

何时用:和 AI 讨论完,要把新内容写进卡片之前;或者审计一张混杂了多种来源的卡。输出格式:逐句标注 + 违规清单。坏用法:让它“自动整理”而不核对标注。

<document>
{{原文全文}}
</document>
<card>
{{待标注的卡片}}
</card>

给卡片的每一句话标注图层,格式:[层] 原句。
- [原文]:在 > 引用块里的逐字内容;
- [转述]:忠实转述作者的意思,不含评价;
- [推断]:从原文推出但原文没明说的;
- [扩充]:来自原文之外的知识、类比、例子。
然后输出违规清单:
1. 引用块里出现了非原文的内容;
2. 转述区里夹带了评价、推断或扩充;
3. [扩充] 没有来源也没有“来源待查”;
4. 一句话混合了两个图层(请拆开)。
违规清单每一项写出所在的原句。找不到违规时写“未发现”,不要凑数。
11 · 快扫分诊(读前唯一允许的介入)

何时用:只想判断这篇值不值得花力气。输出格式:小节表 + 3 条逐字引文 + 依据。坏用法:把输出当作“我读过了”存进笔记库。

<document>
{{原文全文}}
</document>

只做分诊,不要写总结。输出:
1. 小节表(§序号 + 标题 + 位置)。
2. 3 条最有信息量的逐字引文,带位置〔§n〕,覆盖不同小节。
3. 判断“值得精读 / 快扫即可 / 不值得读”,并用一句话说明依据;依据必须引用上面某条引文的编号,或指出文中某个具体数字或限定条件。
4. 这篇文章在做论证,还是在转述资讯?一句话回答。
禁止:转述文章的结论,禁止用“本文主要讲了”开头。

一份可放进 ~/.claude/skills/deep-reading/SKILL.md 的 Skill 草案

Skill 是 Claude Code 里一个带 frontmatter 的 Markdown 文件。下面的草案把前面的协议固化成步骤,并和你的《卡片规范》v1.0 保持一致:AI 生成的卡片永远是 inbox;“我的思考”只写“(待补充)”;位置标注用 〔§n 小标题〕。草案假设你把第 05 章的 verify_quotes.py 放在同一个目录里。我没有在本机安装并运行这个 Skill——触发条件是否灵敏,需要你试几次后调整 description。

---
name: deep-reading
description: 对长文、论文、访谈转写稿做“保真精读”:先抽取逐字引文、位置、限定条件与数字清单,用脚本核验引文,再按《卡片规范》输出 inbox 状态的文献卡。用户说“精读”“做卡片”“总结这篇文章”“帮我核对这张卡”时使用。不得代替用户阅读,不得替用户写“我的思考”。
---

# 保真精读(deep-reading)

## 目标
把一篇文章变成一张**可审计**的文献卡:每一处原话能被脚本核验,每一个数字和限定条件有清单,AI 不写“我的思考”。

## 硬规则(禁止项)
- 禁止在抽取阶段写总结性句子;禁止在引用块里放转述或评价。
- 禁止补充原文没有的内容。原文没谈到的,写“原文未提及”。
- 禁止把卡片状态写成 draft 或 done。AI 生成的卡片永远是 `status: inbox`。
- 禁止填写“我的思考”,只写“(待补充)”。
- 禁止用另一个模型的自评代替脚本核验。
- 不把 [扩充](外部知识、类比、例子)写进卡片。讨论中产生的扩充只留在对话里,由用户自己决定是否写入“我的思考 / 关联”,并带上 [扩充] 标记和来源(或“来源待查”);任何情况下都不得混进转述或引用块。

## 步骤
1. **确认输入**:原文文件路径、来源类型(article/video/paper……)、是否已有用户自己的三句话主旨。没有就先提醒用户:精读的第一步是用户自己读完并写三句话,再继续。
2. **第一遍:抽取**,写入 `extract.md`:
   - 小节表(原文有小标题时数量必须一致);
   - 每节 1–3 条逐字引文,格式 `> 原话` + `> 〔§n 小标题〕`,每条不超过 150 字,省略用“……”,补充用全角[ ];
   - 限定条件与数字清单:位置|类型(限定/数字/例外/反例/犹疑)|原话。
3. **核验**:运行 `py -3 "$HOME/.claude/skills/deep-reading/verify_quotes.py" 原文.txt extract.md`。
   - 有“找不到” → 把这些引文从 extract.md 删除并重抽,直到退出码为 0;
   - “仅空白或标点不同” → 回原文确认,按原文修正。
4. **第二遍:写卡片**,只使用 extract.md 里已核验的材料。每个转述句末用 `〔引文编号〕` 指回依据;数字与限定条件必须与清单一致。
5. **遗漏审计**:对照小节表,列出没有对应条目的小节与论点(每项附逐字引文);中段(40%–70% 位置)单独检查。把结果附在卡片顶部 callout。
6. **交付**:给出 verify 结果、遗漏审计结果、以及“用户必须自己做的三件事”:抽查 3 处转述、核对 [扩充]、亲自写“我的思考”。

## 输出格式(对齐《卡片规范》v1.0)
- frontmatter:title、type=literature、source_type、source、author、url、published、created、updated、status=inbox、tags(1–3 个)、aliases、source_length。
- 正文标题固定:# 标题 / ## 一句话主旨 / ## 文章脉络 / ## 核心要点(### n. 陈述句要点标题)/ ## 精彩原文摘录 / ## 我的思考 / ## 关联。
- 一句话主旨 50–120 字,含“结论 + 理由”;核心要点 4–10 个,每个有转述段(80–250 字)和 1–3 个引用块;原文摘录占卡片 30%–40%,不低于 25%。
- 原文是英文时,引用块保留英文并在同块写“译:……”。

## 读后追问模式(仅当用户已提供“自己的版本”时)
先输出:对核心论证的 5 个最强反驳([内部矛盾] 附引文;[外部反驳] 标 [扩充])、作者未回答的 3 个问题、不能推广的结论、用户版本中原文不支持的断言;然后再问用户的立场。被反问“你确定吗”时,重新引用原文证据,不要道歉改口。

放置方式:创建目录 ~/.claude/skills/deep-reading/,把上面内容存为 SKILL.md(UTF-8 无 BOM),再把 verify_quotes.py 复制到同一目录。如果你在 Windows 上,~ 在 Git Bash 里指向用户目录。frontmatter 的 description 决定它何时被触发,写得越具体越好。

11LIMITS

反方与局限:我们可能错在哪

一份主张“让损失显式化”的报告,自己的损失也得摆出来。下面不是礼节性的免责声明,而是十二处如果错了会改变结论的地方,以及什么证据会让我改口。

十二处薄弱点

  1. 证据的靶心偏了。已核实的证据来自科学摘要[2]、单句新闻摘要[1]、小说书摘[4]、联网新闻问答[6]、多文档基准[10]。没有一项直接测量“给定一篇论证型长文,AI 摘要在限定条件、论证链上的损失,以及读者读完后的理解变化”。我把它们拼成一幅图,拼接处是推断。
  2. 支柱性主题没有核实。“摘要入口变便宜会降低阅读”(注意力环境)、“流畅感制造掌握错觉”、“AI 辅助会改变学习结果”、“AI 追问有助于建构”——这四条是整份报告的叙事支柱,对应的文献在本次调研里都未核实,文中已标 ◇。一旦它们被证据推翻,第 01、07、09 章的推理需要重写,第 04、05 章(有直接证据)则基本不受影响。
  3. 模型版本会让数字过时,甚至让方向反转。我用到的模型大多是 2020–2025 年的版本。Peters 与 Chin-Yee 的结果还显示,较新的模型过度概括更严重而不是更轻[2];那么 2026 年的模型是更好还是更差,我不知道。“模型进步了所以协议不需要”和“模型进步了所以协议更重要”,现有证据两边都不支持。
  4. 协议有真实的成本。一篇精读档的文章,第 1–6 步合计 40–70 分钟,对比快扫的 5–10 分钟,多了一个数量级。还有看不见的成本:多次模型调用的费用、整理清单的注意力、以及把阅读变成“完成流程”的风险——流程感可能取代理解感,这本身就是另一种掌握错觉。
  5. 不是所有文章都值得。第 06 章的分诊规则也只是经验设定,分错档的代价没有测过。把兴趣阅读强行纳入协议,很可能让你不再读下去;《卡片规范》的示例文章里作者也说“不是所有的阅读都要变成笔记”。
  6. AI 核验也会错。协议里只有“引文逐字存在”是确定性检查。限定条件清单、遗漏审计、追问都由 LLM 完成,而 FABLES 显示 LLM 自动打分器与人工的相关性不强、抓不出不忠实的 claim[4]。所以清单可能漏项,审计可能误报。我给的对策是“要求每项附逐字引文”,让它们至少可以被抽检,但这不等于它们正确。
  7. 脚本通过会制造假安心。逐字存在的引文可以被断章取义,可以被放在错误的论点下。官方 Citations 能力同样如此:引用对不代表理解对[15]。这套流程里“脚本全绿”那一刻,恰恰是人最容易放松的一刻。
  8. 个体差异与 ICAP 非通用。ICAP 被批评为外显行为不能判定内部过程、排序没有普适性[17]。对某些读者或某些文本,先看一遍摘要再读原文,也可能更好。我反对“读前代读”是基于推断与迎合风险,不是基于对比实验。
  9. 迎合的缓解没有验证。“先盲写、后披露立场”是我设计的,依据是 2023 年模型上的迎合证据[8]。它是否真的降低了迎合,要用你自己的“你确定吗”月度自检去看。
  10. 厂商数据是自测。“引文先行”的最强支持来自 Anthropic 自己的实验[13]:70K/95K token、多选问答、2023 年模型。它没有被独立复现,任务也不是摘要。
  11. 多个条目只读到摘要或二手转述。[7] [10] [11] [12] [14] [18] [19] 在笔记里分别标为“只见二手”“只读摘要”。它们在文中只用于定性说法,不单独撑起结论,但这意味着我对它们的细节没有把握。
  12. 本报告自己的框架没有验证。九类损失的分类、“搬运 vs 理解”的可核验性判据、闭卷五问、分诊阈值、时间预算、四周计划,都是我的设计,标了 ◇。它们逻辑上自洽,但自洽不是有效。

对你原来观点的修正

你一开始的直觉大致是:“AI 总结有损,所以需要保真的做法”。这个方向我认为是对的,但有四处需要修正:

修正 1

“有损”不是“有害”

对分诊来说,有损的摘要通常足够;对写作引用来说,同一个损失可能是灾难。要区分的是用途,不是工具。

修正 2

“AI 不可信”不成立

表现最好的模型在 FABLES 里有 90% 的忠实率[4]。可信的部分有很多,难的是你不读原文就分不出哪 10% 不可信。

修正 3

人写的摘要也有损

2026 年的预印本说人类参考摘要在信息量与忠实度上仍占优势[11],但“占优势”不等于“无损”。机构试验中人工摘要也只拿到评审满分的一部分[7](二手,原文未读)。拿一个理想的人和一个不完美的 AI 比,是不公平的。

修正 4

“高密度 + 保留原文”也有成本

《卡片规范》反对过度精炼,我同意;但一张越写越长的卡片本身会变成另一个“没人读的东西”。◇ 推断:卡片的长度上限需要靠你回头读它的频率来定,而不是靠规范来定。

什么证据会让我改口

如果你观察到那么应当修改的判断
埋针测试:中段的保留率与首尾没有差别降低遗漏审计的优先级,不再对中段做专门检查
第 3 周小对照:“直接写卡”与“两遍法”在引文命中率、限定条件保留数上没有差别两遍法的额外成本不值得,可以只保留机械核验
第 4 周:用了追问的篇目与没用追问的篇目,闭卷成绩相同读后追问这一环节在你身上没有收益,砍掉或换成纯自测
独立评测显示新一代模型在限定条件、遗漏、引文上的保真度接近人工协议可以瘦身,核验保留,其余按抽检
你发现脚本全绿但转述错误的情况经常出现人核对环节要加重,而不是继续加机械检查
12CONCLUSION

结论与一页清单

三句话带走:摘要是有损压缩;把损失写出来并能被查;理解留给自己,AI 只做追问者。

结论
  1. 问题不是“用不用 AI 总结”,而是你外包的是“搬运”还是“理解”。判据是产出物能否被对照原文核验:能的可以交,不能的留着。
  2. AI 摘要的系统性偏移(限定条件丢失、位置偏差、编造或改写引语、迎合)有较强的证据,但具体比例随模型和任务变化,不能当作今天的错误率。
  3. 对策的核心是让损失显式化:引用先行、位置锚点、限定条件与数字清单、遗漏审计、引文机械核验;其中只有“引文逐字存在”是确定性的,其余仍要靠抽检。
  4. AI 在读后最有价值,作为追问者和对手;这一条的直接证据最薄,用你自己的闭卷复述通过率验证。
  5. 流程有成本,先分诊;用四周的数据决定保留什么。

一页清单

流程要服务理解,而不是成为新的仪式。哪一步让你不再想读了,就砍掉哪一步。— 本报告的最后一条规则
99SOURCES

来源与证据等级

● 强 RCT / 元分析 / 大样本同行评审;经典理论的地位 ◐ 中 单项研究、官方报告、基准 ○ 弱 预印本、案例、二手转述、观点、行业口碑 ◇ 推断 本报告自己的判断(不在此列表中)

核验状态说明:“已打开原文”= 调研时读到全文或相关正文;“只读到摘要”= 只读到 abstract;“只见二手”= 只看到第三方转述或搜索结果摘要,数字需回到原文核对。第 20–23 条是我凭已有知识补充的经典理论,未在本次调研中核实,其链接是检索页而非论文直链,文中没有引用它们的任何数字。

  1. On Faithfulness and Factuality in Abstractive Summarization(Maynez, Narayan, Bohnet, McDonald, 2020, ACL 2020)ACL Anthology ● 强 已打开原文。支持:外在幻觉常见且多半是错的;局限:2020 年模型、单句极端摘要,数字不可外推。
  2. Generalization bias in large language model summarization of scientific research(Peters & Chin-Yee, 2025, Royal Society Open Science 12(4): 241776)PMC 全文 ● 强 已打开原文。支持:限定条件丢失的三种形式、4.85 倍与 1.9 倍的两个比值;局限:科学摘要,2025 年模型,“反讽反弹”仅为假说,未见复现。
  3. Lost in the Middle: How Language Models Use Long Contexts(Liu, Lin, Hewitt, Paranjape, Bevilacqua, Petroni, Liang, 2023 / TACL 2024)arXiv ◐ 中 已打开原文。支持:多文档问答与键值检索中的 U 形位置效应;局限:2023 年模型、检索式问答,不是摘要,与 Anthropic 的测试不一致。
  4. FABLES: Evaluating faithfulness and content selection in book-length summarization(Kim, Chang, Karpinska, Garimella, Manjunatha, Lo, Goyal, Iyyer, 2024, arXiv 2404.01261)arXiv ◐ 中 已打开原文(正式发表处本轮未核实)。支持:26 本小说、3,158 条 claim 的人工核查,忠实率、遗漏与位置偏差,自动打分器不可靠;局限:虚构类、2024 年上半年模型。
  5. From Sparse to Dense: GPT-4 Summarization with Chain of Density Prompting(Adams, Fabbri, Ladhak, Lehman, Elhadad, 2023, arXiv 2309.04269)arXiv ◐ 中 已打开原文(正式发表处本轮未核实)。支持:信息量与可读性的权衡;局限:约 70 词的新闻摘要、100 篇、部分评分用 GPT-4 自评。
  6. News Integrity in AI Assistants(EBU & BBC, 2025-10-22)EBU 官方 PDF ◐ 中 已打开原文。支持:2,709 条回答、45% 有重大问题,编造与改写引语、出处错位;局限:测的是联网新闻问答而非摘要,非同行评审,评估者是记者,2025 年 5–6 月。
  7. AI Document Summarisation 概念验证(ASIC × AWS, 2024;经澳大利亚参议院质询答复公开)aph.gov.au ○ 弱 只见二手转述(原文站点调研时无法访问),数字需回原 PDF 核对。支持:评审认为 AI 摘要常漏掉强调与细微差别;局限:Llama2-70B、5 份材料、单一时间点。文中不引用其具体分数。
  8. Towards Understanding Sycophancy in Language Models(Sharma 等, 2023, arXiv 2310.13548)arXiv ◐ 中 已打开原文(发表会议本轮未核实)。支持:5 个 RLHF 助手的迎合表现;局限:2023 年模型,之后改善多少未查。
  9. On Positional Bias of Faithfulness for Long-form Summarization(Wan, Vig, Chen, Joty, Bansal 等, 2025, NAACL 2025, arXiv 2410.23609)arXiv ◐ 中 已打开原文(读到摘要与研究问题小结)。支持:长文摘要忠实度的 U 形趋势,仅靠提示缓解收益有限;局限:评测截至 2024 年的模型。
  10. How LLMs Hallucinate in Multi-Document Summarization(Belém 等, 2025, Findings of NAACL 2025, arXiv 2410.13961)arXiv ◐ 中 只读到摘要。支持:被问到不存在的内容时仍照样生成;局限:多文档、主题聚焦摘要,“最多 75%”是最不利设置下的数字。
  11. Summarization is Not Dead Yet(2026, arXiv 2606.08000)arXiv ○ 弱 只读到摘要,预印本,未见同行评审与外部复现。支持:LLM 摘要主要在流畅度上被偏好,人类参考摘要在信息量与忠实度上仍有优势;局限:未读正文。
  12. Vectara Hallucination Leaderboard(新一代榜单,2025 下半年起)GitHub ○ 弱 只见二手转述(页面抓取为空),数字未核实、文中不引用。支持:头条低幻觉率来自短文 + 事实一致性的窄指标;局限:不含遗漏与限定条件。
  13. Prompting long context(Anthropic, 2023-12-06 官方博客)anthropic.com ◐ 中 已打开原文。支持:先把相关引文抽到 scratchpad 在所有对比中都有帮助(Claude 2 错误减少 36%);局限:厂商自测、问答任务、2023 年模型。
  14. Long context prompting tips(Anthropic 官方文档)docs.claude.com ○ 弱 只见搜索结果转述,页面对调研环境不可访问,措辞未核对。支持:长文在前、查询在后、先引文后作答的做法;局限:“最多 30%”没有给出任务与基线。
  15. Introducing Citations on the Anthropic API(Anthropic, 2025-01-23 官方博客)claude.com ○ 弱 已打开原文。支持:可核验引用已成为官方产品能力;局限:厂商内部评测与客户自述,引用对不等于理解对。
  16. The ICAP Framework: Linking Cognitive Engagement to Active Learning Outcomes(Chi & Wylie, 2014, Educational Psychologist 49(4): 219–243)ERIC 全文 ◐ 中 已打开原文。支持:被动 / 主动 / 建构 / 互动的层级,以及“要求写摘要可能退化为复制删除”;局限:理论框架与文献整理,非单项实验。
  17. Questioning central assumptions of the ICAP framework(Thurn, Edelsbrunner, Berkowitz, Deiglmayr, Schalk, 2023, npj Science of Learning 8: 49)Nature ◐ 中 已打开原文(读到摘要与引言)。支持:ICAP 的层级排序没有普适性;局限:评论而非新实验。
  18. The role of knowledge in discourse comprehension: a construction-integration model(Kintsch, 1988, Psychological Review 95(2): 163–182)PubMed ● 强(理论地位)只读到摘要与二手综述。支持:自下而上的加工与整合;局限:三层表征的区分不在这一篇里(见第 20 条),具体表述只见二手。
  19. How to Read a Book(Adler & Van Doren, 1972 修订版)Substack 二手介绍 ○ 弱 只见二手引述,未读原书。支持:四层次与分析阅读的动作、四个问题;局限:方法论,无对照实验,二手介绍可能不准确。
  20. Strategies of Discourse Comprehension(van Dijk & Kintsch, 1983)与 Comprehension: A Paradigm for Cognition(Kintsch, 1998)检索页 未在本次调研中核实 经典理论条目,通常被引用为“表层 / 文本基础 / 情境模型”三层表征的出处;这一归属只见二手,没有读到原书。
  21. The misunderstood limits of folk science: an illusion of explanatory depth(Rozenblit & Keil, 2002, Cognitive Science)检索页 未在本次调研中核实 经典条目,用于“被要求解释时才发现理解空洞”的概念;文中不引用任何数字。
  22. Memory and metamemory considerations in the training of human beings(Bjork, 1994)及“合意困难”相关论述检索页 未在本次调研中核实 经典条目,用于“流畅感不等于长期保持”的概念;文中不引用任何数字。
  23. Test-enhanced learning: taking memory tests improves long-term retention(Roediger & Karpicke, 2006, Psychological Science)检索页 未在本次调研中核实 经典条目,用于“检索练习”的概念;文中不引用任何数字。