00 TL;DR−0 m · 表土
结论先行:值钱的东西搬家了
AI 把“做出来”的成本压得很低,稀缺性于是向两头迁移:上游是到底要做什么 (定义问题),下游是做出来的东西对不对、好不好 (判断),以及在几个都说得过去的版本里选哪一个并为之负责 (承担选择)。
你的直觉——底层能力比软件操作重要、不同领域的底层能力互通、一个人加 AI 能做过去要一个小团队才做得出的东西——大方向有证据支持。支持的证据主要有两类:一类是随机实验和大样本数据,显示 AI 在它擅长的任务上把新手和老手的差距拉近了[1] [2] [3] ;另一类是软件工程里的老结论,即最难的部分是“确切决定要造什么”,而不是把它敲出来[23] 。
但把原话原样接受,会掉进三个坑。下面四个数字先给你一个手感,每个数字的条件和局限在后文都有交代。
0
AI 能力范围内的任务里,起点低于平均的咨询师用 AI 后的得分提升(高于平均者提升 17%)。
0
同一实验里,刻意放在 AI 能力边界之外的那道题,用 AI 者答对的比例下降。仅一道题,是百分点不是 19%。
0
撤掉 AI 后的闭卷测验,无护栏 GPT 组比从没用过 AI 的对照组低;学生并没有觉得自己学得差。
● 强 · 近 1,000 名高中生 RCT
[10]
0
22–25 岁在 AI 高暴露职业里的就业量,低于“与低暴露同龄人保持同步”应有的水平;有经验者无类似差距。
三处必须修正的地方
修正 ①
底层能力不是通用肌肉 它是在具体领域里长出来的“深层结构”:专家按原理而不是表面特征看问题[16] ;思维过程和领域知识缠在一起[17] 。要靠对比多个案例才能抽象出来,再迁移[18] 。所以是“在具体里练抽象,用抽象跨领域”。
修正 ②
领域知识不可省 判断 AI 的输出,需要你自己先懂那个领域。在 AI 能力边界之外,盲目采纳输出的人表现更差[1] ;资深者评估“AI 能做的份额”更低,作者把原因指向难以模仿的隐性、情境化专长[7] 。
修正 ③
用法决定增强还是萎缩 无护栏地用,练习时成绩涨、撤掉后反而低[10] ;整体委托的人学得更差[11] 。人机组合在“决策类”任务上平均还不如最好的一方单干[29] 。“人在回路里”不自动等于“质量有保证”。
还有一个更现实的修正
底层能力要在真实实践中长,而入门级的实践场地正在被压缩:在 AI 高暴露的职业里,年轻人的就业下降主要通过“少招人”发生[6] 。这意味着你得主动为自己造练习场 ——别指望工作里自然给你。注意这项研究自称是描述性指标,不是因果估计,后文会展开。
你要做的 5 件事
动手前先写“规格卡”,再交给 AI 目标、受众、约束、验收标准、反例,五行。它同时练能力 1 和 9。对照见第 06 章的实验室 3。
每个主力领域保留“先自己做第一版” Blender、剪辑、关卡、Astro 各留一类任务,每周至少一次不用 AI 起稿,再让 AI 来对照。这是对修正 ③ 的直接回应(第 06 章)。
每周一次“同构对照” 把同一种结构(节奏、层级、状态机……)在两个领域各做一个最小实例,写三句对照。这是修正 ① 的落地做法(第 05 章)。
每 2–4 周一次闭卷测评 不带 AI,用客观分数代替“感觉”。证据显示人对自己是否在退步并不敏感[10] 。工具在第 07 章的实验室 4。
每月造一个小而完整的作品闭环 有验收标准、有人能评价、真的交付。这是你给自己造的“入门岗位”。完整的 90 天排布在第 08 章。
怎么读这份报告
每条关键事实带来源角标,悬停可看出处;来源页给出证据等级和“读到了什么程度”(全文 / 只读摘要 / 二手转述)。徽章含义:
● 强 RCT、元分析、大样本同行评审◐ 中 单项研究、官方报告、基准○ 弱 预印本、案例、观点◇ 推断 本报告自己的判断
“12 项底层能力”这个分类本身是本报告的组织方式,不是研究得出的结构;每项的训练参数(时长、频率、验收阈值)是经验设定,不是实验结果。第 10 章会把这些边界一条条摊开。
01 PHENOMENON−80 m · 黏土
现象与数据:门槛确实被拉平了,但只在一块有边界的地方
要判断“底层能力更重要”这句话,先得确认前提:AI 到底拉平了什么、没拉平什么。本章只回答这个问题,并且把每个数字的条件交代清楚——拉平是真的,边界也是真的。
1.1 三个互相印证的实验:差距在压缩
三项研究来自不同行业、不同方法,但指向同一个方向:起点低的人,用 AI 受益最多 。
研究 对象与设计 主要结果 谁受益 要留意的局限
Dell'Acqua 等 2023 [1] ◐ 中 758 名 BCG 咨询师;预注册;随机分三组(无 AI / GPT-4 / GPT-4 加提示概览);18 项现实咨询任务 多完成 12.2% 的任务,速度快 25.1%,质量评分高出 40% 以上 起点低于平均者提升 43%,高于平均者提升 17% 单一公司、2023 年模型;工作论文;原文承认 GPT-4 评分偏宽松
Noy & Zhang 2023 [2] ● 强 在线预注册实验;大学学历专业人士做 20–30 分钟职业写作;随机一半用 ChatGPT Science 版摘要口径(453 人):耗时下降 40%、质量上升 18%;工作论文版(444 人):耗时下降 0.8 SD、质量上升 0.4 SD 低能力者受益更多,工人之间的不平等缩小 两个版本样本数与表述口径不同;质量由评估者打分;没测长期技能变化
Brynjolfsson 等 [3] ● 强 5,179 名客服人员,AI 对话助手分阶段上线 平均每小时解决的问题数提高 14% 新手/低技能者提高 34%;经验丰富/高技能者影响极小 只读到摘要;单一公司、单一岗位;偏流程话术类工作
Noy 与 Zhang 在论文里有一句很准的概括:ChatGPT 主要是替代努力 ,而不是和技能互补;任务的重心从“起草”转向“出点子加编辑”[2] 。这和你的直觉一致:执行的部分被压低了,剩下的是想法和取舍。
客服那项研究给了一个值得停一下的细节:高技能者几乎没有增益,作者的提示性解释是 AI 传播了高水平员工的最佳实践,让新人沿着经验曲线往下走了一段[3] 。换个角度读,AI 学的是顶尖者已经明文化的做法,所以顶尖者边际收益小,而可明文化的任务正是它拉平得最彻底的地方。 这一层读法是本报告的解读,不是原文结论。
推断 · 拉平的适用范围
三个实验里的任务(咨询分析、职业写作、客服对话)都是能被写成流程和范例的工作。把“拉平”推广到所有创作任务——比如决定一个镜头值不值得留——超出了这些证据能覆盖的范围。后一类正是下一节要讲的边界。
1.2 锯齿边界:AI 越界时,人会被带偏
同一项 BCG 实验里,作者刻意设计了一道落在 AI 能力边界之外的题:需要把访谈信息和表格数据综合起来,才能得出正确的建议。结果是:对照组正确率约 84.5%,两个用 AI 的组约 60% 与 70%,平均低了 19 个百分点 [1] (二手文献常把它误写成“19%”;而且它只来自这一道题)。表现差的人有一个共同点:倾向于盲目采纳输出、较少质询。
AI 可靠区 · 可明文化、有大量范例
看似胜任,实则出错
批量重命名对象的脚本
把访谈要点整理成提纲
按参考图出概念草图
拓扑是否利于后续形变
三个镜头谁做开场
“渲染设置已优化”是否属实
任务表面上看起来难度相近,却可能落在边界两侧
示意图。边界形状来自 Dell'Acqua 等的“锯齿边界”比喻[1] ;图中六个任务的归位是本报告的举例,不是研究数据。
作者还观察到两种成功的用法:Centaur (按任务切换)与 Cyborg (子任务级深度交织)[1] 。共同点是人始终在质询,而不是照单全收。
Vaccaro 等的元分析把这一点放大到更大的样本:106 项实验、370 个效应量,人机组合平均比“人或 AI 中最好的一方”单干更差 (Hedges' g = −0.23,95% 区间 −0.39 至 −0.07);决策类任务出现性能损失,内容创作类任务增益更大 ;AI 单干优于人时,组合反而有损[29] 。作者提醒可能有发表偏倚,且多为 2023 年之前的模型。你可以把它读作一条分工提示:让人去做 AI 不擅长的那一半,或者先把“自己的校准”练好。
一个流传很广、但今天不能再当结论的数字
METR 在 2025 年做的 RCT:16 名开发者在自己熟悉的成熟开源项目里完成 246 个任务;事前预测 AI 能省 24% 时间,事后自评省了 20%,实测反而多花 19% [4] 。
2026 年 2 月,METR 自己发文说:后续实验的数据不可靠——越来越多开发者不愿在没有 AI 的条件下工作,30%–50% 的人因此没提交某些任务;原班子集估计时间变化为 −18%(即省时,置信区间 −38% 到 +9%),新招募者为 −4%(−15% 到 +9%)。METR 认为 2026 年初的提速“很可能大于 2025 年初”,但这批数据对提速幅度“只是非常弱的证据”[5] 。
所以可以保留的只有一点:“感觉快”和“实测快”可以是两回事 。不要再引用“AI 让资深开发者慢 19%”当作当前结论。
1.3 就业与技能需求:入门台阶在缩短
Brynjolfsson、Chandar 与 Chen 用 ADP 工资单数据(至 2026 年 6 月)追踪就业变化[6] 。最新版本的六个事实里,与你最相关的是:
没有证据显示全经济范围出现大规模岗位被替代;
22–25 岁人群在 AI 高暴露职业中的就业量,现在比“与低暴露同龄人保持同步”的水平低 19% ;有经验者没有类似差距;
这个差距主要通过“少招年轻人”而不是裁员发生;
下降集中在 AI 主要替代 人类任务的职业;AI 主要互补 人的职业,就业持平或上升。
要点和局限同样重要:作者自称这些是“早期的、描述性的指标,而不是因果估计”;控制教育后这些模式会减弱,部分分化趋势早于生成式 AI。我还见到他人对“22–25 岁这个窄年龄带对招聘流入高度敏感”的批评,但只读到搜索摘要,属二手引述,未核实。早先版本给出的是 13%–16% 一类的估计,随数据更新扩大到 19%,这说明数字本身还在动。
雇主的口径是另一个角度。世界经济论坛 2025 年报告基于逾 1,000 家雇主(合计超过 1,400 万员工、55 个经济体):分析性思维被 69% 的雇主视为核心技能,位居第一;创造性思维 57%,系统思维 42%。预期 2025–2030 年净增长上,创造性思维为 66、分析性思维 55、系统思维 51;39% 的现有技能预计会被改变或过时[28] 。但同一份报告里,“AI 与大数据”净增长 87、“阅读、写作与数学”净增长 −4。 这是雇主的主观预期而不是技能回报的实证,也不能只摘“软技能”那一半。
Anthropic 的 Economic Index 提供了“人到底怎么用 AI”的使用侧数据(仅覆盖 Claude 用户,自选择样本):2026 年 1 月期里,增强式对话占 52%,自动化式占 45%[7] ;3 月期发现使用时间 ≥ 6 个月的用户成功率高 10%,且这一关联不能被任务选择、国家等因素解释——作者给出两种读法,要么早期采用者本来就更精明,要么是边做边学[7] 。6 月期首次引入问卷:工作年限 ≥ 15 年的人,评估“AI 能做的任务份额”比第一年工作者低约 10 个百分点;受访者认为 AI 永远做不到的任务,最常被提到的是判断力、情境意识和情境推理[7] 。以上都是自评与分类器判定,别当成硬因果。
1.4 谁受益,谁受损
群体 证据显示什么 证据强度
在 AI 能力范围内做可明文化任务的新手 受益最大:+43%、+34%、“低能力者受益更多”[1] [2] [3] ● 强 / ◐ 中
知道 AI 边界、且自己懂领域的人 在边界之外不被带偏(对照组答对率最高);资深者评估 AI 可替代份额更低[1] [7] ◐ 中
盲目采纳 AI 输出的人 边界之外表现更差;对 AI 信心越高,批判性思维越少(自评调查)[1] [13] ◐ 中
用 AI 替代学习过程的学习者 撤掉 AI 后成绩低于对照,且自己没察觉[10] [11] ● 强 / ◐ 中
想进入 AI 高暴露职业的年轻人 就业量下降 19%,经验者无类似差距;仅描述性[6] ◐ 中
顶尖者 客服研究中“影响极小”;其余研究没有直接测量他们 ○ 不明
本章结论
拉平是真的,但发生在 AI 能做、能被明文化的那一块;边界之外,差距反而可能被放大——因为谁能识别边界,谁才不被带偏。同时,入门级的练习场地在变少。这三点合起来,决定了后面的结构:先看一个为什么判断成了瓶颈 的生产模型(第 02 章),再分解成 12 项能力(第 03 章)。
推断 · 对你的含义
你在 Blender 与剪辑里“起点低”的部分——批量脚本、粗排、素材整理、草图——会被 AI 很快补上。真正拉开差距的是它补不了的部分:整体结构是否站得住、几个版本里选哪一个、AI 说“没问题”时你敢不敢信。这是把上面的数据套到你的工作上,数据本身没有测过你的领域。
02 MODEL−190 m · 砂层
一个生产模型:产出 = 杠杆 × 判断
上一章留下一个看似矛盾的地方:如果人人都能用 AI,为什么“判断”反而更值钱?答案藏在一个朴素的事实里——产出是乘出来的,不是加出来的 。AI 提供的是杠杆,而杠杆乘的是你最弱的那一环。
杠杆AI 压低的执行成本
×
判断定义 · 验证 · 取舍
=
有效产出示意模型
2.1 为什么是乘法:O-ring 的启发
经济学家 Kremer 在 1993 年提出 O-ring 理论:设想一个生产过程,任何一个环节出错都会毁掉整体产出 。在这样的生产函数下,出错少的高技能者会在均衡中被匹配在一起,产出和工资随技能陡峭上升[22] 。它是个理论模型,写作时间远早于生成式 AI,Kremer 本人没讨论过 AI。
把它借来用,是本报告的类比:一个人带着 AI 做作品,要过定义问题、设计结构、生成、验证、审美取舍、交付这几关。AI 把“生成”一环抬得很高,但其余环节仍然是你;只要其中一环接近零,整条链的价值就被拖住 。这个类比有一个前提隐患:O-ring 假定任务数量固定,而 AI 会重新切分任务,这个前提未必成立。所以下面的实验室只是一个教学化的简化,不是实证。
2.2 Brooks:难的部分一直是概念结构
Brooks 在 1986 年区分了软件开发的“本质困难”与“偶然困难”。本质是由数据集、数据项关系、算法和调用构成的概念结构 ;难的是这个概念结构的规格、设计与测试,而不是把它表示出来的劳动 。他给出的不可约属性有四个:复杂性、一致性、可变性、不可见性[23] 。
The hardest single part of building a software system is deciding precisely what to build.〔Brooks 1986, No Silver Bullet, 5.2 节〕[23]
他还有一个很重的论证:除非偶然工作占了全部精力的 9/10 以上,否则把它压缩到零,也得不到一个数量级的提升[23] 。这和“部分加速”的算术同构——只加速一部分流程,整体提速受不被加速那一部分限制。实验室 1 里的吞吐倍数用的就是这个算术(把两者联系起来是本报告的推断)。
Brooks 同样强调:需求出错的代价最大、最难事后纠正,他主张快速原型与迭代;并且最好的设计师与一般设计师的差距“接近一个数量级”,所以要识别并培养伟大的概念设计者[23] 。Dijkstra 在 1978 年从另一边补了一刀:换成自然语言接口,不是单纯把工作转移出去,跨接口的沟通成本要计入;形式符号的价值是能排除各种胡话,自然语言的“自然”,归结为我们能轻易用它说出荒谬却不自知的话[24] 。
边界 · 1986 年的论断,2026 年还成立吗
LLM 是否也能压缩一部分“本质”里的设计工作,本次没有读到相关的反驳文献,未核实。可以确定的是:AI 擅长的主要是“表示”的那部分(写代码、出图、剪粗排),它至少没有消除“确切决定要造什么”这件事本身。Dijkstra 与 Brooks 的论证是否原样适用,应当持保留。
2.3 “一人团队”要补齐团队里的哪些职能
“一个人加 AI 能做原本要团队做的事”,拆开看,就是你把团队里的几种职能一个人扛下来。AI 顶替的主要是“执行”这一格;其余几格没人替你,缺哪格,哪格就是最弱环节。
职能 团队里通常是谁 一人加 AI 时 对应能力 缺位的症状
产品 / 需求 制片、导演、策划、产品经理 必须你自己,且要写下来 1、12 做完才发现“这不是我要的”
架构 / 结构设计 架构师、美术指导、关卡主策 你定边界与接口,AI 填内部 2、5 每个局部都对,整体拼不上
执行 建模师、剪辑助理、程序员 主要交给 AI 9 (被压低最多的一环)
QA / 验证 测试、校对、监修 你自己,加独立来源 3、4、10 AI 说“好了”,你就当好了
编辑 / 审美 编辑、美术总监、调色师 你自己,AI 提供备选 6、7 一切“还行”,没有个性,或满是 AI 腔
项目 / 交付 制片、项目经理 你自己,含停止条件 4、11、12 永远在改,不交付
职能与能力的对应是本报告的推断,不是研究结果。
有一项实验与此直接相关,但只读到二手转述:宝洁的一天虚拟产品开发工作坊里,个人加 AI 的表现与“无 AI 的两人团队”相当,AI 起到了让人用到本专业之外知识的“跨边界”作用[30] 。限制也明显:任务是产出产品创意方案,不含落地与长期维护;样本数在工作论文版(776)与据称的发表版(791)之间冲突,未解决。所以最多支持“在方案生成层面接近团队”,不支持“一个人能完成过去需要团队才能完成的全部工作”。我没有找到支持后一句话的系统性实证。
Autor 的论证则给了一个积极的版本:AI 的独特机会,是扩展人类专业知识的相关性、覆盖面与价值,让更多具备互补知识的人能做过去由精英专家垄断的高风险决策[8] 。作者明说这是“关于可能性的论证,而不是预测”,条件是“用得好”。注意“互补知识”这个词——它正是修正 ② 的理论依据。
LAB 01
杠杆 × 最弱环节计算器
示意模型,不是实证。假设:6 个环节的质量相乘(Kremer O-ring 的教学化简);环节水平 = 分数 ÷ 5,下限 0.05;AI 只抬高“生成执行”一环(取你与 AI 的较高者),并按“部分加速”算术加快吞吐:倍数 = 1 ÷ ((1 − f) + f ÷ L);有效产出以“六环全满分、无 AI = 100”为参照。结论(补最弱环节通常比再加杠杆划算)是这套假设的必然结果,用来帮助理解,不能当作对真实工作的预测。
2.4 用这个模型读你的工作
拨动实验室里的滑块,会发现三个规律,每一条都对应后面的一章:
杠杆有递减。 把杠杆从 10 倍提到 20 倍,吞吐只多一点点——因为不被加速的那部分(定义、验证、取舍)撑住了总时间。这是 Brooks 那个 9/10 论证的算术。
最弱环节决定上限。 把杠杆再加倍,通常不如把最弱的一环提高一分。这是第 03 章把 12 项能力分开讲的原因,也是第 07 章雷达自测要找“最弱的 3 项”的原因。
“只会生成”不是一种安全的位置。 执行强、其余弱,被 AI 追平的就是你最强的一环——前面数据里“起点低者受益最多”,反过来也说明这一环的差异正在被抹平。
本章结论
稀缺性迁移的不是一个抽象的“思考力”,而是链条上 AI 替不了的几个具体环节:定义、结构、验证、取舍、交付。它们彼此相乘,所以不能只练一项。下一章把它们拆成 12 项能力,每项给出失败的样子和能执行的练法。
03 ABILITIES−330 m · 砂岩
十二项底层能力:统一版式,逐层下探
上一章说链条上有几个 AI 替不了的环节。这一章把它们拆成 12 项能力 ,每项用同一张“岩层卡”:是什么 → 为什么在 AI 时代更重要 → 失败的样子 → 怎么练 → 怎么测 → 与 AI 协作的好坏姿势。
先说清三件事
这 12 项是本报告的组织方式 ,不是研究得出的能力结构;它们互相重叠,边界是我划的。
“为何更重要”一栏混合了证据与论证 ,每条都标了来源;没有来源的判断会写“推断”。
“怎么练”里的时长、频次、验收阈值是经验设定 ,不是实验结果;它们的作用是让练习可检验,你可以改。
不要想“12 项一起练”。第 08 章的 90 天方案把它们绑在两三个真实项目上轮流推进;第 07 章的雷达自测帮你先找出最弱的 3 项。
01 问题定义与需求表述
02 结构与架构思维
03 逻辑与论证分析
04 概率与估算思维
05 抽象与看本质
06 审美与品位 → 专题
07 语言判断力
08 深度阅读与专注 → 专题
09 向 AI 提问与协作
10 验证与怀疑
11 元认知与学习方法
12 决策与取舍
是什么
不是把需求写长,而是写到可被证伪 :一个没看过上下文的人,能据此判断成品是否做对。一份合格的规格至少含六样:目标、受众、约束、验收标准、反例、已知风险 。
AI 时代为何更重要
Brooks 把“确切决定要造什么”称为软件开发里最难的一步,并指出需求出错代价最大、最难事后纠正[23] ;Dijkstra 提醒,自然语言的“自然”,意味着我们很容易说出荒谬却自己不觉得荒谬的话[24] 。AI 把执行压得很便宜,这两条反而更重:规格错了,错误会被又快又流畅地实现出来,而不是被一周的拖延拦住(本报告的推断)。
间接证据指向同一处:在编程学习实验里,把整个任务委托给 AI 的人,无 AI 测验得分偏低(低分组平均不到 40%)[11] ;非专家写提示多是“机会主义式”的试错而不是系统化的规格[25] (GPT-3 时代的结论)。没有对照实验直接证明“规格写得好”带来多少收益,这一项主要靠理论。“先弄清问题再动手”也是经典问题求解论述的起点[34] (未核实,只借思想)。
失败的样子
Blender “做一个好看的赛博朋克场景”——没有镜头意图和焦点,摆了很多资产,渲染出来每个角落一样满。剪辑 “剪一个很酷的 30 秒”——没说受众、平台、情绪曲线,于是粗剪、精剪、调色各返工两轮。关卡与任务 “做一个有意思的 Boss 房”——没写玩家当时的状态、目标时长、想让玩家学到什么。Astro / Python “给网站加个作品集页”——内容从哪来、分几类、移动端怎么显示,都留给 AI 现场猜。
怎么练
对象 手头真实的小任务,每周 3 个。 时长 每个 10 分钟,在动手之前写;每周 3 次。 产出物 一张“规格卡”(一个 Markdown 文件,持续追加):目标 / 受众 / 约束 / 验收标准 / 反例 / 已知风险。 验收 把规格卡交给没见过任务的人,或开一个全新 AI 会话,请它只列出“我还需要问什么”。若它问出的关键问题里有 3 个以上本该写在卡上而你没写,规格不合格;验收标准每条都能回答“是或否”。
怎么测
追踪“大返工次数”(因理解偏差而推翻重做):每个任务记一栏,4 周后对比有规格卡和没有时的差别。样本很小,只当自己的内部基准,不是实验。
与 AI 协作
好姿势 先自己写规格,再让 AI 找漏洞、列澄清问题,修订后才开始执行。
坏姿势 一句话许愿,不满意就“再来一版”——把本该在规格阶段付的澄清成本,变成无限返工。
是什么
把一个项目看成部件、接口、变化点 三样东西:每个部件只做一件事,对外只暴露必要的接口,最可能变化的决定被关在某个部件里面。
AI 时代为何更重要
Brooks 说软件的本质是概念结构——数据集、数据项关系、算法与调用——并列出复杂性、一致性、可变性、不可见性四个不可约属性[23] 。AI 很擅长生成局部:一个函数、一个资产、一段粗剪。局部都对而整体不一致,是靠局部生成拼起来的作品里常见的毛病(推断);能守住整体一致性的,只有持有整体心智模型的人。
按“隐藏易变决定”来划分模块,有经典的出处[38] ,本次未核实原文,这里只借它的思想,不引用细节。
失败的样子
Blender 所有东西堆在一个场景里,没有集合和命名;修改器栈顺序一错,后期想改比例就牵一大片。剪辑 素材不分层、序列不嵌套,对方要改一版,等于重剪。关卡与任务 任务状态散落在各个触发器里,加一个分支,要改八个地方。Astro 组件与内容数据耦合,加一个字段要改八个文件。
怎么练
对象 一个你做过的中型项目:一个场景、一个剪辑工程或一个 Astro 站。 时长 每次 40 分钟,每周 1–2 次;连续 3 周换 3 个项目。 产出物 一页结构图(手绘拍照也行):部件、依赖、“最可能变化的 3 个点”;外加 3 条“变更演练”:若需求变成 X,要动哪几个部件。 验收 每条变更演练里,需要改动的部件不超过 2 个算通过;超过说明边界划错,重画一版并记下改了什么。
怎么测
把结构图给别人,请对方预测“改 X 会动哪里”,看命中率;或自己隔两周不看图重新预测。
与 AI 协作
好姿势 自己画部件边界和接口,AI 在边界内实现,并请它指出“哪里耦合过紧”。
坏姿势 让 AI 一次性生成整个项目或整个场景,再在输出上修补——你没有心智模型,后期无法维护。
是什么
能把一段话拆成主张 → 前提(显式与隐含)→ 证据 → 推理 ,并能分辨:相关与因果、必要与充分、样本与总体、平均与个例。
AI 时代为何更重要
在 AI 能力边界之外,盲目采纳输出的人表现更差[1] ;对 AI 信心越高,自评的批判性思维越少,而对自己任务有信心的人批判性思维更多[13] (319 人的自评调查,相关非因果)。流畅的文字会把漏洞盖住,只有看得见论证骨架的人才能挑出来。雇主口径也把分析性思维列为首位核心技能(69% 的雇主)[28] ——那是雇主的预期,不是回报的证据。
失败的样子
Blender 采纳 AI 给的“最佳渲染设置”,不看它隐含的前提:场景规模、显卡、软件版本。剪辑 看到“这种开场完播率更高”就照搬,没想到因果可能是反的:做得好的账号才会选这种开场。架构 照搬一篇博客的“某方案更好”,没检查自己的条件是否相同。写作 把“19 个百分点”写成“19%”——差一个词,结论强度全变。
怎么练
对象 每周 2 段文字:一段 AI 的回答,一段你自己读到的文章或评论。 时长 每段 15 分钟,每周 2 次。 产出物 一张“论证图”:主张 / 前提 / 证据 / 最强反例,四栏;再写一句“证据实际能支持的最强结论”,要比原文弱。 验收 每张图至少揪出 1 个隐含前提和 1 个反例;“降级改写”的那句话,比原文多出至少一项限定(样本、条件或范围)。
怎么测
请 AI 出一段含 2 个故意漏洞的论证,你先作答,再对照它给的答案;记录命中数。
与 AI 协作
好姿势 让 AI 当反方,列出对你结论最强的三条反驳,由你判断哪些成立。
坏姿势 让 AI 给出结论后只问“对吗”,并把同一个来源的肯定当成验证。
是什么
区分“大概率对”与“一定对”;给估计写区间而不是单点;先问“同类事情通常怎样”(参照类),再调整到当下情况。
AI 时代为何更重要
AI 给出的多是一个干净的单一答案,没有区间,也不说把握多大——这是对它输出形式的观察,不是某项研究的结论(推断)。更要紧的是人自己的感觉:METR 那次实验里,开发者事前预测省 24% 时间、事后自评省 20%,实测却多花 19%[4] ;这项结果已被 METR 自己标注为过时[5] ,但“感觉与实测可以相反”这一点仍站得住。
“校准可以训练”是一个有名的主张(Tetlock 一类),但本次未核实[35] ;估算偏差的通俗出处是 Kahneman[39] ,同样未核实。下面的练法把它们当作需要你用自己的日志去验证的做法。
失败的样子
Blender “这个镜头渲染一晚上够了”,结果单帧时间乘上帧数,第二天下午还没出完。剪辑 “两天剪完”,实际调色加修改花了六天——总比估计长,却从不记录。用 AI 采信“这样能提速 3 倍”,没有做过一次基准测量。
怎么练
对象 自己的任务:渲染时间、剪辑工时、开发工时。 时长 每个任务开始前 2 分钟写估计、结束后 2 分钟补实际;4 周内至少 20 条。 产出物 一张估算日志:任务 / 估计区间 / 把握度(如 80%)/ 实际 / 偏差。 验收 累计 10 条以上后,统计“你说 80% 把握的区间里,实际落进去的比例”。本报告设定的经验阈值是 60%–95%;偏离就调宽或调窄区间,并写一句原因。
怎么测
命中率校准表;每月一次 Fermi 式估算题(让 AI 出题,你先写区间再对答案)。
与 AI 协作
好姿势 让 AI 帮你找“同类任务通常多久”的参照,你独立给出区间后再对比。
坏姿势 问 AI“需要几天”并照单全收,或把它说的“90% 确定”当真。
是什么
能把具体问题映射到结构 :有序序列、层级、状态转移、约束与自由度、反馈回路……并能说出“它与另一个领域里的某件事哪里同构、哪里不同”。
AI 时代为何更重要
Chi 等的经典实验里,8 名物理学博士生与 8 名刚修完一学期力学的本科生对 24 道力学题分类:新手按表面特征(弹簧、斜面……),专家按物理原理[16] 。Willingham 用应用题说明同一件事:换了场景学生就不会,是因为没认出题目在数学上相同[17] 。AI 把“软件操作”这类表面技能压得很便宜;能识别深层结构的人,才能在 AI 没见过的组合里用它(推断)。
必须补一句:这些发现是领域内的,并不证明这种能力能跨领域迁移——这正是第 05 章要处理的问题。
失败的样子
Blender 按教程和按钮学,每个新需求都像一个全新的问题;学会了几何节点,却不会拆问题。剪辑 把转场当风格,而不是调节节奏的手段。Astro 每个新页面都从头摸索,看不出“列表页加详情页”是同一种结构。
怎么练
对象 收集 20 个你做过的任务:模型、镜头、页面、文案。 时长 每周 2 次 × 30 分钟,共 3–4 周。 产出物 一张按“要解决的结构性问题”而不是按工具分类的任务表,每类一句结构描述(如“有序序列 + 注意力引导”)。 验收 之后每来一个新任务,5 分钟内说出“它与哪一类同构、差别在哪”,做完后回看对错;累计记录至少 10 次,正确率应逐步上升。
怎么测
随机抽两个不同领域的任务,判断是否同构并写理由;再请一位同行(或先让 AI 给出分类)对照你的分类。
与 AI 协作
好姿势 让 AI 帮你找“这个问题的同构问题”,并要求它指出不同点。
坏姿势 让 AI“总结本质”然后背下来——没经过你自己抽象的“本质”,只是另一种表面。
是什么
不是“喜欢哪个”,而是能指出层级、对比、节奏、统一性 等可观察特征上的差别,并据此取舍。
AI 时代为何更重要
AI 把产出一个版本的成本降到近零,瓶颈就从“做出来”转到“选哪个、为什么”(论证,推断)。审美的证据、训练与测量,本报告不展开,见专题报告 03 · 审美能力 。
失败的样子
通用 采用第一个出图的版本,因为“差不多”;于是作品都落在 AI 的平均口味里。平面 / 剪辑 排版没有主次,配乐与画面节奏各走各的,却说不出问题在哪。
怎么练
对象 同一主题的两个版本(你的与参考作品,或你自己的两稿)。 时长 每周 2 次 × 20 分钟。 产出物 一页盲评笔记,每次写 3 条差异理由。 验收 理由都指向可观察特征(如“主体与背景的明度对比”,而不是“更有感觉”);隔一周不看笔记复评,结论一致。
怎么测
隔周复评的一致率;把同一批对比拿给一位你信任的人盲评,对照结论。
与 AI 协作
好姿势 让 AI 一次给出多个方向的备选,你按自己写下的标准淘汰。
是什么
把文采 与堆砌 分开:好文字是信息密度高、具体、节奏合适,而不是形容词多;还要能看出 AI 腔——空泛的总括、对称的排比、不增加信息的过渡句。
AI 时代为何更重要
有两项研究方向相近、但模型和被试都不同,不能直接比较:2021 年,未经训练的众包评审区分 GPT-3 与人类文本处于随机水平,三种快速训练最多把准确率提高到约 55%[27] ;2025 年,经常用 LLM 写作的标注者无需训练就能很好地识别 AI 文本(具体准确率我没读到)[26] 。合在一起,提示的是:语言判断力随接触与反馈而变,不是天生的 。
Noy 与 Zhang 还发现,用 AI 后任务的重心从起草转向“出点子加编辑”[2] :编辑的能力,就是你的价值所在。
失败的样子
通用 接受 AI 流畅但空洞的文案:镜头脚本、作品集自述、README。改稿 只会换同义词,说不出一句话到底哪里失效。文采 把形容词多当作有文采;一读出声,处处绊脚。
怎么练
对象 每周一篇 300–500 字的文本:你自己的作品说明,或 AI 的初稿。 时长 每次 25 分钟,每周 1–2 次。 产出物 三遍改稿:删(去掉不增加信息的句子)、换(抽象词换成具体细节)、读(出声读,标出绊脚处);留下原稿与改稿对照,并写 3 条改动理由。 验收 改稿字数不超过原稿的 80%,而逐条列出的信息点不少于原稿。
怎么测
盲选:请 AI 就同一主题写一段,与你写的混在一起打乱,一周后你自己辨认并说出理由;重点是判断哪个更好,而不只是真假。
与 AI 协作
好姿势 让 AI 当“读者模拟”:复述你文章的主张,对照它与你的意图是否一致。
是什么
能不借摘要地读完一篇原文,抓住论证结构,标出作者没有证明的地方,并把原文片段 与自己的批注分开存放。
AI 时代为何更重要
有证据显示省力不等于深度:使用 LLM 的学生认知负荷更低,但最终论证的质量低于用搜索引擎的人[15] (二手转述,未取得原文);ChatGPT 组作文得分更高,而知识增益与迁移无显著差异[14] (只读到摘要,样本 117 人)。Kosmyna 等的 EEG 研究是预印本、小样本,只当提示性线索[12] 。本项的证据与训练,见专题报告 02 · 深度阅读与 AI 。
失败的样子
通用 只读 AI 摘要,转头在笔记里记下一句“结论”,却回答不出论文测了谁、测了多久。卡片笔记 笔记里全是自己的转述,没有一处保留原文片段,日后无法回查是不是读歪了。
怎么练
对象 每周 1 篇你真正关心的原文(论文、长文、文档)。 时长 每周 3 次 × 40 分钟,不开摘要工具。 产出物 5 张卡片:每张“原文片段 + 你的批注”,片段保持原样。 验收 合上原文,用 5 句话复述论证结构,并指出 1 处原文的局限;再对照原文核对。
怎么测
一周后闭卷复述同一篇;请 AI 针对原文出 5 道细节题,不带原文作答。
与 AI 协作
好姿势 先自己读,再让 AI 出题考你,或对照你的复述找遗漏。
坏姿势 让 AI 先总结,再只读它挑出来的“重点”。
是什么
与第 1 项的区别:第 1 项是想清楚要什么 ,这一项是怎样把它交给 AI ——上下文管理、任务拆分、要解释而不是要答案、设置检验回路、知道什么时候不该问。
AI 时代为何更重要
Anthropic 的使用数据发现:使用时间 ≥ 6 个月的用户成功率高 10%,且不能被任务选择、国家等因素解释;作者给了两种读法——早期采用者更精明,或边做边学[7] 。这条证据分不清“通用提问能力”与“领域知识加工具熟练度” ;我没有找到“提示技能与领域知识谁更重要”的对照实验,未核实。
更直接的是学习实验:高分者(平均不低于 65%)既用 AI 生成,也问概念;低分者(低于 40%)整体委托或逐步依赖[11] 。BCG 实验里两种成功用法 Centaur 与 Cyborg,共同点是持续质询[1] 。给 AI 加“提示而非答案”的护栏,也基本消除了高中数学实验里的负面效应[10] 。
失败的样子
Blender 问“怎么做这个效果”,得到一串点击步骤,不懂原理,版本一变就失效。通用 一次丢一个大任务,不给素材、不说限制;卡住就换种问法再抽一次。Astro 让 AI 重写整个页面,而不是只改一个组件,结果 diff 太大,没法审。
怎么练
对象 你每一次用 AI 做的真实任务。 时长 每周至少 5 次;每次多花 3 分钟写协作日志。 产出物 一份“协作日志”:任务 / 我给了什么上下文 / AI 给了什么 / 我改了什么 / 下次改进。 验收 挑一个任务,用“裸问”与“模板问”(第 06 章的模板)各做一次,对比返工轮次,并闭卷解释最终结果为什么对。
怎么测
同一任务的裸问与模板问对比;关闭 AI 后能否解释结果。
与 AI 协作
好姿势 先写自己的方案,再带约束提问,要备选与权衡,自己验证。
坏姿势 让 AI 替你决定你想要什么,然后把它的回答当成自己的想法。
是什么
对一份输出,能立刻想出最便宜的几种检验 :找反例、查独立来源、做小实验、与基准对照;并能回答“如果它错了,最先暴露的症状是什么”。
AI 时代为何更重要
边界之外,用 AI 者答对的比例下降 19 个百分点[1] ;对 AI 的信心越高,批判性思维越少[13] ;人机组合在决策类任务上平均更差[29] ;学生看不出自己的学习已经受损[10] ;开发者的主观感觉与实测相反[4] 。这些结论互相咬合:感觉不可靠,所以需要独立于感觉的检验 。
验证本身也需要领域知识:Autor 的论证强调,AI 要放大人的专业知识,前提是人有互补性的知识[8] 。这是领域知识不可省的最直接理由。
失败的样子
Blender 把 AI 给的 Python 脚本直接跑在没有备份的工程上。剪辑 AI 说“这段颜色已匹配”,不看示波器,也不在另一块屏幕上确认。架构 没跑测试就合并;或只让同一个对话“再检查一遍”,把它当成独立复核。
怎么练
对象 AI 输出的三类东西:事实断言、代码或脚本、创作建议。 时长 每次 20 分钟,每周 3 次。 产出物 一份“验尸记录”:断言 / 最便宜的 3 种检验 / 执行了哪种 / 结果 / 发现了什么错。 验收 每条记录都写出“若这是错的,最先暴露的症状”;每月至少一次“埋雷测试”:请 AI 在另一个会话里生成含 1 处故意错误的材料,你不看答案去找,命中率逐月记录。
怎么测
埋雷测试的命中率;验证记录里“事后发现、事前没想到”的错误占比应逐步下降。
与 AI 协作
好姿势 让另一个会话(或另一个模型)做独立复核,同时自己抽检;复核提示里不暴露你的结论。
坏姿势 同一对话里问“你确定吗”,得到肯定就当通过。
是什么
区分表现 (这次做得好)与学习 (以后没有帮助也能做好);会为自己设置检验:预测、闭卷、复盘。
AI 时代为何更重要
表现与学习是分开的:撤掉 AI 后,无护栏组比对照组低 17%,学生并没有察觉[10] ;用 AI 的编程学习者测验得分 50%,手写组 67%,差距最大的是调试题,作者写道“painfully stuck”对掌握很重要[11] ;作文得分更高,但知识增益与迁移无显著差异[14] 。
也别迷信“练得多就行”:刻意练习的元分析发现,它解释的表现差异在游戏领域约 26%、音乐 21%、运动 18%、教育 4%、职业不到 1%,结论是“重要,但不如主张得那么重要”[20] (该元分析有争议)。所以要同时看反馈质量,不要只数小时。“在行动中反思”[36] 、“想要的困难”一类概念[32] 与自评偏差[33] 的常见出处,本次均未核实。
失败的样子
通用 用 AI 做完一件事,觉得“我会了”。Blender 跟着教程点完,作品很漂亮,换一个题目不会做。通用 一直在舒适区重复,因为那里的反馈全是正面的。
怎么练
对象 每个你想真学会的新技能。 时长 每周 1 次闭卷小测 × 30 分钟,其余每次练习后 5 分钟复盘。 产出物 “预测 / 闭卷 / 复盘”三栏日志:做之前预测得分与耗时;隔天不用 AI 复现关键部分;写下卡在哪、怎么卡住的。 验收 预测与实际的偏差逐渐变小;一周后同题复测的得分不低于首次的 80%。
怎么测
同一题目的“无 AI 闭卷分”与“有 AI 分”之差,越小说明依赖越低(这是本报告设的自测指标)。
与 AI 协作
好姿势 先自己试 N 分钟,再看提示;默认要“提示”而非“答案”。
坏姿势 一卡住就问,答案抄走,再用成果证明自己“学会了”。
是什么
在时间与信息都不完美时做选择:列出选项、写清标准、定停止条件、承认放弃了什么——还要知道什么证据会让你改主意 。
AI 时代为何更重要
Autor 认为,信息只是更重要的经济功能——决策——的投入,而决策历来是精英专家的领地;AI 的机会是让更多具备互补知识的人做高风险决策,但这是“可能性的论证”,不是预测[8] 。同时元分析显示,决策类任务上人机组合平均反而更差[29] :所以“AI 建议、人拍板”不会自动成为好决策。Economic Index 的问卷里,受访者认为 AI 永远做不到的任务,最常被提到判断力与情境推理[7] (自评)。
AI 让备选方案变得便宜,选项因此爆炸,选择成了瓶颈(本报告的推断)。
失败的样子
Blender 场景越加越多,渲染不完,永远不到交付。剪辑 同一条片子调了二十版色,没有一版被定为“完成”。关卡 把所有好点子都放进去,玩家反而不知道该做什么。Astro 个人站永远在重做,从没有对外公开过。
怎么练
对象 每个项目的起点与中点各一次。 时长 每周 2 个决策 × 15 分钟。 产出物 一份“决策日志”:选项(至少 3 个)/ 标准 / 选择 / 被放弃的及理由 / 什么证据会让我改主意 / 截止时间与停止条件。 验收 每条都有“改主意的证据”一栏;30 天后回看,标注“如果重来,是否仍会这样选”,并统计项目是否真的在停止条件处停下。
与 AI 协作
好姿势 让 AI 列出被你忽略的选项,以及每个选项最大的风险;由你选,并写下理由。
12 项之间的关系
它们不是并列的,有三条主线:入口与出口 ——1 定义问题与 12 决策取舍,分别在链条的最前与最后;中间的加工 ——2 结构、3 逻辑、5 抽象、4 估算是把问题“想明白”的工具;防线与校准 ——10 验证、11 元认知、7 与 6(语言与审美的判断)是防止“看起来不错”的防线,而 9 向 AI 提问是把前面这些交接给 AI 的接口。
如果只能先练三项,我的建议(推断)是:1 问题定义、10 验证、11 元认知 。理由是它们最直接对应修正 ② 与 ③,而且练习成本最低——每一项一张纸就能开始。
04 MAP−780 m · 页岩
能力与领域互通:一张图谱,一张同构表
你说“各领域是互通的”。这句话的直觉很强,但证据要分开看:本调研读到的出处,只覆盖了互通的一小部分 ——Brooks 讲的是软件,Chi 讲的是物理,Loewenstein 讲的是谈判。把它们扩展到 Blender 建模、剪辑、关卡,是本报告的推断。所以这一章给你的是一张待验证的地图 ,不是已证实的定律;怎样把它变成真能迁移的东西,在下一章。
4.1 互通有三个层次
同一条工作链。 无论建模、剪辑还是写作,都要走“规格 → 生产 → 验证 → 交付”。第 02 章的六个环节在各领域里都存在,这一层互通最稳,因为它描述的是“做事”本身。
同构的概念。 节奏、层级、状态机、约束与自由度、反馈回路……不同领域里换了名字的同一种结构。这一层最有价值,也最需要证据;本章的图谱主要画的就是这一层。
同样的认知动作。 比较两个版本、找最弱环节、把意图写成可检验的标准。这一层其实是 12 项能力本身。
要注意,第 2、3 层的“互通”有一个反面证据:对“训练某类活动、看能否迁移到一般认知”的元分析显示,远迁移很少发生 (只见二手转述)[21] 。这并不否定本章的图谱——它说的是“练一般思维”,而本章谈的是“在具体领域里练出结构,再主动对照”,第 05 章会把这个区别讲清楚。
LAB 02
互通图谱:7 个领域 × 12 项能力 × 11 个同构概念
点左边的领域、右边的能力,或下面的概念按钮。线越粗,表示该领域越依赖该能力(权重是本报告的主观判断)。
示意与推断。领域×能力的权重(0–3)是本报告的主观判断,不是测量结果。同构概念里,只有“本质与偶然复杂度”“按深层结构表征”“规格精确化”“反馈回路”“最弱环节”“比较案例抽原理”在软件、物理或谈判等领域有读到的出处,且一律标出;其余、以及所有向 Blender、剪辑、关卡、平面的扩展,均是本报告的推断。
4.2 同构表:同一个结构,在你的领域里长什么样
同构概念 一句话 在你的领域里 出处 / 状态
本质与偶然复杂度 把“要表达的概念结构”与“表示它的劳动”分开 建模:形体意图 vs 点按钮;剪辑:叙事结构 vs 软件操作;写作:论点结构 vs 打字润色 Brooks 1986 讲软件[23] ;其余◇ 推断
按深层结构表征 按问题的原理而不是表面特征归类 把“列表页+详情页”、“起承转合”、“主次对比”看成各自的同一种结构 Chi 1981[16] 、Willingham 2007[17] (领域内);跨领域◇ 推断
分层与抽象层次 封装细节,在不同粒度上思考 Blender 的集合与修改器栈;剪辑的嵌套序列;架构的模块;写作的总分结构 软件部分可见 Brooks[23] ;其余◇ 推断
规格精确化 把意图变成可检验的标准 建模的参考图与尺寸;关卡的设计意图与度量;写作的读者与目的 Brooks 5.2[23] 、Dijkstra[24] 讲软件;其余◇ 推断
约束与自由度 限制逼出选择,自由决定上限 关卡的引导与自由;平面的网格与限色;建模的拓扑约束;写作的体裁 ◇ 推断 (未找到可引文献)
反馈回路与迭代 原型 → 检验 → 修改 灰盒 → 细化;粗剪 → 精剪;提纲 → 初稿 → 改稿;playtest Brooks 5.2 论软件原型与迭代[23] ;其余◇ 推断
状态机 状态与转移 架构的状态管理;关卡里的任务与玩家状态;动画的状态切换 ◇ 推断 (未找到权威出处)
节奏 张弛与信息密度的时间分配 剪辑的镜头长度;写作的句长;关卡的紧张与缓冲;动画的 timing/spacing ◇ 推断
层级与注意力引导 让观众先看什么、后看什么 平面的视觉层次;剪辑的画面焦点;关卡的视线引导;写作的主次 ◇ 推断
最弱环节决定整体 多环节流程里,最差的一环拖低总体 任何“定义 → 生成 → 验证 → 交付”的链条 Kremer 1993[22] ;应用到人加 AI 的工作流◇ 推断
比较案例抽原理 并置两个实例,找出共同结构(这是一种方法,而不是概念) 所有领域 Loewenstein 等 1999[18]
推断 · 怎么用这张图
下周有一个具体任务时,先在图谱里点它所在的领域,看它依赖哪几项能力、含哪几个同构概念;再换一个“你不太熟、但共享其中一个概念”的领域,看那里的做法。这不是要你读完别的领域,而是为第 05 章的“同构练习”选题——图谱的作用是帮你找到值得做对照的一对 。
别过度相信图谱
“同构”只是说两个领域里存在可类比的结构,不是说会了一个就会了另一个。图谱里每条连线都是一个待你验证的假设:做完同构练习后,如果你在第二个领域里的表现没有变化,就应该把这条连线划掉。
05 TRANSFER−940 m · 石灰岩
迁移的真相:在具体里练抽象,用抽象跨领域
这一章处理第一处修正。你的直觉是“练好底层能力,就能用到所有领域”。证据说的是另一个版本:能迁移的是抽象出来的结构,不是抽象的思考力 ;而结构必须先在具体的东西里长出来。
5.1 你直觉里对的那一半
“深层结构”是真实存在、并且重要的。Chi 等人让 8 名物理学博士生和 8 名刚修完一学期力学的本科生,对 24 道力学题分类:新手按题里的表面特征(弹簧、斜面、字面术语),专家按背后的物理原理[16] 。原文用的词是 surface structures 与 principles,“深层结构”是后来文献普及的说法。Willingham 用应用题讲同一件事:换了场景,学生就不会了,因为没认出它在数学上是同一道题[17] 。
但要注意这个发现的范围:8 对 8 的人、单一领域,说的是“专家在自己的领域内 看得见原理”,并没有证明这种眼力能搬到别的领域。
5.2 为什么“练通用思维”常常无效
Willingham 的核心论点是:思维过程与思维内容(领域知识)缠在一起。如果你对某个议题知之甚少,被提醒“从多个角度看”也没有用,因为你没有可供切换的角度[17] 。这是评述而不是原始实验,证据等级不高,但它与另外两条线索相合:
远迁移元分析(二手转述)。 多个领域的元分析一致显示,训练某类认知任务对“领域一般认知”的效应极小,大样本、有主动对照组的研究往往没有训练相关效应[21] 。注意它针对的是“训练一般认知任务,看是否迁移到一般认知”,不等于“在领域里抽象后迁移”。
迁移失败常常是“提取”失败。 据 Loewenstein 等转述的 Gick 与 Holyoak 经典结果:Duncker 的肿瘤问题只有约 10% 的人能解;刚学完类比的“堡垒问题”后,仅约 41% 的人自发迁移,被提示“想想前一个问题”之后升到约 85%[18] [19] (原论文未打开,二手转述)。知识保留了,却没被调用。
练习量不是万能的。 刻意练习的元分析发现,它解释的表现差异在不同领域差别极大,职业领域不到 1%[20] (该元分析有争议)。所以别用“练够 X 小时”来承诺迁移。
5.3 为什么对比多个案例能抽象
Loewenstein、Thompson 与 Gentner 做过一个干净的实验:116 名管理硕士学两个谈判案例,一组被要求并置比较 两个案例,另一组分开学。之后在面对面的真实谈判里,比较组有 10/19(53%)用上了训练案例里的对赌策略,分开学习组只有 5/26(19%);摘要的说法是“几乎三倍”,且比较组更能抽出原则[18] 。作者的解释是:把两个共享同一原理的实例放在一起比较,能促进抽出一个可迁移的图式。
这条证据的价值在于它给了一个可执行的动作 :不是“多思考”,而是“把两个实例摆在一起,写下它们共同的结构”。它的局限也要说清:任务是谈判,被试是大学生与 MBA,后续复现本次没有核实,更没有在建模或剪辑里验证过——把它搬到你的领域是推断。机制上“类比靠关系结构而非表面属性”的理论出自同一研究传统[37] ,同样未在本次核实。
领域 A:视频剪辑
领域 B:文章写作
表面:软件界面、转场、字幕
AI 最先压低的一层
做法:粗剪、精剪、调色的流程
表面:文风、词句、排版
AI 最先压低的一层
做法:提纲、初稿、改稿的流程
共享的结构层(抽象出来的东西)
节奏 · 层级 · 约束与自由度 · 反馈回路 · 状态
这一层只能靠“对比多个案例”长出来
向下:比较两个实例,抽象
向上:新情境里被提示、调用
新领域 C ?
示意图(本报告的概念图,不是数据)。表面层各领域不同、被 AI 最快压低;共享的结构层要靠比较实例才能长出来,之后遇到新领域,还要有意识地调用。
结论:两句话
在具体里练抽象 :每个结构都要先在你真做的任务里做出来,再并置比较;用抽象跨领域 :遇到新领域时,主动问“它和我做过的哪个结构同构”,把“调用”也练成习惯。——不要空练“逻辑思维”,也不要把每个领域当成全新世界。
5.4 同构练习的设计方法
选一个结构,两个领域 从第 04 章的同构表里挑一个概念,且两个领域里你各有一个正在做的真实任务 。每次只练一个结构。
各做一个最小实例,每个不超过 45 分钟 先自己做,不让 AI 起稿;做完才允许让 AI 来对照。小到能一次做完,才做得起来。
写对照三句 共同点、不同点、适用条件(什么情况下这个结构不适用)。这一步就是 Loewenstein 实验里“比较”的动作。
一周后做“新情境测试” 给自己一个第三个领域的小任务,不给任何提示,看是否自发想到这个结构;没想到,再提示自己“想想上次的对照”,看提示后能否用上。两种情况都记录。
沉淀一张结构卡 写结构名、两个实例(保留实例的原始片段与截图,不只留一句总结)、不适用条件,并链接到实例笔记。卡片格式沿用你已有的卡片规范。
结构 领域 A 的最小实例 领域 B 的最小实例 对照问题 验收
节奏 剪辑:把同一段 30 秒素材剪成两个版本,镜头平均长度分别约 1.5 秒与 4 秒 写作:同一段 200 字,分别以短句为主、长句为主各写一遍 信息密度在哪里加快、在哪里放缓?注意力在哪里掉? 各写一句“哪个更快、快在哪、付出什么代价”,且用同一组词描述两个领域
状态机 关卡:画一个四状态任务(未接 / 进行 / 完成 / 失败)的转移图 Astro:画“作品筛选”组件的状态(全部 / 筛选中 / 无结果 / 出错) 哪些转移不该发生?谁来保证? 每个至少列出 2 条非法转移,并写出处理办法
层级与注意力 平面:一张海报三层信息(标题 / 卖点 / 细节),做眯眼测试 Blender:产品镜头里主体与背景的对比与景深 观众第一眼看哪里?靠什么(大小、对比、位置)? 找 3 个人看 5 秒,说出第一眼看到什么;至少 2 人命中你的设计意图
三行示例的具体做法是本报告的设计,不是已被验证的训练方案;“至少 2 人命中”等阈值是经验设定。
这一章的边界
支持“并置比较促进迁移”的直接证据来自谈判实验;“原理分类”来自物理;“远迁移罕见”来自对一般认知训练的元分析(二手)。没有任何一项直接在建模、剪辑、关卡或平面设计里测过同构练习 。所以第 4 步的“新情境测试”不是形式——它是你替自己做的小实验:如果自发调用率长期为零,就该怀疑这个结构并不真正同构,或者练习方式有问题。
06 RISK−1080 m · 板岩
风险:认知卸载与技能萎缩,以及怎么当“脚手架”而不是“拐杖”
第三处修正:AI 既可能放大你,也可能让你悄悄变弱,分水岭是你怎么用,而不是用不用 。本章先把相关证据按强度摆出来,再给出四条可执行的使用原则,最后用实验室 3 练最基础的一步——把需求写清楚。
6.1 证据:同一个模式,换了几种做法
这些研究的做法各不相同,但模式一致:表现(作品、练习成绩)因 AI 变好,而撤掉 AI 之后的学习结果没有变好,甚至更差;当事人自己常常察觉不到。
研究 设计 结果 强度 局限
Bastani 等 2025 [10] 预注册 RCT;近 1,000 名高中生,约 50 个班;4 次、每次 90 分钟的课内复习;三臂:GPT Base / GPT Tutor / 无 AI 练习阶段成绩 GPT Base +48%、GPT Tutor +127%;撤掉 AI 后闭卷测验 GPT Base 比对照低 17%,GPT Tutor 的负效应“基本缓解”;学生不觉得自己学得差 ● 强 单一学校与学科;短期;学生而非职场人;“Tutor”是针对性设计
Shen & Tamkin 2026 [11] RCT;52 名以初级为主的工程师学一个全新的异步库,一半可用 AI;之后无 AI 测验 AI 组平均 50%,手写组 67%(Cohen's d = 0.738,p = 0.01);AI 组只快约 2 分钟且不显著;差距最大的是调试题 ◐ 中 52 人;Anthropic 自己的研究;只测即时理解;聊天式而非 agentic 工具
Fan 等 2025 [14] 随机实验;117 名大学生做写作;四种支持 ChatGPT 组作文得分提升更多,但知识增益与迁移无显著差异 ◐ 中 只读到摘要;“metacognitive laziness”是假设性概念
Lee 等 2025 [13] 319 名知识工作者、936 个使用实例的调查 对 AI 信心越高,批判性思维越少;自我信心越高,批判性思维越多 ◐ 中 自评、横断面、相关非因果;只读到摘要
Stadler 等 2024 [15] 学生科学探究;LLM 与搜索引擎对比 (二手)LLM 组认知负荷更低,但最终建议的推理与论证质量低于搜索引擎组 ◐ 中 只见二手转述;样本量未核
Kosmyna 等 2025 [12] EEG;54 人完成前 3 次写作,18 人完成第 4 次(交换条件) LLM 组脑连接度最弱,自述所有权感最低 ○ 弱 预印本、小样本;连接度不等于能力;原文没有“脑损伤”的说法;只当提示线索
两个细节值得单独记住。第一,在 Bastani 的实验里,护栏的内容很具体——教师设计的提示、不直接给答案——它几乎消除了负效应[10] 。第二,Shen 与 Tamkin 的分组发现:高分者(平均 ≥ 65%)是“先生成,再追问理解”或“生成加概念性提问”,低分者(平均 < 40%)是整体委托或逐步依赖[11] 。作者的总结也值得照抄:“AI 加持的生产力不是通往能力的捷径”;“困难,甚至痛苦地卡住,对掌握很可能重要”。
6.2 脚手架 vs 拐杖:四条使用原则
判别标准只有一条:撤掉 AI 之后,你还剩下什么? 脚手架帮你够到原本够不到的高度,然后被拆掉;拐杖让你一直不用自己的腿。下面四条按证据强度排序。
原则 ① · 证据 强
要提示,不要答案 做法: 学新东西时把 AI 设成“只给提示”。提示词里写明“不要给完整答案;我两次尝试失败后,再给下一级提示”。依据: Bastani 的 GPT Tutor 条件[10] 。你的场景: 学 Geometry Nodes 时,让它只讲“这个节点解决什么问题”,不贴整套节点图。
原则 ② · 证据 中
先自己想,再问 做法: 每次提问前,先写下自己的方案或思路,哪怕很糙,再问 AI“差在哪”。依据: “先生成后追问理解”组得分高,整体委托组低[11] 。你的场景: 剪辑先自己排一版粗剪,再让 AI 评节奏,而不是让它先排。
原则 ③ · 证据 弱
保留“不用 AI 的练习日” 做法: 每周至少一天,对主力领域的一个小任务完全不用 AI。依据: “痛苦的卡住”对掌握重要[11] ;入门实践场地在缩小[6] 。具体比例(每周一天)没有实证,是经验之谈。你的场景: 周三做一个无 AI 的 Blender 小练习。
原则 ④ · 证据 中
AI 之后必须验证 做法: 采用任何输出前,过“验尸三问”:它依赖什么前提?最便宜的检验是什么?若错了,最先暴露的症状是什么?依据: 边界之外的盲目采纳[1] ;信心与批判性思维的负相关[13] 。你的场景: AI 给的脚本,先在复制的工程上跑。
还要加一个客观度量:每 2–4 周一次不带 AI 的闭卷小作品或小测 。理由不是“严格”,而是人对自己是否在退步并不敏感[10] ;频率是本人建议,没有实证。工具是第 07 章的雷达与第 08 章的计划。
6.3 为自己造练习场
第 01 章的 Canaries 数据提示:入门级岗位在缩,而那里正是人们过去“边做边长底层能力”的地方[6] 。再强调一次——那项研究自称是描述性的,控制教育后模式会减弱——但无论因果如何,对你这类个人创作者来说,没有人会自动给你一个有反馈的练习场 。
每月一个“小而完整”的作品闭环 总工作量 ≤ 10 小时:一支 10 秒动画、一个关卡片段、一页站点。“完整”的意思是有规格卡、有验收标准、真的交付。
找一个外部验收人 一位同行、朋友或社群成员。给他规格卡,让他按验收标准评,而不是问“好不好看”。
留下复盘 作品、外部意见、你的复盘各一份,存进同一个文件夹。验收:收到至少一条具体、你原先没想到的反馈。
这一节的做法是本报告的推断,没有对照实验;动机来自上面的就业与学习证据。
LAB 03
需求表述对照:含糊版 / 合格版 / 专家版
示意。两个任务和三个版本的措辞是本报告写的范例,里面的数值(40 秒、8 小时、3 个代表作等)只是示例,不是推荐值,请换成你自己的约束。“完整度”是教学用的粗评分(每个维度 缺 0 / 部分 1 / 齐全 2 分),不是经过验证的量表;它想让你看到的是版本之间“到底差在哪”,而不是一个分数。点右侧的维度,可以在左边高亮对应的句子。
三个版本的差别不在“长度”,而在是否把 AI(和你自己)需要猜的事,变成了可检验的陈述 。专家版里最值钱的两栏通常是“反例”和“已知风险”:前者划出禁区,后者提前说出你已经知道的坑,把一次返工变成一次预防。下面是一个可以直接复制的模板。
【任务】一句话说清要交付什么
【目标 / 用途】谁在什么场景用它,为了达成什么
【受众】他们是谁,看或用的方式,决定的时间有多长
【输入 / 现状】已有的文件、版本、素材;我已经尝试过什么
【约束】工具与版本、时间、体积 / 性能上限、不能动的部分
【验收标准】逐条写成"是 / 否"可判定的检查项(至少 3 条)
【反例】我不想要的样子(至少 2 条)
【已知风险 / 我不确定的地方】我预见到会出问题的点;发现后请先告诉我,不要自行处理
【工作方式】先复述你的理解,并列出不超过 5 个澄清问题;等我确认后再给方案;先给方案,不要直接做完
练习
把你手头一个真实任务,分别写成“含糊版”和“专家版”(用上面的模板),请一个全新的 AI 会话各做一遍。比较:返工轮次、你对结果的把握、以及你能不能不看 AI 的回答、独立说出结果为什么对。把差别记进第 03 章能力 1 的规格卡里。
07 RADAR−1230 m · 片岩
雷达自测:先找出最弱的三项
第 02 章的模型说,最弱环节决定上限。所以与其平均用力,不如先找出最弱的三项 。但自评有一个绕不开的问题:人对自己的判断常常是错的。所以这一章先给自评的锚点,再给校准办法,最后才是那个雷达。
7.1 先给分数一个锚
分 含义(通用锚点) 怎么确认你没有高估
0 没接触过,或不知道这是什么 —
1 知道概念,需要别人提示才能做 能说出一个例子,但做不出来
2 在熟悉的情境里能做,换情境就掉 换一个领域的同构任务,做不出来
3 在熟悉与相邻情境里稳定能做,并说得出理由 最近一个真实产出,对照第 03 章该项的验收标准,达标
4 陌生情境里也能做,并能指出别人做法里的问题 有第三方(同行或客户)按标准评过,结论与你一致
5 长期稳定,且有外部可核验的成绩 极少有人对多数项能给 5;给 5 请先停下来想想证据
这套锚点是本报告设定的粗略分级,不是经过验证的量表。
7.2 为什么必须校准
三条线索都指向“自评靠不住”:学生在撤掉 AI 后成绩下降,却不觉得自己学得差[10] ;开发者事前预测省 24% 时间、事后自评省 20%,实测反而慢了(该结论已被 METR 自己标注为过时,但“感觉与实测可以相反”仍站得住)[4] [5] ;Kruger 与 Dunning 关于“能力低者高估自己”的研究很有名,但本次未核实它的细节与复现情况[33] 。所以雷达只能当“假设”,要用下面四种办法之一去验证它:
用产出打分 每项取你最近一个真实产出,对照第 03 章该项的“验收”逐条打勾,用打勾数换算分数,而不是凭感觉。
请 AI 出题测你 闭卷、先作答后评分。实验室里的按钮会按你的自评生成提示词。把测得分与自评对照。
请他人盲评 把同一个产出给一位同行,只给验收标准,不说你的自评。
记录预测与实际 每次练习前写预测分,练习后写实际分。偏差本身就是元认知能力(能力 11)的读数。
规则: 自评与校准分相差 2 分以上的项,以校准分为准,并把这一项排到第 08 章计划的前面。
LAB 04
12 项能力雷达自测
示意工具。分数完全来自你的自评,没有任何常模;当前分数与快照只保存在你浏览器的本地存储里(localStorage),不会发送到任何地方。“最弱三项”按分数从低到高取,同分时按本报告建议的优先顺序(1 问题定义、10 验证、11 元认知……)。第一周练习是各项“怎么练”的压缩版,完整说明见第 03 章。
推断 · 怎么解读雷达的形状
形状比总分重要。单点深陷 (某一项远低于其余)通常最值得先补,因为它是链条里的最弱环节;整体偏小但圆润 说明可以先在最常用的领域里补两三项;整体很大 时请回到 7.2,多半是需要校准。这三条是对第 02 章模型的直接应用,不是实证规律。
08 PLAN−1310 m · 片麻岩
90 天训练方案:13 周,每周 4–5 天,每天 30–45 分钟
方案的设计原则只有三条:绑定真实项目 (不空练,对应修正 ①)、每周有不用 AI 的一天 (对应修正 ③)、每个阶段有闭卷复测 (对应自评不可靠)。总投入约 30–45 小时(13 周 × 每周 4–5 天 × 30–45 分钟);所有时长与频次是经验设定,不是实验结果,你可以按自己的情况增减,但请保留上面三条。
8.1 主线项目:用一个项目贯穿全程
12 项能力不要一项一项孤立地练。建议用同一个主线项目 作为载体——这样每项练习都有真实对象,产出也会自然累积:
子任务 A
10 秒 Blender 产品动画 三镜头;与实验室 3 的范例一致。承载:规格、估算(渲染时间)、验证、审美、剪辑节奏。
子任务 B
Astro 作品集页 把动画放进去。承载:结构与架构、状态、层级与注意力、验收。
子任务 C
800 字制作说明 写下做法与取舍。承载:语言判断、论证、决策记录。
子任务 D
3 张结构卡(Obsidian) 同构练习的沉淀。格式沿用你的卡片规范:保留原始片段,不只留一句总结。
主线项目只是建议,可以换成你手头任何真实项目(一个关卡片段、一支剪辑短片……),关键是“有验收标准、能交付、有人评价”。
8.2 每周节奏
日 时长 做什么 留下什么
周一 · 规格日 30–40 分钟 为本周的子任务写规格卡;做本周的 2 个决策(决策日志) 规格卡、决策日志各一条以上
周二 · 主练 40 分钟 本周的主能力练习(见 8.3 表) 本周的产出物
周三 · 不用 AI 日 40 分钟 对主线项目的一个小块,完全不用 AI(8.5 节) 手写 / 手绘的第一版
周四 · 主练二 / 同构 40 分钟 本周的第二个练习,或同构练习的第二个实例 对照三句 / 结构卡
周五 · 验证日 30 分钟 验尸记录,更新估算日志;与本周产出对照验收 验尸记录、估算日志更新
周日 · 复盘 20 分钟 用 8.6 的模板写周复盘(不计入“4–5 天”) 周复盘一条
只做 4 天也可以:优先保留周二、周三、周五与周日。
8.3 13 周安排
阶段 A · 第 1–2 周
诊断与基线 先量,再练。把“感觉”换成数据。
阶段 B · 第 3–6 周
问题定义、验证、与 AI 协作、估算 最直接对应修正 ② ③,成本最低,先拿到收益。
阶段 C · 第 7–10 周
结构、抽象、同构练习 对应修正 ①:在主线项目里做出结构,再并置比较。
阶段 D · 第 11–12 周
语言、逻辑、审美、深读 判断类能力,其中审美与深读各指向专题报告。
阶段 E · 第 13 周
复测与决策 重测,对比,决定下一个 90 天。
周 主题(对应能力) 这一周的重点动作 产出物 验收标准
1 基线(全部) 建 地基/ 文件夹与 6 个日志文件;做雷达自评;无 AI 完成 3 个基线:写一份规格、画一张论证图、估 3 个任务时长 基线档案 3 个基线都有文件,且各自对照第 03 章该项验收标准给出分数
2 校准(11);选项目(12) 请 AI 出闭卷题测最弱 5 项;对比自评;选定主线项目并写规格卡 v1;记下为什么选它 校准表;规格卡 v1;决策日志一条 自评与测得分相差 ≥ 2 的项被标出;规格卡在全新会话里被问出的“关键遗漏”不超过 2 个
3 问题定义(1) 为主线项目的 3 个子任务各写一张规格卡(分镜、页面、说明) 3 张规格卡 每张都有可判定的验收项和 ≥ 2 条反例
4 向 AI 提问(9)、验证(10) 同一任务用“裸问”与“模板问”各做一次;做 3 次验尸 协作日志;3 条验尸记录 能闭卷解释结果为什么对;每条验尸都写了“若错了最先暴露的症状”
5 估算(4) 估主线项目的每个子任务(渲染、剪辑、开发)的区间与把握度,并记实际 估算日志 ≥ 10 条 10 条后统计命中率;偏离 60%–95% 就调整区间宽度并写原因
6 验证(10)、元认知(11) 做 1 次埋雷测试;做 1 次预测—闭卷—复盘;与第 1 周基线之一对照 埋雷记录;闭卷小测 闭卷分与第 1 周相比有记录;写出一个“没想到的错误”
7 结构(2) 为主线项目画结构图;做 3 条变更演练 结构图;变更演练记录 每条演练需改的部件 ≤ 2 个;否则重画并记录改动
8 抽象(5) 把过往 20 个任务按“要解决的结构问题”分类 任务分类表 之后 5 分钟内能为新任务指出同构类,并至少记录 3 次回看对错
9 同构练习 ①:节奏(5、7) 剪辑两版(镜头平均 1.5 秒 / 4 秒)与同一段文字的短句 / 长句两版;写对照三句 两对实例;对照三句 用同一组词描述两个领域;写出“适用条件”
10 同构练习 ②:状态机或层级(2、5);新情境测试 在关卡任务与 Astro 筛选组件之间,或海报与产品镜头之间做对照;一周后做第三领域的新情境测试 结构卡 2 张;新情境记录 记录“自发调用 / 被提示后调用 / 未调用”三种结果
11 语言判断(7)、逻辑(3) 把 800 字制作说明做“删、换、读”三遍改稿;做 2 张论证图 改稿对照;论证图 改稿 ≤ 原稿 80% 且信息点不少;每张图有隐含前提与反例
12 审美(6)、深读(8) 做 4 次盲评(见专题报告 03);精读 1 篇原文并做 5 张卡(见专题报告 02) 盲评笔记;5 张卡 理由指向可观察特征;闭卷 5 句复述并指出原文 1 处局限
13 复测与决策(11、12) 重测雷达与 3 个基线;交付主线项目并请外部验收人评;写下一个 90 天的决策日志 对比表;交付物;决策日志 基线重测有分数对比;收到 ≥ 1 条具体、你原先没想到的反馈
8.4 打卡
8.5 “不用 AI 的练习日”怎么排
每周三固定一天。依据只有间接的:高分学习者里有人“先生成后追问”,也有人因“痛苦地卡住”而掌握[11] ;撤掉 AI 后无护栏组成绩下降[10] 。“每周一天”这个比例没有实证,是经验之谈(弱)。 规则很简单:这一天允许查资料、看教程,但不让 AI 起稿、不让 AI 解题、不让 AI 点评;AI 只在练完之后用来“对照”。
周 周三不用 AI 做什么 目的
1–2 手写一份规格;手画论证图;用纸估算时长 建立无 AI 基线
3–6 一次不用 AI 的子任务起稿;手工做验证 保持“第一版”在自己手里
7–8 手绘结构图;手工分类任务 结构必须出自你的心智模型
9–10 各做同构实例的第一版,再允许 AI 对照 让抽象的“比较”由你完成
11–12 改稿与盲评只靠自己;之后才让 AI 来读 判断力靠自己的接触与反馈
13 闭卷复测 客观度量,而不是感觉
8.6 每周复盘模板
## 第 __ 周复盘(日期:____)
1. 本周完成:对照计划表,完成了哪些产出物(文件名)
2. 预测 vs 实际:本周预测 ____ ;实际 ____ ;偏差原因 ____
3. 卡住点:最久的一次卡住是在 ____ ;我怎么走出来的 ____
4. AI 使用审计:本周有几次"先写自己的方案再问"? __ / __ ;有几次直接让 AI 起稿? __
5. 最大的一个错误:____ ;它是怎么被发现的(我自己 / AI / 别人)?
6. 验证:本周采纳的 AI 输出里,我验证了几条? __ / __ ;验证出了什么?
7. 可迁移的结构:本周有没有发现某个结构在两个领域里同构?写一句
8. 下周只调整一件事:____
9. 值得存进卡片的一个例子(保留原始片段):____
与你现有实践的接口
Blender / 建模与动画 :主线子任务 A,承载规格卡、估算日志(渲染时间)、验尸(脚本与设置)。
剪辑 / 动效 / 调色 :阶段 C 的节奏对照;粗剪自己做,AI 只对照;调色以示波器等客观读数验证,不凭“感觉匹配”。
平面 / 设计 :盲评与层级对照;给专题报告 03 的审美练习留位置。
知识库(Obsidian) :精读卡与结构卡保留原文片段和实例截图;这与“信息密度高、忠于原文”的原则一致。
Python / Astro :主线子任务 B;npm run check 与 build 是现成的客观验收。
风险提示
13 周不是“练完”的承诺:Macnamara 等的元分析提示,练习量只解释表现差异的一部分,职业领域不到 1%[20] (有争议)。所以请把它当作建立回路、找到最弱环节的一个阶段,而不是通往“专家”的配方。
09 PROMPTS−1420 m · 花岗岩
用 AI 练底层能力:8 个提示词
这些提示词的共同点是:让 AI 当出题官、对手、澄清者,而不是代笔 。它们是第 06 章“脚手架”原则的具体写法——要提示不要答案、先自己想再问、AI 之后做验证。每个都标明何时用、预期输出和坏用法;点右上角的按钮即可复制,方括号里是需要你替换的部分。
先看三条使用前提
你的作答要先于它的答案。 任何“先看答案再自己做”的用法,都会把脚手架变成拐杖[10] 。
AI 出题、AI 评分都可能出错。 评分与“标准答案”请对照原文、工具或一个独立来源核实,尤其是事实类题目;这是能力 10 本身的练习。
这些提示词本身没有被实验验证过。 它们是本报告按第 06 章原则设计的做法(推断),效果请用你自己的闭卷分数来检验。
P1 · 出题考我(闭卷测评)
练什么 能力 11、全部(校准) 何时用 每 2–4 周一次;或雷达自评之后。 预期输出 逐题交互:一次一题,你作答后它才评分;最后有“把握度 vs 实际得分”的对照表。 坏用法 一次要走全部题和答案“先看看”;作答前偷看提示;让它直接说“你的水平如何”(没有题目作依据)。
你是一位严格的出题官。我想检验自己在【能力或主题,如:结构与架构思维】上的真实水平,领域是【如:Blender 建模 / Astro 项目】。
规则:
1. 出 5 道闭卷题,难度由易到难,覆盖:概念解释、情境判断、找错、一道需要我写出完整思路的题;
2. 一次只给一题;我作答之前,不要给任何提示,也不要给答案;
3. 我作答后:先问我“你对这个答案有几成把握”,再评分(0–5),写出扣分理由与标准答案要点;
4. 5 题结束后,给出“我的把握度 vs 实际得分”对照,指出我最过度自信和最不自信的各一题。
P2 · 苏格拉底追问
练什么 能力 5、11、3 何时用 学一个新概念,或做完一个决定、想检查自己的理由时。 预期输出 一问一答;最后得到一段你自己写的总结,以及它指出的一处不精确。 坏用法 一直要它“直接告诉我”;让它替你写最后的总结。
你是苏格拉底式的导师。我想弄懂【概念或决定,如:为什么这个场景的集合要这样分层】。
请不要直接解释。按以下方式进行:
1. 先问我一个问题,让我说出我现在的理解;
2. 根据我的回答,只追问一个最能暴露漏洞的问题(每次只问一个);
3. 当我连续两次答不上来时,才给一个最小的提示,不给答案;
4. 当我能用自己的话讲清楚并举出一个反例时,让我写一段不超过 150 字的总结,并指出总结里还不精确的一处。
P3 · 红队攻击我的方案
练什么 能力 3、10、12 何时用 开工之前、发布之前。 预期输出 按“可能性 × 代价”排序的 5 个失败原因,每个带隐含前提和一小时内能做的廉价检验,外加 3 个关键问题。 坏用法 让它“既攻击又重写”(你会直接采纳而不思考);只攻击一次就当通过。
你是一位经验丰富、但不留情面的评审。以下是我的方案:
【粘贴:目标 + 方案 + 约束】
请以“它会怎样失败”为出发点:
1. 列出最可能导致失败的 5 个原因,按“可能性 × 代价”排序;
2. 对每一个,指出我的方案里隐含的前提(我没写出来、但依赖的假设);
3. 给出最便宜的验证办法(一小时内能做完);
4. 最后只允许你问我 3 个问题,问最关键的。
不要给改进方案,也不要夸我;我自己决定怎么改。
P4 · 反例生成
练什么 能力 3、5 何时用 总结出一条“经验或规则”时;同构练习里写“适用条件”时。 预期输出 3 个满足你给的条件却推翻结论的具体情境,以及每个反例击中的隐含前提;然后问你怎么收窄结论。 坏用法 被反例击中就整条放弃,而不是收窄适用范围;只让 AI 生成反例,自己一个都不想。
下面是我得出的一条结论或规则:
【结论 + 它依据的材料】
请帮我找反例:
1. 构造 3 个“满足我给的条件、但结论不成立”的具体情境(尽量放在 Blender、剪辑、写作或软件开发里);
2. 对每个反例,说明它击中了我的哪一个隐含前提;
3. 然后问我:要把结论的适用范围收窄成什么样,才能挡住这三个反例?等我回答后再评价。
P5 · 需求澄清官
练什么 能力 1、9 何时用 任何比“一次对话就能做完”更大的任务开始之前。 预期输出 它的复述、不超过 7 个澄清问题、3 个最含糊的词,以及一份规格卡草稿,由你修改定稿。 坏用法 对澄清问题回答“随便”;不看问题,直接说“按你的理解做”。
你是需求澄清官,不是执行者。我要做的事:【一两句话】。
在我确认之前,请不要开始做,也不要给方案。
请只做三件事:
1. 复述你对任务的理解(不超过 5 行);
2. 列出需要我回答的澄清问题,不超过 7 个,按“不问就会做错”的程度排序;
3. 指出我这段描述里最含糊的 3 个词,并问我分别指什么。
我回答后,再输出一份“规格卡”草稿:目标 / 受众 / 约束 / 验收标准 / 反例 / 已知风险,由我修改定稿。
P6 · 验收标准生成
练什么 能力 1、10 何时用 规格卡写完之后、动手之前。 预期输出 分为“必须 / 应该 / 明确不做”三类的可判定清单,每条带检查方法,并指出哪些标准你其实检查不了。 坏用法 原样接受,不删不改;以为标准越多越好——超过你能检查的数量,等于没有标准。
下面是一份任务规格:
【粘贴规格卡】
请为它写验收标准:
1. 每条必须是“是 / 否”可判定的检查项,不能出现“好看”“流畅”这类无法判定的词;遇到这种词,请改写成可观察的表述;
2. 分三类:必须满足、应该满足、明确不做;
3. 对每一条写出“怎么检查”(用什么工具、看什么、多久);
4. 最后指出:哪些标准我其实检查不了(缺少工具或知识),需要我先补什么。
P7 · 埋雷测试
练什么 能力 10、3 何时用 每月至少一次,专练“发现错误”。 预期输出 一份 300 字以内、看起来合理的材料,含两处故意错误;你提交答案后,它再公布并说明每个错误的最便宜检验办法。 坏用法 偷看答案;总用同一类主题(只练到一类错误)。注意:出题与评分都由同一个 AI 做,事实类的“雷”它自己也可能搞错,需要你查证。
我要练习“发现错误”的能力。请围绕【主题,如:Blender 修改器栈的用法 / Astro 内容集合的配置 / 一段关于 AI 与生产力研究的综述】写一份 300 字以内的材料。
要求:
1. 材料看起来合理,语气自信;
2. 故意埋入 2 处错误:一处事实或概念错误,一处推理(逻辑)错误;
3. 不要告诉我错误在哪里,也不要暗示数量以外的任何信息;
4. 我提交“我找到的错误”之后,再公布答案,并说明每个错误的“最便宜的检验办法”。
P8 · 同构对照教练
练什么 能力 5、11 何时用 同构练习的第 3、4 步:写对照三句与适用条件时。 预期输出 它先逼你把相同与不同说清楚,再指出哪部分是真同构、哪部分只是字面相似,给你一个第三领域的新情境,最后让你写适用条件。 坏用法 直接要它给出“共同结构”;把它给的类比当成已验证的迁移——那只是假设,要靠你的新情境测试来检验。
我刚做完两个练习,想比较它们是不是同一种结构。
练习 A(领域:【如:剪辑】):【描述 + 我的做法】
练习 B(领域:【如:写作】):【描述 + 我的做法】
我的猜测:它们共享的结构是【如:节奏】。
请你:
1. 先不要评价我的猜测;先问我 3 个问题,逼我把两个练习里“相同的地方”和“不同的地方”各说清楚;
2. 我回答后,指出我说的“共同结构”里哪一部分是真正同构,哪一部分只是字面相似;
3. 给出一个我没做过的第三个领域的小情境,让我判断这个结构在那里是否适用,并说明理由;
4. 最后让我写出“适用条件”(什么时候这个结构不适用)。
怎么搭配
一个典型的周内流程:周一用 P5 澄清需求并写出规格卡,再用 P6 生成验收标准;周二到周四做事;周五用 P3 红队、P7 埋雷;每 2–4 周用 P1 做一次闭卷测评;同构练习的周用 P8 与 P4 。想弄懂一个新概念时,换成 P2 。
10 LIMITS−1540 m · 玄武岩
反方与局限:我们可能错在哪
一份主张“底层能力更重要”的报告,最该警惕的就是自己。这一章把可能出错的地方一条条摊开:哪些证据偏弱,哪些是推断,哪些东西如果变了,结论也要跟着变。凡是没法核实、或只靠推断的部分,下面都有标注。
1 · 证据大多来自上一代模型
BCG 实验用的是 GPT-4(2023)[1] ;人机组合元分析的检索截止到 2023 年 6 月[29] ;“未经训练评审区分不出 GPT-3 文本”是 2020–2021 年的情形[27] ;METR 的第一轮用的是 2025 年初的工具[4] ,而 METR 自己判断 2026 年初的提速“很可能更大”[5] 。
影响: “AI 的边界在哪里”“判断力在哪里是瓶颈”,这些具体位置会随模型移动。本报告最稳的是结构性的论证(乘法模型、最弱环节),最不稳的是具体数字。◐ 中
2 · AI 继续进步后,“判断”也可能被替代
Polanyi 的“我们知道的多于我们能说的”[31] 所描述的约束,已被“从人类示例中学习”部分绕过:Autor 2014 年的论文写于 LLM 之前,它自己描述的绕过路径恰是后来的路径[9] ;Autor 2024 的“扩展专业知识”是条件性的论证,不是预测[8] ;“判断文字真伪”的难度随模型更新而变[26] [27] ;人机元分析里,AI 单干优于人时,组合反而更差[29] 。
◇ 推断 如果 AI 在评估类任务上稳定超过多数人,“人当裁判”的价值会收缩,剩下的更可能是:提供 AI 没有的情境、承担责任、决定目标。这也是为什么本报告把“定义问题”和“承担选择”放在“判断”的两端。但这只是一个情景,不是预测。
3 · 幸存者偏差与自选择
Economic Index 只覆盖 Claude 用户,“高使用时长用户成功率高 10%”既可能是边做边学,也可能是更精明的人用得更久,作者自己给出了两种解释[7] ;METR 的后续实验因开发者拒绝在无 AI 条件下工作而产生自选择,使估计偏向“AI 不起作用”[5] 。创作者圈子里“一人公司”“一人独角兽”的流行叙事,我没有找到系统性实证,未核实。
影响: 你看到的“一个人加 AI 做成了某事”的案例,有大量没被讲述的失败。○ 弱
4 · 自评与日志的偏差
本报告的“怎么测”里有不少依赖日志和自评。可是学生没察觉自己在退步[10] ,开发者的感觉与实测相反[4] 。雷达自测因此可能系统性偏高或偏低。我给的校准办法(闭卷、外部盲评)能缓解,不能消除。◐ 中
5 · 文化、行业与场景差异
研究场景集中在英语世界的咨询、客服、软件开发和高中数学;唯一的高中实验在土耳其[10] ;WEF 的雇主调查虽覆盖 55 个经济体,但是主观预期[28] 。没有任何一项研究直接测过 Blender 建模、剪辑、关卡设计或平面设计。 本报告把结论搬到你的领域,是推断。◇ 推断
6 · 通才风险:十二项并行等于浅尝
“各领域互通”与“领域知识不可省”之间有张力:如果把精力摊给太多领域,你可能在任何一个里都不够深,而判断 AI 输出恰恰需要深。刻意练习的元分析还提示,练习量只解释表现差异的一部分[20] 。“个人加 AI 接近两人团队”的证据只来自一天的方案生成任务,且二手、样本数冲突[30] 。
对策: 先确定一个主领域,把 12 项绑定到项目上轮流推进(第 08 章);“一个人完成团队的全部工作”在本报告里没有证据支持。○ 弱
7 · 研究样本局限
Chi 等 8 对 8[16] ;METR 16 人[4] ;Shen 与 Tamkin 52 人[11] ;Kosmyna 第 4 次仅 18 人[12] ;BCG 边界外只有一道题[1] ;Loewenstein 的被试是 MBA[18] ;Noy 与 Zhang 的工作论文版(444)与 Science 版(453)样本数不同[2] 。小样本、单一任务、单一人群,是本报告许多“支持性证据”的共同弱点。◐ 中
8 · 迁移证据是外推的
“并置比较促进迁移”来自谈判实验,复现情况本次未核实[18] ;“远迁移罕见”来自对一般认知训练的元分析,且我只见二手转述[21] ;Gick 与 Holyoak 的数字也是二手[19] 。同构练习在你的领域里有没有效果,是待验证的假设。◇ 推断
9 · 雇主预期不是技能回报
WEF 里“分析性思维”位列核心技能之首,但同一份报告显示“阅读、写作与数学”净增长 −4,而“AI 与大数据”为 87[28] 。只摘“软技能”这一半,会给出比证据更乐观的图景。◐ 中
10 · 就业数据的因果方向
Canaries 自称“早期的、描述性的指标”,控制教育后模式会减弱,部分分化早于生成式 AI[6] ;窄年龄带的批评只有二手摘要,我没有读到原文。“入门台阶被压缩”因此是一个值得警惕的信号,而不是已证实的因果结论。◐ 中
11 · 12 项能力的划分与训练参数,是我的设定
这 12 项不是研究得出的结构,彼此重叠;每项练习的时长、频次、验收阈值(如“命中率 60%–95%”)是经验设定。第 03 章也说明过:它们的作用是让练习可检验,而不是被证明过的剂量。◇ 推断
12 · 一个根本的对照缺失
本报告没有任何证据比较“专门练这 12 项”与“只在领域里做大量带反馈的项目”哪个更好。很可能后者已经能长出其中很多能力;本报告的方案更像是把“边做边学”变得有意识、可度量。◇ 推断
13 · 来源的利益关联与未核实项
Economic Index 与 Shen、Tamkin 的研究出自 Anthropic 自己[7] [11] ,存在利益相关。以下内容本次未核实 ,正文没有当事实用:Ousterhout 的深模块、需求缺陷成本的“越晚越贵 N 倍”、“一万小时”、Ericsson 对 Macnamara 的反驳、Barnett 与 Ceci 的迁移分类、Kalyuga 的专长反转、Tetlock 的校准训练、“提示技能与领域知识谁更重要”的对照实验,以及 Fan、Stadler、Lee、Johnny、Russell 与 Cybernetic Teammate 的全文数字。第 99 章的 H 组经典理论也是未核实的。
主张分级:哪些有直接证据,哪些是推断
主张 状态 依据与范围
AI 在可明文化任务上拉平技能差 ● 直接证据 咨询、写作、客服[1] [2] [3] ;旧模型
AI 边界之外会把人带偏 ◐ 单项实验 仅一道题[1]
人机组合在决策类任务上平均更差 ● 元分析 2023 年前的研究[29]
无护栏使用损害学习,且学习者不察觉 ● 直接证据 高中数学[10] ;编程学习[11] ;到创作者的职场使用是外推
专家按原理而非表面特征看问题 ◐ 领域内证据 物理[16]
并置比较促进迁移 ◐ 单项实验 谈判[18] ;到创作领域是推断
通用思维的远迁移罕见 ● 元分析(二手) 针对一般认知训练[21]
入门台阶在被压缩 ◐ 描述性 年轻人的就业[6]
领域知识是判断 AI 输出的前提 ○ 间接 Autor 的论证[8] 与自评问卷[7] ;其余是推断
12 项能力能按本报告的方式练好 ◇ 推断 无对照实验
各领域的同构概念确实互通 ◇ 推断 个别概念有领域内出处,见第 04 章
一个人加 AI 能完成团队的全部工作 ○ 证据不足 只有一天方案生成的二手证据[30]
什么证据会让我们改变主意
如果出现对照实验,显示“直接做大量带反馈的项目”与“项目加刻意的结构练习”在迁移任务上没有差别,第 05 章的同构练习要降级。
如果新一代模型在 AI 边界之外的任务上,校准良好且稳定好于人,“判断稀缺”需要让位给“情境与承担”。
如果 Canaries 类的差距在控制教育与行业趋势后消失,“主动造练习场”的紧迫性要下调。
如果你自己的 90 天数据显示:闭卷分没有变化,说明练法有问题,应该换,而不是加量。
11 CONCLUSION−1650 m · 辉长岩
结论与本周 5 件事
回到起点。AI 把执行压低,稀缺性迁到“定义问题、判断结果、承担选择”。你的直觉大方向成立,但要换成一个更准确、也更有行动力的说法:
底层能力不是脱离领域的通用肌肉,而是在具体实践里长出来的深层结构;在具体里练抽象,用抽象跨领域,并且别让 AI 替你做掉那部分“困难”。— 本报告的结论(综合 [10] [11] [16] [17] [18])
修正 ①
结构,不是肌肉 可迁移的是在具体里抽象出的结构;用同构练习与新情境测试把它练出来(第 04、05 章)。
修正 ②
领域知识不可省 它是判断 AI 输出的前提;先定一个主领域,把 12 项绑在项目上推进(第 08、10 章)。
修正 ③
用法决定增强还是萎缩 提示不要答案、先想再问、不用 AI 的练习日、AI 之后必验证、闭卷度量(第 06 章)。
还有一点:入门级实践场地在收缩,所以你要自己造练习场 ——每月一个小而完整、有验收标准、有外部反馈的作品闭环。最后要诚实地说,本报告的很多支持证据来自上一代模型、小样本、非创作领域;其中 12 项的划分与同构图谱是推断。所以最好的用法是:把它当作一组可以检验的假设,用你自己 90 天的闭卷分数去验证。
本周 5 件事
下一步
周日花 20 分钟用第 08 章的模板写第一份周复盘。两周后,对照雷达的“最弱三项”,决定第 3 周起把重点放在哪里。想继续深挖,请读专题报告 02 · 深度阅读与 AI 与 03 · 审美能力 ——它们是 12 项里最重的两项的展开。
99 SOURCES−1740 m · 基岩
来源与证据等级
来源按调研笔记编号,调研截止 2026-10-01。每条同时标两样东西:证据等级 (研究设计本身有多可靠)和核验状态 (我实际读到了什么程度)。两者是两回事:一篇强证据的研究,我也可能只读到摘要。
● 强 RCT、元分析、同行评审大样本◐ 中 单项研究、官方报告、基准○ 弱 预印本、案例、观点、理论◇ 推断 本报告自己的判断
已读原文 取到全文并检索过只读摘要 只读到出版方或数据库摘要页二手转述 只见他人转述,原文未取到
A · 生产力与技能分布
Navigating the Jagged Technological Frontier (Dell'Acqua, McFowland, Mollick 等, 2023, HBS Working Paper 24-013)全文 PDF 镜像 ◐ 中 已读原文 支持“AI 在边界内拉平差距、边界外把人带偏”。局限:单一公司;边界外只有一道题;GPT-4 时代;工作论文。
Experimental Evidence on the Productivity Effects of Generative AI (Noy & Zhang, 2023, Science 381:187–192)Science 页面 · 工作论文 PDF ● 强 工作论文已读 Science 版只读摘要 支持“AI 替代努力、压缩差距、任务转向编辑”。局限:短写作、在线实验、评估者打分;两个版本样本数与口径不同。
Generative AI at Work (Brynjolfsson, Li & Raymond, 2023 NBER WP 31161;2025 QJE)NBER 摘要页 ● 强 只读摘要 支持“新手受益最大、高技能者影响极小”。局限:单一公司、单一岗位;QJE 全文未取到。
Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity (Becker, Rush, Barnes, Rein;METR, 2025, arXiv:2507.09089)arXiv ◐ 中 已读原文 支持“主观感觉与实测可以相反”。局限:16 人;旧一代工具;METR 已标注“out of date”(见 [5])。
We are Changing our Developer Productivity Experiment Design (METR, 2026-02-24)METR 博客 ○ 弱 已读原文 方法学更新,自述数据不可靠(自选择、多 agent 计时失真)。用来说明“不能再引用慢 19%”。
Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of AI (Brynjolfsson, Chandar & Chen, Stanford Digital Economy Lab, 2025-08 首版;2026-08 版)PDF ◐ 中 已读原文 支持“年轻人在 AI 高暴露职业里就业下降、经验者无类似差距”。局限:作者自称描述性而非因果;控制教育后减弱。EIG 对窄年龄带的批评只见二手摘要。
Anthropic Economic Index (Anthropic, 2026-01 / 2026-03 / 2026-06 三期)2026-01 · 2026-03 · 2026-06 ◐ 中 三期已读 支持“增强式占比过半、使用越久成功率越高、资深者估计 AI 可替代份额更低”。局限:只含 Claude 用户;成功率由分类器判定;问卷为自评;高使用时长的关联不是因果。
Applying AI to Rebuild Middle Class Jobs (Autor, 2024, NBER WP 32140)NBER 摘要页 ○ 弱 只读摘要 提供“AI 扩展专业知识的相关性”的理论框架。作者明说是论证而非预测,条件是用得好。
Polanyi's Paradox and the Shape of Employment Growth (Autor, 2014, NBER WP 20485)NBER 摘要页 ○ 弱 只读摘要 提出隐性知识难以被计算机化;写于 LLM 之前,其约束已被“从示例中学习”部分绕过,不能原样套用到今天。
B · 认知卸载与技能萎缩
Generative AI without guardrails can harm learning (Bastani, Bastani, Sungu 等, 2025, PNAS 122(26):e2422633122)PMC 全文 ● 强 已读原文 支持“无护栏使用撤掉 AI 后成绩下降,学生没察觉;护栏式 Tutor 基本缓解”。局限:单一学校与学科,短期,学生而非职场人。
How AI assistance impacts the formation of coding skills (Shen & Tamkin, Anthropic, 2026, arXiv:2601.20245)官方博文 · arXiv ◐ 中 已读原文 支持“AI 辅助不等于获得能力;概念性提问优于整体委托”。局限:52 人;Anthropic 自己的研究,有利益关联;只测即时理解。
Your Brain on ChatGPT: Accumulation of Cognitive Debt… (Kosmyna 等, 2025, arXiv:2506.08872 预印本)arXiv ○ 弱 只读摘要 批评为二手 只作提示性线索。局限:预印本;第 4 次仅 18 人完成;EEG 连接度不等于能力;原文没有“脑损伤”的说法。
The Impact of Generative AI on Critical Thinking (Lee, Sarkar 等, 2025, CHI '25)ACM ◐ 中 只读摘要 支持“对 AI 信心越高、批判性思维越少”。局限:319 人的自评横断面调查,相关非因果。
Beware of metacognitive laziness (Fan 等, 2025, BJET 56(2):489–530)Wiley ◐ 中 只读摘要 支持“作品变好不等于人变强”。局限:117 人;“metacognitive laziness”是作者提出的假设性概念,不是已验证机制。
Cognitive ease at a cost (Stadler, Bannert & Sailer, 2024, Computers in Human Behavior 160:108386)DOI ◐ 中 二手转述 方向与 [10][11][14] 一致:省力不等于深度。样本量与效应量未核实。
C · 迁移与“通用能力”
Categorization and representation of physics problems by experts and novices (Chi, Feltovich & Glaser, 1981, Cognitive Science 5(2):121–152)PDF ◐ 中 已读原文 支持“专家按原理、新手按表面特征表征问题”。局限:8 名博士生对 8 名本科生,单一领域,不证明跨领域迁移。原文用词是 surface structures 与 principles。
Critical Thinking: Why Is It So Hard to Teach? (Willingham, 2007, American Educator)PDF ○ 弱 已读原文 支持“思维过程与领域知识交织,批判性思维不是通用技能”。局限:认知科学家写给教师的评述,不是原始实验。
Analogical encoding facilitates knowledge transfer in negotiation (Loewenstein, Thompson & Gentner, 1999, Psychonomic Bulletin & Review 6(4):586–597)PDF ◐ 中 已读原文 支持“并置比较两个案例能促进抽象与迁移”(116 名管理硕士,53% 对 19%)。局限:谈判任务;后续复现本次未核实。
Gick & Holyoak 类比迁移研究 (1980, 1983, Cognitive Psychology)◐ 中 二手转述 仅经 [18] 转述:自发迁移很低,被提示后明显上升。原论文未打开,数字只引 [18] 转述的版本。
Deliberate Practice and Performance in Music, Games, Sports, Education, and Professions: A Meta-Analysis (Macnamara, Hambrick & Oswald, 2014, Psychological Science 25(8):1608–1618)PDF ● 强 已读原文 支持“刻意练习重要,但不如主张得那么重要”。局限:有争议;2018 勘误与 2019 复现只见二手;Ericsson 一方的反驳未核实。
远迁移元分析 (Sala & Gobet, 2016 / 2017 / 2019, Trends in Cognitive Sciences 等)2019 TICS ● 强 二手转述 据摘要转述:认知训练对领域一般认知的效应极小,远迁移很少发生。针对“训练一般认知任务”,不等于“领域内抽象后迁移”。象棋效应量等具体数字未核实。
D · 生产模型的理论依据
The O-Ring Theory of Economic Development (Kremer, 1993, QJE 108(3):551–575)PDF ○ 弱 只读摘要段 理论模型:任何环节出错都毁掉产出。不涉及 AI,把它用于“人加 AI 的工作流”是本报告的类比。
No Silver Bullet: Essence and Accidents of Software Engineering (Brooks, 1986, UNC TR86-020)PDF ○ 弱 已读原文 本质与偶然复杂度;“最难的是决定造什么”。权威观点而非实验;1986 年论断,LLM 是否改变其适用范围未核实。
On the foolishness of “natural language programming” (Dijkstra, EWD667, 1978)EWD 抄本 ○ 弱 已读原文 支持“自然语言需求容易含糊,精确化是能力”。1978 年观点;LLM 的对话澄清改变了接口,但洞见仍可用。
E · 提问、表述与判断文字
Why Johnny Can't Prompt (Zamfirescu-Pereira, Wong, Hartmann, Yang, 2023, CHI '23)ACM ◐ 中 只读摘要 支持“非专家的提示探索是机会主义式而非系统性的”。局限:GPT-3 时代;样本数未核。
People who frequently use ChatGPT for writing tasks are accurate and robust detectors of AI-generated text (Russell, Karpinska & Iyyer, 2025, ACL 2025)arXiv ○ 弱 只读摘要 支持“经常用 LLM 写作的人更会识别 AI 文本”。具体准确率未读到;使用频率与识别力是否因果不明。
All That's 'Human' Is Not Gold (Clark, August, Serrano 等, 2021, ACL 2021)arXiv ◐ 中 已读原文 支持“未训练的评审区分 GPT-3 与人类文本处于随机水平;短训练最多提到约 55%”。局限:GPT-3 时代,众包非专家,训练仅分钟级。
F / G · 劳动力口径与补充
The Future of Jobs Report 2025 (World Economic Forum, 2025-01)PDF ◐ 中 已读原文 雇主调查口径:分析性思维 69%、创造性思维 57%、系统思维 42% 为核心技能。局限:主观预期,不是技能回报;同报告里“阅读、写作与数学”净增长 −4。
When combinations of humans and AI are useful: A systematic review and meta-analysis (Vaccaro, Almaatouq & Malone, 2024, Nature Human Behaviour)Nature ● 强 只读摘要 106 项实验、370 个效应量:人机组合平均不如最好的一方单干,决策类任务损失、内容创作类增益。局限:作者自述发表偏倚;多为 2023 年前的模型。
The Cybernetic Teammate (Dell'Acqua 等, 2025, NBER WP 33641 / Organization Science)NBER PDF ◐ 中 二手转述 据转述:个人加 AI 与无 AI 的两人团队相当。样本数 776 与 791 冲突,未解决;一天工作坊的方案生成任务,不含落地。
H · 经典理论(未在本次调研中核实)
下列是我凭自身知识补充的经典出处,本次没有取到原文,因此正文里只用它们的思想,不引用具体数字或原话 。如要引用,请先回查。
The Tacit Dimension (Polanyi, 1966)○ 弱 未在本次调研中核实 “我们知道的多于我们能说的”的原始出处;本报告只经 [9] 间接引用其思想。无链接。
Memory and metamemory considerations in the training of human beings (Bjork, 1994)○ 弱 未在本次调研中核实 “想要的困难(desirable difficulties)”概念的常见出处;正文仅借用概念。无链接。
Unskilled and unaware of it (Kruger & Dunning, 1999, Journal of Personality and Social Psychology)DOI ○ 弱 未在本次调研中核实 自评偏差的常见出处;其效应的解释与复现情况有争论,正文只作“自评会有偏差”的背景。
How to Solve It (Pólya, 1945)○ 弱 未在本次调研中核实 问题求解启发法的经典;正文只借用“先弄清问题再动手”的思想。无链接。
Superforecasting (Tetlock & Gardner, 2015)○ 弱 未在本次调研中核实 校准训练的常见出处。调研笔记明确标注“校准可训练的证据:未核实”,正文把它当作需自行验证的做法。无链接。
The Reflective Practitioner (Schön, 1983)○ 弱 未在本次调研中核实 “在行动中反思”的经典;正文仅借用这一思想。无链接。
Structure-mapping: A theoretical framework for analogy (Gentner, 1983, Cognitive Science 7(2))DOI ○ 弱 未在本次调研中核实 类比靠“关系结构”而非表面属性匹配的理论;与 [18] 同一研究传统,正文只用其思想。
On the Criteria To Be Used in Decomposing Systems into Modules (Parnas, 1972, CACM)DOI ○ 弱 未在本次调研中核实 按“隐藏易变决定”划分模块的经典;正文仅借用思想。
Thinking, Fast and Slow (Kahneman, 2011)○ 弱 未在本次调研中核实 估算偏差(如计划谬误、参考类)的通俗出处;正文不引用其任何数字。无链接。