← 返回目录
w2.1概念⏱ 约 6 分钟

蒸馏:把一堆资料熬成一锅可复用的高汤

学会把原始资料压缩成结构化笔记,让后面所有环节只处理一次资料

🔎 最后验证 2026-08📚 来源:本课产线源码 ops/course-factory/workflows/*.yaml 与两门课的运行留档
为什么学这个

你有没有过这种经历:每接一个活,都把同一堆资料从头翻一遍——上个月明明整理过,但整理的结果散在聊天记录里,找不回来,只好重来。

我们做课程产线时也遇到同样的问题:一门课要写几十节,如果每节都让 AI 从原始资料“现场理解”一遍,不但慢,而且不稳定——我们的留档里记录过一次实例:同一份资料让模型理解两次,两次的结果并不一致。这是单次观察,我们不把它当普适规律,但它足以让我们警惕“每次现场理解”这条路。

解法是把“理解资料”这个重活只干一次,产出一份固定格式的笔记,之后所有写作都只用这份笔记。这一节讲清楚这个动作——蒸馏——是什么、为什么、怎么做。

💡 打个比方

想象你开了一家小饭馆。每来一个客人都从头处理食材:洗菜、切肉、吊汤,一单做两小时。老练的厨师不这么干:开工前先熬一大锅高汤,之后每道菜都用这锅汤打底。食材只处理一次,之后反复复用。

在 AI 产线里,这锅高汤叫蒸馏(distill):把一份原始资料压缩成结构化笔记,作为后续所有写作步骤的输入。

蒸馏在产线里的位置

我们这条产线由四个工作流组成:蒸馏资料(distill-source)→设计大纲(design-course)→逐模块写稿(write-module)→转站点格式(to-mdx)。蒸馏是第一站——它的产出是后面所有环节的输入。这不是口头描述,工作流源码就在仓库的 ops/course-factory/workflows/ 目录里,可以直接核对。

为什么不直接把原始资料整包扔给 AI 写稿? 三个理由:

  1. 原始资料太散。一手记录里有日志、闲聊、重复表述,AI 每次写稿都得自己“现场理解”一遍——而如上所说,两次理解的结果可能不一致。
  2. 蒸馏产物是结构化的。好的蒸馏笔记不是摘要,而是有固定格式的“标准件”:概念卡片、断言库、坑点清单。下游拿到的是可以直接引用的零件,不是一堆毛坯。
  3. 只处理一次。资料理解这个重活只干一遍,之后写 10 节课还是 40 节课,都用同一份笔记——这正是上一模块讲的“省重复劳动”。

一份合格的蒸馏笔记长什么样

至少要有这三块:

组成部分里面放什么为什么需要
概念卡片每个概念的定义、生活类比、前置概念(先学什么才能懂它)下游写教学内容时直接取用,不用重新发明类比
断言库每条技术事实单列一行,标注可信度和在原文的位置让每句话都能回答“这条出自哪里”
坑点与诚实条款素材资料里承认的缺陷、失败、边界缺点是最强信任状,蒸馏时就要留住它们

其中断言库是核心。判断一份笔记是蒸馏还是摘要,标准只有一条:你能不能指着笔记里任意一句话问“这条出自原文哪里”,并得到答案。 能,是蒸馏;不能,是摘要。

蒸馏是源头,源头丢了下游全没有

先打一个本模块后面会反复回来的预防针:蒸馏做得再好,也会丢东西。我们自己的产线就丢过——原文里明明存在的 URL,蒸馏时被弄丢了,导致下游成稿写出了错误声明(这是我们自己踩的坑,运行日志有留档,后面 2.3、2.4 两节会把这个事故完整拆开)。

所以蒸馏完成后的“人工过一遍”不是客套,是必做步骤。蒸馏是产线的源头,源头丢了的东西,下游每一个环节都拿不到。

🔧 动手做:蒸馏一份你自己的资料(10 分钟)

  1. 挑一份你手头的真实资料——一篇文章、一份会议纪要、一份产品说明都行,篇幅不要太长,一遍能读完的量最合适。
  2. 把下面 PromptCard 里的指令连同资料全文一起发给 AI。
  3. 拿到结果后,人工对照原文过一遍,至少检查两件事:断言库里有没有哪条在原文找不到出处?原文里你认为重要的东西有没有被丢掉?
  4. 各记一条检查结果——哪怕结论是“没发现”,也要写下来。

你会看到:一份三段式结构化笔记(概念卡片 + 断言库 + 缺陷清单),加上你自己写的至少 1 条“丢失/多出”记录。

为什么:这一步让你亲手体验蒸馏的产出形态,更重要的是体验“人工核对”——它是本模块后面所有内容的伏笔:蒸馏会丢东西,而且不会报错。

🤖 蒸馏指令
请把这份资料蒸馏成结构化笔记,包含三部分:1) 概念卡片(每个概念给定义+生活类比);2) 断言库(每条事实单列,标注在原文的位置);3) 资料中承认的缺陷或边界。不许添加资料里没有的信息。【粘贴你的资料全文】
❓ 测验
让 AI“总结一下这篇文章”,得到三段流畅的概述。按本节的标准,这份产出的问题是什么?
⚠️ 避坑把“摘要”当“蒸馏”

最常见的错误是发一句“总结一下”就当蒸馏做完了。摘要没有逐条断言、没有来源位置,下游写稿时既没法引用也没法核查,等于源头没建账本。之后你在成稿里看到一句可疑的话,想追问“这从哪来的”,会发现无从查起。

✅ 小结

蒸馏是把原始资料压缩成结构化笔记(概念卡片 + 断言库 + 坑点清单),资料理解的重活只干一次,之后反复复用。蒸馏和摘要的分界线是可核查:每句话都能回答“出自原文哪里”。但蒸馏是源头,丢了的东西下游全都没有——所以有了这锅高汤之后,下一个问题是:怎么保证 AI 写作时只用这锅汤,不偷偷加料?

下一节 → 唯一事实来源:写作只准依据蒸馏笔记
🔎 来源与核验· 3 条,点开核对
本节每个关键论断都对应一个可追溯的来源 —— 这是本课程"靠谱、不过时"的底线。
「产线由蒸馏/设计/写稿/转格式四个工作流组成,蒸馏是第一站」
📚 课程工厂工作流源码 ops/course-factory/workflows/*.yaml✓ 已核验 2026-08
「同一份资料两次理解结果不一致(单次观察,非普适结论)」
📚 本课产线运行留档(两门课生产记录)✓ 已核验 2026-08
「蒸馏环节丢过原文中存在的 URL,导致下游写出错误声明」
📚 本课产线运行日志(runs 目录留档,已修)✓ 已核验 2026-08
智图软件的赞赏码
都看到这了,打个赏呗!
接下来 · w2.2
唯一事实来源:写作只准依据蒸馏笔记
继续读下一节 →