全站入口
LUNA

第三篇 · 进阶系统与 AI 员工

第 22 章 把一本书、一个视频、一套方法,蒸馏成能跑的 Skill

本章成果

把一套已经理解并跑过的方法,蒸馏成一套 AI 员工能在真实场景里自动调出来、直接照着干的可执行 Skill 集合——而不是又一份没人翻的笔记。

问题起点:知识读了,却用不起来

AI 在训练时已经吃进了大量经典著作,但真到你问它一个具体问题,它常常给你"正确的废话"——每个字都对,就是没有能落到你这件事上的步骤。这不是它在瞎编(不是幻觉),是调用机制出了问题:它知道书里有什么,却不知道在你这个场景下,该主动调出哪一个框架。

人也一样。你读完一本营销书,笔记记了、金句划了,合上书觉得自己升级了。两周后真要定选题、写方案,那几套方法却怎么都抓不住。知识在记忆里,但激活的路径不清晰。

知识蒸馏要解决的,就是这个"学了、却用不上"的问题。
知识读了却用不起来
官方 WorkBuddy 蓝皮书配图 · 知识读了却用不起来 · 仅作参考

什么是知识蒸馏

知识蒸馏(把知识提纯成 Skill)指的是:从一本书或一个视频里,提取出带有独立触发条件和执行步骤的最小知识单元(一个 Skill),让 AI 员工在遇到对应场景时,能自动激活、给出可以直接照做的行动路径。

化学里的"精馏"是按沸点把混合物分离成不同纯度的组分。知识蒸馏是按框架 / 原则 / 案例 / 反例 / 术语五个维度,把书或视频里的东西分离开,再只把真正有用的那部分,提纯成能跑的 Skill。

它不是

摘要(把原文压短)、读书笔记(把原文重新排版)、RAG 检索库(把原文切片存起来等你去查)。

它是

把方法论变成 AI 员工能在真实场景下自动调用的执行单元。摘要帮你回忆,Skill 帮 AI 干活。

cangjie-skill 知识蒸馏工具
官方 WorkBuddy 蓝皮书配图 · 知识蒸馏工具(cangjie-skill)· 仅作参考

六阶段蒸馏 SOP

把一本书或一组视频蒸馏成一套 Skill,走六个阶段。先看整条流水线,再一段段拆开:

六阶段蒸馏流程总览
官方 WorkBuddy 蓝皮书配图 · 六阶段蒸馏流程总览 · 仅作参考
六阶段蒸馏流程
官方 WorkBuddy 蓝皮书配图 · 六阶段蒸馏流程 · 仅作参考
蒸馏实例
官方 WorkBuddy 蓝皮书配图 · 蒸馏一本方法论书的实例 · 仅作参考

阶段 0整书 / 整片理解

不要一上来就摘金句,先读清整本书的骨架:

  • 全书主旨是什么;
  • 核心论证链怎么一步步走下来;
  • 关键术语,作者是怎么定义、怎么用的;
  • 作者自己的局限和盲点在哪。

这一步决定后面提取的质量上限。跳过它直接摘,最容易把作者反对的观点,当成他推荐的方法抄下来。

阶段 0 整书理解
官方 WorkBuddy 蓝皮书配图 · 阶段 0 · 整书理解 · 仅作参考

阶段 1五个维度并行提取

让五路同时从五个维度扫全文,各扫各的、互不干扰,避免一条线读下来漏掉视角:

提取维度提取什么
框架作者搭起来的分析框架、决策框架
原则能跨场景复用的行为原则
案例作者举的正面案例、成功路径
反例作者举的失败案例、反面教训
术语作者的专有术语,和它的定义
五维度并行提取
官方 WorkBuddy 蓝皮书配图 · 阶段 1 · 五维度并行提取 · 仅作参考

阶段 2三重验证筛选

每一条候选知识,都要过三关,过不了就淘汰:

验证问自己一句
跨域验证这个方法在书里,至少两个不同场景出现过吗?只出现一次的是孤证。
预测力测试能用它推导出书里没直接讲到的问题吗?
独特性检验是不是随便谁都能说出来的常识?常识不构成 Skill。

宁缺毋滥。一本书通常能扒出 50–100 条候选,过完这三关,往往只留下 10–25 条。

三重验证筛选
官方 WorkBuddy 蓝皮书配图 · 阶段 2 · 三重验证筛选 · 仅作参考

阶段 3构造 Skill

把每一条过关的知识,写成一个 Skill。核心、也是最难的一步,是设计触发条件——没有触发条件的 Skill,AI 员工在真实任务里根本认不出该什么时候调它。一个 Skill 至少要说清四件事:

举个 Luna 客群里的例子。一位做课程与服务的老师,把自己跑过很多遍的"咨询到报名"那套答疑话术,蒸馏成一个客户答疑 Skill,它的结构就是一条有边界的流水线:

客户答疑 Skill · 结构示意
触发:有人问"这门课适合我吗 / 和别的有什么区别"
输入:课程事实、常见异议清单、客户这句话
步骤:先判断客户卡在哪一步,再给对应回应
产出:一段可以直接发出去的答复草稿
边界:改价格、给承诺、谈退款 → 停下来,交回老师本人确认
构造 Skill
官方 WorkBuddy 蓝皮书配图 · 阶段 3 · 构造 Skill · 仅作参考

阶段 4链接:把 Skill 连成一张网

找出 Skill 之间的关系,让它们连成一张网,而不是一堆散件:

  • 依赖:A 要先用到 B 的产出,才能执行;
  • 对比:A 和 B 面对相似场景,但方向相反;
  • 组合:A 和 C 配着用,效果更好。

连成网之后,AI 员工遇到复杂问题时,能一次调出一组配合的 Skill,而不只是单个。

Skill 关系网络
官方 WorkBuddy 蓝皮书配图 · 阶段 4 · Skill 关系网络 · 仅作参考

阶段 5压力测试

  • 诱饵测试:故意喂它一个不该触发的场景,看这个 Skill 忍不忍得住、能不能不激活。一个没有边界的 Skill,在错的场景里被调出来,只会帮倒忙。
  • 执行验证:喂它一个真实问题,看它给的是能落地的步骤,还是又一段"正确的废话"。
压力测试
官方 WorkBuddy 蓝皮书配图 · 阶段 5 · 压力测试 · 仅作参考

蒸馏出来长什么样

一本书蒸馏完,产物是一套 Skill 集合,通常是这样一个文件夹:

蒸馏产物 · 目录结构
book-skill/
├── README.md          # 书目信息、蒸馏说明、适用场景
├── skills/
│   ├── skill-01.md    # 每个 Skill 一个独立文件
│   ├── skill-02.md
│   └── ...
├── index.md           # Skill 之间的关系网络(阶段 4 的产物)
└── tests/
    ├── skill-01-test.md   # 每个 Skill 的测试用例
    └── ...
蒸馏产物文件结构
官方 WorkBuddy 蓝皮书配图 · 蒸馏产物 · 文件结构 · 仅作参考

每个 Skill 文件里都含:触发条件、执行步骤、输出格式、边界限制、测试用例。测试用例写成标准格式后,产物还能被自动进化工具接着优化——不是一次性的死文件(这一点下面第 9 节会展开)。

Skill 文件内部结构
官方 WorkBuddy 蓝皮书配图 · 单个 Skill 文件的内部结构 · 仅作参考

它和 RAG 到底差在哪

这是用的人最常问的一句。一句话说清:RAG 解决"知识管理"——让你能查到书里有什么;知识蒸馏解决"知识运用"——让 AI 员工在对的时刻,主动拿出对的框架。当你根本不知道该问什么的时候,RAG 帮不了你。

维度RAG知识蒸馏(Skill)
本质检索——找出最相关的原文片段提炼——从原文里提取可执行的方法
使用前提你得先知道该问什么你描述问题,Skill 自己识别并激活
质量控制无——什么内容都能入库三重验证过滤,宁缺毋滥
调用方式被动等你查询主动匹配场景、主动触发
知识形态存原文(记住知识)提纯成执行步骤(运用知识)
边界控制诱饵测试确保不乱激活
资源消耗较重(要维护向量索引)较轻(几个 Skill 文件就行)

和 Karpathy "LLM 知识库" 的差别

有人会把它和 Andrej Karpathy 提的"LLM 知识库(LLM Wiki)"搞混。Karpathy 的思路是:把原始资料索引进目录,让 LLM 编译成一个 Wiki,再对 Wiki 做问答、把结果回填、持续增强。知识蒸馏的前两步(整书理解、并行提取)确实吸收了这个思想——先让 AI 深度读、结构化整理、建索引。差别在最后几步:

对比点LLM 知识库知识蒸馏
产物形态Wiki 条目(结构化知识库)Skill 集合(可执行单元)
使用方式用户主动去查AI 员工被触发后主动激活
解决问题知识管理知识运用

两种方案不冲突,只是目标不同:一个帮你存好、查到,一个帮 AI 在对的时刻用出来

视频也能蒸馏

视频和书的唯一区别是:得先把视频变成文字,再进同一套六阶段 SOP。整条流水线是这样:

视频蒸馏工作流
官方 WorkBuddy 蓝皮书配图 · 视频蒸馏工作流 · 仅作参考
  • 视频下载:yt-dlp 支持主流平台,输入链接就能下;视频号因平台限制,暂时没法自动化。
  • 音频转写:本地 Whisper 能用,但长视频慢(一小时的视频,本地转写要花掉将近一小时);量大、要批处理,建议用转写 API。
  • 多个视频合并蒸馏:同一主题的好几个视频可以合起来蒸馏,产出一套统一的 Skill,重复的原则会被自动去重合并,不会同一条被拆成好几个。

什么材料适合蒸馏

不是所有东西都值得蒸馏。方法论密度越高越划算,纯叙事、纯金句的越不划算:

材料类型适合程度说明
方法论密度高的书★★★★★框架清晰、原则能提,最适合
访谈 / 课程视频★★★★☆结构化程度高,适合
长视频 / 播客★★★☆☆能用,知识密度看内容
金句散文类★★☆☆☆方法论少,产物质量有限
小说 / 叙事文学★☆☆☆☆没有可提取的方法框架,不适合

一个前提:蒸馏前,最好自己先把原材料读 / 看过一遍。因为你得判断哪些方法是重点、在三重验证的边界情况上得由你拍板。读过之后再蒸馏,吸收率明显更高——蒸馏不是替代阅读,是读完之后把知识结构化的工具。

蒸馏出来的 Skill,还会自己进化

前面说过,每个 Skill 都自带测试用例。把这些测试用例写成标准格式后,产物就能交给自动进化工具:它会自动评估、改进、再测试,而且分数只升不降。

这意味着蒸馏出来的东西不是静态的——随着 AI 员工在真实任务里用出反馈,这套 Skill 可以持续自动优化,一点点逼近这本书的方法在你真实场景下的最佳用法。

蒸馏产物自动进化
官方 WorkBuddy 蓝皮书配图 · 蒸馏产物 · 自动进化 · 仅作参考

它有多耗资源、该配什么模型

蒸馏是个很吃算力(token)的活,主要耗在这几步:阶段 0 要把整本书读进上下文、阶段 1 五路并行、阶段 2 多轮推理做验证、阶段 5 跑多组测试。所以配模型时要分工:

  • 任务拆解、蒸馏协调:用推理能力强的模型当"包工头";
  • 并行提取、验证:可以用性价比高的模型干;
  • 长上下文那步:选原生支持长上下文的模型,别让整本书读到一半被截断。

至于具体要烧多少算力、跑多久,各家工具、各种材料差别很大。下面是工具方公开的参考量级(不是我们自己的实测数字,你实际跑的时候以你用的工具为准):

场景大致算力(token)大致耗时
蒸馏一本普通书数万至十余万30–90 分钟
蒸馏 26 集课程视频(约 4 小时)较高约 1 小时
蒸馏 4 个主题视频(约 80 分钟)中等约 40 分钟

— 以上量级引自工具方公开说明,供估算参考,非本白皮书实测。

蒸馏出来的 Skill,还能分享和复用

蒸馏产物有个很值钱的特点:它能直接分享、直接复用

  • 直接装来用:把仓库地址给 AI 员工,让它自动装上对应 Skill 就能用,不用自己重新蒸馏一遍;
  • 不重复造轮子:同一本书不需要每个人各蒸馏一遍,谁蒸馏好了开源出来,别人拿去就能用;
  • 接着往上长:一门课蒸馏出来的 Skill,可以再搭成一个"课程 AI 员工",供学员问答、陪练——这正好接到第 26 章,把它变成你网站上的陪学答疑入口。

四个常见误区

  • "AI 早训练过这本书,不用再蒸馏了。" 大众经典 AI 确实有记忆,但小众书、新书、时效性强的视频,它大概率没见过。更重要的是:蒸馏的价值在建立触发条件——让 AI 知道什么场景该调哪个框架,不只是"知道书里有什么"。
  • "蒸馏完就不用看书了。" 蒸馏是阅读的补充,不是替代。没读过就蒸馏,会在关键判断上缺背景、漏重点。
  • "AI 给了建议就能直接照做。" 就算 Skill 正确激活、给了能落地的步骤,方向对不对、能不能执行、效果好不好,仍然要人来判断。AI 给选项和分析,决策是你的责任。
  • "Skill 覆盖面越宽越好。" 触发条件铺太宽,会在不该用的场景被误触发,反而误导。三重验证和诱饵测试的意义,正是控制边界——宁可窄一点,也不要乱激活

一个真实的蒸馏场景

拿 Luna 客群里最常见的一类来说——一位做课程与服务的老师,手里有一门四五个小时、二十来集的录播课。过去这门课录完就躺在网盘里;现在把它整套喂进六阶段蒸馏,产出一套带触发条件的 Skill 集合:学员问到某个具体环节,对应的 Skill 自动激活,给出这门课里那一段真正的方法,而不是泛泛而谈。

这套产物再往前一步,就是第 26 章要讲的陪学答疑 AI 分身——课不再是一次性交付,而是变成一个会一直在线、越用越懂这门课的知识服务。

— 佐证:工具方公开的一个演示,把吴恩达约 4 小时、26 集的 AI 入门课整套蒸馏,产出约 25 个 Skill;因为是最新内容、AI 没训练过,蒸馏后能被直接调用——这类时效性材料,正是蒸馏最划算的地方。

蒸馏结果示例
官方 WorkBuddy 蓝皮书配图 · 蒸馏结果示例 · 仅作参考

它在整个技能体系里的位置

知识蒸馏只是"生产 Skill"的其中一条路。它和第 25 章要讲的"把自己的业务流程(SOP)封装成 Skill"是并行的两条线:

来源适合拿来做什么
从业务流程提炼(SOP → Skill)你自己的操作规范、重复性业务流程
从书 / 视频蒸馏(知识蒸馏)专家方法论、经典著作、高价值课程内容

两条线产出的格式一样,都是带触发条件的可执行 Skill,可以在同一个 AI 员工身上混着用。

完成检查

  • 材料在蒸馏前,我自己至少完整读 / 看过一遍;
  • 走完了六阶段:整片理解 → 五维度提取 → 三重验证 → 构造 → 链接 → 压力测试;
  • 每个 Skill 都写清了触发、步骤、输出、边界、测试用例;
  • 做过诱饵测试,确认它在不该触发的场景能忍住;
  • 没有把摘要冒充成可执行能力;
  • 产物存成了可以直接分享、下次直接调用并继续改进的 Skill 集合。