终检、交付与复盘:把它真的发出去
保留集分数、README 该写什么、以及这门课之后往哪走
最后一天。你的东西能跑、能扛、有仪表、有防线。剩下三件事:验、交、复盘。
验里最重要的是那 10 条保留集——你从第一天起就承诺不看的那一份。它的分数是你唯一能对外说的数字,因为其余所有分数你都对着优化过。
交的重点不是代码,是让别人能在五分钟内明白你做了什么、它有多好、以及它在什么情况下不行。
复盘的重点也不是"我学到了什么",而是把这两周撞到的坑,变成你下一个项目的清单。
论文答辩的三个问题永远是:你做了什么、你怎么证明它有效、它的局限是什么。
第三个问题答得好的人,通常是真的做过东西的人。这一节教你把第三个问题答好。
一、终检:三层验证
第一层:跑保留集
调优集(50 条): 18.2 / 20 ← 你对着它优化过,这个数有水分
保留集(10 条): 8.6 / 10 ← 从没看过,这个数才可信
两个分数都要报。如果保留集明显低于调优集(比如换算后差 15% 以上),说明你过拟合了——你的提示词记住了那 50 条,而不是学会了这个任务。
过拟合了怎么办:回头看你的提示词里有没有"为了修某一条样本而加的规则"。ap2.4 实测过:加边界规则不提分;如果你的提示词里有一堆这样的补丁,大概率就是在给评测集打补丁。
第二层:走 ap7.7 的 41 条清单
逐条过,打不了勾的写下风险。这一步通常会发现 3-5 个漏掉的东西——都是小事,但都是"上线后才发现会很难受"的小事。
第三层:找一个真人用一次
这一层最容易被跳过,但价值最高。
找一个没参与开发的人,给他一个链接,什么都不要解释,在旁边看他用:
| 观察 | 通常会暴露 |
|---|---|
| 他第一步做什么 | 你的引导是不是有效(ap8.3 的激活) |
| 他在哪里停顿 | 界面上缺什么说明 |
| 他输入了什么 | 你完全没想到的输入类型——直接补进评测集 |
| 他什么时候放弃 | 你的 aha 门槛在哪(ap8.3) |
别打断他,别解释,记下来就行。这半小时的信息量,通常超过你自己测两天。
二、交付:README 该写什么
五段就够,别写长:
# 项目名
## 它是什么
一句话:给它 X,它返回 Y。附一张截图或 30 秒的录屏。
## 它有多好 ← 大多数人不写这段,而这段才是专业性的体现
- 评测集 50 条,调优集得分 18.2/20,**保留集 8.6/10**
- 检索命中率 9/10(如果有 RAG)
- 幻觉率:引用核验通过 92%,拒答正确率 5/5
- P95 延迟 2.1s,单次成本 0.003 元
- 回归门禁已挂 CI:分数跌破基线自动拦截
## 它在什么情况下不行 ← 这段决定别人信不信你
- 输入超过 X 字时会截断
- 知识库更新有延迟,最新政策可能查不到
- 对 XX 类问题的准确率明显偏低(评测集里 3/8)
- 未做未成年人保护,不适合面向 C 端青少年
## 怎么跑起来
环境变量、依赖、启动命令。三行以内。
## 架构
一张图或五行文字:输入 → 审核 → 检索 → 调用 → 校验 → 输出。
第二段和第三段是这门课教出来的东西。大多数 AI 项目的 README 只有"它是什么"和"怎么跑",因为作者根本没有数据可写。
而"它在什么情况下不行"这一段,是最强的可信度信号——敢写局限的人,说明他真的测过。
三、复盘:把坑变成清单
别写"我学到了很多"这种复盘。写这三样:
① 三个"我以为会有用但没用"的改动。 本课实测了四次(ap2.4 加规则、ap2.5 加思考步骤、ap2.3 加到五个示例、ap5.5 那次更便宜但更差)。你自己的项目里也一定有——把它们写下来,这是最值钱的经验,因为它防止你下次再花时间。
② 三个"早知道就先做"的事。 通常是:早点建评测集、早点加成本流水、早点把配置抽出来。
③ 一份"下次开局第一天就做"的清单。 把 ① 和 ② 变成行动。这份清单才是你从这门课带走的最实在的东西。
四、这门课之后往哪走
你现在会的东西,可以按这个顺序继续深:
| 方向 | 从哪开始 | 和本课的关系 |
|---|---|---|
| 智能体 | 从 ap3.6/ap3.7 的工具循环,走到自主规划、多智能体协作 | ap3.7 的两道刹车会不够用——自主规划意味着步数和路径都不可预测,ap6.2 的权限收敛在这里变成生死问题 |
| 更强的检索 | 向量库、混合检索、图检索 | AP4 的评测方法完全适用,只是换实现 |
| 微调 / 小模型自部署 | 用你积累的评测集和线上数据 | AP5 的评测集就是微调的起点;成本结构会完全改变(ap8.1) |
| 多模态 | 图像、语音、文档版面 | 评测更难标注,ap5.4 的三把尺子要重新设计 |
| 规模化工程 | 队列、异步、多租户、观测体系 | AP7 的每一节都会变重十倍 |
但更实际的建议是:先让你的毕业项目有第一个真实用户。
一个有 10 个真实用户的小工具,教给你的东西比再学三个方向都多——因为真实用户会给你你想不到的输入、想不到的期待、想不到的失败(ap5.6 的回流)。这门课的所有方法,都是为了消化这些"想不到"而存在的。
🔧 动手做:完成交付(60 分钟)
- 跑保留集,记下分数。和调优集对比,判断有没有过拟合。
- 走 ap7.7 的 41 条清单,逐条打勾,打不了勾的写风险。
- 找一个真人用一次,不解释、不打断,记下他的每一次停顿和每一个意外输入。
- 把意外输入补进评测集(ap5.6),重跑一次,看分数变没变。
- 写 README 五段,"它有多好"和"它在什么情况下不行"必须有数据。
- 写复盘三样:三个白改的改动、三个早知道、一份下次的开局清单。
- 发出去。发给同事、发到社群、发到你的社交账号——发出去这个动作本身,会让你用完全不同的标准回看它。
✅ 做到这里你应该有:保留集分数 + 打过勾的清单 + 一次真人观察记录 + 一份带数据的 README + 一份复盘清单 + 一个别人能打开的链接。
为什么:🎉 全课完结。
回头看这 54 节,它教的其实只有一件事:怎么让"我觉得"变成"我测过"。
- 提示词好不好?跑评测集(AP2)
- 输出可靠吗?跑校验器(AP3)
- 回答有依据吗?核引用(AP4)
- 这次改动有用吗?过门禁(AP5)
- 挡得住攻击吗?打自己一遍(AP6)
- 用户体验好吗?看 P95 和 business_ok(AP7)
- 这生意成立吗?算单位经济模型(AP8)
每一章的答案都是一个数字,而不是一个观点。这是"专业版"三个字的全部含义,也是你和大多数做 AI 应用的人之间,真正的差距所在。
现在,去把它发出去。
最后一天最常见的心理是:"再改改提示词分数还能上去一点"、"UI 太丑了再调一天"。
三条判断:
① 分数还能不能显著提升?用 ap2.5 的噪声地板判断——如果最近三次改动的提升都在噪声内,那你已经到平台期了,继续调是浪费。
② 丑不丑影响的是什么?如果影响的是"用户看不懂怎么用",那要改;如果只是"我觉得不好看",不改——ap8.3 说过,决定留存的是第一次体验成不成功,不是好不好看。
③ 你在怕什么?多数时候拖延不是因为产品不够好,是怕被评价。但这门课的整个方法论就是为了这一刻服务的:你有保留集分数、有门禁、有监控、有降级、有清单——你比 90% 发出去的 AI 产品准备得都充分。
发出去,然后用 ap5.6 的回流机制让它变好。真实用户两天给你的信息,比你自己再调两周都多。
这是我的毕业项目:【贴 README 草稿或项目描述】。评测数据:调优集【X/Y】、保留集【X/Y】、P95【X】ms、单次成本【X】元。请帮我:1) 判断我是否过拟合(两个分数的差距是否正常),如果是,指出可能的原因;2) 按本课 ap7.7 的 41 条清单帮我逐条核对,列出我描述中缺失的项;3) 帮我写「它在什么情况下不行」这一段(基于我给的数据,不要编);4) review 我的 README 五段结构,指出哪里说得不够具体;5) 给我三个「第一批用户」的获取渠道建议,以及该向他们问的三个问题。
终检三层:跑保留集(唯一可信的分数)、走 41 条清单、找一个真人用一次(信息量最高的半小时)。
交付五段:它是什么、它有多好(带数据)、它在什么情况下不行(可信度的来源)、怎么跑、架构。
复盘三样:三个白改的改动、三个早知道、一份下次开局清单。
🎉 AI 应用开发·专业版,54 节全部完结。
这门课只教了一件事:把"我觉得"换成"我测过"。剩下的,是你自己的产品了——现在,去把它发出去。
🔎 来源与核验· 1 条,点开核对
