← 返回目录
ap9.3方法⏱ 约 12 分钟

终检、交付与复盘:把它真的发出去

保留集分数、README 该写什么、以及这门课之后往哪走

🔎 最后验证 2026-08📚 来源:本节整合本课 AP0-AP9 的全部交付要求
为什么学这个

最后一天。你的东西能跑、能扛、有仪表、有防线。剩下三件事:验、交、复盘。

里最重要的是那 10 条保留集——你从第一天起就承诺不看的那一份。它的分数是你唯一能对外说的数字,因为其余所有分数你都对着优化过

的重点不是代码,是让别人能在五分钟内明白你做了什么、它有多好、以及它在什么情况下不行

复盘的重点也不是"我学到了什么",而是把这两周撞到的坑,变成你下一个项目的清单

💡 打个比方

论文答辩的三个问题永远是:你做了什么、你怎么证明它有效、它的局限是什么。

第三个问题答得好的人,通常是真的做过东西的人。这一节教你把第三个问题答好。

一、终检:三层验证

第一层:跑保留集

调优集(50 条):    18.2 / 20     ← 你对着它优化过,这个数有水分
保留集(10 条):     8.6 / 10     ← 从没看过,这个数才可信

两个分数都要报。如果保留集明显低于调优集(比如换算后差 15% 以上),说明你过拟合了——你的提示词记住了那 50 条,而不是学会了这个任务。

过拟合了怎么办:回头看你的提示词里有没有"为了修某一条样本而加的规则"。ap2.4 实测过:加边界规则不提分;如果你的提示词里有一堆这样的补丁,大概率就是在给评测集打补丁

第二层:走 ap7.7 的 41 条清单

逐条过,打不了勾的写下风险。这一步通常会发现 3-5 个漏掉的东西——都是小事,但都是"上线后才发现会很难受"的小事

第三层:找一个真人用一次

这一层最容易被跳过,但价值最高。

找一个没参与开发的人,给他一个链接,什么都不要解释,在旁边看他用:

观察通常会暴露
他第一步做什么你的引导是不是有效(ap8.3 的激活)
他在哪里停顿界面上缺什么说明
他输入了什么你完全没想到的输入类型——直接补进评测集
他什么时候放弃你的 aha 门槛在哪(ap8.3)

别打断他,别解释,记下来就行。这半小时的信息量,通常超过你自己测两天。

二、交付:README 该写什么

五段就够,别写长:

# 项目名

## 它是什么
一句话:给它 X,它返回 Y。附一张截图或 30 秒的录屏。

## 它有多好          ← 大多数人不写这段,而这段才是专业性的体现
- 评测集 50 条,调优集得分 18.2/20,**保留集 8.6/10**
- 检索命中率 9/10(如果有 RAG)
- 幻觉率:引用核验通过 92%,拒答正确率 5/5
- P95 延迟 2.1s,单次成本 0.003 元
- 回归门禁已挂 CI:分数跌破基线自动拦截

## 它在什么情况下不行   ← 这段决定别人信不信你
- 输入超过 X 字时会截断
- 知识库更新有延迟,最新政策可能查不到
- 对 XX 类问题的准确率明显偏低(评测集里 3/8)
- 未做未成年人保护,不适合面向 C 端青少年

## 怎么跑起来
环境变量、依赖、启动命令。三行以内。

## 架构
一张图或五行文字:输入 → 审核 → 检索 → 调用 → 校验 → 输出。

第二段和第三段是这门课教出来的东西。大多数 AI 项目的 README 只有"它是什么"和"怎么跑",因为作者根本没有数据可写

而"它在什么情况下不行"这一段,是最强的可信度信号——敢写局限的人,说明他真的测过。

三、复盘:把坑变成清单

别写"我学到了很多"这种复盘。写这三样:

① 三个"我以为会有用但没用"的改动。 本课实测了四次(ap2.4 加规则、ap2.5 加思考步骤、ap2.3 加到五个示例、ap5.5 那次更便宜但更差)。你自己的项目里也一定有——把它们写下来,这是最值钱的经验,因为它防止你下次再花时间。

② 三个"早知道就先做"的事。 通常是:早点建评测集、早点加成本流水、早点把配置抽出来。

③ 一份"下次开局第一天就做"的清单。 把 ① 和 ② 变成行动。这份清单才是你从这门课带走的最实在的东西。

四、这门课之后往哪走

你现在会的东西,可以按这个顺序继续深:

方向从哪开始和本课的关系
智能体从 ap3.6/ap3.7 的工具循环,走到自主规划、多智能体协作ap3.7 的两道刹车会不够用——自主规划意味着步数和路径都不可预测,ap6.2 的权限收敛在这里变成生死问题
更强的检索向量库、混合检索、图检索AP4 的评测方法完全适用,只是换实现
微调 / 小模型自部署用你积累的评测集和线上数据AP5 的评测集就是微调的起点;成本结构会完全改变(ap8.1)
多模态图像、语音、文档版面评测更难标注,ap5.4 的三把尺子要重新设计
规模化工程队列、异步、多租户、观测体系AP7 的每一节都会变重十倍

但更实际的建议是:先让你的毕业项目有第一个真实用户。

一个有 10 个真实用户的小工具,教给你的东西比再学三个方向都多——因为真实用户会给你你想不到的输入、想不到的期待、想不到的失败(ap5.6 的回流)。这门课的所有方法,都是为了消化这些"想不到"而存在的。

🔧 动手做:完成交付(60 分钟)

  1. 跑保留集,记下分数。和调优集对比,判断有没有过拟合。
  2. 走 ap7.7 的 41 条清单,逐条打勾,打不了勾的写风险
  3. 找一个真人用一次,不解释、不打断,记下他的每一次停顿和每一个意外输入。
  4. 把意外输入补进评测集(ap5.6),重跑一次,看分数变没变。
  5. 写 README 五段,"它有多好"和"它在什么情况下不行"必须有数据
  6. 写复盘三样:三个白改的改动、三个早知道、一份下次的开局清单。
  7. 发出去。发给同事、发到社群、发到你的社交账号——发出去这个动作本身,会让你用完全不同的标准回看它。

做到这里你应该有:保留集分数 + 打过勾的清单 + 一次真人观察记录 + 一份带数据的 README + 一份复盘清单 + 一个别人能打开的链接

为什么:🎉 全课完结。

回头看这 54 节,它教的其实只有一件事:怎么让"我觉得"变成"我测过"。

  • 提示词好不好?跑评测集(AP2)
  • 输出可靠吗?跑校验器(AP3)
  • 回答有依据吗?核引用(AP4)
  • 这次改动有用吗?过门禁(AP5)
  • 挡得住攻击吗?打自己一遍(AP6)
  • 用户体验好吗?看 P95 和 business_ok(AP7)
  • 这生意成立吗?算单位经济模型(AP8)

每一章的答案都是一个数字,而不是一个观点。这是"专业版"三个字的全部含义,也是你和大多数做 AI 应用的人之间,真正的差距所在。

现在,去把它发出去。

❓ 测验
README 里为什么要专门写一段「它在什么情况下不行」?
⚠️ 避坑别在「再优化一点」里无限期地拖着不发

最后一天最常见的心理是:"再改改提示词分数还能上去一点"、"UI 太丑了再调一天"。

三条判断:

① 分数还能不能显著提升?用 ap2.5 的噪声地板判断——如果最近三次改动的提升都在噪声内,那你已经到平台期了,继续调是浪费。

② 丑不丑影响的是什么?如果影响的是"用户看不懂怎么用",那要改;如果只是"我觉得不好看",不改——ap8.3 说过,决定留存的是第一次体验成不成功,不是好不好看

③ 你在怕什么?多数时候拖延不是因为产品不够好,是怕被评价。但这门课的整个方法论就是为了这一刻服务的:你有保留集分数、有门禁、有监控、有降级、有清单——你比 90% 发出去的 AI 产品准备得都充分。

发出去,然后用 ap5.6 的回流机制让它变好。真实用户两天给你的信息,比你自己再调两周都多。

🤖 让 AI 帮你做交付终检
这是我的毕业项目:【贴 README 草稿或项目描述】。评测数据:调优集【X/Y】、保留集【X/Y】、P95【X】ms、单次成本【X】元。请帮我:1) 判断我是否过拟合(两个分数的差距是否正常),如果是,指出可能的原因;2) 按本课 ap7.7 的 41 条清单帮我逐条核对,列出我描述中缺失的项;3) 帮我写「它在什么情况下不行」这一段(基于我给的数据,不要编);4) review 我的 README 五段结构,指出哪里说得不够具体;5) 给我三个「第一批用户」的获取渠道建议,以及该向他们问的三个问题。
✅ 小结

终检三层:跑保留集(唯一可信的分数)、走 41 条清单、找一个真人用一次(信息量最高的半小时)

交付五段:它是什么、它有多好(带数据)、它在什么情况下不行(可信度的来源)、怎么跑、架构

复盘三样:三个白改的改动、三个早知道、一份下次开局清单

🎉 AI 应用开发·专业版,54 节全部完结。

这门课只教了一件事:把"我觉得"换成"我测过"。剩下的,是你自己的产品了——现在,去把它发出去。

下一节 → 全课完结
🔎 来源与核验· 1 条,点开核对
本节每个关键论断都对应一个可追溯的来源 —— 这是本课程"靠谱、不过时"的底线。
「终检与交付要求整合自本课全部章节:ap5.1 保留集、ap5.5 门禁、ap7.7 41 条清单、ap8.3 首次体验对留存的影响、ap5.6 线上回流」
📚 本课 AP1-AP8 汇总✓ 已核验 2026-08
智图软件的赞赏码
都看到这了,打个赏呗!