← 返回目录
ap5.1方法⏱ 约 10 分钟

评测集怎么建:从产品目标反推 50 条

没有评测集,就没有"变好了"——本章是全课的灵魂

🔎 最后验证 2026-08📚 来源:本节方法基于本课 AP2-AP4 的评测实践;数据引自各章实测🧰 Python
为什么学这个

你已经在前面几章零散地用过评测了:ap2.4 的 20 条分类样本、ap4.4 的 RAG 评测集、ap3.5 的字段级标注。

AP5 把它们收成一套制度。而制度的第一块砖是:你的评测集从哪来、该长什么样、多少条够用

先说结论,这是全课最重要的一句话:你的产品质量上限,等于你评测集的质量上限。评测集里没有的场景,你永远不知道自己在那里做得多差。

💡 打个比方

考驾照的路考路线,决定了教练教什么。路线里有侧方停车,学员就一定会练;路线里没有雨天驾驶,大部分人就不会——直到某天下雨。

评测集就是你产品的路考路线。你敢不敢让它包含"雨天",决定了你的产品上路后会不会翻车。

三个来源,按优先级

① 线上真实数据(最好,但上线后才有) 用户真实问过的问题、真实上传的文档、真实报错的样本。它的分布最诚实——你手造的样本永远比真实数据"干净"(5.6 讲怎么回流)。

② 业务专家提供(上线前的主力) 让最懂业务的人(客服主管、运营、你自己)列出:用户最常问的 20 个问题、最容易出错的 10 个场景、绝对不能答错的 5 件事

③ 你和 AI 一起造(补边界) 让 AI 帮你生成边界样本:混合意图、极短输入、反讽、脏数据、超长文本——AI 造边界样本很在行,因为这不需要业务知识

一套评测集该有的结构

智图软件的赞赏码
都看到这了,打个赏呗!
接下来 · ap5.2
规则评分:能用代码判的,先用代码判
继续读下一节 →