ap5.4方法⏱ 约 10 分钟
幻觉率测量:把最难量的东西量出来
三把尺子——引用核验、拒答率、抽样人工标注
🔎 最后验证 2026-08📚 来源:本节方法基于 ap4.1 幻觉基线与 ap4.6 引用核验的实测结果🧰 Python、DeepSeek API
为什么学这个
准确率好量:有标准答案,对比就行。幻觉难量,因为它的定义是"说了资料里没有的东西"——你得先知道"资料里有什么"。
ap4.6 给了我们第一把尺子:引用核验(答案里的数字,在被引用的原文里找得到吗)。这一节把它扩成一套三把尺子的测量体系,让"幻觉率"从一个吓人的词,变成你仪表盘上的一个数字。
💡 打个比方
食品安全检测有三个层次:看标签(声称的成分)、查配料表(有没有对应)、送检化验(抽样实测)。
幻觉测量同理:看引用(有没有标出处)、核对原文(引用支不支撑答案)、人工抽检(最终真相)。三层各有成本和精度。
尺子一:引用核验(自动、便宜、可全量)
来自 ap4.6,核心是三级检查:
def check_hallucination(answer, cited_chunks):
cites = re.findall(r'\[(C\d+)\]', answer)
if not cites:
(c cited_chunks c cites):
nums = extract_facts(answer)
src = .join(cited_chunks[c] c cites)
unsupported = [n n nums appears_in(n, src)]
unsupported

都看到这了,打个赏呗!
接下来 · ap5.5
回归门禁:分数跌了,不许上线
继续读下一节 →