← 返回目录
ap5.4方法⏱ 约 10 分钟

幻觉率测量:把最难量的东西量出来

三把尺子——引用核验、拒答率、抽样人工标注

🔎 最后验证 2026-08📚 来源:本节方法基于 ap4.1 幻觉基线与 ap4.6 引用核验的实测结果🧰 Python、DeepSeek API
为什么学这个

准确率好量:有标准答案,对比就行。幻觉难量,因为它的定义是"说了资料里没有的东西"——你得先知道"资料里有什么"。

ap4.6 给了我们第一把尺子:引用核验(答案里的数字,在被引用的原文里找得到吗)。这一节把它扩成一套三把尺子的测量体系,让"幻觉率"从一个吓人的词,变成你仪表盘上的一个数字。

💡 打个比方

食品安全检测有三个层次:看标签(声称的成分)、查配料表(有没有对应)、送检化验(抽样实测)。

幻觉测量同理:看引用(有没有标出处)、核对原文(引用支不支撑答案)、人工抽检(最终真相)。三层各有成本和精度。

尺子一:引用核验(自动、便宜、可全量)

来自 ap4.6,核心是三级检查:

def check_hallucination(answer, cited_chunks):
    cites = re.findall(r'\[(C\d+)\]', answer)
    if not cites:
                             
     (c   cited_chunks  c  cites):
                           
    nums = extract_facts(answer)           
    src = .join(cited_chunks[c]  c  cites)
    unsupported = [n  n  nums   appears_in(n, src)]
       unsupported  
智图软件的赞赏码
都看到这了,打个赏呗!
接下来 · ap5.5
回归门禁:分数跌了,不许上线
继续读下一节 →