
RAG答对一次还不够:把检索失败和幻觉分开测

评估RAG系统,应把检索器和生成器分开测:先看回答所需的证据是否被找到、相关片段是否排在前面,再看答案是否回应问题、其中的事实是否得到实际检索上下文支持。Ragas原始论文将检索相关上下文、忠实使用上下文和生成质量列为不同评估维度。一次答对只能说明那次输出可用,无法显示系统是否稳定地找到了依据。
可执行的起点是从真实问题中选出30至50道,建立一份小型离线黄金集。为每题标注预期事实和知识库证据;每次运行分别保存检索片段及其顺序、实际送入模型的上下文和最终答案。再用上下文精确率、上下文召回率、答案相关性和忠实度定位退步,结合逐题人工复核决定是否放行。这个题量是便于启动的编辑建议,并非具有通用统计保证的样本规模。
黄金集要同时保存预期证据和运行结果
选题应保留用户真实的中文问法,覆盖简称、同义表达、跨文档提问、带有适用条件的问题,以及知识库确实无法回答的问题。只收集答案很短的常识题,会漏掉企业问答中更棘手的版本、权限和例外条件。样本有限时,失败类型的覆盖比题目数量整齐更有价值。
每条黄金样本至少记录问题、答案不可缺少的事实、支持这些事实的文档或片段标识,以及允许拒答的条件。证据要对应明确的知识库版本:同一政策若已修订,旧片段可能与新答案文字相似,却不再适用。参考答案允许不同的自然表述,标注重点应是事实、条件和出处,而不是固定措辞。
运行记录与黄金标注分开存放。除了检索返回的片段和排序,还要保存过滤后的结果、真正送入生成器的上下文、最终答案及系统配置。这样,错答出现时才能分清正确资料从未被检到、检到后未进入上下文,还是模型拿到证据仍生成了无依据内容。对预期拒答的问题,同样保留检索结果,以便发现系统是否把相似但不适用的资料当成依据。
四项指标分别指向什么故障
Ragas指标目录列出了上下文精确率、上下文召回率、答案相关性和忠实度等评估项。它们适合作为并列的诊断结果;合成一个总分后,检索退步可能被答案表面的改善掩盖。比较版本时,还须固定所用指标的具体实现和评判器配置。
- 上下文召回率检查回答所需的信息是否进入检索结果。采用参考答案的评估实现,会逐项判断参考答案中的事实能否从检索上下文得到支持;它需要一份可靠的参考答案。低分时,先确认黄金证据存在于本次知识库,再检查索引、切片、查询改写和过滤条件。
- 上下文精确率关注相关片段在返回顺序中是否靠前。旧版本、相似标题或只共享关键词的片段排在前列,会挤占留给有效证据的位置。这项指标涉及相关性及排序,不能简单理解为“有用片段占全部片段的比例”。
- 答案相关性检查回答是否切中用户所问。模型可能忠实复述一段资料,却遗漏提问中的对象、期限或例外。相关性高也不代表事实正确,因此要与证据核对结合使用。
- 忠实度检查答案中的事实性陈述能否从实际提供给模型的上下文推得。流畅、切题,甚至碰巧符合外部常识的回答,都可能在这项检查中暴露无依据陈述;上下文本身若过期,还要另按黄金证据核实其适用性。
指标名称相同,评估实现也可能不同。有的上下文精确率实现拿检索片段与参考答案比较,有的拿它与生成答案比较;后一种做法可能忽略答案本身漏掉的必要事实。因此,黄金集中独立标注预期事实和证据,比分数单独存档更能支持事后归因。
从指标组合追到具体故障
Microsoft的RAG评估文档将检索质量归入过程评估,将回答的依据性和相关性归入系统评估;在有相关文档标注时,还可以直接比较检索结果与标注。逐题分析也应沿这条链路进行,先确认证据到达了哪里,再判断答案怎样使用证据。
召回不足时,查看正确文档是否入库、关键条件是否被切片截断,以及检索范围或过滤器是否将其排除。如果所需证据已返回,但无关片段持续排在它前面,就重点检查排序、版本过滤和片段粒度。两种情况都发生在生成之前;修改提示词可能改变个别回答,却不会补回未送入模型的证据。
证据完整而忠实度低时,应指出答案里具体哪项陈述找不到支持,再检查生成指令、引用约束和拒答行为。忠实度高而答案相关性低时,则要看模型是否依据资料回答了另一个问题。举一个条件示例:用户问某流程适用于谁,系统检到了完整规则,答案却只复述办理步骤。这里主要是回答遗漏;若检索片段本就缺少适用对象,则故障仍须追溯到检索或知识库。
尤其要分清“无依据”与“事实错误”。忠实度衡量的是答案与所给上下文的一致程度;如果上下文包含过期规定,模型忠实复述仍会产生不适用的回答。黄金集中的版本信息和人工核对承担这一步判断,不能让自动裁判的高分替代它。
用逐题回归设置发布门槛
比较版本时,固定问题集、知识库快照、黄金标注和评判配置,并保存检索参数、提示词与生成模型版本。若同时改变知识库内容、检索器和模型,即使分数上升,也难以确认改进来自哪一环。对输出有波动的系统,可以重复运行同一版本并保存每题结果,观察失败是否反复出现。
门槛应从当前系统和业务风险出发,而不是套用统一的漂亮阈值。例如,可以规定原本能检到必要证据的关键题不能丢失证据;涉及适用范围或资格条件的回答一旦新增无依据陈述,就进入发布前复核。措辞不够精练与错误适用条件应分别记录严重度,不能用同一种平均分变化抵消。
回归报告同时保留四项指标、有效样本数和新增失败题清单。整体均值上升时,仍要检查拒答题、跨文档题等小类是否退步。新增问题可以进入下一版黄金集;比较新旧系统时,先报告固定题集上的变化,再单列新增题的表现,避免题库变化被误认作模型进步。
人工复核校准自动评分
自动评分适合筛出可疑样本,人工抽查则负责裁定关键失败。优先看新出现的低分题、指标相互冲突的题、答案看似正确却缺少检索依据的题,以及影响业务条件的回答。复核者需要同时看到原问题、黄金证据、实际检索片段和最终答案,才能判断是漏检、噪声靠前、答非所问、无依据陈述,还是原标注有误。
人工与评判器意见不一致时,先核对证据和标注,再调整可复现的评判规则,并在同一批样本上重跑。发布记录应保存逐题变化、人工裁决和门槛例外。这样,下一次回归出现时,团队仍能追溯它来自检索覆盖、排序噪声,还是生成器使用证据的方式。
相关阅读:
相关文章
订阅我们的新闻通讯
将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。




