ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

大模型幻觉评估实战:忠实性、事实性及IAG框架解析

大模型幻觉评估实战:忠实性、事实性及IAG框架解析 1. 项目背景为什么现在要死磕大模型幻觉评估过去一年多我一直在做大模型应用的评测和落地。坦白说模型能力迭代的速度远超预期但有一个问题始终绕不开就是幻觉。无论你用的是开源模型还是闭源API无论参数规模是7B还是70B幻觉都像影子一样跟着你。尤其在做知识库问答、法律文书摘要、医疗咨询这类高敏感场景时一句看似流畅的胡编乱造足以让整个项目信誉崩塌。业界对幻觉的定义大同小异模型生成了看似合理、语法通顺、但事实上有误或没有依据的内容。问题是光知道“有幻觉”没用你得能量化它、评估它、定位它。这就引出了今天要聊的核心——**忠实性Faithfulness和事实性Factuality**这两个评估维度。很多刚接触大模型评测的朋友会把它们混为一谈实际上它们在评估对象、判定逻辑、适用场景上都有明显差异搞不清楚这两个概念评测体系建出来就是歪的。这篇文章会从概念本源讲到具体评测方法再给出一套可落地的实操方案配合IAG信息对齐粒度这类前沿评估框架的拆解最后附上我在真实项目中踩过的坑。无论你是做RAG应用的工程师、大模型产品经理还是刚入门想系统了解幻觉评估的研究生这篇文章都能给你一个相对完整的地图。2. 幻觉评估的两个核心维度忠实性Faithfulness与事实性Factuality2.1 先理解幻觉的本质模型在“编”还是在“错”在深挖评估方法之前得先搞清楚幻觉到底从哪来。大模型本质上是一个概率语言模型它的训练目标是“根据上文预测下一个最可能出现的词”。这意味着模型内部存储的是海量文本中的统计规律而不是一个结构化的“世界知识库”。当模型不确定答案时它会用流畅的表达来“掩盖”不确定性这就是幻觉的温床。幻觉按成因分成两类内在幻觉和外在幻觉。内在幻觉指模型生成的答案与输入上下文比如用户提供的文档、对话历史矛盾外在幻觉指模型生成的答案与客观事实或世界知识不符但这种矛盾在输入上下文中看不出来。这个分类直接对应了我们说的两个评估维度忠实性管“内在”事实性管“外在”。我打个比方。忠实性像考试中的“材料作文”阅卷老师只关心你有没有跑题、有没有曲解给定材料的意思事实性像“百科知识竞答”你答得再流畅答案本身错了就是错了。内容安全也是一样的逻辑——做评测前先想清楚你的业务更怕“跑题”还是更怕“知识错误”这决定了评估体系的优先级。2.2 忠实性输出是否“忠于”输入忠实性评估的核心命题是模型生成的回答是否忠于给定的上下文不包含上下文里没有的信息或与上下文相矛盾的信息。在RAG检索增强生成系统里忠实性聚焦的是模型有没有忠实于检索到的文档片段。如果文档里明明没写“该产品支持蓝牙5.3”模型却一本正经地告诉你支持那这就是忠实性问题。忠实性评估的好坏直接决定RAG系统能不能用。我见过不少RAG项目召回率做到90%以上但生成环节把多篇文档的信息张冠李戴最后答非所问。这就是典型的忠实性失败。评估忠实性时我们需要逐句判断模型生成的每个陈述能否从参考文档中找到直接对应或合理推断的证据。注意这里有个尺度问题忠实不等于一字不差的复述合理的引申、概括、同义改写都算忠实但无中生有、错误拼接、因果关系颠倒都是不忠实的表现。2.3 事实性输出是否与“世界”一致事实性评估则跳出了上下文去衡量模型输出与真实世界知识的吻合程度。模型也许没有歪曲你提供的文档但它告诉你的“事实”本身是错的比如把“《红楼梦》的作者”说成“吴承恩”或声称“珠穆朗玛峰高度为8848.86米”时把数字搞错——这类错误在上下文中没有对照物只能靠外部知识源来校验。这就给评估出了个难题事实性没有一个绝对的标准答案。同一个问题的正确答案会随时间的推移而变化比如国家人口数据、公司CEO人选。在具体操作中事实性评估通常依赖高质量的知识库、权威数据源或经过验证的常识。如果你的应用领域是医疗、金融、法律事实性评估的数据源必须做到权威、及时、可追溯否则模型输出的“事实”本身就是过时的你怎么评都不准。2.4 两个维度之间的关系一本正经地胡说八道到底是哪种问题很多刚入行的朋友会问既然两者都关注“错误”区分它们的意义在哪我先说结论——只有正确区分了这两个维度你才能找到幻觉的“病根”对症下药。举个例子。用户问“苹果公司2023年的营收是多少”模型回答“根据公开财报苹果公司2023财年总营收为3832.85亿美元”。如果参考文档里写的确实是这个数字那么模型在忠实性上是合格的但如果实际财报是3943.28亿美元2023财年实际数字那这就是一个事实性错误。反过来如果参考文档写的是“苹果公司2022财年总营收”模型却把它说成2023年的那即便是数字真实存在也构成了忠实性错误。所以忠实性错误往往是“有中生错”搬错信息、张冠李戴事实性错误往往是“无中生有”编造信息或“知识过时”。实际评测中两种错误经常是共存的比如一个完全靠编造的答案既不符合上下文不忠实也不符合事实不真实。但在定位问题时你必须要能分辨错误的主要来源是RAG链路里检索到的上下文与问题无关导致模型强行生成还是模型本身知识库的陈旧导致“一本正经地胡说八道”定位不准优化方向就会错项目白干半个月。对比维度忠实性Faithfulness事实性Factuality核心问题输出是否忠于输入上下文输出是否与客观事实一致判断依据参考文档、对话历史、检索片段外部知识库、权威数据源、世界常识错误类型上下文矛盾、无中生有、信息错位事实错误、知识过时、数字偏差适用场景RAG问答、摘要生成、对话系统开放问答、常识推理、知识密集型任务常见评估方法NLI蕴含判断、指标计算、LLM裁判知识库检索比对、事实抽取验证、人工核对这个表格建议收藏后续做评测方案时可以直接对照。3. 主流的幻觉评估方法从人工到自动化3.1 人工评估最准但贵到用不起人工评估是大模型幻觉评测的“金标准”操作方式很直观标注人员阅读模型输出对照参考文档或权威知识源逐句标注输出是否忠实、是否事实正确。这种方法准确率高能捕捉到非常细微的语义偏差但问题也显而易见——成本极高速度极慢且标注员之间的主观差异很大。我在一个医疗问答项目里做过尝试三位标注员对同样的100条模型输出做事实性标注一致性只有72%远低于学术研究要求的80%以上。分歧主要出在“知识边界”的把握上有些医学常识标注员A认为是常识标注员B认为必须查证。所以如果业务场景对准确性要求极高且预算充足人工评估可以做但只建议作为抽检手段不适用于大规模、持续性的评测流程。3.2 基于规则的评估快但只能抓皮毛基于规则的方法本质是“硬匹配”通过计算模型输出与参考文档之间的词元重叠率、编辑距离、ROUGE/BLEU等指标来判断忠实性。这类方法速度快、可复现性好但致命弱点是它只能识别表面词汇的重合无法理解语义。举个例子“公司去年营收增长显著”和“公司去年的营收大幅提升”在语义上几乎等价但词元重叠率可能只有60%。反过来“小明不喜欢苹果”和“小明不喜欢吃苹果”词面上很接近意思却大不相同。基于规则的方法在这种情形下几乎失灵。所以在实际项目中我只会把ROUGE-L、BLEU这类指标作为快速筛选工具先粗筛一遍明显不忠实的输出再交给更精细的语义判断模型。3.3 基于NLI自然语言推理的评估结构化的语义判断目前最稳NLINatural Language Inference评估是目前学术界和工业界用得最广泛、也相对靠谱的自动化方法。它的核心思路把“评估忠实性”转化成“判断前提premise和假设hypothesis之间的蕴含关系”。具体来说将参考文档作为前提将模型生成的每个陈述句作为假设用一个NLI模型判断假设是被前提蕴含entailment、矛盾contradiction还是中性neutral。如果模型生成的句子被NLI模型判定为“矛盾”或“中性”那它就是不忠实的。这里我多说一句NLI之所以比规则方法好用是因为它引入了推理能力。这几年像TRUE、ANLI、MNLI这些数据集上训练出来的NLI模型已经能处理大量改写、指代消解、逻辑推断等复杂语言学现象。在实操中有两类NLI模型用的比较多一类是专门的蕴含分类模型如基于DeBERTa微调的NLI模型另一类是用大模型做“定性裁判”让LLM判断两个句子之间是蕴含、矛盾还是无关。前者速度快、成本低适合批量处理后者更灵活能给出更细粒度的解释。3.4 基于大模型裁判LLM-as-a-Judge的评估灵活且解释性强用大模型来做幻觉评估是最近一年最火的思路我几乎每天都在用。做法很简单把“模型生成的回答”“参考文档”和“评估指令”一起扔给一个强LLM如Claude、GPT-4让它逐条判断回答中的每个陈述是否可以在参考文档中找到依据、是否与事实相符并输出判断理由。输出格式可以设计成结构化JSON方便程序化解析。大模型裁判的好处是理解力强、能适应复杂语义场景、还能给出“为什么错”的解释。但它有个绕不开的问题是裁判本身的可靠性。我自己实测过用GPT-4当裁判评估一个垂直领域的摘要它会把一些专业术语的同义改写误判为不忠实。所以我会在指令里加入详细的评估标准、范例和“不确定就标中性”的兜底策略。另外大模型裁判也有位置偏见倾向选择靠前或靠后的答案在做A/B对比时要注意打乱顺序。3.5 基于知识库的事实性评估不可跳过的垂直领域利器如果说上面几种方法主要解决“忠实性”那事实性评估就绕不开外部知识库。在开放问答场景中想判断模型说的“事实”对不对最可靠的方式是与可信数据源做比对。垂直领域做事实性评估的常见做法是三步走第一步从模型输出中抽取“事实三元组”主体-关系-客体比如珠穆朗玛峰高度8848.86米第二步将三元组与知识库中对应的实体关系做匹配比对第三步通过相似度计算或规则判断三元组是否与知识库一致。这套流程工程上并不难难的是知识库的搭建和维护。举个我做过的法律问答项目案例我们自建了一个包含最新法规条文、司法解释、指导案例的法律知识库每篇文档都带时间戳和效力等级。事实性评估时模型说“根据《民法典》第XXX条”必须能从知识库中精确检索到对应条款并且条款内容一字不差。凡是有出入的直接判为事实性错误。这个过程后来还发现了一个“版本坑”——模型是从旧版法律条文里学的知识而知识库里已经是修订后版本导致大量误导性输出。这也说明事实性评估中的“数据新鲜度”是极其容易被忽视的环节。4. 实操案例我用IAG框架做了一次完整的幻觉评估4.1 IAG框架是什么为什么它比经典指标更贴近业务IAG全称是Information Alignment Granularity信息对齐粒度它是我最近在做的项目里用到的一个评估大模型幻觉的框架。它和经典评估指标最大的区别在于IAG引入了“语义片段”这一中间粒度先对齐句子中的关键信息单元比如命名实体、关系短语、数值再做一致性判断。传统ROUGE只看词元重叠NLI只能做到句子级判断而IAG做到了片段级对齐既能识别词元层面漏掉的语义等价情况又能细粒度定位到是哪一段信息出错了。这对于做幻觉归因特别有用。假设模型回答“小明在北京大学获得了计算机科学博士学位”但参考文档只写了“小明在北大读博”IAG框架会识别出“计算机科学”这个片段无法从文档中推导出来判定为“信息添加”从而标记为不忠实。而传统NLI很可能因为句子整体语义相近而误判为“蕴含”。4.2 具体实操步骤从数据准备到指标计算为了让你能直接复现我给出一个简化版的IAG幻觉检测实操流程。第一步准备数据。从实际业务中提取问答对(question, context, answer)context是RAG检索到的参考文档answer是模型回答。我建议每个测试集至少包含200条样本涵盖不同类型的问题否则统计指标波动会很大。第二步拆解语义片段。使用文本分割算法或者大模型指令将模型answer切分成多个“信息单元”比如“主语关系宾语”结构也可以细化为属性片段。这一步是整个IAG的核心如果拆分得不干净后续对齐必定出错。我用大模型拆分的prompt如下伪代码你可以根据业务调整输出格式EXTRA_PROMPT 请将以下回答拆分为最小粒度的信息片段列表。 每个片段只能包含一个可校验的事实性陈述以JSON数组格式输出。 示例 输入小明的公司去年营收增长了20%员工人数超过500人。 输出[{subject: 小明的公司, predicate: 营收增长, object: 20%, time: 去年}, {subject: 小明的公司, predicate: 员工人数超过, object: 500人}] 注意不要合并两个独立的陈述不要遗漏负数和时间修饰词。 回答{answer} 这一步建议用强模型如Claude、GPT-4来做弱模型拆分质量差后面全盘皆输。第三步片段对齐与一致性判断。将拆好的每个片段与参考文档进行对齐判断该片段是“蕴含可推导”、“矛盾与文档冲突”还是“中性无据可依”。这一步我使用NLI模型完成也可以利用大模型但对齐上需要设置相似度阈值。如果用BGE等embedding模型一般余弦相似度0.8才认为是同一实体。第四步指标计算。汇总所有pair片段文档的对齐结果计算核心指标信息忠实度Faithfulness Score判断为“蕴含”的片段数 / 全部片段数幻觉率Hallucination Rate判断为“矛盾”或“中性”的片段数 / 全部片段数事实正确率Factual Accuracy与外部知识库校验通过的三元组数 / 全部抽取三元组数要特别提醒的是这三个指标要分开看不能直接相加。忠实度低说明模型严重跑题或编造事实正确率低说明模型知识陈旧或错误。两者都高才是你想要的“既有据可依又真实可靠”。4.3 工具选型与配置整个流程如果用代码来串大致长这样。我提供一个极简的Python脚本框架你可以在此基础上扩展import json from openai import OpenAI client OpenAI(base_url你的模型网关地址, api_key你的key) def split_semantic_units(answer): 调用大模型将回答拆分为语义片段 prompt EXTRA_PROMPT.format(answeranswer) resp client.chat.completions.create( modelgpt-4o, messages[{role: user, content: prompt}], temperature0, ) units json.loads(resp.choices[0].message.content) return units def check_faithfulness(unit_list, context): 调用NLI模型判断每个片段与文档的对齐情况 results [] for unit in unit_list: nli_prompt f [前提] {context} [假设] {unit[subject]} {unit[predicate]} {unit[object]} 请判断假设是否可以被前提蕴含只输出: entailment / contradiction / neutral resp client.chat.completions.create( modelyour-nli-model, messages[{role: user, content: nli_prompt}], temperature0, ) results.append({ unit: unit, label: resp.choices[0].message.content.strip(), }) return results # 使用示例 answer 小明所在公司去年实现营收增长20%总部位于上海。 context 根据财报小明所在公司2022年总营收为8000万元同比增长约20%公司在上海设立总部。 units split_semantic_units(answer) faith_labels check_faithfulness(units, context) print(faith_labels)实际跑下来这个脚本的核心瓶颈在于大模型拆片段的速度。如果数据量上百条建议做并发调用或者改用本地部署的Qwen2.5-72B做批处理拆分。还有一点NLI模型的温度必须设为0否则同样输入偶发输出不同的标签评估一致性就没法保证。4.4 实战中的评估报告与结果解读我在一个智能客服项目里用IAG框架评测了三个版本的大模型7B开源模型、14B开源模型、商用闭源API。每个模型跑500条真实业务问题结果非常有意思模型版本信息忠实度幻觉率事实正确率7B开源模型71.4%28.6%63.2%14B开源模型84.7%15.3%78.5%商用闭源API92.1%7.9%89.3%结论很明显模型规模越大忠实度和事实正确率都越高幻觉率越低。但14B和闭源API的差距也比我想象的大尤其在与实时知识相关的业务上开源模型受限于训练数据截止日期事实正确率明显吃亏。后来我们还发现商用API高出的分数中有相当一部分是“安全性拒答”换来的——模型在不确定时倾向于说“我不知道”宁可拒绝也不乱答。这说明幻觉评估不能单独看“幻觉率”还要结合“拒答率”一起看否则你会把“废柴”模型误判成“靠谱”模型。5. 评估过程中的常见坑与排查实录5.1 坑一NLI模型在长文档上的“注意力稀释”用NLI判断忠实性时如果参考文档特别长比如超过1000字NLI模型经常会把关键的约束条件“看丢”。我当时做过一个测试把文档从200字扩展到1500字后同一个错误信息被漏判的概率提高了近一倍。这是因为Transformer类NLI模型在处理超长序列时中间位置的注意力权重会被稀释。排查思路很简单在进入NLI之前先把长文档切段只将与假设相关的窗口片段作为前提。这个窗口切片可以按段落切也可以先用embedding做粗粒度检索锁定相关度最高的段落再送进NLI。切片之后NLI准确率实测能提升5%到8%。5.2 坑二事实性评估被“知识版本”坑了这个坑让我印象深刻。在一个金融金融知识问答项目里我们用了某公开知识图谱做事实性校验。有一次模型回答“截至2023年底A公司CEO为B”但知识图谱还停留在2022年版本判了“事实错误”。后来人工复核发现模型是对的知识库过时了。从此之后我们在事实性评估流程里加了一条硬性规则所有涉及时间敏感信息的判断必须使用时间戳匹配到对应版本的知识库。换句话说动态事实必须关联“生效时间”来判断不能一刀切。5.3 坑三LLM裁判的“幻觉”也会误导评估用大模型当裁判有个人尽皆知的毛病它自己也会幻觉。我遇到过最离谱的一次裁判模型对一条明显与文档矛盾的答案给出了“蕴含”的判断理由竟是“根据相关行业常识这是合理的”。所以现在只要用LLM-as-a-Judge我会强制要求裁判输出“支持判断的原文引用”并且对没有引用原文的判断直接标记为低置信度。相当于给裁判也套上了一个“忠实性”的评估手铐。5.4 坑四评估视角没对齐标注结果不可比做人工标注时最常见的纠纷是评估视角不一致。标注员A认为“这段回答偏离了用户问题算不忠实”标注员B认为“内容虽偏但信息正确不算幻觉”。两个人的标准不同标注一致性极低。我在实操中会先写一份详细的“标注排除规则手册”明确哪些情况算跑题、哪些算编造、哪些算知识过时并且用20条预标注样本做培训校准直到三人一致率达到80%以上才正式开标。这一步别省否则数据出来根本没法信。5.5 常见问题速查表问题现象可能原因解决方案NLI把所有长句都判为“中性”前提太长关键信息丢失文档切片只送入相关段落事实性指标忽高忽低知识库版本混乱没有时间戳管理建立知识版本管理按时间过滤LLM裁判与人工评估结果偏差大裁判没有参照原文凭常识判断强制裁判引用原文并做低置信过滤模型幻觉率稳定但业务投诉还是多评估只看“有误”没看“误导性”引入误导等级评分按业务影响加权同一模型在不同评测集上分数差异大评测集领域覆盖单一样本量不足扩充多领域样本至少500条才做结论6. 幻觉评估与RAG、模型微调、安全性的关系6.1 RAG系统里评估要管到“端到端”还是“分模块”做RAG应用的朋友经常问我幻觉评估应该只评生成环节还是连检索一起评我的建议是两者都要但分开评。检索环节可以单独用召回率、MRR等指标衡量生成环节再做忠实性和事实性评估。这样一旦发现端到端效果不好你能快速定位是检索没召回对的文档还是生成环节没用对文档。我自己的实操顺序是先跑端到端评估对最终答案做忠实性事实性评估如果幻觉率高再单独测试检索模块和生成模块。用这种分层排查法有几个项目都精准定位到了问题源头——一个项目是检索Top-5文档里根本没有正确答案模型只能硬编另一个项目是检索没问题但生成模型把两篇文档的信息拼错了。两类问题的修复方式完全不同混在一起排查只会浪费时间。6.2 模型微调后的幻觉评估为什么微调会带来新的幻觉指令微调和偏好对齐是当下优化模型的主流手段但微调在提升指令遵循能力的同时也可能伤害模型的事实性。我在一个垂直领域微调项目里发现用少量领域数据微调后模型在领域术语的忠实性上确实提升了但遇到领域外的通用知识问题事实正确率反而降了。原因在于微调过程过度适应了训练分布压缩了通用知识表示的空间。所以任何一次微调迭代都建议跑一遍完整的幻觉评估基线不能只看下游任务指标。我把微调后的评估做成了一套固定流程领域内问答50条、领域外问答50条、通用事实问答50条分别计算忠实度和事实正确率。只要领域外或通用事实指标下滑超过5%我会建议回退版本或调整微调数据配比。6.3 幻觉评估作为安全防线的一部分幻觉不只是“业务体验差”的问题在极端情况下它就是安全漏洞。试想一个客服机器人被诱导说出“该药物可以替代处方药”这种无依据的话轻则误导用户重则造成法律纠纷。在安全基线里我会额外加一类“诱导性幻觉”用例构造一些带有陷阱的prompt看模型会不会在不具备上下文依据时强行给出具体操作建议。这类评估没有统一标准我的经验是结合业务红线来定制。比如金融行业凡是涉及收益承诺、过去业绩暗示未来收益的表述一律视为高危幻觉医疗行业凡是给出具体用药剂量而无出处的内容直接判负。幻觉评估不应该只停留在“文本是否忠于文档”更要融入业务价值观的判断。安全评估和幻觉评估之间我个人的做法是互相补充先做通用幻觉评估再结合安全红线做一次规则过滤两层都过了才放量上线。7. 当前研究前沿与值得关注的方向7.1 IAG框架的扩展从片段对齐到推理链校验IAG框架虽然解决了片段级对齐问题但它目前更多是“平面的”一一比对缺乏对多步推理过程的约束。比如模型从文档A推出结论A再从文档B推出结论B最后组合成结论CIAG只能判断A和B各自是否成立对C的推理链是否合理无能为力。最近看到一些论文开始引入“推理链校验”要求评估器不仅判断每个事实片段是否正确还要判断片段之间的逻辑关系是否成立。这会是未来1到2年幻觉评估的一个重要方向。7.2 在线评估与主动检测幻觉率之外的“动态风险”静态评估只能告诉你“这个模型在测试集上有多爱胡说”但生产环境是动态的。用户问题千变万化检索到的文档也在变化。我最近在关注在线幻觉检测方向——通过在生成过程中注入不确定性信号或让模型对每个生成片段附带置信度分数实时判断哪些片段可能是幻觉。这在RAG场景下特别有潜力一旦检测到高危碎片系统可以自动触发“澄清问题”或“拒答”策略而不是等幻觉生成完再事后校验。7.3 多模态幻觉评估文本方法还能用吗随着多模态大模型普及图片描述、视频理解中的幻觉问题开始变成焦点。一个模型可能文字描述完全流畅但把图片里的“红色汽车”说成“蓝色汽车”。多模态幻觉评估在忠实性维度上依然可以沿用本文的思路——参考对象从纯文本变成了“图文”组合但NLI方法需要升级成跨模态的蕴含判断。目前业界还没有特别成熟的开源评估框架但基于CLIP的图文匹配模型和基于VLM的裁判已经可以作为过渡方案。如果你正在做多模态项目建议尽早开始积累图文不匹配的bad case这个坑只会越来越深。7.4 低成本评估小模型蒸馏与主动学习不是所有团队都用得起GPT-4当裁判。我在部分项目中尝试用蒸馏方法把大模型裁判的判断逻辑蒸馏到一个7B模型上再把该模型作为专门的幻觉检测器。效果肯定有折扣但胜在便宜、快速、可离线部署。配合主动学习策略先让弱检测器粗筛一遍人工只标注那些“模型犹豫”的样本用增量数据持续优化检测器。1500条标注数据后弱检测器在特定业务上的判断一致性就能达到大模型裁判的90%左右。这算是一条性价比很高的实用路线。8. 关于这套评估体系的最后几点实操心得我在多个行业项目里反复迭代过幻觉评估方案后有几个很深的感受可以分享给你。第一评估维度别贪多。一开始就上五六个指标很容易把自己绕晕。先把忠实性和事实性这两个核心维度做扎实再逐步扩展。第二指标计算流程要做成自动化流水线人工评估只做抽检否则评测本身的成本就能吃掉项目预算。第三评估不是为了证明“我的模型还不错”而是为了暴露问题。所以构造测试集时要有意识地加入边界case、反常识问题、时间敏感问题尽量去刁难模型。最后再分享一个细节技巧在评估报告里除了分数一定要附带典型案例尤其是“模型自信但错了”的失败案例。这些案例比分数本身更有业务决策价值——因为它们直接告诉产品团队哪些用户问题场景不能轻易交给模型自动答复必须做人工兜底。我一直认为幻觉评估的终点不是输出一个分数而是输出一套“哪些环节我需要信任模型、哪些环节我必须防着模型”的决策边界。这才是真正能落地到生产环境的幻觉治理方案。
返回列表