ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【RAG面试系列】生成和融合

【RAG面试系列】生成和融合 RAG生成和融合1.检索到的内容如何和用户问题一起喂给 LLMPrompt 怎么设计1.1 Prompt 设计核心原则1.2 标准 RAG Prompt 模板1.3 上下文窗口管理策略2. 如果检索到的内容与问题无关模型会怎么表现如何缓解3. 如何评估 RAG 系统的效果有哪些指标4. RAG 的幻觉问题怎么产生的如何降低RAG面试系列共分为四篇文章【RAG面试系列】基础概念、【RAG面试系列】检索优化、【RAG面试系列】生成和融合、【RAG面试系列】工程落地。上一篇【RAG面试系列】检索优化讲解了RAG检索优化现在我们聊聊RAG生成和融合。1.检索到的内容如何和用户问题一起喂给 LLMPrompt 怎么设计核心思路RAG 的本质是把检索到的外部知识“注入”到 Prompt 里让 LLM 基于这些知识回答而不是凭空生成。关键点在于 检索内容不是附加信息而是回答的真实依据Prompt必须明确告诉模型“只能基于给定材料回答”。检索内容通过“分隔符编号”的结构化方式拼进Prompt并用system指令强约束“只依据资料回答资料不足时明说”。1.1 Prompt 设计核心原则明确角色和任务边界清晰区分检索上下文和用户问题给出不知道的退路要求引用来源1.2 标准 RAG Prompt 模板最常见的做法是三段式结构按固定模板拼进Prompt## 指令 你是一个专业的知识助手。请**仅根据**下面提供的参考文档回答问题。 - 如果参考文档中包含答案请准确回答并引用来源用 [来源X] 标注。 - 如果参考文档中**没有**相关信息请明确说根据现有资料无法回答不要猜测或编造。 - 不要使用参考文档以外的知识。 ## 参考文档 [来源1] {chunk_1_content} [来源2] {chunk_2_content} [来源3] {chunk_3_content} ## 用户问题 {user_query} ## 回答1.3 上下文窗口管理策略策略做法适用场景Top-K 截断只取 Rerank 后的 Top-3~5大多数场景上下文压缩用 LLM 先对检索内容做摘要再注入文档很长但相关信息分散递归摘要对多篇文档分别摘要后合并需要综合大量文档自适应窗口根据查询复杂度动态调整注入数量Agentic RAG关键设计要点检索内容按相关性排序最相关的放最前/最后利用首尾效应每条 chunk 附带元数据来源、章节方便引用设置temperature较低0-0.3以减少幻觉2. 如果检索到的内容与问题无关模型会怎么表现如何缓解无关检索的典型表现强行关联LLM 试图从无关内容中找出答案产生牵强附会的回答幻觉LLM 忽略检索内容转而使用自身预训练知识生成可能正确也可能错误拒绝回答如果 Prompt 设计得当LLM 应说无法回答答非所问基于无关内容生成的答案与用户问题不匹配缓解策略策略做法效果相关性阈值过滤设置相似度分数阈值如 cosine 0.7 则丢弃简单但可能误杀Rerank 过滤Cross-Encoder 分数低于阈值的 chunk 不注入更精准拒答机制Prompt 中明确不知道就说不知道减少幻觉CRAGCorrective RAG检索后先评估相关性不相关则改写查询重试或触发外部搜索自适应处理Self-RAG模型自己判断是否需要检索、检索结果是否相关按需检索LLM-as-Judge 过滤用轻量 LLM 对每个 chunk 做二分类相关/不相关灵活但增加延迟3. 如何评估 RAG 系统的效果有哪些指标评估框架RAGASRetrieval Augmented Generation AssessmentRAGAS 是当前最主流的 RAG 评估框架开源、LLM-as-Judge 范式覆盖检索和生成两侧。核心四大指标指标测量什么计算方式目标值Context Precision检索到的 chunk 中有多少是真正相关的信噪比加权 Precisionk 0.75Context Recall回答所需的信息是否都被检索到了覆盖度从 ground truth 提取 claims检查是否在 context 中 0.8Faithfulness忠实度生成的答案是否完全基于检索上下文有无幻觉将答案拆为原子 claims逐一验证是否被 context 支撑 0.9Answer Relevancy答案是否直接回应了用户问题LLM 从答案反推问题与原始问题做语义相似度 0.8检索侧补充指标指标公式/含义说明RecallkTop-K 结果中包含相关文档的比例按实际注入 LLM 的 chunk 数来定 kk 通常取 5/10/20 多 k 值联合报告Recall5, Recall10, Recall20更全面MRRMean Reciprocal Rank第一个相关文档排名的倒数均值关注正确答案排第几NDCGk归一化折损累计增益考虑排名位置和相关度分级生成侧补充指标幻觉率Hallucination RateVectara HHEM Leaderboard 提供模型级幻觉率对比BERTScore与参考答案的语义相似度比 BLEU/ROUGE 更鲁棒Citation Accuracy引用标注的准确率评估方法论补充离线 vs 在线离线评估使用标注数据集BEIR、MS MARCO、KILT 等评测检索质量用 RAGAS 在自建 ground truth 上评测端到端效果在线评估A/B 测试、用户点赞/点踩、点击率、会话完成率评估数据集构建RAGAS 支持用 LLM 合成高质量评估数据synthetic data generation无需大量人工标注4. RAG 的幻觉问题怎么产生的如何降低RAG 幻觉的两类根因内在幻觉Intrinsic Hallucination生成内容与检索上下文矛盾原因LLM 未能正确理解或遵循检索内容被自身预训练知识覆盖例子检索到产品 A 价格 100 元LLM 输出产品 A 价格 150 元外在幻觉Extrinsic Hallucination生成内容超出检索上下文范围原因LLM 补充了检索中不存在的信息即使是正确的也是幻觉例子检索内容没提产地LLM 自己加了产地中国系统性降低幻觉的方法方法原理效果优化 Prompt明确仅基于上下文回答不要补充基础但有效Rerank 过滤减少噪声注入降低 LLM 被无关内容误导的概率提升 15-35%Faithfulness 监控用 RAGAS 持续监控忠实度发现退化及时修复持续保障CRAGCorrective RAG检索后评估→不相关则重试→仍不行则拒答显著降低Self-RAG模型自反思需要检索吗检索结果相关吗生成忠实吗开放域 QA 幻觉显著降低Citation 强制要求逐句标注来源倒逼模型忠实可解释可验证知识冲突处理检测检索内容间的矛盾提示 LLM 注意或由仲裁模块处理减少混淆
返回列表