
RAG系统搭建实战指南从答非所问到智能体架构的选型地图【免费下载链接】awesome-generative-ai-guideA one stop repository for generative AI research updates, interview resources, notebooks and much more!项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-generative-ai-guide如果你正打算搭一套 RAG检索增强生成Retrieval-Augmented Generation系统大概率被三个问题卡住答非所问、知识过期、评估无从下手。这篇不按论文罗列而是以我要落地一套 RAG为主线帮你判断自己该停在哪一档、每一档花多少成本、评估怎么搭。读完你会拿到一张从基础流水线到智能体 RAG 的选型地图以及一套可执行的落地顺序。一、先别急着搭你的业务卡在哪一档我们踩坑的顺序通常是这样的。先搭了个最简版本跑通 demo 很爽一上线就翻车——检索回来的资料看着很像实际根本不相关。图里这个例子很典型查询是Q4 客户流失分析系统捞回三条相似度 87%~92% 的文档但全是满意度调研Q3 报告营收分析真正的答案Q4 流失报告压根没进上下文于是模型开始礼貌地反问你需要什么帮助。这就是第一类痛点答非所问。根子往往不在模型而在检索。第二类是知识过期。模型权重里的知识是训练截止那天定死的你今天改了价目表、上线了新接口它答的还是旧版。指望重新微调成本太高、周期太长。第三类最要命也最被忽视评估无从下手。你说我这套 RAG 比上一版好了但拿不出数字。上线后用户投诉变多你分不清是检索的锅还是生成的锅。这三个痛点恰好对应三档解法。下面按成本从低到高讲你对照自己的场景挑档位。二、第一档基础流水线以及它在哪里失效基础 RAG 就三段业内一般叫 Ingestion入库、Retrieval检索、Synthesis生成入库把文档切成 chunk文本块转成 embedding向量表示把文本变成一串数字语义相近的文本数字也相近存进索引。检索用户问题也向量化在索引里做 ANN近似最近邻就是在海量向量里快速找出最像的几条取 top-k。生成把问题和这 k 条资料拼成提示词让模型基于资料作答。最小实现长这样逻辑一目了然# 示意最简 RAG 检索链路 chunks split(doc, 512) # 切块 chunk vecs embed(chunks) # 向量化 embedding top_k ann_search(index, embed(q)) # ANN 近似最近邻取 top-k ctx \n.join(top_k) # 拼接上下文 answer llm(prompt(q, ctx)) # 让模型基于资料作答这档的边界很清楚静态语料、单跳问题答案在一条文档里就有它够用而且便宜、快、好调。FAQ 机器人、内部制度问答、产品文档助手停在这里性价比最高。它在哪失效只要满足下面任一条就该往上走文档很长、答案要跨多个段落综合多跳语料里噪声多无关资料一混进来模型就跑偏或者你需要它能自己判断该不该再查一次。三、第二档把检索做厚高级 RAG 的几板斧这一档不换骨架只把检索这一个环节做厚。按投入产出比排个序我一般这么建议1. 查询改写 混合检索性价比最高先上这个。用户问法和你文档里的措辞经常对不上咋退款 vs 退款流程。先把查询改写成更贴近语料的多个版本再检索同时别只用向量检索叠加 BM25 这类关键词检索做混合召回再交给 reranker重排序模型把候选资料按真实相关性重新打分排序精选。这一步能消掉相当一部分答非所问。2. 纠错检索CRAG 的思路。代表工作 Corrective RAG 解决的是检索错了还硬答。它加一个轻量评估器先判断这次捞回来的资料到底相不相关相关就用不确定就降级处理不相关就直接丢弃或转向联网搜索而不是把垃圾喂给模型。代价是多一次评估调用换来的是抗噪能力明显变强。3. 长文档多粒度检索RAPTOR / LongRAG。固定大小的切块有个死穴切细了丢上下文切粗了混主题。RAPTOR 把文档递归聚成一棵摘要树从句子级到章节级多粒度都能捞LongRAG 干脆把检索单位放大到 4K token。适合整篇报告、整本规范这类需要全局理解的场景。4. 图 RAGHippoRAG、G-Retriever、NodeRAG。向量检索只比像不像不处理实体之间的关系。一问这家供应商和那个项目、以及它背后的股东是什么关系多跳链条就断了。图 RAG 把实体和关系显式建图沿边推理。代价是建图贵、查询慢所以只推荐在金融、医疗、安全这种实体关系密集的语料上用别为了用而用。一句话总结这一档它是在单次检索上做精雕细琢适合你明确知道答案该怎么捞、只是捞得不够准的情况。四、第三档让系统自己决定何时查、查什么智能体 RAG前两档都是你写死检索逻辑系统照做。到了任务型场景——写调研报告、做合规审查、跨多个数据源做决策——固定流程就兜不住了。这时把 LLM 当成会做决策的检索调度器就是智能体 RAG。它靠四种设计模式把想和查串起来规划先把大问题拆成子问题逐个去查PlanRAG 那类。反思查完自己评一句够不够、准不准不够就换角度再查Self-RAG 的反思 token、CRAG 的评估器都是它的雏形。工具调用把检索当成一个工具模型决定调不调、调几次。多智能体协作一个主智能体派活给多个专职工种各自负责检索、过滤、生成。挑两个代表讲清楚代价。Auto-RAG 实现了完全自主的迭代检索由模型自己规划查询、评估结果有用没用到按题目难度决定迭代几轮人工干预少很多。MMOA-RAG 更进一步把查询重写、检索、过滤、生成每个组件都当成独立的强化学习智能体用最终答案的 F1 作为统一奖励去协同训练解决局部模块各自最优、整体却打架的错配问题。但这档不便宜。多轮 LLM 调用意味着延迟和 token 成本成倍涨一个简单问题可能要跑三四次检索-生成循环。我们的经验是只有当单轮方案明显够不着、且单 query 价值高值得花这个算力时才上。近来的趋势如 LatentRAG就是把中间思考压进连续潜在空间在保住多跳质量的同时把推理延迟压掉约九成正是冲着这个成本痛点去的。三档放在一起选型就有依据了档位适用场景成本效果上限代表方案基础流水线静态 FAQ、内部文档问答低单跳问答BM25 向量检索高级 RAG长文档、多粒度、关系较密中多跳、抗噪混合检索、CRAG、RAPTOR智能体 RAG任务型、需自主多步检索高延迟/算力复杂决策Auto-RAG、MMOA-RAG、图智能体五、别忽略另一半输入侧与多模态 RAG很多人只盯着怎么查忽略了喂进去的东西长什么样。两个方向值得留意。输入处理。传统按纯文本切块会丢掉结构。HtmlRAG 发现保留 HTML 标签标题层级、列表、表格边界比拍平成纯文本更利于模型理解检索知识针对 PDF 的视觉分块用多模态模型看图切块则能正确处理跨页表格和插图。如果你的语料是网页或结构化文档这一步别省。多模态 RAG。当答案里含图、含视频时纯文本检索就失灵了。这里按场景 成本 效果给你几个坐标图文混合Beyond Text把图像也变成可检索证据实验发现让模型把图先转成文字摘要比直接塞图更灵活、更容易落地。视频语料VideoRAG动态检索相关视频片段再联合生成适合课程回放、监控、会议记录这类视频问答。区域级检索RegionRAG只定位到文档里相关的那块区域而不是整页喂进去省 token 同时提高命中率对视觉 token 预算紧张的部署很友好。我的判断多模态 RAG 现在还属于按需上先用文本摘要兜底等确实有图像/视频问答需求再上专用方案别一上来就追求全模态。六、评估没有测试集的 RAG 等于盲人摸象回到最被忽视的痛点。RAG 评估最大的坑是把检索和生成混在一起评——分数掉了你分不清是资料没捞对还是捞对了模型没用对。所以第一步永远是拆成两段分开打分评估维度回答的问题常用指标代表基准 / 框架检索相关性捞回来的资料真的对吗RecallK、MRRCRAG Benchmark、FRAMES答案忠实度回答有没有依据资料忠实度分、引用命中RAGAS噪声鲁棒混进无关资料会不会跑偏准确率降幅RGB系统对比A 方案比 B 好多少Elo 相对分RAGElo几个值得知道的工具各解决一块RAGAS 主打免人工标注用模型给检索相关性和答案忠实度打分开发期快速迭代够用RGB 专测模型对噪声的抵抗力、会不会在资料不够时认怂拒答负例拒绝这点对生产很关键CRAG Benchmark 提供 4409 条问答加模拟 API能同时压测检索和生成RAGElo 则用 Elo 打分让多个 RAG 变体自动对战帮你客观比较谁更强省掉人肉评审。评估不是搭完一次性打分的动作而是闭环。把它接成飞轮才能真正转起来生产里的 bad case 回流成新的测试样本 → 跑评估定位是检索还是生成 → 改进对应环节 → 再部署。缺了这条回流你的优化就只是拍脑袋。七、落地顺序一张决策树定档最后把前面的判断浓缩成一条决策路径你照着走就行几条落到地气的经验先做基础版把评估搭起来再往上走。顺序错了就是白折腾——没有测试集你连高级 RAG 到底有没有用都证明不了。钱花在检索侧的性价比通常高于换更大的模型。混合检索 重排这两板斧往往比升级生成模型见效更快。图 RAG 和智能体 RAG 都是按需上不是标配。语料没有复杂关系、任务不是多步决策上了就是纯烧钱。多模态先用文本摘要兜底。真需求出现了再上专用多模态方案。想持续跟这个方向的进展仓库里有一份长期维护的论文索引可以当研究雷达RAG Research Table按检索优化、多模态、评估、智能体等维度归类了 2023 年以来的代表作比散着搜论文省事。再配合Retrieval and RAG 主题导航里的分档学习路径从入门到研究都能接上。一句话收尾RAG 没有最强方案只有和你场景匹配的那一档。先用评估把现状量出来再决定往哪走这是少走弯路的最短路径。【免费下载链接】awesome-generative-ai-guideA one stop repository for generative AI research updates, interview resources, notebooks and much more!项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-generative-ai-guide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考