ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

检索索引也能自我进化?三星延世等提出SELF-INDEX

检索索引也能自我进化?三星延世等提出SELF-INDEX Self-Evolving Search Index作者Sangam Lee, Wonjae Lee, Sunghwan Kim, Deogyong Kim, Jaehoon Kim, Daye Nam, SeongKu Kang, Dongha Lee核心发表机构Yonsei University、Samsung Research、University of California, Irvine、Korea University论文链接arXiv:2609.19656v1发布于arXiv 预印本cs.IR|—|——| Sparse BM25 | BM25 | 14.5 | 0.0% || | Doc2Query | 14.6 | 1.0% || | SPIKE | 15.1 | 4.2% || | RL-Index | 15.8 | 9.2% || |Self-Index|20.4|40.4%|| Dense BGE | BGE | 13.9 | 0.0% || | Doc2Query | 13.0 | -6.2% || | SPIKE | 15.3 | 9.8% || | RL-Index | 15.4 | 10.4% || |Self-Index|21.8|57.0%|| Qwen3-Emb-8B | 基础索引 | 18.8 | 0.0% || | Doc2Query | 19.2 | 1.9% || | SPIKE | 21.2 | 12.8% || | RL-Index | 20.5 | 9.1% || |Self-Index|26.1|38.8%|关键观察有三点。其一Self-Index 在每一种检索器上都取得最高平均分提升幅度相对于竞争方法有量级上的差别BM25 上从 9.2% 提升到 40.4%BGE 上从 10.4% 提升到 57.0%。其二Self-Index 在三种语料类型自然语言、代码、数学下也都是最高分这与动机部分的论断一致——固定策略无法在多样环境中一致有效而针对环境进化的索引可以。其三竞争方法的表现模式恰恰印证了环境依赖Doc2Query 在 BM25 表格检索上大幅提升但在代码语料上下降在 BGE 上甚至整体低于基础索引-6.2%。这类在某些环境有效、在另一些环境有害的现象正是需要自进化的直接证据。表格检索。表 2 报告三个数据集上的平均 nDCG10 与相对提升。检索器方法Avg.Improv.Sparse BM25BM2533.2-Doc2Query45.537.2%SPIKE37.011.6%EnrichIndex47.242.4%Self-Index49.549.1%Dense BGEBGE45.1-Doc2Query43.6-3.2%SPIKE49.08.7%EnrichIndex51.113.3%Self-Index53.117.9%Qwen3-Emb-8B基础索引49.0-Doc2Query45.5-7.1%SPIKE50.12.2%EnrichIndex54.511.2%Self-Index57.016.2%在表格这一结构化内容形态上Self-Index 同样在所有数据集与所有检索器上取得最高平均分且持续超过最强基线 EnrichIndex。值得注意的是 Doc2Query 的行为反转在稀疏检索下它带来 37.2% 的大幅提升但在密集检索与 Qwen3-Emb-8B 下反而造成下降这再次说明伪查询拼接这类固定策略对环境的敏感性。搜索智能体端到端性能。在 BrowseComp-Plus 上比较三种索引条件基础索引、Self-Index 演化索引、SPIKE 构建索引并参考无索引的 DCI 方法。代表性答案准确率结果如下GPT-OSS-120B BM25 上基础索引为 31.08、SPIKE 为 43.3739.54%、Self-Index 为 58.9289.53%GPT-5.4-nano BM25 上为 36.51 / 47.5930.35%/ 64.9477.87%Kimi-K2.5 BM25 上为 50.96 / 62.1722.00%/ 71.9341.13%。在稠密检索下提升幅度收窄但不改方向GPT-5.4-nano Qwen3-Emb-8B 上 SPIKE 与基础索引持平52.170.00%Self-Index 为 59.2813.63%Gemini-3.7-Flash 与 Kimi-K2.5 配稠密检索时SPIKE 甚至略低于基础索引-1.58%、-1.40%而 Self-Index 仍为正增益。除准确率外Self-Index 在所有设置下都取得最高证据召回通常降低校准误差并一致减少搜索调用次数SPIKE 则会在部分情况下增加搜索调用。例如 GPT-OSS-120B BM25 上搜索调用从基础的 21.16 降到 SPIKE 的 17.78-15.97%与 Self-Index 的 16.62-21.46%校准误差从 42.05 降到 40.00-4.88%与 26.20-37.69%。在线成本效率。论文依据 token 使用量与 backbone 特定 API 价格估算在线成本。该图展示了在 BrowseComp-Plus 全部评测集上的答案准确率与估计 API 成本之间的关系使用 Self-Index 的搜索智能体在提高准确率的同时降低在线成本甚至可以以较弱的 backbone 达到使用更强 backbone 加基础索引的智能体相当的准确率。具体地GPT-5.4-nano BM25 Self-Index 达到与使用相同 backbone 的 DCI 相当的准确率而在线成本更低。论文进一步指出基于索引的搜索智能体通常在线成本低于 DCI但任务性能较低Self-Index 缓解了这一权衡在任务性能接近的同时强化了成本优势这一点也与搜索调用次数的下降相互印证。语料规模鲁棒性。遵循 DCI 的语料扩展设置把 BrowseComp-Plus 语料扩展到 100K、200K、400K 文档每个规模下用 GPT-5.4-nano 搜索智能体 BM25 比较 Self-Index 与 SPIKE并与 DCI 参照对比。趋势是Self-Index 的答案准确率随语料扩大保持稳定每查询在线成本相对 100K 基线略微降低SPIKE 的准确率低于其自身基线在线成本随语料增大而上升DCI 的准确率急剧下降、成本大幅上升对语料增长的敏感度明显高于两种基于索引的方法。需要说明的是该分析的图报告的是相对各方法自身 100K 基线的相对百分比变化准确率变化是相对百分比而非百分点差且由于 DCI 的规模结果取自其原文、使用不同的智能体配置与不同的问题子集该分析只比较各方法相对自身基线的变化不比较跨方法的绝对准确率或成本。智能体记忆利用率。表 4 在 LongMemEval-V2 上比较三种检索式记忆系统在替换索引前后的表现。方法StaticDynamicWorkflowGotchasOverallImprov.Query → Slice0.5600.5230.5540.2760.415-Self-Index0.6120.6400.6620.2410.47213.9%Query → SliceNotes0.6040.5810.6350.3100.448-Self-Index0.6490.6510.7160.3100.50312.4%AgentRunbook-R0.7310.7330.6350.2760.532-Self-Index0.7840.7440.7840.2760.5819.2%由于实验只演化检索键、不改动存储的记忆内容且使用相同的 LLM reader 基于检索到的记忆条目生成答案所以这一提升可以归因于检索过程能否浮现已存于记忆条目中的信息而不是记忆内容被改写。提升一致出现在 Static、Dynamic、Workflow 三类能力上Gotchas 提升不明显论文的解释是 Gotchas 更依赖记忆系统如何把过去交互处理成有用的记忆内容而非检索能否找到它。因为 Self-Index 只修改检索键它与记忆如何构建和组织基本正交可以叠加到不同的记忆设计之上。4.3 消融实验 / Ablation StudyOptimizer 组件消融。表 5 在 BRIGHT 上按语料类型报告 nDCG10每个语料类型的 Avg. 是三种检索器分数的等权平均Δ \DeltaΔ为相对完整框架的变化单位为点。所有消融都独立施加于完整框架验证类消融保留 Self-Diagnosis 与 Self-Revision 的指令与输入构造包括共检索画像只在是否接受一次修订的验证检查上不同。配置NL Avg.Δ \DeltaΔCode Avg.Δ \DeltaΔMath Avg.Δ \DeltaΔSelf-Index完整26.6—22.1—17.2—w/oC k \mathcal{C}_kCk​19.7-6.916.7-5.415.9-1.3w/o Validation16.1-10.513.0-9.111.9-5.3w/o Faithfulness21.0-5.618.1-4.015.6-1.7w/o Specificity20.6-6.016.1-6.113.0-4.3w/o Separation23.9-2.716.8-5.312.1-5.1w/o Dissimilarity22.2-4.418.5-3.614.8-2.4这张表提供了四条结论。第一去掉 Self-Diagnosis 中的共检索画像C k \mathcal{C}_kCk​同时移除 Self-Revision 输入侧的 competing-key 上下文但保留验证侧所需的画像所有语料类型的平均 nDCG10 都持续下降说明有效的索引优化不能只看目标文档及其当前键还必须看这些键在索引中与其他键一起被检索的方式。第二三条验证准则中任意去掉一条都会在所有三种语料类型上造成下降说明每一条都有独立贡献Faithfulness 在代码与自然语言上损失较大Specificity 损失最为均匀Separation 在数学与代码上损失突出。第三完全去掉验证阶段、接受所有提出的修订时下降最为严重NL -10.5、Code -9.1、Math -5.3并且在每种语料类型上都低于基础索引——这意味着不加验证的自我修订会主动破坏索引验证不是锦上添花而是避免退化的必要环节。第四去掉 Self-Exploration 中的 Dissimilarity 过滤也会一致降低平均 nDCG10说明持续探索彼此不同的新检索需求对索引演化有实际价值需要注意的是该变体与完整框架使用相同数量的查询、batch size 与优化预算但匹配被接受查询的预算并不等于模拟成本相同因此论文把生成成本与过滤成本分开记账。查询来源对比。Optimizer 也可以使用用户交互或既有训练数据中的查询来进化索引。论文用 ReasonIR HQ 的预生成合成查询整体替换 Query Simulator这些查询由 BRIGHT 语料生成属于语料接地查询源且不施加 Answerability 检查与 Dissimilarity 过滤完整 Optimizer 与三条验证准则全部保留两种条件下批大小均为 128每数据集最多使用 2,560 条查询。结果显示使用 ReasonIR 查询时同一个 Optimizer 在三种检索器下都把整体 nDCG10 相对基础索引提升说明索引演化确实可以由独立于本文 Query Simulator 的语料接地查询驱动但 Query Simulator 提供的查询在每个领域、每种检索器上都取得更高分数。论文对此的解释是Optimizer 是反应式地改进索引其演化方向上受所接收查询揭示的检索需求限制因此查询供给过程本身会影响同一优化器所能获得的增益上限。分数聚合的对照。Self-Index 在原文键与生成键之间取最大相关性分数因而不需要分数合并权重SPIKE 虽然也对 scenario 分数取最大但会把该最大值与原文分数做加权和原文档权重 0.7、最高 scenario 权重 0.3。为了排除增益只是来自不同的最终评分规则这一可能解释论文让 SPIKE 也改用同样的最大分数聚合进行评估结果 Self-Index 在三种检索器上仍然持续取得更高的平均 nDCG10说明其优势并非仅由聚合规则造成。4.4 索引演化动态与案例研究逐迭代的演化轨迹。论文在 BRIGHT 中为每种语料类型选一个代表性数据集Biology、Robotics、TheoremQA-Theorem用 BGE-Large 在固定测试查询集上评估迭代 0、5、10、15、20 的 checkpoint。结论是 Self-Index 在早期迭代就已超过 SPIKE并且此后还能继续获得增益而 SPIKE 在早期迭代后趋于平台。这一差异直接支持了需要让索引演化超出固定优化策略的论点一个策略一旦固定其收益就有上限而一个能自主诊断并修订的循环可以持续发现新的短板。评估查询在索引演化期间不可见且不决定停止点源文档、相关性判断、排序流程与优化骨干在 checkpoint 之间保持固定。单文档键集合的演化机理。案例研究追踪了一个金标文档的键集合在迭代中的变化其典型模式是金标文档确实包含能解决测试查询信息需求的知识但该知识嵌入在更宽泛的内容中。迭代 0 时以完整文档文本作为唯一的初始键K 0 ( d ) { d } \mathcal{K}_0(d) \{d\}K0​(d){d}检索器难以捕捉相关性因为其他细节分散了注意力文档排名靠后早期迭代把宽泛内容组织为若干独立键每个键突出不同侧面文档排名上升但与查询信息需求相关的知识在这些键中仍是隐式的排名依然相对靠后后续迭代中某个修订后的键更显式地表征了与查询信息需求相关的知识文档排名接近榜首。该图给出的正是一个来自 BRIGHT 的生物学案例。测试查询已压缩问的是为什么无名指不能独立移动、为什么小指必须随它一起动金标文档是描述伸指肌腱的解剖学段落其源段落只陈述手指肌腱由两条斜行带连接这一结构事实。迭代 0 直接引用该段落文档排名 63迭代 6 的键改写为使伸指肌腱保持在掌骨头正上方以保证杠杆效率的结构组件排名升到 40迭代 10 的键变成手中哪些具体的附着结构造成了外侧手指运动自由度的差异排名升到第 2 并保持到迭代 20。这个案例清楚展示了 Self-Index 所做事情的实质它把源文档所做的事翻译成用户所问的需求把解剖学描述与手指独立运动这一问题连接起来。12 个案例的共同模式。论文共考察 12 个成功案例覆盖技术散文、代码、数学、表模式以及先前交互说明修订后的索引键通过改善文档排名、在 agentic search 中更早定位来源、复用既往经验三种方式把既有证据所支持的任务暴露出来。除上述生物学案例外还有若干具有代表性的模式Robotics 案例中原始段落只描述给对象应用纹理与在 Gazebo Classic 中加入 ArUco marker 以测试机器人识别这一任务错配迭代 12 虽提到 Gazebo 但内容讲墙面纹理模糊仅平台重叠不足以解决问题迭代 13 引入 ArUco marker 模型迭代 15 把Gazebo与ArUco markers放入机器人应用语境排名从 84 到 41 再到第 1另一个 Robotics 案例中原始代码键从迭代 0 到 13 都在 200 名之外迭代 14 的键改用lambda capture 绑定 this 指针以向回调传递额外参数这一编程概念表达相关性排名直接跃至第 1。数学案例中Ramsey 定理的通用定义在迭代 0 到 12 都排不进前 200迭代 13 的键加入最小阶数“2-着色”“4 阶单色完全子图这三个约束后排名升到第 2鸽巢原理案例则揭示了一个更微妙的观察——保留原始索引键并不能保证文档在其他键演化时保持相对排名该文档在迭代 1–5 掉出前 200直到迭代 6 的新键直接把13 个人”“至少两人”“同一个月生日写入把它推到第 1 并保持。表格检索案例中Firebase 分区表从 1,224 名升到第 1键把表名翻译成2018 年 9 月用户留存报告与由 first-touch 时间戳派生的获取日期”BEAVER 的keystone#sep#group表从 93 名升到第 1键改写为user_directory#sep#security_groups把问题中的两个实体带入表描述。搜索智能体案例中在一个需要串联多条传记线索才能识别的电影问题上使用原索引的智能体 20 次搜索都未检索到金标文档并最终失败而使用 Self-Index 演化索引的智能体在第 1 次搜索就以第 5 名检索到该文档文档并在 2 次搜索内正确回答。需要强调这些案例的分析口径案例解释的是个体轨迹总体有效性由主实验评估索引演化使用 Query Simulator 的查询且不观察评估查询源文档与存储的记忆内容保持不变问题在未标注 “full” 时都经过压缩展示的键是节选与问题的对应关系以粗体标出而这些节选不能单独分离出某一条键的贡献。此外多个案例存在明确的边界条件某案例检索到的段落支持的是反射性晕厥机制而非低血糖特异性的因果解释某案例的示例代码并未显式实现所要求的额外参数Firebase 案例的 Rank 1 只是让相关分区可被取到完整分析仍需所请求的日期范围BEAVER 案例的 Rank 1 只提供组属性确定用户属于哪些组仍需成员关系表。这些边界说明索引优化的目标是让正确的证据变得可检索而不是替代下游推理或补全缺失的数据关系。离线效率。论文把每个优化 checkpoint 与其累积 LLM 成本配对并与 SPIKE 的全语料索引构建成本比较。结果是 Self-Index 在索引演化过程中超过 SPIKE同时在三个数据集上累积优化成本都更低在最终 checkpoint其检索性能更高且累积成本更低。这一成本优势与 Self-Index 的选择性一致它只修订被识别出检索短板的文档键集合而 SPIKE 需要为每个文档生成 scenario。成本核算的边界也需说明离线成本由记录的输入/输出 token 用量估算包含查询模拟、诊断、修订、验证以及被拒绝的提案与被过滤掉的查询但不含本地 GPU 的购置与托管成本在线成本汇总所有智能体调用的输入与输出 token缓存输入 token 计入输入总量并按 cache-read 费率计费覆盖范围不含离线索引优化、检索器服务与答案评测。论文还明确指出搜索调用次数本身并不能决定成本因为上下文长度、输出长度以及输入 token 的缓存占比在不同运行间会变化。五、相关工作 / Related Work索引优化。这一方向可分为两个范式。早期范式依赖人工预定义的策略来扩展或重构文档表示包括伪查询、摘要、关键短语、命题、多语义视角以及场景化画像等。这类方法的共同弱点是一旦策略对某语料或某检索器不佳就必须人工重新设计策略。近期范式转向从标注数据中学习策略减少了人工策略设计但仍有两个残留缺陷当某些检索需求支撑不足时仍需要人提供额外的相关性标注并重跑策略学习修订后的策略会在全语料上广泛施加即使只有一小部分索引表示真的需要改进。Self-Index 的差异在于它直接从检索结果进化索引键既不需要人工改写策略也不需要相关性标注并且选择性只修订与已观测缺陷相关的键。具体到基线层面Doc2Query 用文档可能回答的预测查询增强表示SPIKE 把可能的信息需求与文档如何满足该需求的解释表示为 scenarios 并按权重合并分数RL-Index 训练一个基于检索强化学习目标的 rationale 生成器EnrichIndex 构造互补表示并合并检索分数。它们的共同点是策略或权重是预先确定或调优的而 Self-Index 把如何表示文档这一决策本身交给一个能观察到检索后果的循环来处理。自进化框架。自进化的定义是模型或智能体通过自生成的监督信号与自我交互来改进自身、减少对人的依赖已在推理模型与智能体系统中被广泛研究。但已有工作聚焦于进化模型或智能体把自进化应用于索引优化基本未被探索。Self-Index 的定位正是填补这一空白把自进化范式扩展到索引优化让索引自身改进其表示。就机制而言Self-Diagnosis 借用了伪相关反馈用检索结果作为反馈、无需相关性标注的思想但把这一思想从扩充查询表示迁移到了诊断索引键的表征短板上Self-Validation 的三条准则则分别对应信息检索中对表示忠实性、文档特异性与键间可区分性的经典要求。检索增强的智能体与智能体记忆。搜索智能体依赖检索来获取外部证据其端到端表现受检索质量直接制约智能体记忆系统同样依赖检索从过往交互中取出有用信息。本文通过 BrowseComp-Plus 与 LongMemEval-V2 两个下游评测把索引优化与这两类应用连接起来并特别强调 Self-Index 只修改检索键、不改动存储内容因而与记忆的构建与组织方式正交。在与无索引方法 DCI 的对照中论文指出 DCI 此前在 BrowseComp-Plus 上优于现有基于索引的搜索智能体而 Self-Index 使基于索引的智能体达到与 DCI 相当的任务性能且在线成本更低在语料规模扩展时DCI 的准确率急剧下降、成本大幅上升而 Self-Index 保持稳定。六、局限性与展望 / Limitations Future Work论文以诚实的方式标出了若干结论的适用边界这些边界本身也指向后续工作空间。第一覆盖率扩张与反复精修的效应未被分离。在索引演化分析中作者明确说明没有在固定覆盖率下做对比因此该分析不能分离更多文档被纳入修订与同一批文档被反复精修各自的贡献。要回答Self-Index 的收益主要来自覆盖面还是来自深度需要在固定累积覆盖率的条件下重做对照实验。第二优化查询供给是性能上限的直接约束。Optimizer 是反应式地改进索引能否发现某个检索需求取决于它收到的查询是否揭示了这一需求。查询来源对比显示ReasonIR HQ 查询虽然也能带来相对基础索引的提升但 Query Simulator 的查询在每个领域、每种检索器上都更好。这说明如何生成既语料接地、又与已有需求不重复的查询仍是一个有优化空间的问题同时该对比评估的是整个模拟器对一个已有查询源模拟器内部 Dissimilarity 过滤的贡献只能由单独消融来考察。第三验证环节高度依赖同源 LLM judge。Faithfulness 与 Answerability 都使用与 Optimizer 相同的 backbone LLM 做判断阈值为 0–3 量表中的 2 分。这种设计保持了低人工干预但也把判断质量与 judge 的能力绑定在一起消融结果显示验证不可或缺去掉后性能甚至低于基础索引这意味着验证环节的可靠性对整个框架至关重要而这方面的敏感性分析在现有材料中并未展开。第四下游收益在不同能力维度上并不均等。在 LongMemEval-V2 上Static、Dynamic、Workflow 三类能力一致提升但 Gotchas 提升不明显。论文的解释是 Gotchas 更依赖记忆系统如何把过去交互处理成有用的记忆内容而非检索能否浮现它。这提示 Self-Index 的适用边界它能改善信息已在存储中、只是检索不到的情形但无法改善信息根本没有被正确构建成可检索内容的情形。第五成本核算存在明确的排除项。离线成本估算不含本地 GPU 的购置与托管成本在线成本覆盖智能体的 LLM 调用但不含离线索引优化、检索器服务与答案评测开销。此外搜索调用次数与成本之间没有简单的单调关系因为上下文长度、输出长度与缓存命中占比都会变化。因此Self-Index 更便宜这一结论应被理解为在给定计费口径下的结论而不是全生命周期成本的结论。第六部分对照不可直接横向比较。DCI 的语料规模结果取自其原文使用不同智能体配置与不同问题子集因此规模分析只做各方法相对自身基线的变化对比不比较跨方法的绝对准确率或成本。RL-Index 因本设置下没有可用的表格检索训练数据而被排除在表格检索比较之外。EnrichIndex 的分数合并系数在各数据集验证集上调参评测查询被排除在调参之外这一点保证了公平性但也意味着基线享有一定的调参优势。第七案例研究的解释力是定性而非定量的。12 个案例解释的是个体轨迹展示的键是节选不能单独分离出某一条键的贡献部分案例存在明确的边界条件如检索到的段落支持的是邻近机制而非问题所问的特异性因果解释、示例代码并未真正实现所要求的功能、排名第一只代表相关表或分区可被取到而完整分析仍需其他数据。这提醒读者不要把案例读成索引优化可以替代下游推理。在这些边界之外论文的方向性意义是清楚的如果索引的表示方式必须随检索环境而变那么把选择何种表示这一决策持续交给一个能观察检索后果、能自我诊断并自我验证的循环比固化任何一种策略都更有前途。可继续推进的方向包括设计不依赖评测查询的、可用于判断何时停止演化的稳定准则把框架扩展到更多内容形态与更多模态的记忆与语料让验证阶段的判断能力与优化器解耦以提升可靠性以及在固定覆盖率等受控条件下厘清各类收益的来源。七、总结 / Conclusion本文提出 Self-Index一个使索引能够自我演化的框架。它把索引优化中原本由人承担的诊断失败、精化策略、重处理索引循环替换为 Optimizer 自主执行的自诊断、自修订、自验证三阶段闭环Self-Diagnosis 借助共检索画像从检索结果中识别表征短板并给出修订指引而不直接生成键Self-Revision 以文档键集合为单位整体提出一次修订从而避免同集合内的冗余表示且不依赖任何预定义策略Self-Validation 用 Faithfulness、Specificity、Separation 三条准则逐键把关确保只有真正忠于源文档、具有文档特异性且与竞争键保持区分度的生成键才会被写入索引。在此之上Query Simulator 通过 Self-Exploration 主动构造新的检索需求并用 Answerability 与 Dissimilarity 双重过滤保证查询可被语料回答且彼此不重复使索引的进化超出已有可用查询所覆盖的范围从反应式进化为主动式。在 BRIGHT 的自然语言、代码、数学三组语料上以及 Spider 2.0、FIBEN、BEAVER 三个表格检索数据集上Self-Index 在 BM25、BGE-Large、Qwen3-Embedding-8B 三种检索器下均取得最高平均 nDCG10相对基础索引的提升显著高于 Doc2Query、SPIKE、RL-Index 与 EnrichIndex而后者只在部分环境有效、在另一些环境甚至造成下降。消融实验进一步表明共检索画像、三条验证准则与不相似性过滤各自都有独立且一致的贡献其中去掉整个验证阶段会使性能低于基础索引说明自验证是自进化索引不发生退化的必要机制查询来源对比显示即便换成外部的语料接地查询同一个 Optimizer 也能带来提升但 Query Simulator 的查询供给在每个领域与每种检索器上都更好。在索引演化过程中Self-Index 在早期迭代即超过 SPIKE此后仍持续获得增益同时以更低的累积优化成本完成演化——这与它只修订被诊断出短板的文档键集合这一选择性设计一致。最后收益可迁移到下游在 BrowseComp-Plus 上Self-Index 同时提高搜索智能体的答案准确率与证据召回、减少搜索调用并降低校准误差在语料规模从 100K 扩展到 400K 时保持准确率稳定与成本效率在 LongMemEval-V2 上仅演化检索键就能稳定提升记忆系统的整体准确率说明该框架与记忆如何构建和组织基本正交。综合来看这项工作最重要的启示并不在于某个具体的修订模板而在于证明了让索引自己决定如何表示文档是一条可以在多样检索环境中稳定兑现收益的路径。原文摘要:Information retrieval is increasingly important as LLM agents tackle complex tasks involving diverse information needs. Because retrieval relies on an index that represents each document through index keys, retrieval quality depends heavily on how effectively these keys expose the knowledge contained in each document. However, effective index representations vary across retrieval environments, making it difficult for any fixed optimization strategy to perform consistently. Yet evolving an index to its retrieval environment remains largely human-driven, requiring humans to diagnose retrieval failures, refine the optimization strategy, and reprocess the index accordingly. We propose SELF-INDEX, a framework that enables an index to self-evolve without human intervention. Its Optimizer autonomously diagnoses retrieval shortfalls, selectively revises the responsible index keys, and validates each revision before updating the index. Beyond reacting to observed retrieval demands, SELF-INDEX proactively explores additional demands through a Query Simulator, allowing the index to evolve beyond the queries already available for optimization. Across diverse corpora and retrievers, SELF-INDEX consistently improves retrieval performance while outperforming existing index optimization methods. We further show that these benefits extend to downstream applications, improving the effectiveness and efficiency of search agents and helping agent memory systems retrieve useful past interactions.PDF链接:https://arxiv.org/pdf/2609.19656v1部分平台可能图片显示异常请以我的博客内容为准
返回列表