
Jev远程重排到底值不值memsearch中英双语检索质量评估实验全解读【免费下载链接】memsearchA persistent, unified memory layer for all your AI agents (e.g. Claude Code, Codex, DSH), backed by Markdown and Milvus.项目地址: https://gitcode.com/gh_mirrors/mem/memsearchmemsearch是一个为 Claude Code、Codex 等 AI Agent 提供持久统一记忆层的开源项目基于 Markdown Milvus 构建语义检索。其中的Jev 远程重排通过 TypeSafe API 对检索结果二次排序是一项可选功能它到底能提升多少检索质量要花多少钱本文完整解读 memsearch 官方的中英双语重排评估实验用 4344 条真实记忆语料的数据回答值不值。⚡太长不看Jev 让 Recall5 从 0.7471 提升到 0.79414.70 个百分点代价约 $0.171/千次查询对照组 Voyage rerank-3 质量更高0.8187且更便宜$0.120/千次。Jev 是免费的午餐升级但不是最优解——这正是它保持可选而非默认的原因。一、实验怎么设计的固定候选只比重排这次实验非常严谨的地方在于控制变量详见 evaluation/reranking-evaluation.md要素设定语料来自 12 个真实项目的 955 条记忆块中英双语查询集每语言 2172 条955 简单 926 复杂 291 多跳合计4344 行候选集每个查询固定复用 BGE-M3 检索的Top-10 候选三种方法比同一池子对照方法① 冻结原始排序基线② Jev 1.13.0 ③ Voyage rerank-3这样做的意义候选成员完全一致测的是重排模型把正确答案往上挪的能力而不是端到端搜索系统。Jev 的提示词适配自官方 reranking cookbook对每个候选独立判断它是否包含查询所需的具体事实请求构造逻辑在 src/memsearch/jev_reranker.py。二、核心结果三种方法的完整对账方法Recall5MRR10NDCG10千次查询成本冻结原始排序0.74710.63720.6728$0Jev 1.13.00.79410.68840.7114~$0.171Voyage rerank-30.81870.77540.7755~$0.120三个关键读数 Recall5Jev 比原始排序4.70 个百分点Voyage 再 2.46——两个重排器都有效重排本身值得做MRR10Jev 与 Voyage 差距最大0.6884 vs 0.7754。Voyage 更擅长把正确答案推到最前几位而不只是塞进 Top-5——对用户只看前 3 条的场景更友好中英均衡Jev 的中文 MRR0.6885和英文0.6883几乎相同说明翻译后它和 Voyage 的差距并没有消失不是语言问题。三、分题型拆解Jev 在哪类问题上最给力题型冻结 R5Jev R5Voyage R5简单事实题0.76750.82720.8398复杂推理题0.76570.80720.8396多跳题需多个片段0.62120.64360.6831 规律清晰越难的问题重排收益越明显。多跳题基线最低0.6212但 Voyage 的提升也最大6.19ppJev 在多跳题上只小幅提升说明它更擅长判断单个候选是否命中而非综合多个候选排序。完整 40 组细分数据在 evaluation/reranking-metrics.csv 中。四、成本账本每千次查询多少钱语言Jev 1.13.0Voyage rerank-3计费 Token1772 万1045 万估算费用$0.7443双语$0.5225双语平均延迟0.86 ~ 1.23 秒0.60 ~ 0.88 秒注意 Jev 是每个候选一个独立问题的判定式设计token 消耗比 Voyage 高约 70%。对重度使用的 Agent每天上千次记忆召回这笔账每月约 $5 vs $3.5差距不大但存在。五、结论Jev 值不值得开✅值得你的记忆库偏中英混合、想要零本地模型部署纯 API、不下载模型、不改向量索引、且对成本不敏感时Jev 用约 $0.17/千次换来 4.7pp 的 Recall5是明显赚的⚖️犹豫如果首条命中率MRR对你更重要Voyage 质量更高还更便宜是更理性的选择不必日常低频使用、或记忆内容涉及隐私不想发往第三方 API 的场景保持默认关闭reranker.model 即可——注意开启后查询和候选文本会发送到 TypeSafe官方建议只配置在可信的全局配置中。所以官方把 Jev 定位为显式开启的可选提供者而不是改变默认配置——评估数据支撑了这个克制它证明 Jev 有效但没证明它是最佳重排器。六、动手启用 Jev 重排与复现评估启用只需两步配置说明export TYPESAFE_API_KEYyour-key memsearch config set reranker.model jev:jev-1.13.0 # 或 jev:jev-latest 跟随最新稳定版想在自己的数据集上复现这套评估官方提供了完整运行器 evaluation/rerank_evaluate.py支持--preflight在不发起任何 API 调用的情况下预估成本聚合结果存于 evaluation/reranking-results.json更早的 12 款嵌入模型基准bge-m3 夺冠的那篇见 evaluation/README.md程序化接入方式见 docs/python-api.md。一句话总结Jev 远程重排在 memsearch 的中英双语评估中用 4.7 个百分点的 Recall5 提升证明了自己值得存在但面对 Voyage 的成本-质量组合它更适合作为按需开启的增强项而非默认答案。【免费下载链接】memsearchA persistent, unified memory layer for all your AI agents (e.g. Claude Code, Codex, DSH), backed by Markdown and Milvus.项目地址: https://gitcode.com/gh_mirrors/mem/memsearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考