
【免费下载链接】jevgrepFind code by asking what it does. A CLI for coding agents that uses Jev to discover relevant files and source context.项目地址https://gitcode.com/gh_mirrors/je/jevgrep点击查看免费下载本篇技术指南基于 Jevgrepjg项目在 SWE-bench 任务psf__requests-1142上的一次安装候选检查点installed candidate checkpoint记录展开说明 Jevgrep 在安装后的真实 CLI 包 官方规范技能canonical skill 强制初始检索指令条件下如何完成一次多文件定位任务以及在官方评分器下保持通过的同时付出了多少额外成本。读完本文你将掌握该项目的评估协议双臂对比、基线复用、Jev 成本单独核算、一次真实的检索包结构与 Sol 代理行为轨迹以及如何解读这类单任务核查的统计边界。检查点的性质集成质量通过而非队列验收仓库中保留的这份记录specs/done/jevgrep/assets/installed-requests-checkpoint.md明确限定了自己的定位这是一个集成/质量integration/quality检查点而不是队列cohort验收结果。两者的区别在于结论的适用范围——队列验收要回答某个候选版本在一组任务上的总体表现而本次检查只回答把 Jevgrep 以 npm 包形式安装、配上仓库自带的规范技能、要求代理必须先用一次检索之后单个任务还能不能照常通过、成本变化多少。这一点与该项目的评估策略一致evals/cost-quality-policy.md 规定官方 SWE-bench 任务完成度是首要指标同时要求报告每个尝试任务的完整任务成本编码代理 Jev增加的成本可以是更多完成任务的可接受权衡。本次检查点正是一次成本增加换来集成保障的单点核算。核心结果通过保持成本上升 30.03%检查点的原始数据表如下Installed jgFixed baselineOfficially resolvedyesyesFull Sol cost$0.3491436$0.2685004Sol generations1311逐项解读Officially resolved yes / yes安装后的jg方案与固定基线都在官方 SWE-bench 评分器下通过该任务。实现补丁与基线完全一致treatment安装分支额外做的事情是更广泛的测试——也就是说检索本身没有改变最终补丁的内容通过质量未因集成而退化。Full Sol cost 从 $0.2685004 升到 $0.3491436增加$0.080643230.03%。Sol 的生成次数从 11 次升到 13 次。注意这里的成本口径是编码代理Sol的完整成本Jev 成本和 token 均被排除——这是该项目评估策略的一贯口径详见 evals/cost-quality-policy.md 与 docs/architecture.md 中Jev cost is separate的说明。为什么会更贵从记录看treatment 分支承担了额外的检索与阅读开销24 次命令执行、48,127 字节输出而基线只有9 次命令、42,168 字节输出。文档同时提示部分命令是并行执行的因此这些数字不能直接当作模型调用次数。实验协议双臂同底只有两处显式差异检查点记录交代了完整的对照设置保证两只手臂可比双臂均使用openai/gpt-5.6-sol模型、medium effort、相同的900 秒截止时间、Codex 0.153.4以及保留的运行时runtime与源码source身份基线是保存的固定结果直接复用、不重跑The saved baseline was reused without executiontreatment 分支只有两处显式变更强制初始检索指令mandatory initial retrieval instruction代理必须先用一次 Jevgrep 检索安装的规范技能installed canonical skill即仓库中的 skills/jevgrep/SKILL.md它指导代理先读返回的摘录再做进一步发现、已知上下文时跳过冗余搜索、诚实处理不完整结果。这两处差异正是安装包集成实验的意义所在验证的不是检索算法本身而是把 CLI 与技能真实装进代理工作流之后端到端行为是否成立。候选包的 SHA256 为aebb98108817285b21b0dced87786e4060dd28a1509a2ac3236c3d3689217be7用于固化产物身份。实际观察到的检索包一次真实的 Jevgrep 输出检查点记录了 Sol 提出的原始查询verbatimrequests.get always adds Content-Length header; expected GET requests with no body to omit automatically generated Content-Length, while preserving body/header behavior. Find request preparation, header calculation helpers, callers, and tests.这是一个典型的按行为找代码问题requests.get总会自动添加Content-Length头而期望是无 body 的 GET 请求省略自动生成的 Content-Length同时保留 body/header 行为——并要求定位请求准备、头部计算辅助函数、调用方与测试。对应返回的检索包packet包含源码摘录requests/models.py:231–256, 385–414测试摘录test_requests.py:18–26外加六个文件线索file leads。这个包立即暴露了两件事无条件 header 赋值unconditional header assignment与认证重算authentication recalculation都直接可见。同时值得注意的是它的边界prepare_body只作为线索出现而非源码摘录——说明它未通过摘录阈值但文件位置仍被保留这正是 docs/architecture.md 描述的Paths without excerpts remain optional reading leads, not a compulsory checklist测试摘录test_requests.py:18–26只有 HTTPBIN/helper/class 脚手架不含行为断言——这成为后文薄弱的周边/测试上下文假设的依据。从实现侧看这种摘要先行、详细声明/调用位置殿后的输出顺序是 CLI 的固定渲染规则apps/cli/src/render.ts 定义了DEFAULT_MAX_SOURCE_BYTES 0默认包含全部选中的源而 apps/cli/src/args.ts 解析--max-source-bytes等参数输出全部走 stdout不生成报告文件。Sol 的行为轨迹识别缺陷、失败恢复、双重验证检查点记录了编码代理Sol在拿到检索包之后的完整行为链这是本文最有参考价值的部分识别缺陷Sol 直接认出了Content-Length的无条件赋值问题扩展阅读随后读取更广泛的 models/test 源码并检查 adapters、utilities、structures 与 setup——即检索包之外的普通工具阅读一次失败与恢复它的第一次捆绑检查bundled inspection在产生输出前失败随后用分离的命令恢复。这说明即便在安装好的 Jevgrep 流程里代理自身的工具调用也可能失败而恢复是正常行为双重验证验证运行了两次两次成功运行之间有一次测试编辑test edit。记录特别强调这不是未改动测试的重复运行not unchanged-test repetition。观察到的代理行为还包括额外的指导性搜索guidance searches、失败命令后的恢复、源码阅读与测试细化test elaboration。这些都在为后续呈现presentation研究积累假设薄弱的周边/测试上下文 宽泛的可选线索是文档给出的两个最可能影响成本与效果的呈现因素。Jev 成本单独核算$0.011889360 与0 ≠ 免费由于该项目把 Jev 成本从评分口径中剥离检查点专门花了一节澄清 Jev 侧的真实账目全部85 次 Jev HTTP 请求都返回 200这 85 次响应全部保留了 Gateway 成本元数据汇总报告成本为$0.011889360对应283,080 个输入 token、8,963 个输出 token若把 Jev 计入总成本$0.3491436 $0.011889360 $0.361032960这个数字是响应报告的 API 成本不是发票对账not an invoice reconciliation原始总和保留在尝试目录的jev-accounting.json中之前会计字段中的jev_cost_usd: 0表示的是评分口径下的排除而不是实测零费用——文档特别强调这一点避免被误读为 Jev 免费。还有一个容易被忽略的细节85 个客户端调用内部实际发生了100 次 Gateway provider 尝试。因此全部返回 HTTP 200不能解读为没有内部 provider 失败或回退——两者是不同层级的事实。这与 apps/cli/src/index.ts 中doctor命令的设计一脉相承诊断只报告一个经过消毒的 provider 错误并区分 HTTP 失败、超时与连接失败。另外整个任务中jg只被调用了一次其 CLI 数据包为2,852 个 UTF-8 字节——单次检索的体积很小成本主要消耗在 Sol 后续的阅读与验证上。保留证据与可复现性检查点记录声明没有从结果中丢弃任何任务、基线或失败并给出了证据留存位置这些目录按设计位于 Git 忽略的本地evals/runs/之下不随仓库提交本地忽略研究目录evals/runs/swebench/installed-jg-requests-checkpoint-v3/内含冻结计划、npm 包、安装前缀installed prefix与安全输入导出其attempt/子目录保留原始原生 rollout/events、jg-stdout.txt、原始 Jev bodies、补丁、官方评分控制台/收据以及生成查询与会计记录基线evals/runs/swebench/lookahead-native-v88/psf__requests-1142/codex-baseline/官方报告运行jg-installed-psf__requests-1142-8cd1b55070bf独立的实时安装查询evals/runs/swebench/installed-jg-live-query-v1/先于本任务完成其 Docker 启动 stderr 只有初始 Node 镜像拉取应用输出即为保存的 stdout。这种冻结候选、保留一切、机器可读与人工可读报告并存的做法与 evals/results/total-cost-2026-09-28.md 中每次尝试都有完整的传输与用量覆盖的披露口径一致。结论边界单对样本不能做因果归因检查点文档在末尾给出了严谨的统计声明一对样本one pair既不能把成本上升归因于某个变更也不能排除普通的模型方差。换句话说30.03% 的成本增加是观察事实但强制初始检索 安装技能导致成本上升只是待验证假设24 次命令 vs 9 次命令、13 次 vs 11 次生成这些差异同样可能来自 Sol 的随机轨迹差异因此文档把薄弱的周边/测试上下文与宽泛的可选线索称为未来呈现工作的假设hypotheses for future presentation work而不是已经证实的结论。这一边界同样体现在项目整体评估里evals/results/relevance-threshold-2026-09-27.md 与 evals/results/total-cost-2026-09-28.md 都强调十任务是有针对性的小型样本不是 holdout不构成跨语言/跨仓库的一般性结论其中psf__requests-1142在最新总成本重跑中的数据为 Sol $0.3368 Jev 估计 $0.0128官方结果 pass——与本次检查点的通过结论相互印证但两者是独立测量。从检查点看 Jevgrep 的定位把这份检查点放回项目语境可以看到 Jevgrep 的设计哲学在端到端实验中的体现README.md 概括为编码代理花在陌生任务上的每一部分时间都在找文件Jevgrep 给出起点实现与验证仍归代理所有。本次任务的真实流程——一次jg调用2,852 字节包→ Sol 拿到精准的源码位置与线索 → 自己补读、修复、双重验证、官方通过——正是这一分工的完整演示。安装侧的操作也由此可复现先npm install --global dzhng/jevgrep安装 CLI再jg auth选择 provider 保存密钥、jg doctor验证连通性最后在代理工作的项目里执行jg skill安装规范技能详见 apps/cli/README.md 与 skills/jevgrep/SKILL.md。检查点验证的正是这条安装链路 强制首用在官方评分器下依然能完成任务只是要付出约三成的 Sol 成本增量——这个代价换来的是对真实安装产物而非开发期内部构建的端到端信心。核心结论一句话psf__requests-1142检查点证明安装后的 Jevgrep含规范技能与强制初始检索能保持官方通过代价是 Sol 成本 30.03% 与更宽的命令/字节足迹它是一次诚实的单点集成核查其成本差异与行为假设都有完整证据留存但单对样本不足以做因果归因。赞分享【免费下载链接】jevgrepFind code by asking what it does. A CLI for coding agents that uses Jev to discover relevant files and source context.项目地址https://gitcode.com/gh_mirrors/je/jevgrep点击查看免费下载相关推荐Germeo-7B-Laser模型微调教程定制化你的德语AI助手Germeo 7B Laser模型微调教程定制化你的德语AI助手 Germeo 7B Laser是一款专为德语优化的AI语言模型基于leo mistral3个关键步骤如何用Python离线翻译库彻底告别网络依赖3个关键步骤如何用Python离线翻译库彻底告别网络依赖 还在为跨国协作的语言障碍烦恼吗还在担心敏感文档的翻译隐私问题吗Argos Translate是人工智能NLP本地部署JSHint 与持续集成Jenkins 中的代码质量检查JSHint 与持续集成Jenkins 中的代码质量检查 你是否还在为项目中JavaScript代码的质量问题头疼每次部署前才发现隐藏的语法错误本文将带你Lint静态分析上一篇解决LovelyMem常见问题新手到专家的排错指南下一篇终极修复方案彻底解决《恶霸鲁尼》Windows 10兼容性问题创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考