ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AutoResearch双MCP Server实战:让外部模型进入代码审查与结论评审闭环

AutoResearch双MCP Server实战:让外部模型进入代码审查与结论评审闭环 AutoResearch双MCP Server实战让外部模型进入代码审查与结论评审闭环【免费下载链接】AutoResearchAI/ML research agents from idea to paper-ready evidence. An EvoMap open-source project.项目地址: https://gitcode.com/gh_mirrors/autore/AutoResearchAutoResearch 是一个开源 AI 研究智能体项目能把研究想法自动推进到论文级证据。本文实战讲解它的两个内置 MCP Server——ar-gemini-review代码审查与ar-external-critic结论评审如何配置、如何自检以及它们怎样构成一个外部模型参与决策的完整闭环。一、双 MCP Server 解决什么问题AutoResearch 的执行层 ar-runtime/ 由官方claudeCLI 驱动一个确定性工作流队列见 ar-runtime/ar-coordinator-startup-flow.md从plan_gate到code_gate、code_review、实验运行最后close_if_done收尾。问题在于干活和把关不能是同一个模型。如果 Claude Code 自己写代码、自己判断可以结束了研究结论就缺乏外部校验。AutoResearch 的答案是两个 stdio 型 MCP Server基于 Bun MCP SDK 实现让外部模型以评审员身份安全地介入MCP Server职责核心工具落盘产物ar-gemini-review代码审查code_review 单元gemini_reviewreview.mdar-external-critic结论评审 / 盲审external_critic、blind_reviewcritic.md 评审回执一句话总结设计哲学模型负责判断引擎负责留痕。所有评审报告都必须经过契约校验并写入工作流引擎换掉模型可以报告必须可追溯。二、代码审查 Serverar-gemini-review实现见 ar-runtime/scripts/ar-gemini-review-mcp.ts。它注册了唯一工具gemini_review兼容旧名实际路由到code_reviewer角色输入是代码包 上下文计划、成功标准、硬约束输出是一份严格结构化的 markdown 报告Blockers运行前必须修复崩溃、静默错误结果、数据泄露、无效结论或任何被违反/未验证的硬约束Warnings应当修复不影响实验范围与有效性的改进项Constraint Audit上下文中的每条硬约束必须恰好出现一次标注satisfied / violated / not_verified及证据文件:行号被违反或未验证的约束必须同时报为 BlockerNotes / Overall低风险观察与总体评价报告通过 MCP 返回后并不是口头结论。当调用方指定了unit、cycle、project_root、output四个参数时ar-runtime/scripts/ar-review-contract.ts 会校验输出路径必须是project_root/review.md注入溯源信息model、model_identity、unit、cycle并重新规范化blockers_count程序化校验 Constraint Audit 条目无重复、证据齐全、blocker 编号一致调用 ar-runtime/scripts/ar-workflow-engine.py 的record-review-report命令把报告绑定到队列单元引擎拒绝则整个工具调用失败。也就是说Blocker 数量、约束审计结果都会被机器校验模型说没问题是没问题还是真的没问题由契约层说了算。三、结论评审 Serverar-external-critic实现见 ar-runtime/scripts/ar-external-critic-mcp.ts它提供两个工具1.external_critic—— 挑战是否该结束工作流到达收尾阶段时协调者把产物包bundle提交给外部评审。关键机制是双评审独立身份主评审critic与次评审critic_secondary必须来自不同的模型身份次评审调用时还会显式排除主评审的身份防止同一模型自己审自己两者都必须成功且返回可解析的 verdict否则整个工具抛错不允许半吊子放行共识裁决有明确优先级任一评审给出needs_revision代码/分析/报告缺陷→ 优先于needs_more_research证据不足→ 最后才是finish_ok再审一轮也不太可能改变结论。报告持久化到critic.md后还会写入评审回执receipt每位评审的角色、模型、身份、verdict 以及响应原文的 SHA256 哈希见 ar-runtime/scripts/ar-critic-contract.ts。事后可以逐字节验证结论评审确实发生过、是谁做的。2.blind_review—— 模拟同行评审把研究提交做成无记忆审稿场景Reviewer A 扮演方法论怀疑者Reviewer B 扮演实证严谨性怀疑者按目标会议默认 ICLR校准输出 1–10 分评分、soundness/contribution/presentation 分项、accept/borderline/reject 决定并强制忽略自评分与内部评审历史、中位数投稿应被拒稿。这是给论文质量加的一层外部标尺。四、配置步骤3 步跑通双 MCP Server第 1 步注册 Server。配置集中在 ar-runtime/.mcp.json两个 server 都用 Bun 启动对应脚本ar-gemini-review: { command: bun, args: [run, ./scripts/ar-gemini-review-mcp.ts] } ar-external-critic: { command: bun, args: [run, ./scripts/ar-external-critic-mcp.ts] }第 2 步配置角色与模型。MCP Server 本身不含密钥它通过 Python 桥 scripts/call_role.py由 ar-runtime/scripts/ar-role-client.ts 拉起按角色名取模型code_reviewer、critic、critic_secondary。参考 config/providers.example.json 在本地config/providers.local.json中为三个角色选择模型——三个角色至少需要两个互不相同的模型身份否则独立身份检查会失败。凭据与投影机制详见 ar-runtime/README.md。第 3 步自检。在ar-runtime/目录运行统一入口./scripts/ar-preflight-mcp.shar-runtime/scripts/ar-preflight-mcp.sh 会一次性验证Bun 可用、render_env本机投影新鲜、两个 server 的--self-test各自真实调用一次角色并检查独立身份对。全部通过才输出MCP preflight: 两个 server 都可用。五、闭环实战评审结果如何驱动工作流配置完成后两个 Server 嵌入队列的关键节点code_gate/code_reviewcoder 写完代码后ar-gemini-reviewer整理上下文并调用gemini_review报告落review.mdBlocker 未清零就回到修复循环close_if_done协调者准备收尾时调用external_criticneeds_revision会把工作打回只有独立双评审共识finish_ok才允许输出完成标记promiseAUTORESEARCH_DONE/promise投稿前用blind_review给准论文做一次外部盲审校准。整个过程的进度可以在项目监控面板中直接看到Code review 单元显示 blockers/warnings 计数External review 单元显示 primary/secondary 两位独立评审的模型身份与健康状态上文的监控面板截图即来自项目自带面板生成逻辑见 src/generate_project_dashboard.py。真实的判断进度不要只信队列状态而应读project_root/state.md的## agents段与review.md、critic.md实际产物研究结论沉淀则进入项目知识库面板生成逻辑见 src/generate_kb_dashboard.py六、关键文件速查内容路径MCP Server 注册ar-runtime/.mcp.json代码审查 Serverar-runtime/scripts/ar-gemini-review-mcp.ts结论评审 Serverar-runtime/scripts/ar-external-critic-mcp.ts评审契约报告校验/落盘ar-runtime/scripts/ar-review-contract.ts回执与独立身份契约ar-runtime/scripts/ar-critic-contract.ts角色调用桥scripts/call_role.py统一自检入口ar-runtime/scripts/ar-preflight-mcp.sh工作流队列说明ar-runtime/ar-coordinator-startup-flow.md示例想法文件examples/ideas/synthetic_gpu_smoke.md总结AutoResearch 的双 MCP Server 把外部模型参与研究决策变成了一条可验证的流水线——代码审查有结构化契约与约束审计结论评审有独立身份共识与 SHA256 回执配置与自检各有统一入口。新手按注册 → 配角色 → 跑自检三步即可把这套闭环跑起来让每个实验结论都有外部模型的独立背书。【免费下载链接】AutoResearchAI/ML research agents from idea to paper-ready evidence. An EvoMap open-source project.项目地址: https://gitcode.com/gh_mirrors/autore/AutoResearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表