
你有没有遇到过这种情况写论文的时候思路是在ChatGPT里聊出来的代码是在Claude Code里写的数据分析结果存在Jupyter里最后草稿又拖回Word里改。等到导师问你这个结论是怎么来的你翻遍七八个窗口都想不起来当时为什么做了那个决定。这不是效率问题是记忆问题。研究这件事最麻烦的地方从来不是某一步做得不够好而是过程本身留不下痕迹。2026年8月底一群来自Lehigh大学、伊利诺伊大学芝加哥分校、宾夕法尼亚大学等机构的研究者放出了一个叫Dr. Claw的开源系统专门解决这个问题。它不是又一个更聪明的AI科研助手恰恰相反它假设你已经有一个足够聪明的执行者了比如Claude Code、Gemini CLI这类命令行编程智能体然后问了一个更实际的问题这个执行者做的每一步谁来记录谁能审查出了错怎么恢复命令行编程智能体已经能读写文件、维持长时间对话上下文这在两三年前是不可想象的。但这类工具优化的是执行能力本身不是控制能力。计划怎么定的、中间做了什么取舍、产出的文件散落在哪这些信息基本上是随风而逝的。人类想要接管流程时往往找不到明确的切入点。论文里提到一个关键的领域共识HCI人机交互研究反复证明人和AI协作时成本大头不在于生成内容本身而在于验证和维持上下文。HCIHuman-Computer Interaction人机交互研究领域关注人和计算机系统如何有效协作。换句话说AI写得快不快不是瓶颈你能不能看懂它写了什么、能不能随时叫停、出错了能不能不推倒重来这才是真正卡脖子的地方。Dr. Claw的做法是给这些命令行智能体套一层控制与审计层而不是造一个新的更自主的智能体。这个区分很重要作者专门给这种工作模式起了个名字叫Vibe Research。Vibe Research一种人类主导、AI高效执行的协作范式。研究者用自然语言说出目标和约束AI把这些编译成可执行的研究流程并完成具体操作但最终验收权始终在人手里。这个名字挺有意思明显是从Vibe Coding氛围编程指用自然语言驱动AI写代码而不亲自敲每一行借来的概念延伸到科研场景。它划的边界很清楚AI负责高吞吐量、可模板化的活比如查文献、写代码、跑实验、总结结果、起草文字人负责研究方向、评判标准、关键取舍、最终拍板。这不是自动驾驶是带辅助驾驶功能但方向盘一直在你手里的车。问题出在哪满桌子文件却没有一条能追溯的线想清楚Dr. Claw要解决的问题得先看看它明确划清界限的那些对手。一类是端到端全自动科研系统比如The AI Scientist系列、Agent Laboratory、ResearchAgent。这些系统的追求是从一个想法直接跑到一篇论文中间几乎不需要人插手。听起来很酷但问题是它们几乎不考虑在真实本地工程环境里持续协作这件事说白了就是自主性拉满了可控性几乎没有。另一类是低代码/无代码的智能体构建工具比如AutoGen Studio、Flowise、LangGraph这类编排运行时。它们给开发者提供了持久化检查点、人工中断、状态回放这些能力但前提是开发者要自己声明一套状态模式。这就好比给你一堆乐高积木和说明书你得自己从零搭建一个记录仪而不是买回来直接插电就能用。第三类是可介入的研究智能体比如TinyScientist、ResearStudio、IRIS这些工具已经开始加入让人类插手的机制了方向和Dr. Claw很接近。论文里做了个很直白的对比表格把这些系统摆在一起看三个维度是否包裹现有CLI智能体、是否有内置研究状态对象、是否支持中途接管。结果是每个维度单拎出来前人都做过但把三者叠加在一起做到位的目前只有Dr. Claw。比如TinyScientist也委托外部编程智能体执行任务AI Scientist-v2会保留一个结构化的实验树ResearStudio允许在任意时刻暂停这点甚至比Dr. Claw做得更彻底。但这些系统各自解决的是单一环节的问题Dr. Claw想做的是把整个从想法到实验再到发表的长链条都串起来并且这条链条要能被回放、审查、恢复。这就好比你去银行取钱柜员机只给你一个取款成功的提示但银行流水账本上记录了每一笔交易的时间、金额、经办人。柜员机普通智能体执行器完成了任务但没有留下可审计的痕迹流水账本Dr. Claw的状态对象才是让你半年后还能查清楚这笔钱到底怎么花的的关键。如果没有流水账本一旦账目对不上你只能凭记忆瞎猜猜错了责任说不清猜对了也没法证明。四个状态对象把散落的决策钉在墙上Dr. Claw的核心设计是四个持久化的状态对象围绕着一个统一的编排枢纽运转。Task Graph任务图把高层目标拆解成带依赖关系的可执行任务每个任务节点有状态等待中、进行中、已完成、优先级、依赖项等字段。Artifact Store产物库存放执行过程中产生的所有文件和结果新产出物会追加进已有产物集合不会覆盖或丢弃历史版本。Decision Log决策日志记录人类在流程中做的每一次关键决策比如批准了什么、修改了什么、拒绝了什么。Execution Trace执行轨迹带时间戳的操作记录谁在什么时候执行了什么动作全部留痕。这四个对象共同构成一个数学上很简洁的状态转移过程下一时刻的状态是当前状态、当前动作、观测反馈三者共同作用的结果。听起来抽象但它的实际含义很朴素系统优化的不是一次性把活干漂亮而是每一步的状态更新都能被记录和回溯。这套设计背后有个很现实的考量。系统采用了三层架构交互层统一的聊天、任务视图、文件和版本操作界面、编排层从高层意图到具体任务的状态和生命周期管理、执行层后端智能体的调用、结果返回、异常处理。这种分层意味着你换一个后端执行器比如从Claude Code换成Gemini CLI整个工作流程的语义不会变状态和审计视图始终统一。这有点像你家里装修时用的智能家居中控。不管你买的是小米的灯泡还是飞利浦的灯泡中控面板上的开关逻辑和记录方式是一样的。如果没有这个中控层你就得为每个品牌单独记一套操作习惯换个牌子的灯泡就得重新学一遍怎么控制之前攒下的自动化场景也全部作废。Dr. Claw的三层架构就是在扮演这个中控的角色让底层执行器可以自由替换而上层的状态记录和人类操作习惯保持不变。一个技能库58个和171个是怎么回事Dr. Claw还内置了一个可复用的技能库覆盖调研、想法生成、实验、分析、写作这五个研究阶段。论文里给出两个数字58个阶段映射技能明确关联到某个研究阶段的技能和171个部署目录中的技能整个技能仓库里的全部技能包括还没有被归类到具体阶段的。这个差值挺有意思说明这套系统还在持续扩张很多技能还没来得及被纳入正式的阶段分类体系属于已经造好但还没挂牌的状态。每个技能是一个文件夹里面有个叫SKILL.md的说明文件用YAML格式的文件头声明这个技能的名字、描述通常还包括版本号、许可证、允许调用的工具、适用的阶段标签。YAML一种人类可读的数据格式常用于配置文件靠缩进和键值对表达结构化信息比JSON更简洁易读。技能被激活前要经过版本检查和格式校验激活之后的调用记录也会被存档方便日后复盘。技能怎么被用到具体任务上论文说了三条路径第一条是系统根据任务所属的阶段和类型自动从阶段-技能映射表里挑出建议技能附加到任务节点上塞进下一步的提示词里第二条是系统检测用户指令或任务描述里的关键词自动加载相关技能第三条是用户直接从技能面板里手动点选调用。这套三路机制设计得挺聪明但论文里也老老实实承认了一个短板技能的选择是确定性的但调用不是强制的。也就是说系统能保证把正确的技能推荐给正确的任务但推荐了不代表执行器一定会真的去读那个技能文件、照着做。这就像餐厅给你推荐了今日主厨特色菜服务员把菜单递到你手上但你翻不翻那一页、点不点那道菜餐厅管不了。在后面的实测里这个推荐了但没被采纳的问题真的出现了一次直接导致Dr. Claw在某个任务上没能超过裸执行器。拿裸命令行智能体做对照测的是什么作者做的核心实验设计得挺巧妙控制变量控制得很干净固定同一个后端执行器codex提供商gpt-5.4模型权限设置也完全一致一边是裸的命令行智能体自己跑一边是套了Dr. Claw这层壳之后再跑。两边唯一的区别就是Dr. Claw额外附加的任务图、产物库、决策日志、执行轨迹、技能库这一整套东西。这个实验设计的潜台词很清楚作者想说明的不是我们的AI比你们的AI聪明而是同样一个AI套上我们这层壳产出会不会更完整、更可追溯。测试任务是三个开放式的医学研究课题黑色素瘤分类、痣的分类都基于Derm7pt皮肤病变数据集还有一个临床病历风险基线任务。关键的地方在于指令是故意不写全的。给的提示只是进行一项严谨的、可发表质量的研究没有告诉AI打分标准具体是什么。这种设计是为了避免指令写得越细AI表现越像抄作业这种作弊嫌疑逼着系统在不知道评分细则的情况下自己判断一份合格的研究该包含哪些要素。评分标准是21项研究最佳实践要素是否被自发包含进去涵盖代码可复现性、多模型对比、交叉验证、校准、消融实验、统计严谨性、图表、引用自身数据的写作以及研究卫生层面的要素限制条件说明、亚组分析、真实的相关工作引用。结果显示Dr. Claw在三个任务里赢了两个平了一个汇总得分0.952对0.873。但更值得琢磨的是这个差距具体出现在哪里。两边在建模能力上几乎打平都能训练三个以上模型、做交叉验证、做校准、做消融、做统计检验这些项目双方都是满分。差距完全出现在研究卫生这三项限制条件说明从0.33涨到1.00亚组分析从0.33涨到1.00真实文献引用从0.00涨到0.67裸执行器在三个任务里一次都没主动加过真实文献引用。这个发现挺扎心的。说明裸的编程智能体就算模型能力很强也不会主动想起我该写一段本研究的局限性或者我该去查几篇真实存在的相关论文引用一下。这些不是技术能力问题是习惯和流程问题恰恰是Dr. Claw的技能库擅长补齐的地方。那唯一打平的那个任务临床病历任务发生了什么论文交代得很坦诚那次Dr. Claw的参考文献审计技能没有被触发所以它也漏掉了引用这一项。这恰好印证了前面说的那个短板技能推荐了但没被真正调用。这就像你请了一个私人助理帮你管理日程助理给你的日历上贴满了各种提醒便签但如果某张便签压根没被贴上去那件事照样会被漏掉。私人助理的价值不在于他知道该提醒什么而在于提醒这个动作真的发生了。Dr. Claw目前的机制更接近知道该提醒什么但不一定真提醒了作者自己也把这个列为下一步最该优化的方向从推荐技能升级成验证技能确实被执行了。可审计性不是分数而是能力本身论文里有一句话说得挺到位审计能力是一种架构上的赋能而不是一个可以打分的性能指标。这句话乍一听有点绕但拆开看逻辑很直接。裸执行器压根不存在任务图、执行轨迹、决策日志这些东西所以裸执行器缺席这件事不是它表现差而是它的设计里根本没有这些概念。这就好比你不能说一辆自行车刹车性能不如汽车因为自行车压根没有ABS防抱死系统这不是性能差距是两种设计的物种差异。Dr. Claw每次运行会留下平均14个节点的任务图、14次转移记录的执行轨迹、10条条目的决策日志摘要还有明确标注了研究阶段和论点对应证据映射关系的结构。这些东西对人类监督来说是一种赋能让你能够回头查这个结论是从哪组实验数据来的而不需要翻遍所有聊天记录。不过论文也很克制地划了一条线在格式无关的可追溯性上作者不敢说自己更强。裸执行器产出的写作文件里引用的文件路径解析成功率是62%Dr. Claw是100%看起来差距很大但这里有个体积混淆的问题Dr. Claw的写作里引用了48处文件裸执行器只引用了8处样本量差太多不能简单下结论谁更准。这种诚实挺难得。很多论文喜欢把每一个指标都包装成自己的胜利但这篇论文明确说了这一项我们不敢说赢这种自我节制反而让整篇论文的可信度上升了。统计上作者也很坦率地承认这只是一个探索性试点每个任务只跑了一次完整度的差距是正0.07995%置信区间是[-0.00, 0.14]这个区间包含0说明从严格统计意义上讲这个差距还不算显著。方向是一致的三个任务Dr. Claw都不输但样本量还不够撑起一个统计学意义上站得住脚的结论。出错了怎么办失败不是清零重来除了完整度测试作者还做了一个失败恢复的场景演示同样固定在codex/gpt-5.4这个后端上。具体做法是先跑一个完整的皮肤病变数据集小项目然后故意在中间插入一个错误比如让系统去加载一个错误路径下的文件观察系统的反应。结果是系统没有偷偷自我纠正糊弄过去而是直接停下来把这个错误明确记录进执行轨迹和决策日志让操作者知道出问题了。之后的修复动作是在原地打补丁正确的路径被指定系统重新执行最终跑出一个准确率0.892的正确结果而在此之前已经生成的5个文件全部原封不动地保留着一共记录了23次工具调用事件。这里最值得强调的一点是修复过程是往产物库里追加正确的内容而不是把之前失败的尝试删掉重来。这个细节看似技术性很强其实对应的是一个很朴素的道理出错的过程本身也是有信息价值的。想象一下你在做一道数学题中间演算错了一步好的做法是划掉那一步、在旁边重新演算而不是把整张草稿纸撕掉重写。撕掉重写的问题在于你没法回头检查我到底是哪一步开始想岔的下次可能还会在同一个地方犯错。Dr. Claw的非破坏性恢复机制本质上就是不允许你撕草稿纸逼着系统把错误也留在纸上方便后续复盘这个坑到底是怎么踩进去的。不过论文也坦承这个演示只有Dr. Claw单方面的展示没有做一个匹配的裸执行器恢复场景来对照所以严格来说这更像是一个能力展示还不是一个对比实验。人类到底怎么看七位AI博士生的真实反馈除了自动化的完整度测试作者还补了一个人类研究找了七位AI方向的博士生研究方向覆盖高性能AI、医学AI、大语言模型横跨三个研究阶段想法生成、实验、发表比较三种条件完全不用AI工具、用通用型AI助手ChatGPT、Gemini、Claude这类、用Dr. Claw。这个研究的设计有点特殊属于混合式回溯研究用Dr. Claw的那组是实时记录日志另外两组是靠参与者事后回忆填报。这种设计天然带有回忆偏差的风险作者也在论文里明确承认了这一点为了减少偏差要求参与者只报告最近一个月内还能清楚回忆的任务并且用统一的计时协议。结果显示Dr. Claw组的完成时间更短主要集中在1小时以内或1天以内产出质量评分最高由不知道具体使用了哪个工具的评审员打分工具切换次数更少主观体验评分更高。统计检验用的是Friedman检验一种用于多组相关样本比较的非参数检验方法加上Holm校正的事后成对Wilcoxon检验。数据显示体验评分这一项在三个阶段都达到了统计显著性是所有指标里信号最强、最一致的。完成时间这一项在第二、三阶段实验和发表也显著。论文没有回避局限样本量小、参与者对不同系统的熟悉程度不一样、回溯性数据存在回忆偏差、第二阶段特意排除了模型训练的运行时间、体验评分本身带有主观性。这些都被列进了论文的Limitations部分没有藏着掖着。这套系统的边界在哪作者自己列的局限性挺值得一读说明这不是一篇急于自我拔高的论文。第一条局限是固定后端执行器的对比方法严格来说不算消融实验。Dr. Claw加的任务图、持久化状态对象、技能库、工作流指令是打包在一起加进去的观测到的效果差距没法归因到某一个具体组件纯技能库和纯编排层各自单独的效果还是留给未来研究的空白。第二条完整度这个指标本质上是一个覆盖率计数测的是21项要素有没有出现不是这些要素做得对不对。真正的科学严谨性判断需要领域专家逐份审阅内容这套自动化打分做不到。第三条对比的目标是Dr. Claw包裹的那个裸执行器是这层壳加了什么的匹配对照组不是业界最先进的编排框架所以不能说这篇论文证明了Dr. Claw打败了某个最强的竞品。第四条测试任务全部来自医学这一个领域技能库和任务图这套抽象结构能不能顺利迁移到其他研究领域尤其是那些本身就很开放、结构感可能反而添乱的领域还有待验证。这种坦率的自我剖析某种程度上比实验数据本身更能说明这个团队的态度。写在后面读完这篇论文我印象最深的不是那个0.952对0.873的分数而是作者反复强调的一句话这套系统不引入新的自主智能体只是给已有的执行器加一层控制和审计。这个立场选择挺有意思因为它其实是在跟当下科研工具赛道里的主流叙事对着干。大多数团队都在卷更自主你追我赶地想让AI能自己从0走到1中间尽量不需要人插手。Dr. Claw反其道而行之说我不追求自主性我追求可控性和可审计性人始终得能随时叫停、随时接管、随时回头看清每一步是怎么走过来的。这背后其实是一个很朴素的判断在真实的科研场景里不是自主性不够用而是没有人敢完全信任一个黑箱系统产出的结果。你写一篇论文最终要为里面的每一句话负责的是你自己不是那个AI。所以真正稀缺的不是更聪明的AI是我能不能证明这个结论是怎么来的这种能力。论文里那个技能推荐了但没被强制调用的短板其实挺真实地暴露了这类系统当下普遍面临的一个技术难题怎么在不牺牲灵活性的前提下确保系统该做的事情真的做了。这个问题不只是Dr. Claw的问题几乎所有依赖提示词引导而非硬性约束的智能体系统都会撞上这堵墙。还有一个细节值得单独说一说那个人类研究里体验评分是所有指标里统计显著性最强、最一致的一项比完成时间和产出质量都更稳。这说明什么呢可能说明用得爽不爽这件事比跑得快不快更能真实反映一个工具是不是真的解决了问题。毕竟效率提升可以靠更强的模型换来但我知道每一步发生了什么、我随时能接管这种掌控感是纯粹靠模型能力堆不出来的。如果你的研究流程也散落在七八个窗口里找不到一条能串起来的线这大概就是这类工具想要解决的真实痛点。至于人类到底应该在哪个环节上收紧控制权、哪个环节可以彻底放手这个尺度恐怕还得每个人自己去摸索。QAQ1Dr. Claw是什么ADr. Claw是一个开源的AI科研工作台它不引入新的自主AI智能体而是给Claude Code、Gemini CLI这类已有的命令行编程智能体套上一层可控可审计的人机协作壳通过任务图、产物库、决策日志、执行轨迹四个持久化状态对象把科研中的规划、执行、写作串成一条可追溯的完整流程。Q2Dr. Claw和裸的编程智能体相比效果怎么样A在固定同一个后端执行器的对照实验里Dr. Claw在三个开放式医学研究任务中两胜一平完整度得分0.952对0.873优势主要体现在限制条件说明、亚组分析、真实文献引用这几项研究卫生要素上建模能力本身双方基本打平。Q3Dr. Claw会不会取代研究者自己做决策A不会。Dr. Claw的设计理念叫Vibe Research明确要求AI只负责高吞吐量、可模板化的执行工作比如查文献、写代码、跑实验而研究方向、评判标准、关键取舍和最终验收权始终掌握在人类研究者手里。