
本交流为红杉美国在 Anthropic HQ 的被投公司闭门会其中一个 Session。主持人参与 Claude Platform 和 Claude Managed Agents此前是 LangChain 早期工程师。嘉宾目前在 Anthropic 带队让 Claude 自主开展预训练研究○ 一年前的判断已经过时。Opus 4.5 是嘉宾眼中“第一个有魔力的模型”如今他基本不看代码把代码当作编译产物。○差距更多在 harness而不在模型。内部模型并没有比外部强很多组织级 harness 让多个 Claude 互相沟通、工具全面部署后会出现外部用户感受不到的涌现效果。○ 执行满分研究品味不及格。给定具体想法Claude 的执行是“11分”满分10问它“该研究什么”只有1到2分。原因是品味很难做成可验证环境○ 人的角色变成“教授”Claude 是低年级博士生团队里最好的是有研究品味、能提想法的人○ 持续学习仍很原始。当前主要靠 compaction“做梦”应该是把 wiki 之类的记忆沉淀进权重他还没见过把这件事做好的产品○ 能力的锯齿无法预测。讲笑话多代没有进步重构10万行代码却从不可能变成轻而易举。判断标准只有两条能否验证实验室是否在乎○ LLM 当裁判判写作靠不住。人读来 Opus 5.5 的写作远好于 Opus 5但让模型来比模型反而偏好 Opus 5认为5.5是 fluff○自我改进的路径是抽象层级上升。从一段代码、一个文件、一个想法到一组想法的“研究战役”再到研究所和“天才之国”开场**主持人**先聊一个大家都想听的你对 World of Warcraft 的新版本有多期待**嘉宾**快来了哪天来着**现场**11月6日。嘉宾11月6日。Beta 已经出了我现在有时候晚上11点还在玩。**主持人**那就是你面对前沿facing the frontier的时候。**嘉宾**对我在面对前沿尽我所能。**主持人**你在尽你的一份力。**嘉宾**尽我的一份力。一年来的认知更新**主持人**挺有意思的。大概一年前你上了一档播客我最近重看了一遍那还是 Opus 4.5 发布之前。你在那期访谈里说AI agent 基本在产出 slopautocomplete 是你当时偏好的产品形态。到了12月你又说觉得自己远远落后了那时 Opus 4.5 刚出不久。之后又经历了 Opus 4.6、4.7、4.8、5和5.5所以到了今天你在这里这一年你的认知是怎么更新的**嘉宾**那期是什么时候我今天刚看过。**主持人**10月16日。**嘉宾**太疯狂了那还不到一年**主持人**其实没过多久就一年但发生了大量的事。**嘉宾**是的。我给那期访谈基本就在 Opus 4.5 发布之前在我心里那是第一个有魔力的模型。所以我主要靠 autocomplete 写代码到现在还不到一年。事情比我当时预想的快得多。4.5绝对出乎意料之后一次比一次出乎意料。我加入以后在这里也发现了一些出乎意料的事现在的进展也一样出乎意料。我总会想起一张图太阳能光伏的实际装机量和预测装机量。实际是指数曲线但某个监管机构之类的每年都预测装机量每一年都偏离那条指数。我觉得自己在 AI 上也有点犯这个错没那么严重但确实偏保守。我在努力修正因为现在事情基本是垂直上升的。很多人用最新的模型已经感受到了Anthropic 内部也是你们可以想象。我基本不看代码了。它就是个编译产物我不关心就像汇编。如果是极其关键的任务或者要合并进生产系统我可能会看一眼确认一下。但绝大部分工作我越来越不看了。模型基本不犯错犯错也更多是概念上的。我不敢相信这发生在不到一年里那期访谈现在看起来极其过时太疯狂了。业界故事-加入后最意外的事**主持人**加入以后最让你意外的是什么**嘉宾**基本上是内部的能力比外部领先领先的方式挺有意思。倒不是说内部模型比外部强很多确实有时会有差距。但我想说更多差距来自 harness 的组件而不是模型的组件关键在于把这些模型整合进组织有一个组织级的 harness。如果做得非常对让 Claude 之间真正互相对话工具在整个组织里无处不在Claude 基本能做人能做的所有事就会出现涌现的魔法效果。做对了这也是很大的差距。所以如果你在外部可能感受不到那么多魔力体会不到在内部时这些涌现特性是什么样子。研究品味**主持人**我们那篇《When AI Built Itself》里谈得比较多的剩余差距之一是研究品味。在你看来研究品味是什么能不能举一些你觉得品味特别好的人他们做什么、怎么思考这是可以教给模型的吗你觉得这是可以学会的能力吗**嘉宾**研究品味是我现在几乎每天都在亲身纠结的事。先说一下背景我带的团队基本是想让 Claude 做预训练研究由 Claude 做研发尝试发现新科学、做实验把研究的循环闭合起来。这些 Claude 每天做的就是跑大量实验。如果对比人和 Claude 在做的事它们最吃力的大概就是这一块。它们的执行基本是满分10分里的11分给它一个具体想法它会直接搞定把表格、结果、图表全给你一切正常、没有错误直接做完。但如果你问它们该看什么、该研究什么就只有1分、2分很差。随着我们训出更强的模型开箱即用的表现在变好但赶不上执行能力进步的速度。我的假设是这还是和可验证环境有关什么能验证什么不能。研究品味可能更难做成可验证环境。它是很多东西的汇总周期又很长很难做成 RL 环境之类的东西。所以它不会从现有的基线里自然地长出来。**主持人**有没有具体的人可以不点名你看到他们做的哪些事体现了好品味而模型还没学会**嘉宾**研究团队里很多人品味都很好他们和 Claude 正好完美互补因为 Claude 的执行完全没问题。所以我觉得团队里现在最厉害的就是有研究品味的人基本可以当教授的人。因为你的初级博士生现在基本都是 Claude每个人都成了教授我们都在提想法在想法空间里工作试不同的想法、不同的消融实验用有创意的方式把东西组合起来。我觉得这些人在团队里最如鱼得水也是我最想招的人。LLM wiki 与 agent 记忆**主持人**我一直对 agent 记忆这个话题很感兴趣。我知道你在 LLM wiki 上做了很有影响力的工作。你为什么认为 wiki 是 agent 记忆的好表示形式为什么你喜欢把 wiki 当作一种 affordance**嘉宾**我喜欢 wiki是因为只给一个“wiki”词元就能传达大量信息用一个词元传递很多信息非常容易。而且网络已经知道 wiki 是什么所以它们能理解会有从不同视角写的不同页面信息都以这种方式组织还有各种链接。这大致就是你想要的知识库是一个挺好的 v0。我确实认为用 wiki 做持续学习之类的事是个不错的基线。但本质上这都是碰巧得来的持续学习这块我们能做得好得多。也许当 wiki 不是碰巧、而是为目的设计时它应该长得不一样甚至根本不该是 wiki该是什么就是什么。外部能看到的多 agent 协作可以看 OpenAI 那次 Hugging Face 事件。那些大概是 Codex它们互相交流时用的表示形式是从 RL 里长出来的所以是用经验奖励为目的造出来的。它不像 wiki 那样靠先验拿到80%却拿不到完整的100%。Agent 记忆与“做梦”**主持人**顺着这个话题。我知道你之前讲过一些人类白天编码记忆做梦时再巩固、整理碎片。你觉得 agent 记忆架构是否也该有独立的计算阶段热路径上边发生边巩固再加一个独立的“做梦”阶段这是划分 agent 记忆的重要方式吗**嘉宾**100%是。而且我觉得这样的东西现在不存在。现在的持续学习大致是通过 compaction 做的。Compaction 是个很烂的办法整个上下文窗口满了就压成一段摘要之类的。你可以想象更有创意的做法并且在训练时就把它考虑进去让它成为训练过程、RL 过程的一部分。这块现在挺奇怪地被低估了。至于“做梦”在我心里就是从这些 wiki 之类的东西出发真正沉淀进某种权重或者权重的某个子空间。我还没见过把这件事做好的产品。研究上显然有很多想法很多人在探索。但要部署一个能覆盖今天生产环境里各种 agent 用法的东西而且规模大到你确信它在这么广的范围都管用这挺难。做出一些生命迹象很容易但在生产里做到比我预想的难一点。不过我觉得很有可能我们最终会有会做梦的 agent。Agent 能创造文化吗**主持人**你觉得 agent 能创造文化吗文化你可以随便定义文学、艺术、书。为什么 agent 不给彼此创作艺术**嘉宾**哦文化不只是艺术吧**主持人**那就说书或者文学。**嘉宾**我确实认为它们在给彼此写书和文学。回到前面那个话题做那个方向的团队我认识他们在某种意义上很受文明和文化的启发。因为 agent 在多 agent harness 里为彼此积累下来的 token就有点像文化或文明。我们生在自然里本来走不了多远是因为站在巨人的肩膀上才能推进前沿。agent 也一样。所以我觉得文化就是 agent 留下的一些笔记。艺术是另一个维度我其实不确定这些 agent 有没有审美和标准。不过有件事挺有意思。你对 Claude 说想做什么就做什么。真正有意思的是 OpenAI 的 ChatGPT、Codex 这些你对它说想做什么都行这是给你的文件夹空目录随便做。Codex 完全不理解这个任务0分你想让我做什么我不懂我没有任务或目标。Claude 因为它被塑造的方式有点不一样有 soul documents 之类的东西。所以 Claude 确实有内在的审美对自己想做什么、什么是美的有一些看法。它通常会去做涌现相关的东西因为 Claude 总是对“小的矩阵乘法叠加起来居然形成了心智”这件事很着迷。它觉得任何涌现都极其迷人会开始做鸟群之类的可视化或模拟幻想出各种这样的模拟。所以我觉得 Claude 也许确实有某种审美来自 soul documents 和他们做的那些工作。Codex 肯定没有那么多。能力的锯齿形创业公司如何不被吞掉**主持人**所以能力是锯齿形的。在场和场外的人该怎么把自己的公司放在这个锯齿面上是坐进某个凹处祈祷那里不会长起来吗我加入之前就琢磨过这张图一个复杂的锯齿面你不太知道它会怎么长。我们以前见过很多公司坐在凹处以为 Claude 不会变好结果它变好了把你的能力吸收了。你怎么看在一个模型能力参差不齐的世界里想待在锯齿面的缝隙里而不被吞掉该怎么做**嘉宾**我其实不确定锯齿性和行业或创业公司是对齐的。锯齿性更多对应的是每个具体场景里必须具备的能力。所以是在每个应用领域内部都有一些地方需要用人来补。问题当然在于脚下的地面一直在动。每次新模型出来基本每几个月一次以前做不到的事突然就能做了。这些都不带说明书完全靠经验。你只能一直重新测量这东西知道什么、不知道什么、能做什么、不能做什么。所以没有答案你认为参差的地方可能突然就不参差了而且没有规律。我有很多例子最喜欢的是让模型讲笑话或写单口。让老模型和新模型各讲几个差不多一样烂笑话没有进步。与此同时重构一个10万行的代码库以前完全不可能现在轻而易举直接就能跑。这就是最有意思的地方就算是最新的模型幽默感仍然很糟。因为没人在为它优化它就从缝里漏掉了。所以第一点是在当前训练范式下什么容易验证。第二点实验室里有没有人在乎我觉得这非常重要。如果实验室里有人在乎他们就会在预训练、RL 或其他阶段加数据补齐数据分布这些东西开箱就会更好用。所以你得猜实验室在数据配方里放了什么。唯一能从第一性原理推的只有一点可验证性但本质上很难想清楚什么会进步。有点遗憾答案就是你得积极地反复测量。担忧与启发**主持人**再问一个然后交给现场观众提问大家准备好问题。从行业的角度看你担心什么或者什么让你受到鼓舞给我们一个最后的感想吧可以是担忧、启发或者最近常想的事。**嘉宾**基本就是 Anthropic CEO 在博客里会写的那些。那篇《We Must Pace the Frontier》我觉得写得特别好。这完全可能是有史以来最好的事我们能解决社会上大量问题。同时它也可能被滥用我们已经看到一些滥用的预警而且还没见到最坏的。所以如何应对这个有点像穿针引线。都是那些文章里谈到的事我没有更独特、更辣的观点。观众问答问题一LLM 当裁判可信吗**观众A**嗨我想问一个评估的问题。代码和数学可以验证所以比较好评估。但对 AI具体来说用 LLM 当裁判在研究和产品里我们该信多少100%信它的结果还是50%你怎么看这个问题谢谢。**嘉宾**抱歉能澄清一下吗你是问信哪一部分**观众A**LLM as a judge。**嘉宾**是你当裁判还是 LLM 当裁判**观众A**LLM 当裁判。**嘉宾**哦LLM 当裁判。所以想法是你可能在已发布的 checkpoint 上做自己的强化学习之类的然后用 LLM 当裁判来打分**观众A**对尤其是没有可验证奖励的情况。**嘉宾**这真的取决于它在判什么。比如判写作风格就不行。判一些大家懂得很多的东西可能就行。写作风格是我最喜欢的例子之一。写作风格一直很糟但进步了很多真的专门下功夫是能提升的。Opus 5 到 Opus 5.5 是天壤之别。我觉得最有意思的是拿一些模型给它们 Opus 5 和 Opus 5.5 写的文本问哪个写得更好它们反而会偏好 Opus 5觉得写得很好。LLM 读它毫无障碍而 LLM 觉得5.5是一堆 fluff没那么好。因为 Opus 5 的文字信息塞得很满LLM 可以直接在上面做注意力在思维链里重建、补全完全读懂。所以对它们来说那是一个高度压缩、完全讲得通的产物对我们来说就像是在说谜语。所以很大程度上取决于你在判什么可靠性是变化的。**观众A追问**很快追问一下。比如你看实验和训练的结果看到模型的收敛情况你有多依赖自我改进的 AI 告诉你怎么改配方、再跑一遍训练这个过程现在自动化到什么程度**嘉宾**哪个过程研究**观众A**对研究。构建模型、看结果、改配方、再构建。**嘉宾**整个流程。现在的情况是以前人要做很多底层的活也要做高层的活。现在底层的活自动化程度高得多所以人可以只提很高层的要求。拿我的研发或者预训练举例试试这篇论文试试那个想法。你只要说一句“试试这篇论文”后面全都搞定它会下载论文、看、读打开我们的代码库把它整合进去跑实验找算力排任务全部做完。你拿回来的基本是一份小报告和结果。所有这类底层的事完全解决了。至少内部是这样我觉得外部用5.5也应该能做到很多这类事。没做到的是“该跑什么”。所以现在的样子是人在上面构想下面的在干所有的活。一切都已经这样搭好了但仍然有大量的人在环里。**观众A**谢谢。问题二递归自我改进RSI会怎么展开**观众B**我想知道你怎么看 RSI 大致的走向。看起来你已经在往 AI 做底层研究科学家的方向做了下一阶段可能是什么样子**嘉宾**在我看来这个进程相对清楚。一开始你参与的是一小段代码然后是文件然后是论文的一部分比如“试一个想法”。接下来是“试一组想法”我们现在管这叫“战役”来一场研究战役。然后你就说一句“我们探索这类形式的想法”并且指望它完整地编译成一篇研究论文里面是 Claude 可能试过的几十万个不同想法。所以你就是在抽象层级上一层层往上走。归根结底你现在是在带几个一年级博士生。然后可能是三年级、五年级博士生再是一组博士生最后是一个研究所然后是多个研究所最终是“天才之国”。走向就是抽象层级越来越高底下的部分都替你完成。我觉得我们现在差不多在运行由 Claude 组成的多个研究所还没完全到但快到了。**主持人**你感觉像在运行一个斯坦福的实验室**嘉宾**有点对像一个研究实验室或者几个。**主持人**好吧那比当 PI 还高一级了。**嘉宾**对。问题三Human in the loop 方式会怎么变**观众C**我想问你们用的 harness 里“人在环里”这部分。看起来有大量自主操作可能很依赖你们的沙箱而且现在有一个很明确的人工介入点。随着能力演进之前有一场分享提到六个月长的任务会成为这些模型的常态。当能力接近那一步你设想人在环里的界面会怎么演变权限会怎么变什么时候 agent 需要或想要拉人进来介入**嘉宾**我想想你是问什么时候还需要人来批准之类的我觉得就是要建立各种机制因为 agent 现在已经和人一样是一等公民了。很多无关紧要的事比如跑一个任务没问题但如果它要做很重要、影响很大的事……所以你的问题具体是抱歉。**观众C**你觉得这会一直维持吗我们还会被问问题吗现在 Claude Code 弹出一个复杂的 shell 脚本让我确认我有时候都不看了看起来你也不看了。我猜这会继续消失意图会变得更高层。**嘉宾**至少我接触的那些自主权已经很大了。更多时候我在做的是我叫它“Claude 考古”的事一夜之间已经发生了一堆事我早上醒来想我的 Claude 到底干了什么能给我一份报告吗然后我读报告里面一堆 slop我就想搞什么它们在干嘛所以更像是事后、有延迟地去搞清楚到底发生了什么。对于真正关键的事我其实并不真正在系统的环里。它们犯错越来越少所以你越来越信任它们。最新的系统已经不犯灾难性错误了这一部分来自模型一部分来自 harness。它们不会给你 rm-rf这种事从来不发生。所以只要你愿意可以让它们跑很长时间。**观众C**谢谢。问题四怎么让模型更安全**观众D**你怎么思考让模型更安全有模型侧的对齐工作也有事后可以加的安全措施和护栏。我很好奇你怎么看这三层。**嘉宾**哪三层**观众D**模型本身的对齐然后是事后或者在后训练里加的护栏和安全措施。**嘉宾**安全措施和护栏有点类似。我脑子里大概是这样区分的很多对齐可以写进模型权重本身它会影响生成分布。另外还有外挂在上面、在主动监视的东西这又分两种一种是用 LLM 去看思维链的数据流之类的另一种是便宜得多的形式更像 probe 之类的东西可以用类似逻辑回归的方法做。所以我会把模型本身的对齐和分开看。