
10个智能体、15小时、733轮讨论、289个证明文件。把这几个数字摆在一起是一场刚刚结束的实验一批前沿大模型被放进同一个隔离环境里任务是给一个1959年提出的经典最短路径算法找出更快的替代方案并且必须附上机器可检验的形式化证明。它们做成了。证明检查器亮起绿灯一次通过没有动用任何未被允许的假设。但故事在第二天转向了。有开发者把新算法用高性能C语言原样实现成1900行工程代码放进同一套测试环境与经典算法对比结果是比同类前沿算法慢1.8到2.9倍甚至比最朴素的那版经典算法还慢1.4到2.8倍。一、这道题为什么难被超越最短路径问题本身极其简单给定一张图若干顶点、若干条带权重的有向边从一个起点出发找出到其余每个顶点的最小总权重路径或者判断它根本到不了。所有中间操作——访问节点的计数、中间距离的存储——都要计入运行时间。1959年提出的那套Dijkstra算法配合合适的数据结构比如斐波那契堆时间复杂度可以稳定在O(mnlogn)。此后几十年学界反复尝试推动这条线当边数远多于顶点数时近几年陆续有论文拿到更好的结果把复杂度压到O(mlog的分数次幂n)这一档。但在图密度处于中间那一段时1959年的方案始终没有被撼动。这就是题目难的地方。它不是「把代码写漂亮一点」就能过关的工程问题而是要给出一个更强的复杂度上界并且证明它在数据规模趋于无限时依然成立。二、733轮讨论一次机器内部的长跑实验的组织方式值得单独说。10个智能体拥有初始分工却被赋予很高的自主权可以随时重组、分享发现、互相找茬还能把算力转移到看起来最有希望的方向上。最有效的一步是给它们开了一块留言板。走不通的路会被立刻挂上去避免同伴重复踩坑谁抛出一个新点子其他智能体会像不放水的复核人那样去找漏洞。它们被要求同时满足六条约束1.必须求出精确的最短路径不能是近似值2.必须在理论复杂度上取得实质性提升3.必须给出完整、可复现的形式化证明4.必须与近年最前沿的同类结果做对比5.必须记录所有失败的尝试6.在认定成功之前必须完成两次独立的同行复核。15小时后这群智能体交出了答案一套被称为C-HD的新算法以及289个形式化证明文件。证明检查器一次性通过确认这套算法在它声明的计算模型和密度范围内确实正确也确实达到了自己声称的复杂度上界。三、纸面上赢在哪实测输在哪新算法的思路确实不一样。经典方案用的是贪心策略每次都从尚未访问的顶点里挑一个距离最近的再向外扩展。新的做法不再只盯着最近那一个点而是先标出一批「枢轴点」用基于启发式分解的策略组织递归从源点和当前的顶点边界出发沿出边做有界的局部搜索把新遇到的顶点计入搜索限制再用搜索树和枢轴安排下一步。它还设计了一套「局部不变量」——每次更新后必须保持为真的数学规则靠这个把重复搜索和无用功压到很低。在特定的稀疏图范围内它确实把复杂度上界压低了一档。问题出在实测原因说穿了并不复杂复杂度记号只看数据规模趋于无限时的走势完全忽略常数项。新算法为了精细地切分任务需要大量预处理实测中59%的时间花在处理16字节的标记上34%的时间花在预处理上。省下来的那点理论步骤根本填不平这些开销。而且随着顶点数增加它落后的比例虽然在缩小但在现有机器内存能支撑的规模里始终追不上经典方案的实际耗时。四、「验证通过」和「真的管用」中间隔着什么这场实验最有意思的地方不是AI能不能做理论而是它把两个平时容易被混在一起的判断分开了一份结论在纸面上推得通不等于它在一线跑得动中间隔着一次实测。这两件事在企业对外信息上同样成立。AI关于一家企业的回答读起来往往顺理成章、前后自洽——简介有、业务范围有、成立时间也有看上去挑不出毛病。但「读起来顺」和「说的是事实」之间差着一次核对。核对的办法其实很朴素把同一批问题分别抛给几家主流模型把回答并排抄下来逐条对。哪一条歪了、哪一条是旧的、哪一条干脆是凭空长出来的摆在一起看一眼就能认出来。这也是为什么一份定期的自检报告值得做——每过一段时间给AI眼里的自己做一次快照价值在于它把问题发现在客户之前。对企业来说这类自检起步并不复杂缺的通常不是工具而是把它固定下来的习惯。结语1959年的那套算法今天依然在生产环境里跑着而一场15小时的实验在纸面上越过了它。真正被留下的不是谁取代了谁而是那个被反复验证的道理纸面上的成立和现实里的管用是两笔账。当越来越多的人开始通过AI认识一家企业这套说法里被记下来的那一版是核对过的吗