ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

大模型推理到第 20 步就崩?也许不是它笨,是搜索空间在“使坏“

大模型推理到第 20 步就崩?也许不是它笨,是搜索空间在“使坏“ 专注AI 大模型与前沿科技深度解析习惯从工程师视角拆解技术热点让我们一起在技术浪潮中保持清醒与好奇 大模型推理到第 20 步就崩也许不是它笨是搜索空间在使坏上周帮一个学弟 debug 他的课程项目用当前主流大模型做符号重写任务——给定一个群的表示通过一系列合法变换把它化到目标形式。结果很典型前 5 步每一步读起来都漂亮第 20 步必崩。他试了换更强的模型、加 few-shot 示例、调温度、采样 64 条取多数投票全都没用。后来我们一起把失败轨迹摊开来逐步看发现问题根本不在模型智商而在于他让模型在一个结构性陷阱密布的空间里裸奔。最近一项叫 SAGEStructural Admissibility-Guided Exploration的工作把这件事讲透了我觉得值得每个想做推理增强的同学花十分钟了解。30 秒结论核心判断长链推理20 步以上、奖励只在终点出现的脆弱性根源是搜索空间的结构问题不是模型能力问题。换更大的模型收效甚微注入结构先验收益显著。两个病因探索偏差被局部合理但结构不稳定的分支吸走 复合偏差每步偏一点随深度累积放大稀有奖励被彻底压制。两副药方代数稀疏化治探索偏差双曲空间深度引导治复合偏差。适合谁做数学推理、定理证明、Agent 规划、程序合成的学生和工程师。不适合谁任务链条很短、没有明确合法操作集合、或奖励本身定义不清的场景。关键证据诊断框架可验证这项工作提出 Symbolic Closure AnalysisSCA把长链推理失败形式化为上述两种偏差——不是玄学归因而是能在轨迹数据上逐一测量的量。广度足够在 12 个基准、7 个模型家族上系统超过竞争性基线说明不是过拟合某个任务的小把戏。深度有说服力在 Andrews-Curtis 问题上取得最高 8 倍提升。这是 1965 年提出、至今未解的群论猜想相关的搜索任务属于真实世界的开放难题不是合成玩具。机制一一对应两个组件各治一种病消融实验里去掉任何一个对应的偏差就卷土重来——这种药方与病理对应的实验设计是判断方法是否靠谱的重要信号。展开说明两种偏差长什么样想象走一个故意使坏的迷宫每个岔口都有一条看起来最顺的路但迷宫设计者把诱人的死路修得比活路还气派。这就是探索偏差——模型用局部似然当指南针而局部似然在长链任务里是系统性误导的读起来通顺 ≠ 结构上能走到终点。复合偏差更像复利不过是负利率的。每步偏差 1%听起来无所谓200 步之后整体偏离被指数放大而奖励只在终点出现一次走歪了几十步之后才也许有人告诉你。稀疏奖励下信用分配根本做不完模型连错在哪一步都不知道。结构先验怎么注入代数稀疏化候选动作不再是词表里的全部文本而是被投影到算子索引的代数子空间里。说人话用问题自带的合法变换集群的生成元、重写规则、语法产生式约束候选空间把读起来通顺但结构上不可能存在的分支提前剪掉。模型从自由创作变成在合法集合里排序。双曲结构引导推理过程本质是一棵树树的节点数随深度指数增长。欧氏空间装不下指数增长的结构而负曲率的双曲空间天然可以——庞加莱圆盘里越靠近边缘可用空间越大恰好像树的展开。把推理状态嵌入双曲空间后深度变成可度量的几何量于是每一步都能拿到稠密的方向信号不必走到终点才知道偏了。这正是对治复合偏差的那副药。落到代码上核心改动小到令人意外defadmissible_moves(state,operators):# operators任务自带的合法变换生成元、重写规则等return[op(state)foropinoperatorsifop.is_valid(state)]defguided_step(state,operators,scorer):candsadmissible_moves(state,operators)# ① 结构过滤returnmax(cands,keyscorer)# ② 模型只排序不乱造和已有方法的关系也值得一说MCTS 靠大量 rollout 估计价值但稀疏奖励下 rollout 同样拿不到信号过程奖励模型PRM要训练步骤级打分器标注成本高。结构引导的思路是从问题的几何与代数结构里白嫖中间信号——这是面试里被追问你的方法和 PRM 有什么区别时的标准答法。落地建议今天就能做的 3 件事画一条偏差曲线对你的推理任务采样 N 条失败轨迹逐步检查从哪一步开始偏离合法空间。早期就偏 → 探索偏差为主缓慢累积偏 → 复合偏差为主。诊断清楚再下药别上来就堆算力。把自由生成改成枚举 排序哪怕是 24 点、汉诺塔这种小作业先枚举合法操作再让模型打分效果立竿见影代码就是上面那十几行够写进作品集。补一点双曲几何直觉读懂庞加莱圆盘的可视化原理用它把你项目里的推理树画出来——层次数据的双曲嵌入是一个小而完整的作品级 demo且能证明你理解为什么树状结构需要负曲率空间这个常被追问的点。风险与反例没有结构可提取的任务不适用开放式写作、闲聊、头脑风暴代数稀疏化无从下手硬套只会限制多样性。短链任务不划算三五步就能完成的推理引入嵌入和过滤的额外开销大于收益。先验错了会被放大结构引导是双刃剑它放大你对任务结构的全部理解——包括对的部分和错的部分。如果合法操作集本身定义有误正确路径会被系统性剪断。稳妥做法是保留少量原始分支作为 fallback。奖励定义错了一切免谈更密的中间信号只会让你更快抵达错误的终点。长链推理的失败往往不是模型走不动而是它在黑暗里没有任何扶手。给它结构比给它更多试错次数重要得多。
返回列表