ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【AAAI 2026】AgentSwift:值引导层次化搜索的高效 LLM Agent 设计|从 LLM 智能体自动架构搜索视角

【AAAI 2026】AgentSwift:值引导层次化搜索的高效 LLM Agent 设计|从 LLM 智能体自动架构搜索视角 本文解读 AAAI 2026 论文《AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search》。该论文提出AgentSwift——一个用于自动设计 LLM Agent 的值引导层次化搜索框架通过融合分层搜索空间联合建模 agentic workflow 与 memory / tool use / planning 组件、轻量价值模型7B 骨干 任务适配器的代理评估器与不确定性引导的层次化 MCTS以预测偏差驱动探索把「靠昂贵实测试错的 Agent 设计」改造成「可预测的引导搜索」其特别之处在于只用一个 70 亿参数的蒸馏模型就替代了 GPT-4o 的上下文预测并首次把工作流与功能组件放进同一个搜索空间联合优化。实验表明在 7 个基准、5 类任务上全部取得最好 AgentALFWorld 达到 0.806较最强基线 AgentSquare 0.701 提升 15.0%价值模型均方误差仅 0.0054、Spearman 排序相关 0.8987搜索在 60 次真实评估的预算内稳定收敛为 LLM Agent 的自动化设计提供了重要借鉴。视频讲解点击观看 B 站视频论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQAgentSwift 到底解决了什么问题价值模型为什么比直接用 GPT-4o 预测更好不确定性是怎么定义的有什么用这个框架需要多少实测预算搜出来的 Agent 能换别的模型用吗它和 AgentSquare 有什么本质区别参考链接论文基本信息项目内容标题英文AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search标题中文AgentSwift值引导层次化搜索的高效 LLM Agent 设计作者Yu Li, Lehui Li, Zhihao Wu, Qingmin Liao, Jianye Hao, Kun Shao, Fengli Xu机构清华大学 · 华为诺亚方舟实验室 · 山东大学会议AAAI 2026arXivarXiv:2506.06017项目网站github.com/Ericccc02/AgentSwift背景与动机LLM Agent 已经成为解决推理、网页操作、具身任务与多工具整合的主力范式但一个高性能 Agent 的诞生过程至今仍高度依赖人工设计。早期的自动化尝试集中在局部子系统提示词优化DSPy、OPRO 一类、agent profiling、通信拓扑搜索等它们只动 Agent 的某一个部件。近两年出现了端到端的工作流搜索AFlowICLR 2025 OralarXiv 2410.10762把工作流当成可执行代码图用 MCTS 搜索ADAS自动设计 agentic 系统MaASICML 2025 OralarXiv 2502.04180进一步学习一个与查询相关的架构分布。但它们基本停留在「工作流」这一层无法灵活纳入记忆、规划、工具使用这类已经被人工验证有效的功能组件。与本文最相关的AgentSquareICLR 2025arXiv 2410.06153虽然把四类模块引入设计空间却把工作流模板写死、接口僵硬搜索过程仍以提示词为中心。论文归纳出三重现实困境其一搜索空间偏窄忽视了已被人工验证的记忆、规划、工具使用等关键组件其二评估成本极高——按论文引用的数据在 ALFWorld 上评估一个基于 GPT-4o 的简单 CoT Agent 需要大约 60 美元其三在大设计空间里探索低效让发现新 Agent 的过程又慢又贵。AgentSwift 的出发点就是把这三件事一次性解决把搜索空间扩到「工作流 组件」把昂贵评估换成低成本预测再用不确定性把有限的实测预算花在刀刃上。研究主线从问题到结论图 10AgentSwift 研究主线——从「Agent 设计靠手工」的痛点到 7 基准 60 次预算内收敛的引导搜索Mermaid 流程图基准/方法设计AgentSwift 的核心是把「Agent 设计」重新表述为一个可解的搜索问题。它把 Agent 形式化为四元组 $\mathbf{A}(\mathbf{W},\mathbf{M},\mathbf{T},\mathbf{P})$$\mathbf{W}(N,E)$ 是 agentic workflow由 LLM 调用节点和定义执行顺序的边组成$\mathbf{M}$、$\mathbf{T}$、$\mathbf{P}$ 分别代表记忆、工具使用和规划三类可插拔功能组件。每一类组件都有自己的参数化空间——例如记忆是 $(m,\tau,d)$即提示、温度与外部记忆后端。关键在于这个分层空间是收得更宽的把功能组件固定为固定模板时它退化成 AgentSquare把组件去掉只看工作流时它退化成 AFlow因此论文可以说「把既有方法收为特例」。给定任务描述 $d$ 与评估函数 $\text{Eval}d(\cdot)$目标就是在这个空间里找让评估最大的 Agent即 $\mathbf{A}^* \arg\max{\mathbf{A}} \text{Eval}_d(\mathbf{A})$。图 1框架总览——(a) 分层搜索空间联合建模 agentic workflow 与可组合功能组件(b) 不确定性引导 MCTS 的层次化扩展(c) 价值模型的训练与推理分类全景图 11AgentSwift 分层搜索空间分类——Agent 由工作流 W 与记忆 M、工具使用 T、规划 P 三类可组合组件构成Mermaid 流程图方法细节框架由两块拼成价值模型做代理评估不确定性引导 MCTS做搜索。价值模型是一个监督学习器 $f_\theta(\mathbf{A}, d) \approx \text{Eval}_d(\mathbf{A})$用 7B 预训练语言模型加轻量 adapter 实现以均方误差端到端微调。它最大的价值是「把预测能力从大模型里蒸馏出来」过去的工作如 AgentSquare把历史性能塞进 prompt、用 GPT-4o 做上下文预测搜索期间要反复调用大模型开销很高AgentSwift 把这个能力固化成一个轻量、跨任务泛化的模型推理又快又便宜。训练数据用两阶段构造先用 $t2$ 覆盖阵列保证四个设计元素的两两交互至少出现一次再用 Balanced-Extreme 贝叶斯采样以一个汉明核高斯过程为代理用 UCB 与 LCB 两个采集函数各取一半一半探索高潜力区域、一半探索高不确定性区域最终得到 220 条标注样本8:1:1 划分。图 2价值模型的数据构造——$t2$ 组合覆盖保证两两交互Balanced-Extreme 贝叶斯采样UCB/LCB补足高潜力与高不确定性配置搜索侧用不确定性引导的层次化 MCTS分四步选择用混合概率 $P_{mixed}(i) \lambda \cdot \frac{1}{n} (1-\lambda) \cdot \mathrm{softmax}$把均匀探索与「性能 不确定性」的加权分数结合起来扩展依次做重组、变异、精炼——重组替换工作流或某个子系统变异让 LLM 编程器生成全新子系统实现精炼根据失败案例做提示、温度或控制流的微调每一步都用价值模型给候选打分、只把最好的传到下一步评估把选中的 Agent 实测同时用 $u |s_{real} - \hat{s}|$ 定义价值模型的认知不确定性回传把 $(A, s_{real}, u)$ 写回全局经验池新子系统也入库供后续复用。正是这个不确定性项让搜索主动去补足那些「高潜力但还没被充分评估」的区域。实验设计与结果评测覆盖7 个基准、5 类任务域具身类是 ALFWorld 与 ScienceWorld数学是 MATH网页是 WebShop工具类是多工具整合的 M3ToolEval 与多约束规划的 TravelPlanner游戏类是 PDDL。对比基线分两类手工设计的 AgentCoT、CoTSC、ToT、Fleet-of-Agents、Thought Propagation、Self-Refine、DiLU、Voyager、DEPS、Step-Back Planning与自动搜索方法AgentSquare、AFlow、ADAS、MaAS。所有方法统一用60 个已评估 Agent的预算主实验的 LLM 为 gpt-4o-mini结果取 3 次独立运行的平均价值模型骨干用 Mistral-7B-v0.3 与 Qwen2.5-7B在 3 张 A100 上训练。主结果如下表AgentSwift 在全部 7 个基准上都是最好的方法ALFWorldSciWorldMATHWebShopM3ToolTravelPDDLAgentSquare0.7010.4750.5560.5200.5610.5530.577AFlow0.6190.4520.5620.4970.5240.4970.528ADAS0.5670.4630.5430.4360.5000.4530.509MaAS0.6120.4370.5970.4850.5370.4030.564AgentSwift0.8060.5090.6280.5620.6340.5730.614价值模型本身的比较也很关键。论文把 AgentSwift 的预测器与 GPT-4o / GPT-4o-mini 的零样本、少样本以及朴素监督模型做了对比预测器MSEMAER²SpearmanAgentSwift (Mistral-7B)0.00600.05300.80680.9026AgentSwift (Qwen2.5-7B)0.00540.05470.82750.8987gpt-4o few shot0.01620.08930.47930.7654vanilla0.15720.3593-4.05900.2467消融与跨模型迁移进一步验证了每个设计选择的必要性方法ALFWorldMATHAgentSwift (full)0.8060.628w/o recombination0.7390.588w/o mutation0.7610.562w/o refinement0.7760.621图 3搜索轨迹ALFWorld 与 M3ToolEval——AgentSwift 曲线更陡更稳用更少评估达到更高成功率图 4左搜索策略消融完整版 / 去不确定性 / 去 MCTS右评估方式对比价值模型 / GPT-4o 预测 / 完全实测图 5少样本泛化——迁移到未见过的 M3ToolEval仅用 30 条标注样本即接近全量训练的 oracle 性能图 6成本-性能 Pareto 前沿ALFWorld——极低预算段 MaAS 占优而高性价比的整段前沿由 AgentSwift 独占图 7墙钟时间分析——不仅成功率更高且用更少实际时间达到该性能图 8其余基准搜索轨迹MATH 与 PDDL——更陡且更稳定结论与主实验一致图 9其余基准搜索轨迹SciWorld、TravelPlanner、WebShop——分层空间与不确定性探索具备跨任务普适性结果对比总结图 12AgentSwift 结果对比总结——ALFWorld 0.80615.0%、价值模型 MSE 0.0054、7 基准全面 SOTAMermaid 流程图关键发现7 个基准全面最优ALFWorld 0.806 较最强基线 AgentSquare0.701提升15.0%M3ToolEval 0.634 提升13.0%MATH 0.628 提升5.2%。价值模型压倒性领先Qwen2.5-7B 版本 MSE0.0054、R²0.8275、Spearman0.8987而 GPT-4o 少样本只有 MSE 0.0162 / Spearman 0.7654朴素监督模型 MSE 高达 0.1572——相差约一个数量级。搜索轨迹更陡更稳去掉 MCTS 或去掉不确定性都会让曲线明显变平用价值模型预测比 GPT-4o 预测进步更快完全实测最慢因为它把预算浪费在低效候选上。跨模型可迁移在 gpt-4o-mini 上搜出的 Agent 直接换模型评估ALFWorld 从 0.806 升到 DeepSeek-V3 的0.843、GPT-4o 的0.851M3ToolEval 从 0.634 升到0.695。消融逐项有效去掉重组影响最大ALFWorld 从 0.806 掉到0.739去掉变异降到 0.761去掉精炼降到 0.776。样本效率极高价值模型迁移到未见任务仅用30 条标注样本就接近 oracle成本-性能 Pareto 前沿的高性价比整段由 AgentSwift 独占。局限性提案机制偏启发式重组、变异、精炼依赖人工设计的 LLM 提示词作者认为更原则化的做法是训练一个从任务描述到 Agent 系统的生成模型一次前向就产出适配的 Agent。价值模型仍需标注数据虽然适配器微调可跨任务泛化但在高度专精或交互式环境里标注成本依然高昂引入自监督或偏好信号可减少对真实任务标注的依赖。静态设计当前框架只寻找静态 Agent不处理部署期根据执行反馈做动态适应让 Agent 在运行中实时修订、重组自己的工作流是未来方向。常见问题FAQAgentSwift 到底解决了什么问题它解决的是「自动设计 LLM Agent 太贵、太慢、空间太窄」的问题。做法是把搜索空间从单一工作流扩展到「工作流 记忆 / 工具 / 规划组件」用一个轻量价值模型替代昂贵的真实评估再用不确定性引导的 MCTS 把有限的实测预算花在最有价值的候选上。价值模型为什么比直接用 GPT-4o 预测更好因为它是被蒸馏出来的专用预测器7B 骨干加任务适配器以均方误差端到端训练MSE 0.0054、Spearman 0.8987明显优于 GPT-4o 少样本MSE 0.0162、Spearman 0.7654而且推理成本远低于在搜索中反复调用大模型做上下文预测。不确定性是怎么定义的有什么用不确定性 $u |s_{real} - \hat{s}|$即价值模型预测分数与真实评估分数的绝对偏差。它让搜索在选择父代时既考虑性能也考虑「还没被充分评估」的候选从而避免陷入局部最优——消融显示去掉不确定性会让曲线明显变平。这个框架需要多少实测预算所有方法统一 60 个已评估 Agent 的预算AgentSwift 在这个预算内就稳定收敛到更强的 Agent对比之下完全实测的策略进展最慢因为在低效候选上浪费了大量预算。搜出来的 Agent 能换别的模型用吗可以。论文在 gpt-4o-mini 上搜索再把同一个 Agent 架构直接部署到 DeepSeek-V3 与 GPT-4o 上评估ALFWorld 从 0.806 分别升到 0.843 与 0.851M3ToolEval 从 0.634 升到 0.695说明搜到的架构具备跨模型的可迁移性。它和 AgentSquare 有什么本质区别AgentSquare 虽然引入了四类模块但工作流模板固定、接口僵硬、搜索仍以提示词为中心AgentSwift 用分层搜索空间把工作流结构与组件配置联合优化并把 AFlow、AgentSquare 都收成了这个更宽空间的特例。参考链接论文 arXiv 摘要页arXiv:2506.06017官方代码仓库github.com/Ericccc02/AgentSwift最相关的自动 Agent 搜索基线 AgentSquarearXiv:2410.06153ICLR 2025工作流搜索基线 AFlowarXiv:2410.10762ICLR 2025 Oral架构分布搜索基线 MaASarXiv:2502.04180ICML 2025 Oral给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表