
做 Agent 服务这段时间被问得最多的问题就是我该用哪个模型这个问题其实很难回答因为它往往问错了方向。大多数人把选模型当成选一个更聪明的聊天机器人——谁分数高选谁。但 Agent 不是聊天选模型的标准完全不同。一、为什么 Agent 选模型和聊天不一样聊天是一次问答答错了顶多回答得不专业用户重新问一次就行。Agent 不一样。一次 Agent 任务往往要连续调用 5~20 次模型理解需求、拆解步骤、调用工具、处理结果、再决策下一步。任何一环出错代价都会沿着链条放大。举两个真实的场景客服 Agent 调错了退款工具直接把钱退了——这在聊天里只是回答错在 Agent 里就是操作错财务 Agent 在报表里算错一个数后面所有基于它的决策都跟着错所以 Agent 选模型的头号标准不是最聪明而是最不容易出错、出错也敢兜底。说得直白点不是选最强的是选你敢让它上生产的。二、敢用的三个硬指标不看榜单分数看这三个1. 工具调用正确率Agent 的核心是调工具调对函数、传对参数、按顺序执行、该停就停。这是生产环境里模型之间差距最大的地方。目前多轮工具调用的主流基准 TAU-bench 上头部模型能达到 87% 以上的正确率但这个数字在不同任务上波动很大——所以别只看总分要看它在你那个场景的表现。2. 拒答能力这个指标很少有人提但对 Agent 特别重要不确定的时候敢不敢说不。一个敢拒绝的模型遇到权限模糊、指令冲突、数据缺失的情况会停下来问人而不是硬着头皮执行。对 Agent 来说不乱动比多做一步安全得多。评估的时候专门测这种边界场景比测它多聪明有用。3. 长任务稳定性Agent 常常要跑几十步。有的模型前三步很聪明到第十五步开始跑偏、忘了最初的指令、开始自由发挥。长任务稳定性就是看它能不能从头到尾守得住目标。这个指标只能拿你的真实任务去跑榜单测不出来。三、怎么评估建你自己的 eval 集这是选型里最容易被跳过、也最值钱的一步。别信厂商的跑分也别信别人的测评文章。正确做法是从你的真实业务里挑 20~50 个有代表性的任务做成测试集明确什么算成功工具调对没有、结果对不对、该停的时候停没有让候选模型各跑一遍记下成功率、失败原因、耗时拿结果说话而不是拿感觉说话建议先拿最强模型跑一遍建立性能基线再逐个换小模型看它能不能保住基线的结果。很多场景里小模型在简单任务上完全够用能省下可观的成本——但前提是有 eval 数据撑着而不是凭感觉换。四、选型是一个过程不是一次决定模型不是选一次就完事的。一个 Agent 从原型到生产通常要经历三个阶段原型期先用最强模型把流程跑通这时候不心疼钱目标是确认业务逻辑成立生产期在 eval 集上验证后把简单子任务换到性价比更高的模型贵模型只留给关键环节放量期业务量上来后做模型路由——规划、决策用强模型分类、抽取、总结这类子任务交给便宜模型也就是说选哪个模型的正确答案是分阶段选可能不止一个。五、别忽略模型之外的那一层最后说个容易被忽视的点模型能力再强也绕不开你接入的那条 API 通道。Agent 是生产系统意味着它对接口的要求是稳定而不是便宜限流和并发Agent 高频调用一次 429 就可能打断整个任务链故障响应模型服务出问题多久能恢复、有没有备用通道售后支持出问题找谁、响应多快、能不能帮你排查计费透明缓存怎么算、对账依据是什么能不能看到每一笔消耗这些听起来不像选模型但生产环境里通道的稳定性往往比模型的聪明程度更能决定你敢不敢用。小结给 Agent 选模型别问哪个最聪明问哪个你敢用看工具调用正确率、拒答能力、长任务稳定性用你自己的 eval 集测别信跑分分阶段选型原型、生产、放量各不同模型之外接口通道的稳定性同样决定成败选型是第一步后面还有工程和运营。这个系列我会继续讲——如果你也踩过模型选型的坑欢迎评论区聊聊。