
美东时间中午 12 点北京时间次日凌晨 0 点AWS 在 Strands Labs 实验项目下发布Strands Decider 2B——一个约 20 亿参数、可从 Hugging Face 免费下载、采用 Apache 2.0 许可的决策模型。它不写散文只对“这个工具该不该跑”“三条路径选哪条”这类有界问题一次前向传播给出选项和概率。这条赛道是 Jev 点燃的TypeSafe AI 于 9 月 15 日推出 Jev称之为 “System One” 模型输入应用状态和类型化问题返回选项、分数或 yes/no 概率不生成文字。定价为每百万输入 token 0.042 美元约 0.3 元人民币不收输出 token 费用——10 亿输入 token 折合 42 美元约 300 元人民币。Jev 只提供 API权重和完整训练配方均未公开。此后两周一批带可下载权重的竞品接连出现。AWS 是怎么做的Strands Decider 以阿里 Qwen3.5-2B 为预训练底座去掉预测下一个词的组件换成给候选答案打分的小型“指针”模块底座用 rank-16 LoRA 适配新组件新增参数一百万多一点架构图里这套设计叫 “Hobson”。它只做一次前向传播返回可选项上的分布。AWS 称开发者可用它路由请求、选择工具、评估输出或审查 agent 的动作训练数据、脚本和代码将随 version 20 一同发布。演示场景是天气工具调用前的检查点用户没说城市agent 猜了一个Strands Decider 判断城市是否来自用户请求、此时调用是否过早应用代码据此让 agent 回头去问城市。这一步接的是 Strands 框架已有的 intervention 机制可以放行、拒绝、请求确认或用反馈引导。AWS 承认示例里的问题和阈值是手工设定的专用集成库仍在开发中——模型给判断怎么用还是开发者的事。速度与准确率AWS 说短任务上本地决策耗时几十毫秒部分常见硬件和输入下低于 100 毫秒。更具体的数据是在本机 Nvidia RTX 3090 上跑 version 18230 次请求的中位延迟 106 毫秒、p95 为 296 毫秒且包含 HTTP 往返服务器预热时那次 7.7 秒的首请求被排除在图表之外M3 MacBook 上小任务中位数约 150 毫秒。TypeSafe 报告的 Jev 端到端响应约为 70 至 500 毫秒。硬件与网络条件不同谁更快无法定论。质量方面AWS 用 JevBench 公开部分同时测准确率和概率可信度Brier 分数。图上 v19 约为 72% 准确率、0.35 Brier 分数而体量相近的 Mapika decider-2b v11 约为 76% 和 0.32——两项都是对手更好。AWS 的说法是在同尺寸公开模型中排第二在完整公开训练配方的模型中排第一。图表里既没有 version 20 的结果也没有 Jev 本身。开源是唯一确定的优势价格上有个悖论Strands 标价为零Jev 的使用价也几乎可以忽略。AWS 目前只提供开源模型没有托管 API、没有按次收费但也没给出可与 API 费率比较的每 token 或每请求运营成本估算——用户得自己出 CPU/GPU 或云算力。除非公司已有闲置算力或出于隐私与控制权看重本地执行否则自托管是否更省钱尚无证据。对比之下开放性、自托管、隐私控制、可微调都是 AWS 明确占优的地方易用性则属于 Jev。同赛道的还有 Laya4.21 亿参数 ModernBERT 架构主打本地决策、Jared Palmer 的 Kev、Bespoke Nimble 9BApache 许可适配器、Mapika 的 decider 系列、FLock 的 this-that-model以及斯坦福与英伟达合作的 CLM-8B——后者可缓存可复用动作的表示在研究者自己的测试中某些任务上比 Jev 快最多 9 倍但工具调用准确率落后。真正的考验还没到AWS 提前给媒体的三张技术图表和发布稿都无法证明 Strands Decider 整体胜过 Jev。而且概率性判断不能当作不会出错的安全边界对抗性文本可以影响它的裁决。发布示例里的天气场景只是一个审查点的示意不是“模型点头即安全”的证明。决定这套方案成败的是它在企业自己的策略、文档和异常案例上能否保持准确、校准良好以及本地推理加维护的总成本能否打赢 Jev 那个低得离谱的托管价。