
9 月 30 日谷歌发布了新一代前沿模型 Gemini 4 Argon这是 Gemini 4 世代的第一个前沿模型。官方把它定位成面向复杂、长周期工作流的模型主打软件工程、法律与金融这类企业知识工作还有网络安全防御。这次发布里被讨论最多的一个数字是单次输出上限从此前的 6.4 万 token 提升到了 100 万 token涨了十几倍。注意是输出上限不是上下文窗口——这两个经常被混为一谈但说的是完全不同的两件事。一、这次真正变的是一次能写多长先把概念捋直上下文窗口模型一次对话里能读进去多少。输出上限模型一次任务里能连续写出多少。过去一年多行业卷的多是上下文——往里塞几十万 token 的资料。而输出上限主流前沿模型大多卡在 12.8 万 token 左右谷歌此前的 Gemini 是 6.4 万。Argon 直接拉到 100 万。这个变化的意义在于以前一个 Agent 跑几轮就容易因为输出太长或者上下文成本被顶断现在模型可以在一条任务轨迹里持续推理一次生成几十万甚至接近百万 token 的结果。对大代码迁移“多步骤企业流程”深度研究这类任务是实打实的能力边界外扩。二、配套的几个数字据机器之心、iThome 等报道Argon 公开的关键点大致如下项目数据单次输出上限100 万 token此前 6.4 万DeepSWE v1.1 软件工程评测77.9%CWE-bench v1 漏洞修复评测68%长视频理解 LVBench91.7%API 定价推广期输入 2 美元 / 百万 token输出 10 美元 / 百万 token缓存输入比标准输入低 95%推广期后价格输入 4 美元、输出 20 美元谷歌还称Argon 已在内部工程流程里干活参与内部 C/C 代码库向 Rust 迁移覆盖 re2、libgav1 等核心库以及超过 80 万行代码的 Fuchsia Zircon 内核在 libgav1 项目里重写了约 3.2 万行 SIMD 代码新版本运行速度达到原 Rust 版本的 2.7 倍在数据中心内存优化中相关方案上线后释放了超过 300 TiB 内存。但也要看到另一面。据彭博社报道谷歌内部对 Argon 在编码等关键任务上的表现仍有疑问——基准测试好看员工真正用起来部分编码任务依然难以稳定完成。三、对普通开发者意味着什么一句话别急着为100 万上头先看你能不能用上。Argon 走的是分阶段发布。首批通过 Fairwind Program 提供给受信任的网络安全防御者之后才逐步向开发者、企业和消费者开放首批公开用户包括付费 API 客户和 Google AI Ultra 订阅者。反过来理解就是普通人暂时还用不到。真能用上时长输出是稀缺资源。100 万 token 的输出按 10 美元/百万算一次拉满大约 10 美元值不值要按任务算账。缓存输入打 0.5 折这点很关键做长文档、反复带同一批上下文时优先命中缓存能省下不少钱。长输出适合的任务整库代码迁移、大范围重构、长报告生成、多步骤自动化。不适合的任务日常问答、改几行代码——用长输出模型既贵又慢。四、几个坑提前记一下别把输出上限和能交付划等号。一次能写 100 万 token不等于一次就能写对。越长的产物越需要人审、跑测试、做仿真。警惕榜单第一。官方基准和真实工作流之间往往有落差等独立评测和真实代码库验证再下判断。算清成本结构。输出比输入贵得多Agent 循环里输出占比高账单涨得往往比想象快。安全能力越强风控越紧。Argon 有较强的网络安全能力所以谷歌限制滥用、防提示注入并做分阶段开放。企业接入时要配合自己的审批流程。结尾Argon 这次把输出上限从 6.4 万拉到 100 万本质上是在为 Agent 的长任务场景铺路模型不只是要读得多还要能写得长、写得稳。但能力边界外扩的同时迁移成本、审核成本、账单成本也跟着上来了。这类模型到底能不能进你的主力工作流等它真正全量开放、跑过几轮真实项目再说。你怎么看100 万 token 输出这件事是真需求还是又一次参数竞赛评论区聊聊。