
今日导读昨天 AI 圈把两件极端的事塞进了同一天上午ChatGPT、Claude、Grok 集体躺平近四小时创下有记录以来规模最大的一次宕机几小时后OpenAI 端出 GPT-6 AstraARC-AGI-3 得分从 7.8% 直接跳到 99.9%Brockman 说「欢迎来到 AGI 时代」。一边是最强的模型一边是最脆的地基。1. GPT-6 Astra 发布ARC-AGI-3 从 7.8% 跳到 99.9%S级 速览OpenAI 最强模型上线首个触及 Critical 网络安全门槛企业端默认关闭发生了什么北京时间 9 月 4 日凌晨OpenAI 正式发布 GPT-6 Astra自称“目前全球最智能且对齐程度最高”。官方数据ARC-AGI-3 得 99.9%GPT-5.6 Sol 仅 7.8%FrontierMath Tier 4 达 98%ExploitBench 100%OSWorld 2.0 用约 40 分钟做到 72.6%上一代 75 分钟做 65.7%。上下文 105 万 token最大输出 12.8 万。API 定价每百万输入 10 美元、输出 50 美元是 GPT-5.6 Sol 的 2.5 倍但 OpenAI 称因步骤更少单任务成本可能反而更低。先向 Daybreak 网络安全客户开放企业管理员需手动开启——发布初期默认关闭。对你意味着什么如果你是开发者先别急着切成默认模型。输入超过 27.2 万 token 后价格翻倍、输出涨 50%长上下文任务的账单可能不降反升。如果你是产品/创业者企业端默认关闭是个强烈信号能力越强你越需要主动向客户证明“我关得住”。如果你是安全从业者评测期间 Astra 发现并利用了两个未知零日漏洞并已披露维护方攻防天平正式开始倾斜。现在可以做什么✅ 用同一批真实任务跑 A/B对比“单任务总成本”而不是单 token 单价✅ 把超过 27.2 万 token 的调用单独拎出来核算确认长上下文溢价是否划算 来源openai.com openai.com ithome.com news.cnyes.com标签#GPT6Astra #OpenAI #ComputerUse #网络安全 #模型定价2. AI 史上最大规模集体宕机三家巨头同时躺平近 4 小时S级 速览ChatGPT、Claude、Grok 同日中断Cursor 被拖累Palantir 单日涨 7.8%发生了什么美东时间 9 月 3 日早晨 9 点半起Claude 率先出现错误率飙升两分钟后 Grok 全端下线约一个半小时后 ChatGPT 与 Codex 大规模访问失败。Gemini 与 Copilot 同期收到大量中断报告Cursor 公告部分服务因上游模型故障受损。Downdetector 上 OpenAI 故障报告超 1.2 万份三家合计逾 1.4 万份。全程约 3 小时 40 分北京时间 9 月 4 日凌晨 1 点 10 分左右陆续恢复。xAI 是唯一给出解释的一家为孟菲斯数据中心故障致歉业内推测指向共享云基础设施尚无定论。对你意味着什么如果你是开发者把“模型会挂”写进架构假设。降级链路、重试退避、结果缓存今天起是必选项而非加分项。如果你是企业采购多模型路由不再只是“防止被绑死”的政治正确而是实打实的可用性指标可以写进合同了。如果你是投资人Palantir 单日涨 7.8%市场已经在给“本地化 / 去依赖”这条线重新定价。现在可以做什么✅ 给核心链路加一层兜底模型并压测一次“主模型 502”的完整降级流程✅ 核对你的 SLA 条款供应商状态页的免责范围大概率不覆盖这 4 小时 来源tmtpost.com toutiao.com hkcd.com.hk标签#集体宕机 #AI基础设施 #可用性 #多模型路由 #Palantir3. 微软给 Agent 装刹车发邮件、关工单、付钱都要人点头S级 速览Copilot Studio 上线工具级人工审批闸门独立于 Agent 自身指令发生了什么微软 9 月起向全球企业客户推送 Copilot Studio 新能力开发者可以为每个智能体、每个工具单独打开审批开关。触发时流程暂停弹出说明智能体意图的审批卡片用户可选择批准、批准整个会话或拒绝。官方列举的三类首批场景是发送电子邮件、关闭工单、处理付款。关键在于这道闸门独立于智能体的指令集——即使模型判断这是最优下一步也必须等人授权。审批卡片直接内嵌在 Teams 和 Microsoft 365 Copilot 中无需切回后台。对你意味着什么如果你是Agent 开发者这是把“审批权”从提示词里拿出来的标志性一步。靠写“重要操作请先询问”约束模型从此有了系统级替代方案。如果你是业务负责人你终于可以放心让 Agent 接核心系统了——不可逆动作有了硬闸门可控性第一次能写进流程文档。如果你是合规/风控审批留痕天然满足审计要求比事后解释“这是 AI 自己干的”强太多。现在可以做什么✅ 盘点手上所有 Agent 的不可逆动作发信、改数据、付款、删资源逐个标注风险等级✅ 只给高风险动作开审批别全开——审批疲劳会让闸门形同虚设 来源ithome.com donews.com d365hub.com标签#CopilotStudio #Agent治理 #人工审批 #微软 #企业AI4. OpenAI 砸 10 亿美元把 Astra 的攻击力免费送给防守方A级 速览Daybreak for Frontline Defenders 上线六个月内花完发生了什么随 Astra 同步发布的还有 Daybreak for Frontline Defenders 全球计划。OpenAI 承诺投入 10 亿美元提供 Daybreak 访问补贴、培训、技术支持与合作计划在六个月内消耗完优先覆盖水处理、电网、州与地方政府、社区银行、非营利组织和开源维护者。同期 OpenAI 还提出 Defense Factory 概念——用前沿模型做持续防御自动化完成漏洞的发现、验证与修复并强调“防御者窗口”这一时间概念。对你意味着什么如果你是关键基础设施/公共部门这是明确可申请的预算窗口六个月限期动作慢就真的没有了。如果你是安全厂商OpenAI 正在把“攻”和“防”打包成一件事卖。只做单点工具的壁垒正在变薄。如果你是开源维护者你在优先覆盖名单里。你的项目安全现在成了别人的 KPI。现在可以做什么✅ 确认所在机构是否落在优先覆盖清单走官方渠道提交申请✅ 重估安全投入结构一次性审计 vs 持续自动化防御预算该往哪边挪 来源openai.com ithome.com标签#Daybreak #网络安全 #OpenAI #关键基础设施 #开源维护者5. Anthropic 把 Agent 配置变成代码ant apply 一条命令拉齐A级 速览声明式管理 Managed Agent像管基础设施一样管智能体发生了什么Anthropic 的 Claude Devs 团队在 ant CLI 中新增ant apply。你可以在仓库里用文件声明 Claude Managed Agent 的环境、智能体、技能、记忆存储和部署再跑一条命令让云端 API 资源与这些文件保持同步。这意味着 Agent 配置第一次能进 Git、走 Code Review、做版本回滚。同期 Anthropic 还在公开征集 Function Hooks 的反馈——让开发者用代码挂钩子扩展和定制 Claude Code目前尚未发布。对你意味着什么如果你是团队负责人Agent 配置散落在控制台里的日子要结束了。改一句 prompt 也要走 PR review这是好事。如果你是平台/运维环境漂移终于有了标准解法staging 与生产 Agent 不一致的问题可以从流程上根治。如果你是独立开发者学习成本确实上升了但换来的可复现性和迁移能力值得。现在可以做什么✅ 把现有 Agent 的环境与技能清单导出成声明文件纳入版本管理✅ 去 GitHub 给 Function Hooks 提反馈——现在提还赶得上影响最终形态 来源x.com platform.claude.com x.com标签#Anthropic #Agent工程 #基础设施即代码 #ClaudeCode #可复现性6. 蚂蚁开源金融大模型 Ling-3.0-flash-Fin还顺手造了把尺子A级 速览124B 金融模型开源 FinFIRST 基准中金投行团队参与构建发生了什么蚂蚁百灵开源 Ling-3.0-flash-Fin124B 总参数、激活 5.1B 的 MoE 架构支持约 256K 上下文可接入搜索、文件解析、Python、数据库与电子表格等工具。同步开放金融搜索 Agent 评测基准 FinFIRST123 道金融专家编写并验证的任务50 余名金融专业人士参与构造与质检拆解出 701 个原子评分项、12300 个 Rubric 分值候选题最终采用率仅 9.78%。评测不止看答案对错还核验主体、报告期、单位、口径与数据版本。中金公司投行团队提供专业支持权重已上线 Hugging Face 与 ModelScope。对你意味着什么如果你是金融机构可私有化部署 开放权重意味着内部研报与客户数据不必离开内网。如果你是垂类 Agent 团队FinFIRST 的 Atomic / Loose Pass / Strict Pass 三层指标是一套现成评测方法论金融之外也值得抄。如果你是研究者Loose 与 Strict 通过率之间的巨大差距才是今天金融 Agent 的真实水位线。现在可以做什么✅ 用 FinFIRST 跑一遍现有金融 Agent看清差距卡在检索、核验还是计算✅ 先在 OpenRouter 免费体验期验证效果再决定是否私有化部署 来源mp.weixin.qq.com huggingface.co huggingface.co标签#蚂蚁百灵 #开源模型 #金融AI #FinFIRST #垂类Agent7. Mollick 让 GPT-6 无人干预干了五天造出个几 GB 的个人大脑A级 速览模型自己读邮件、下软件、定策略现在每天两次主动推送简报发生了什么沃顿商学院教授 Ethan Mollick 让 GPT-6 读完他数万封邮件、文稿与日程自主下载软件、自行制定策略在五天不间断、无人干预的工作中构建出一个数 GB 的个人 wiki涵盖研究、联系人、想法与任务。现在这个 AI 每天两次交叉核对新邮件并主动给他发摘要简报。他同时提醒授权 AI 访问自己的电脑存在风险需谨慎试用期内 token 未收费因此无法给出完整成本但“可能相当可观”。对你意味着什么如果你是知识工作者这是“AI 当助理”与“AI 当员工”的分界线——前者等你提问后者主动交付。如果你是管理者当一个人能调动的模型工时接近无限“团队产能”的算法要重写了。如果你是安全负责人请把“给 AI 开放电脑权限”列进本周风险清单这已经是真实在发生的事。现在可以做什么✅ 从只读副本开始先给邮箱和日历的只读权限跑一周看输出质量✅ 为这类长时自主任务单独设预算上限与沙箱别用主账号裸奔 来源x.com标签#个人知识库 #自主智能体 #EthanMollick #权限风险 #知识工作8. xAI 把 Grok Bot 卖给企业顺便重做了智能体该长什么样A级 速览Grok Bot 企业版上线产品主对象从「会话」变成「Bot」发生了什么xAI 宣布 Grok Bot for Enterprise 当日上线未来两周所有 Grok 与 Cursor 企业客户可免费使用还能邀请全组织成员——包括没有席位的员工。同步发布的设计文章解释了产品思路主对象不再是会话而是 Bot每个 Bot 拥有身份、记忆、自己的计算机与工具头像动效实时呈现空闲、工作、等待、阻塞、思考、完成六种状态工作区提供状态、预览、接管三级访问权限。Cursor CEO 称部署 Bot 的体验“像让公司入职几千名能干的同事”。对你意味着什么如果你是产品设计这是目前最清晰的一次表态持久化智能体的 UI 核心不是聊天框而是状态可见 随时接管。如果你是Grok/Cursor 企业客户两周免费窗口是零成本验证期值得让真实团队跑一轮再决定。如果你是创业者纯会话制产品的护城河正在被“有记忆、有身份、有电脑”的 Bot 型产品稀释。现在可以做什么✅ 趁免费期挑一个真实重复岗位周报汇总、工单分诊部署一个 Bot 试点✅ 把“状态可见性”加进你的 Agent 产品需求清单——用户不接受黑箱跑四小时 来源x.ai x.ai标签#GrokBot #xAI #持久化智能体 #企业AI #产品形态9. 斯坦福把中间推理扔掉长思考照样快 3 倍B级 速览Prefix Sliding 只留任务前缀和最近 token无需重训即可提速发生了什么斯坦福等机构的论文《Prefix Sliding for efficient test-time scaling》提出推理时不再保留完整思维链只保留任务前缀和最近 token 的滑动窗口中间推理 token 直接丢弃无需重新训练即可让推理提速约 3 倍。这直接挑战了“推理能力必须依赖长思维链”的默认假设也为“模型想得越久越贵”这个成本模型开了一道口子。对你意味着什么如果你是推理优化工程师这是可以在现有服务上直接试的改动不涉及重训试错成本极低。如果你是成本控制方长思考模式的账单有机会再降一个量级值得纳入下季度优化清单。如果你是研究者论文的边界条件——哪些任务能丢、丢多少不失真——才是真正的价值所在。现在可以做什么✅ 在长思考任务上测试“丢弃中间 token”对最终准确率的影响曲线✅ 关注主流推理框架是否跟进实现 来源x.com标签#PrefixSliding #推理加速 #斯坦福 #测试时扩展 #成本优化10. DeepMind 天气模型5 公里精度每小时刷新一次全球B级 速览WeatherNext 3 直接用气象站观测训练分辨率较上代提升约 5 倍发生了什么Google DeepMind 与 Google Research 发布 WeatherNext 3称其为迄今最先进的全球天气 AI 模型。它把实时静止卫星拼图作为直接输入实现每小时初始化输出精细至 0.05 度约 5 公里的预报分辨率较上一代提升约 5 倍并直接用原始气象站观测训练专用输出头而非依赖再分析数据。Brightband 已对其做独立实时评估。对你意味着什么如果你是物流/农业/能源公里级 小时级预报意味着“看天吃饭”的颗粒度可以从区域细化到具体场地。如果你是开发者这是科学 AI 从“发论文”走向“可调用的实时服务”的又一个样板。如果你是气象/科研人员用观测而非再分析数据训练这条技术路线值得认真评估与复现。现在可以做什么✅ 评估业务中哪些决策依赖天气预报把精度需求从“天级/城市级”重新定义一遍✅ 关注 Google 是否开放 API 与历史数据接口 来源deepmind.google marktechpost.com标签#WeatherNext3 #DeepMind #科学AI #气象预报 #行业应用✍️ 编辑点评最强模型和最脆的地基撞在同一天大概是今年最有画面感的一幕。Astra 的分数已经不太适合用「进步」来形容了但同一天四小时的集体掉线提醒我们能力是别人的风险是自己的。今天最该做的也许不是换模型而是把那条降级链路补上。 今日 3 个钩子问题Astra 把 ARC-AGI-3 从 7.8% 打到 99.9%半年就饱和——你手上用来衡量「智能」的尺子是不是也该换了三大厂商同日宕机 4 小时你的业务能扛多久如果答案是「零」降级方案准备什么时候补微软把审批权从提示词里拿走、做成系统开关——你的 Agent 里哪些动作其实早该加闸门了