ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

GPT-6 Astra刷新SOTA!阿里Qoder眼镜版上线,Muse Spark 1.3回馈数据省90% | 9月4日 AI日报

GPT-6 Astra刷新SOTA!阿里Qoder眼镜版上线,Muse Spark 1.3回馈数据省90% | 9月4日 AI日报 视频版直达https://www.bilibili.com/video/av117210160828820/今日趋势速览OpenAI发布GPT-6 Astra刷新多项基准并支持代替用户操作电脑。阿里推出Qoder眼镜版AI眼镜成为Agent交互入口。Muse Spark 1.3上线AI Gateway回馈数据可省90%费用Agent落地与成本大战同步升温。 今日要点OpenAI 发布 GPT-6 Astra多项基准成绩刷新 SOTA阿里推出 Qoder 眼镜版首批接入千问与乐奇 AI 眼镜Muse Spark 1.3 上线 AI Gateway回馈数据省 90% 今日内容汇总 AI动态OpenAI 发布 GPT-6 Astra多项基准成绩刷新 SOTA阿里推出 Qoder 眼镜版首批接入千问与乐奇 AI 眼镜Muse Spark 1.3 上线 AI Gateway回馈数据省 90%MBZUAI 发布 K2 Horizon 375B A23B 并公开训练代码Runway 发布通用世界模型 GWM Worlds 2OpenEvidence 发布医疗模型家族即日起向认证临床医生开放Qwen 发布统一驾驶视觉语言模型 Qwen-Drive-1.0-4BAnthropic 探索用函数钩子扩展 Claude Code未正式发布Zite MCP 上线把 Claude 订阅变成 AI 应用构建工具微软发布 MAI-Transcribe-2411 倍实时速度转录Cursor 为 Cloud Agents 接入 macOS 运行环境Anthropic 开源 AI 电商 Agent 参考实现DeepMind 发布 WeatherNext 3 天气预报模型AntLingAGI 开源金融模型 Ling-3.0-flash-FinHugging Face 宣布与 NVIDIA 携手将保持独立中立平台定位 芯片半导体Intel 称 14A 工艺关键指标 D0 提前一年达标进度超台积电 机器人具身智能智元机器人开源 AGIBOT WORLD 2026 强化学习数据集 模型排行榜Artificial Analysis AI 模型能力排行榜 AI动态1. OpenAI 发布 GPT-6 Astra多项基准成绩刷新 SOTA来源原文 | OpenAIOpenAI发布GPT-6 Astra称其能代替用户在电脑上完成各类任务而且速度飞快。新模型多项基准刷新最优水平Terminal-Bench Science达64.6%FrontierMath Tier 4达97.6%在第三方智能指数与编码智能体指数中同样名列前茅即日起向部分组织推出未来几天扩展至Plus、Pro、Business与Enterprise用户及API。 https://x.com/OpenAI/status/20955957415281257802. 阿里推出 Qoder 眼镜版首批接入千问与乐奇 AI 眼镜阿里为Qoder推出眼镜版首批接入千问AI眼镜和乐奇AI眼镜。眼镜成为Qoder的语音与视觉入口用户开口即可派任务Agent在云端或电脑上执行眼镜负责汇报进度、确认关键操作。此外看到报错弹窗或设计稿可让眼镜拍摄Qoder复述确认无误后再继续排查修改。 https://x.com/0xLogicrw/status/20954018207221924853. Muse Spark 1.3 上线 AI Gateway回馈数据省 90%来源原文 | vercel_devMuse Spark 1.3 已上线 Vercel AI Gateway可按标准价格运行若选择将训练数据回馈给 Meta价格可便宜 90%。平台提供两个模型标识meta/muse-spark-1.3 标准版与 meta/muse-spark-1.3-contributor 贡献者版。 https://x.com/vercel_dev/status/20952779621449318954. MBZUAI 发布 K2 Horizon 375B A23B 并公开训练代码来源原文 | TestingCatalog (Twitter) | TestingCatalog (Twitter)阿联酋 MBZUAI 发布开放权重 MoE 模型 K2 Horizon 375B A23B总参 375B、激活 23B随模型公开训练代码、数据配方、中间检查点与评估结果并放出 MoVA 专家路由与 Uno 扩散适配器两个组件。Artificial Analysis 智能指数得 47智能体表现较前代提升 30 分。 https://x.com/ArtificialAnlys/status/20955047964680565035. Runway 发布通用世界模型 GWM Worlds 2来源原文 | runwaymlRunway 发布通用世界模型 GWM Worlds 2可生成交互式实时模拟输出连续 720p 视频、24 fps 与 48000 Hz 音频。模型构建于其基础视听生成模型之上用户可定义世界的环境、主体、视觉风格、物理规则与氛围并以文本指令操控主体或场景世界随每次新输入延续。以下是官方给出的 demo https://x.com/runwayml/status/20955400146459200406. OpenEvidence 发布医疗模型家族即日起向认证临床医生开放来源原文 | Max For AI (Twitter)OpenEvidence发布医疗AI模型家族称其为迄今最强大截至2026年各主流基准得分最高的医疗模型。Osler用于走廊快速问诊Sackett用于正式会诊Snow用于肿瘤病例讨论第四款Darwin在MedQA取得满分100%对比Claude、GPT、Gemini等前沿模型四项医疗基准全面领先目前处于研究预览阶段仅限申请使用。 https://x.com/OpenEvidence/status/20955315656990272667. Qwen 发布统一驾驶视觉语言模型 Qwen-Drive-1.0-4B来源原文 | Hugging Papers (Twitter)Qwen 在 Hugging Face 发布统一驾驶视觉语言模型 Qwen-Drive-1.0-4B在单一框架内同时处理 3D 感知、视觉问答与运动规划三类任务。该模型保持基础 VLM 架构不变并在 NAVSIM、Waymo 和 LingoQA 等基准测试上取得有竞争力的结果。 https://x.com/HuggingPapers/status/20953574169509153808. Anthropic 探索用函数钩子扩展 Claude Code未正式发布Anthropic 正在探索一种扩展和自定义 Claude Code 的新方式函数钩子Function Hooks并发布多个视频展示可实现的功能。该功能尚未正式发布开发者可在其 GitHub issue 上提交反馈。 https://x.com/ClaudeDevs/status/20955728919413515509. Zite MCP 上线把 Claude 订阅变成 AI 应用构建工具Zite 宣布推出 MCP 服务将用户的 Claude 订阅变成完整的 AI 应用构建工具把 Claude、ChatGPT 或 Cursor 连接到 Zite MCP 后直接描述想要的应用即可。应用上线后自带数据库、供全团队使用的登录系统以及区分权限的角色设置且构建过程不消耗 Zite 积分。以下是官方给出的 demo https://x.com/domwhyte42/status/209551267599663930010. 微软发布 MAI-Transcribe-2411 倍实时速度转录微软AI发布语音转录模型MAI-Transcribe-2以2.0%的词错误率排名第2约411倍实时速度同为第2跻身准确性-速度帕累托前沿在基准榜单上它仅次于阿里巴巴的1.7%领先ElevenLabs Scribe v2的2.2%定价每千分钟1.67美元不到同类一半语言支持扩至60种。 https://x.com/ArtificialAnlys/status/209552121477744254611. Cursor 为 Cloud Agents 接入 macOS 运行环境Cursor 为 Cloud Agents 接入 Namespace Devboxes运行 Agent 时可直接选择 macOS 环境。Namespace 会为每个会话临时启动一台 Apple M5 Mac让 Agent 在真正的 macOS 上改代码、编译和跑测试任务结束后该 DevBox 就被销毁。在此之前Cursor 默认云端开发环境一直是 Ubuntu无法完成 iOS 和 macOS 原生开发的完整构建此番合作正好补齐这一短板。 https://x.com/0xLogicrw/status/209545953838433081312. Anthropic 开源 AI 电商 Agent 参考实现Anthropic开源了可运行的AI电商Agent参考实现官方称使用Claude购物Agent的零售商购物车价值最高提升35%消费者完成购买的可能性提高60%。该仓库包含购物Agent与商家Agent两类共十项技能并附三个Claude Code插件命令用于构建和评估Agent。以下是官方给出的 demo https://x.com/xiaohu/status/209544312272998449413. DeepMind 发布 WeatherNext 3 天气预报模型Google DeepMind 称 WeatherNext 3 是全球天气预报方式的重大突破该模型与 Google Research 联合开发直接从真实世界的实时观测数据中学习以更快速度提供更本地化、更精准的预测。 https://x.com/GoogleDeepMind/status/209552801279190253614. AntLingAGI 开源金融模型 Ling-3.0-flash-FinAntLingAGI 宣布开源 Ling-3.0-flash-Fin 金融增强模型面向真实工作流场景同时开源 FinFIRST——一个由专家构建的金融搜索智能体基准测试两项发布共同目标是让金融 AI 更易获取、更可验证。 https://x.com/AntLingAGI/status/209553369680805100115. Hugging Face 宣布与 NVIDIA 携手将保持独立中立平台定位Hugging Face 联合创始人 Julien Chaumond 宣布与 NVIDIA 携手。他表示 AI 正处关键拐点开源 AI 可能被大型闭源实验室甩开也可能成为下一阶段人类文明的基础设施鉴于黄仁勋对开源 AI 的立场NVIDIA 是其唯一真正考虑的合作伙伴Hugging Face 将继续作为独立运营的中立平台。 https://x.com/julien_c/status/2095487938909876366 芯片半导体16. Intel 称 14A 工艺关键指标 D0 提前一年达标进度超台积电快科技9月3日消息Intel CFO透露1.4nm节点14A工艺D0缺陷密度提前一年达标今年6月14A缺陷密度已达D0 0.5目标2027年一季度做到D0 0.1-0.2这意味着Intel有望比台积电提前半年甚至3个季度进入1.4nm时代此前18A仅算追平此番有望实现赶超。 https://news.mydrivers.com/1/1148/1148562.htm 机器人具身智能17. 智元机器人开源 AGIBOT WORLD 2026 强化学习数据集智元机器人开源 AGIBOT WORLD 2026 主题 3强化学习面向真实世界机器人学习的具身智能数据集。数据集含 14 项真实世界任务、11430 条轨迹捕捉从示范到部署全过程的成功、失败与人工纠正并提供针对进度、错误与干扰的细粒度标注与人在回路纠正轨迹。以下是官方给出的 demo https://x.com/AGIBOTofficial/status/2095402214324072731 模型排行榜18. Artificial Analysis AI 模型能力排行榜最后是今日的 AI 模型能力排行榜单智力榜Claude Fable 5.1以66分登顶Claude Opus 5以63分居次Muse Spark 1.3以62分第三。智能体榜Fable 5.1以61分领跑Muse Spark 1.3与Claude Opus 5同以59分并列第二。开源GLM-5.3亮眼居智能体榜第4名59分。 https://artificialanalysis.ai/?intelligenceartificial-analysis-intelligence-index#intelligence-tabs以上是今天的AI 风向标欢迎在评论区提出建议我们明天见。
返回列表