ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

9.26 大语言模型研究简报:Flowstate-CUA 科学软件与可验证工作流

9.26 大语言模型研究简报:Flowstate-CUA 科学软件与可验证工作流 Flowstate-CUA把 Computer-Use Agent 带进科学软件与可验证工作流发布时间北京时间2026 年 9 月 26 日机构/作者独立开源研究者harrrshall状态开源数据集 训练指南 完整评测记录暂无论文预印本核心进展Flowstate-CUA / FluidThermal-CUA把 Computer-Use Agent 从网页、Office 等通用 GUI扩展到ParaView 等科学计算软件。数据集包含8,260条 demonstrations269,058次 recorded interactions其中 scientific tasks 包含660条科学任务轨迹、47,700次交互。任务覆盖过热体积、出口质量流量、冷却时间、网格收敛和设计选择等不只是“点击正确控件”而是要求 Agent 完成GUI 操作 → 工具调用 → 数值计算 → 科学结果验证关键点Grounded Verification这个项目最重要的设计是可验证成功。评测不只检查 Agent 最终说了什么还会核对原生 CSV 导出保存的应用状态底层物理场最终数值答案。作者使用固定的Qwen3-VL-4B-Instruct在 120 个 held-out scientific tasks 上测试Base model0 / 120Foundations adapter0 / 120Scientific-task adapter20 / 12016.7%20 个成功案例均通过额外检查。结果来自作者自己的评测流程仍需独立复现。为什么重要当前很多 Computer-Use benchmark 主要关注“动作是否合法、界面是否到达目标状态。”Flowstate-CUA 更进一步关注Agent 是否真的完成了一个科学任务而且结果能被外部证据验证。这暴露了一个重要差距能正确操作 GUI ≠ 能正确完成科学工作流。与此前工作的关系它延续 OSWorld 等 Computer-Use Agent 路线但把环境扩展到专业科学软件并强化三点真实桌面执行 完整 trajectory 外部科学证据验证训练接口也很直接以截图和文本作为输入、下一步结构化model_action作为监督目标可用于 VLM 的 action SFT。详细内容这里的Flowstate-CUA不是一个新模型而是一套针对ParaView等科学计算软件的Computer-Use Agent数据、环境和验证体系。最核心的目标是让Agent不只是会点 GUI而是能完成一个带物理意义、数值结果和可验证输出的科学工作流。其最重要的内容可以分成四部分。数据集的构成整个数据集一共包含8,260条demonstrations、269,058次recorded interactions。它分成两部分一部分是scientific tasks有660条完整科学任务轨迹、47,700次交互覆盖过热体积、出口质量流量、冷却时间、网格收敛、设计选择等15类科学目标另一部分是foundations有7,600条demonstrations、221,358个GUI actions主要训练基础的ParaView操作例如查看物理场、画contour、使用Calculator、生成line profile这里有一个很重要的细节物理场和任务指令是合成的但GUI截图和桌面操作是真实执行产生的。Python controller实际通过鼠标和键盘控制原生ParaView而不是在一个抽象模拟器里伪造动作。每条数据还保存了截图、具体click/type动作、物理输入、应用状态、数值reference和provenance实际训练内容对于 scientific tasks官方给出的训练输入大致是Task instruction 当前 screenshot system instruction ↓ VLM ↓ 下一步 model_action也就是典型的next-action prediction。例如模型看到当前ParaView界面后要决定下一步是打开文件、点击哪个按钮、输入表达式、调用artifact tool还是提交最终答案。页面明确建议使用text image作为输入model_action作为监督目标因此很适合直接做VLM action SFT严格区分动作合法和任务真的做对了作者用固定的Qwen3-VL-4B-Instruct做了120个held-out scientific tasksBase model0 / 120Foundations adapter0 / 120Scientific-task adapter20 / 12016.7%Scientific adapter 灰度截图0 / 120更有意思的是base model 一共执行了 21,600 个 proposed actions全部被环境接受但最终任务成功率仍然是 0%。这说明“模型会点击、会调用工具”与“模型真正理解科学任务并完成正确分析”是两回事。20 个成功任务还不是只根据模型最终说“我完成了”来判断而是独立核对最终答案、原生 CSV 导出、保存的应用状态以及源物理场。数据集 reproducibility作者提供生成、采集、replay、scoring代码并做了数据完整性、split leakage、数值结果、保存状态等检查科学部分375个parquet shard和评测包中的776个文件都做了byte-level checksum验证。完整仓库大约155 GB所以如果从Agent研究角度看这个工作的意义可以压缩成一句话它试图把Computer-Use Agent从UI navigation benchmark推进到可被外部科学证据验证的真实任务执行相关链接FluidThermal-CUA / Flowstate-CUA 数据集主页训练指南自主评测报告Release checks / 可复现性检查
返回列表