
Harbor-Index 是一项面向 Agent 的高难度评测。它把模型放进真实工具环境要求 Agent 读取文件、修改代码、运行工具并根据结果和报错不断调整直到完成任务。这套基准从54套 benchmark 的6627个候选任务中筛选题目最终留下82道高难任务覆盖软件工程、科研计算、数据分析等领域。任务往往需要连续执行多步理解错需求、选错工具或遇到报错后无法恢复都可能导致失败。U2-Flash 采用“后训练 × 递归自我改进RSI”路线。按照官方披露模型会参与任务生成、轨迹分析、错误定位和纠错重采以提升完成可验证任务的能力。在本轮评测中六款模型的成绩如下U2-Flash9.76%Kimi K38.21%GLM-5.3-Flash8.21%DeepSeek V4.1 Flash7.31%Qwen3.8-Flash7.31%DeepSeek-V4-Flash7.31%U2-Flash 的领先体现了它在复杂任务中调用工具、处理错误并持续推进的强大能力。