 / Qwen3.8-max / GPT-5.6 Sol)
测评结果整理说明测评结果由GLM-5.2深度模式完成逐项核对和人工核对。测评结果整理时间为2026.08.26也就是说不包括8.26以后的测评结果比如8.27发现GLM推出了GLM-5.3 Flash不包含在内。逐项核对可参考以下位置https://chatglm.cn/share/jFmEhBo4核对标准如下采纳依据的优先级测评机构官方测试结果三方测评机构复测结果模型厂商官方自测或者自行发布或竞争对手测试结果其他来源。其他来源需排除以下来源测评机构和模型厂商的官方博客和官方社交媒体可视为采纳的其他来源除上述其他来源之外的博客、社媒统一忽略只采用已经存在的测评结果不做评估和预测测评结果模型 \ 测评AA Intelligence IndexALE-CLIHLETerminal-Bench 3.0Terminal-Bench 2.1Terminal-Bench 2.0AutomationBenchSWE-Bench VerifiedSWE-bench ProDeepSWENL2RepoSciCodeCyberGymPaperBenchIFBenchLiveCodeBenchOSWorld VerifiedGPQA DiamondGLM-5.359.528.54232.471.54—48.295—695842.184.5—————GLM-5.252.623.8414.667.798126.28362.143.848.950.577.2—73.3———Kimi K359.728.34717.480.9—52.793—68.55858.780———84.891.2Kimi K2.7-Code43—35—67.04——78—30.5—47.5——63.1———Kimi K2.645.1—38—53.5666.7—7658.6——53.572.8—7689.673.188.4DeepSeek V4 Pro081353.225.741—54.6867.931.89655.462.861.55083.3—76.593.5——DeepSeek V4 Flash073151.825.238—67.0456.925.18952.653.354.249.976.7——91.6——Qwen3-Coder-Next———————————32.3—————89.2Qwen3.8-Max58.12743—67.42—27.38667.757.555.952.978.59382.8—86.1—Qwen3.7-Plus39.4—36—52.8170.3—7857.6—41.145.574.5—7889.673.3—Doubao-Seed-Code———————79——————————Doubao-Seed-2.1-Pro————————57.5—————————Doubao-Seed-Evolving——————————————————Doubao-Seed-2.1-Turbo————————57—————————ChatGPT 5.6 Solmax58.930.649.534.685.7791.951.29664.672.7—56.184.5—72.7—8394.6ChatGPT 5.6 Terra55—4320.877.5387.445.69663.469.6—53.981.8—71.2——92.9ChatGPT 5.6 Lunahigh51.230.34014.379.0384.742.29362.767.2—52.577.9—————各项测评介绍各项测评介绍已整理至另一篇文章欢迎查阅吐血整理大模型评测信息含三方测评发布网站动动小手收藏备用