Task-native Rankings
编码任务地图
先选任务,再比较具体的 Harness + 模型组合,基于来源原生的基准结果、成本与活跃时间。
相同模型在不同 Harness 中不是同一个结果;不同 Benchmark 不直接平均。
你现在要让 Agent 做什么?
前沿概览 (在所选任务上) 更强(Top 表现) 更便宜(低成本) 更快(短时长)
* 排名仅基于所选任务的原始结果,不跨任务、不跨来源平均。
新近发布 / 尚未进入标准化榜单
Harness + 模型状态SWE-Bench Pro(原始)Terminal-Bench v2(原始)说明最后更新
MiMo CodeMiMo-V2.5-Pro厂商报告,暂不混排62%73%来自小米官方同模对照2026-08-05
Claude CodeClaude Opus 5已进入 AA 标准化榜单—最高 84.9%五个推理档位均已纳入2026-08-06