真实代码修改≤ US$10≤ 20 分钟尚未选定组合回到决策中心

Task-native Rankings

编码任务地图

先选任务,再比较具体的 Harness + 模型组合,基于来源原生的基准结果、成本与活跃时间。

相同模型在不同 Harness 中不是同一个结果;不同 Benchmark 不直接平均。

数据快照:2026-08-06关于本页 ↗

你现在要让 Agent 做什么?

筛选条件
前沿概览 (在所选任务上) 更强(Top 表现) 更便宜(低成本) 更快(短时长)
#Harness + 模型原始结果(DeepSWE成本 / 任务活跃时间证据来源

* 排名仅基于所选任务的原始结果,不跨任务、不跨来源平均。

新近发布 / 尚未进入标准化榜单

Harness + 模型状态SWE-Bench Pro(原始)Terminal-Bench v2(原始)说明最后更新
MiMo CodeMiMo-V2.5-Pro厂商报告,暂不混排62%73%来自小米官方同模对照2026-08-05
Claude CodeClaude Opus 5已进入 AA 标准化榜单最高 84.9%五个推理档位均已纳入2026-08-06