真实代码修改≤ US$10≤ 20 分钟尚未选定组合回到决策中心

Harness Lens

Harness 横向对标

固定同一个模型,逐项比较不同 Harness 的任务得分、成本、时间与工作流消耗。

数据快照:2026-08-06方法与定义 ↗
HARNESS COMPARISON固定模型,横向比较 Harness

每一列是一个 Harness;所有指标按行对齐,不把模型差异混进结论。

3 个可比模型7 个 Harness评测逻辑 ↓
固定口径AA Coding Agent Index v1.2模型版本 + 推理档位 + 基准族保持一致
STRICT COMPARISON

Opus 4.7 (medium)

同一模型下收录 3 个 Harness,下面可直接逐行比较。

3个 Harness可横向对标

横向滑动查看更多 Harness →

比较指标所有列使用同一口径
原始指数三项任务等权平均50最高45.4-4.640.5-9.5
DeepSWE真实代码修改39.5最高31.627.4
Terminal-Bench v2终端工作流75.4最高70.671.4
SWE-Atlas-QnA代码库理解34.9最高33.922.6
单任务成本含推理成本,越低越省US$2.9US$2.7US$1.7最低
中位完成时间任务执行耗时,越低越快12.2 分钟13.6 分钟6.3 分钟最低
总 Token工作流资源消耗7,561,0405,656,5804,574,241最低
平均步骤工作流长度,仅作解释548642
原始证据查看该次运行的完整记录查看数据 ↗查看数据 ↗查看数据 ↗
CROSS-MODEL EVIDENCE

跨模型证据覆盖

第二层证据:检查 Harness 差异在其他固定模型上是否重复出现。

3组严格同模证据
固定模型Claude CodeAA Index v1.2CodexAA Index v1.2Cursor CLIAA Index v1.2OpenCodeAA Index v1.2
Opus 4.7 (medium)3 个 Harness 同模对照40.5-9.5 分45.4-4.6 分50组内最高
GPT-5.4 (medium)2 个 Harness 同模对照39.1组内最高37.1-2 分
GPT-5.5 (medium)2 个 Harness 同模对照54.4组内最高46.1-8.3 分
METHOD评测逻辑与边界固定模型版本、推理档位和基准任务,只替换 Harness。
展开方法 +

目标不是给 Harness 造一个总分,而是尽量隔离它对同一模型结果的影响。

查看原始方法 ↗
01固定变量

模型版本、推理档位、基准任务、评分口径保持一致。

02唯一变化

只替换 Harness 的系统提示、工具、上下文组织与执行循环

03任务计分

每个任务进行 3 次评测,以 pass@1 的任务级均值计算各基准成绩。

04形成指数

DeepSWE、Terminal-Bench v2、SWE-Atlas-QnA 三项基准等权平均

DeepSWE · 113 个任务真实代码修改Terminal-Bench v2 · 84 个任务终端工作流SWE-Atlas-QnA · 124 个任务代码库理解

能说明:在当前公开任务和配置下,Harness 工作流带来的结果差异。

不能说明:Harness 在所有模型、私有仓库或真实团队中的绝对优劣;不同来源的分数也不能混算。

补充证据 · MiMo-V2.5-Pro小米官方控制实验 · 待第三方复核
展开来源 +

同一基座模型,仅替换 Harness;因基准来源不同,与 AA 指数分开呈现。

查看报告摘要 ↗
MiMo Code
SWE-Bench Pro
62%
Terminal-Bench 2
73%
VS
Claude Code
SWE-Bench Pro
57%
Terminal-Bench 2
68%
说明:这是一条独立来源证据,不参与上方 AA 指数排名。