模型版本、推理档位、基准任务、评分口径保持一致。
Harness Lens
Harness 横向对标
固定同一个模型,逐项比较不同 Harness 的任务得分、成本、时间与工作流消耗。
HARNESS COMPARISON固定模型,横向比较 Harness
每一列是一个 Harness;所有指标按行对齐,不把模型差异混进结论。
固定口径AA Coding Agent Index v1.2模型版本 + 推理档位 + 基准族保持一致
STRICT COMPARISON
Opus 4.7 (medium)
同一模型下收录 3 个 Harness,下面可直接逐行比较。
3个 Harness可横向对标
CROSS-MODEL EVIDENCE
跨模型证据覆盖
第二层证据:检查 Harness 差异在其他固定模型上是否重复出现。
3组严格同模证据
METHOD评测逻辑与边界固定模型版本、推理档位和基准任务,只替换 Harness。展开方法 +
目标不是给 Harness 造一个总分,而是尽量隔离它对同一模型结果的影响。
查看原始方法 ↗只替换 Harness 的系统提示、工具、上下文组织与执行循环。
每个任务进行 3 次评测,以 pass@1 的任务级均值计算各基准成绩。
DeepSWE、Terminal-Bench v2、SWE-Atlas-QnA 三项基准等权平均。
DeepSWE · 113 个任务真实代码修改Terminal-Bench v2 · 84 个任务终端工作流SWE-Atlas-QnA · 124 个任务代码库理解
补充证据 · MiMo-V2.5-Pro小米官方控制实验 · 待第三方复核展开来源 +
同一基座模型,仅替换 Harness;因基准来源不同,与 AA 指数分开呈现。
查看报告摘要 ↗- SWE-Bench Pro
- 62%
- Terminal-Bench 2
- 73%
- SWE-Bench Pro
- 57%
- Terminal-Bench 2
- 68%