模型日报 · 2026-08-15

模型日报 2026-08-15|AA-AnalystAgent 新评测:五次全对才算可靠

AA-AnalystAgent 用 80 道真实电子表格与文档任务测试数据分析 Agent,并以五次独立运行全部正确的 pass^5 衡量稳定性;本期核对 30 个当前结果及可比边界。

TODAY'S TAKE

一句话结论

新评测

AA-AnalystAgent 专门测试真实电子表格与文档上的端到端定量分析。

五次全对

主指标 pass^5 要求同一道题五次独立运行全部正确,重点观察可重复可靠性。

30 个模型

当前公开 payload 已从发布文章中的 26 个模型扩展到 30 个完整结果。

AA-AnalystAgent 测什么

评测包含 80 道题,覆盖 14 个商业与科学领域。每道题绑定一组真实电子表格和文档,模型需要完成来源查找、筛选汇总、比率与趋势、损益建模,以及现金流、资产负债表或估值分析。

任务通过开源 Stirrup harness 运行,提供代码执行、网页读取、图像查看和答案提交工具。答案先做数值等价检查,再由 LLM judge 判定二元正确性。题集主体私有,仅公开样题,因此不能把它当成可自行复跑的开放数据集。

为什么 pass^5 比“偶尔答对”更重要

每题独立运行五次。pass@1 是所有单次尝试的平均正确率;pass@5 表示五次中至少一次正确;pass^5 则要求五次全部正确。对需要直接进入报表、预算或决策链的数据分析 Agent,最后一种指标更接近“无需人工反复复核”的目标。

AA-AnalystAgent: Score(当前快照前五)
排名模型pass^5pass@1pass@5
1Gemini 3.7 Flash (high)60.0%70.5%77.5%
2Claude Opus 5 (max)53.8%63.7%73.8%
3GPT-5.5 (xhigh)50.0%66.3%78.8%
4Claude Fable 548.8%59.8%68.8%
5GPT-5.6 Sol (max)47.5%61.3%70.0%

GPT-5.5 的 pass@1 和 pass@5 都高于 Claude Opus 5,但 pass^5 更低,正好说明“能力上限”和“重复稳定”并不是同一个问题。当前榜首 Gemini 3.7 Flash (high) 是发布文章之后加入的结果,因此旧文章中的 Claude Opus 5 榜首结论已经不是当前榜单状态。

开放权重模型与选型意义

Kimi K3 (max) 以 38.8% 成为当前开放权重模型中最高的一项,明显高于 DeepSeek V4 Flash 的 25.0%,但仍落后于当前闭源榜首。对企业选型而言,这个榜单更适合筛查“复杂数据分析能否稳定重做”,不能替代速度、隐私、本地部署、上下文或真实业务回归测试。

建议把 pass^5 与失败模式一起看:Artificial Analysis 的发布分析指出,最常见的问题是模型过早接受错误解释并一路坚持。实际接入时,应增加口径确认、来源引用、独立复算和异常阈值,而不是只换一个榜单分数更高的模型。

价格与 API:本期没有确认变化

本轮复核 OpenRouter 第一方模型 API,没有发现本站现有精确付费 variant 的实质价格变化,GLM-5.3 仍没有精确同款。本期不修改当前 API 价格。

AA 页面上的 Cost per Task 是这套评测的运行成本,不是 OpenRouter 的当前每百万 Token 报价;两类价格具有不同来源、任务和观察时间,不能互相覆盖。

未知项与不可比边界

  • AA-AnalystAgent 是独立评测,不计入 Artificial Analysis Intelligence Index。
  • 题集主体私有,外部只能核对方法、样题和公开结果,不能完整复跑。
  • 模型的 reasoning effort、Provider、缓存与工具轨迹会影响成本和结果;同名不同配置不能自动合并。
  • 本期快照时间为 2026-08-15 09:04(UTC+8);后续榜单扩容应作为新观测追加。

相关页面

FAQ

AA-AnalystAgent 常见问题

AA-AnalystAgent 的 pass^5 为什么比 pass@1 更严格?

pass@1 观察一次运行的平均正确率;pass^5 要求同一道题五次独立运行全部正确。偶尔答对但重复不稳定的模型会被明显扣分。

这个评测主要测试 Excel 操作吗?

不只是表格操作。任务要求模型从真实电子表格和文档中判断来源、选择口径、执行定量分析并给出自由文本答案,覆盖 14 个商业与科学领域。

AA-AnalystAgent 是 Intelligence Index 的组成部分吗?

不是。Artificial Analysis 将其作为独立榜单发布,当前不计入 Intelligence Index v4.1.1。

榜单里的 Cost per Task 是当前 API 价格吗?

不是。它是 Artificial Analysis 按本次评测运行与代表性 Provider 计算的单任务成本,不能冒充 OpenRouter 当前 API 的每百万 Token 价格。