AA-AnalystAgent 专门测试真实电子表格与文档上的端到端定量分析。
模型日报 · 2026-08-15
模型日报 2026-08-15|AA-AnalystAgent 新评测:五次全对才算可靠
AA-AnalystAgent 用 80 道真实电子表格与文档任务测试数据分析 Agent,并以五次独立运行全部正确的 pass^5 衡量稳定性;本期核对 30 个当前结果及可比边界。
TODAY'S TAKE
一句话结论
主指标 pass^5 要求同一道题五次独立运行全部正确,重点观察可重复可靠性。
当前公开 payload 已从发布文章中的 26 个模型扩展到 30 个完整结果。
AA-AnalystAgent 测什么
评测包含 80 道题,覆盖 14 个商业与科学领域。每道题绑定一组真实电子表格和文档,模型需要完成来源查找、筛选汇总、比率与趋势、损益建模,以及现金流、资产负债表或估值分析。
任务通过开源 Stirrup harness 运行,提供代码执行、网页读取、图像查看和答案提交工具。答案先做数值等价检查,再由 LLM judge 判定二元正确性。题集主体私有,仅公开样题,因此不能把它当成可自行复跑的开放数据集。
为什么 pass^5 比“偶尔答对”更重要
每题独立运行五次。pass@1 是所有单次尝试的平均正确率;pass@5 表示五次中至少一次正确;pass^5 则要求五次全部正确。对需要直接进入报表、预算或决策链的数据分析 Agent,最后一种指标更接近“无需人工反复复核”的目标。
| 排名 | 模型 | pass^5 | pass@1 | pass@5 |
|---|---|---|---|---|
| 1 | Gemini 3.7 Flash (high) | 60.0% | 70.5% | 77.5% |
| 2 | Claude Opus 5 (max) | 53.8% | 63.7% | 73.8% |
| 3 | GPT-5.5 (xhigh) | 50.0% | 66.3% | 78.8% |
| 4 | Claude Fable 5 | 48.8% | 59.8% | 68.8% |
| 5 | GPT-5.6 Sol (max) | 47.5% | 61.3% | 70.0% |
GPT-5.5 的 pass@1 和 pass@5 都高于 Claude Opus 5,但 pass^5 更低,正好说明“能力上限”和“重复稳定”并不是同一个问题。当前榜首 Gemini 3.7 Flash (high) 是发布文章之后加入的结果,因此旧文章中的 Claude Opus 5 榜首结论已经不是当前榜单状态。
开放权重模型与选型意义
Kimi K3 (max) 以 38.8% 成为当前开放权重模型中最高的一项,明显高于 DeepSeek V4 Flash 的 25.0%,但仍落后于当前闭源榜首。对企业选型而言,这个榜单更适合筛查“复杂数据分析能否稳定重做”,不能替代速度、隐私、本地部署、上下文或真实业务回归测试。
建议把 pass^5 与失败模式一起看:Artificial Analysis 的发布分析指出,最常见的问题是模型过早接受错误解释并一路坚持。实际接入时,应增加口径确认、来源引用、独立复算和异常阈值,而不是只换一个榜单分数更高的模型。
价格与 API:本期没有确认变化
本轮复核 OpenRouter 第一方模型 API,没有发现本站现有精确付费 variant 的实质价格变化,GLM-5.3 仍没有精确同款。本期不修改当前 API 价格。
AA 页面上的 Cost per Task 是这套评测的运行成本,不是 OpenRouter 的当前每百万 Token 报价;两类价格具有不同来源、任务和观察时间,不能互相覆盖。
未知项与不可比边界
- AA-AnalystAgent 是独立评测,不计入 Artificial Analysis Intelligence Index。
- 题集主体私有,外部只能核对方法、样题和公开结果,不能完整复跑。
- 模型的 reasoning effort、Provider、缓存与工具轨迹会影响成本和结果;同名不同配置不能自动合并。
- 本期快照时间为 2026-08-15 09:04(UTC+8);后续榜单扩容应作为新观测追加。
相关页面
FAQ
AA-AnalystAgent 常见问题
AA-AnalystAgent 的 pass^5 为什么比 pass@1 更严格?
pass@1 观察一次运行的平均正确率;pass^5 要求同一道题五次独立运行全部正确。偶尔答对但重复不稳定的模型会被明显扣分。
这个评测主要测试 Excel 操作吗?
不只是表格操作。任务要求模型从真实电子表格和文档中判断来源、选择口径、执行定量分析并给出自由文本答案,覆盖 14 个商业与科学领域。
AA-AnalystAgent 是 Intelligence Index 的组成部分吗?
不是。Artificial Analysis 将其作为独立榜单发布,当前不计入 Intelligence Index v4.1.1。
榜单里的 Cost per Task 是当前 API 价格吗?
不是。它是 Artificial Analysis 按本次评测运行与代表性 Provider 计算的单任务成本,不能冒充 OpenRouter 当前 API 的每百万 Token 价格。