这个评测关注什么
用真实电子表格和文档测试定量分析 Agent;每题独立运行五次,只有五次全部正确才计入 pass^5。
阅读时注意
评测结果受任务集合、评分方法和模型版本影响。本站保留原始口径,不用它生成新的综合排名。
适用场景
用于回答一个明确的问题:模型在这一类任务上的相对表现如何,而不是“哪个模型绝对最好”。
数据分析可靠性
AA-AnalystAgent 公开榜单,比较 30 个模型处理真实电子表格和文档定量分析任务的 pass^5、pass@1 与 pass@5。
| 排名 | 机构 | 模型 | pass^5 | pass@1 | pass@5 | 任务 × 重复 | 发布日期 |
|---|---|---|---|---|---|---|---|
| 1 | Gemini 3.7 Flash (high) | 60% | 70.5% | 77.5% | 80 × 5 | 2026-08-13 | |
| 2 | Anthropic | Claude Opus 5 (max) | 53.8% | 63.7% | 73.8% | 80 × 5 | 2026-07-24 |
| 3 | OpenAI | GPT-5.5 (xhigh) | 50% | 66.3% | 78.8% | 80 × 5 | 2026-04-23 |
| 4 | Anthropic | Claude Fable 5 | 48.8% | 59.8% | 68.8% | 80 × 5 | 2026-06-09 |
| 5 | OpenAI | GPT-5.6 Sol (max) | 47.5% | 61.3% | 70% | 80 × 5 | 2026-07-09 |
| 6 | Anthropic | Claude Sonnet 5 (max) | 46.3% | 61.5% | 77.5% | 80 × 5 | 2026-06-30 |
| 7 | Anthropic | Claude Opus 4.8 (max) | 45% | 63.5% | 78.8% | 80 × 5 | 2026-05-28 |
| 8 | Gemini 3.5 Flash | 45% | 58.5% | 76.3% | 80 × 5 | 2026-05-19 | |
| 9 | Anthropic | Claude Opus 4.7 (max) | 43.8% | 59.5% | 72.5% | 80 × 5 | 2026-04-16 |
| 10 | Gemini 3.1 Pro Preview | 41.3% | 64% | 81.3% | 80 × 5 | 2026-02-19 | |
| 11 | SpaceXAI | Grok 4.6 (high) | 41.3% | 60.8% | 76.3% | 80 × 5 | 2026-08-12 |
| 12 | Kimi | Kimi K3 (max) | 38.8% | 57.8% | 72.5% | 80 × 5 | 2026-07-16 |
| 13 | SpaceXAI | Grok 4.5 (high) | 35% | 54% | 76.3% | 80 × 5 | 2026-07-08 |
| 14 | Thinking Machines | Inkling Small | 27.5% | 57% | 80% | 80 × 5 | 2026-07-30 |
| 15 | DeepSeek | DeepSeek V4 Flash (max) | 25% | 47.3% | 70% | 80 × 5 | 2026-04-24 |
| 16 | Thinking Machines | Inkling | 23.8% | 52.3% | 78.8% | 80 × 5 | 2026-07-15 |
| 17 | Xiaomi | MiMo-V2.5-Pro | 20% | 47% | 68.8% | 80 × 5 | 2026-04-22 |
| 18 | Anthropic | Claude Sonnet 4.6 (max) | 20% | 46.8% | 71.3% | 80 × 5 | 2026-02-17 |
| 19 | Alibaba | Qwen3.7 Max | 18.8% | 48.3% | 75% | 80 × 5 | 2026-05-19 |
| 20 | DeepSeek | DeepSeek V4 Pro (max) | 18.8% | 45% | 75% | 80 × 5 | 2026-04-24 |
| 21 | OpenAI | GPT-5.4 mini (xhigh) | 15% | 41.3% | 62.5% | 80 × 5 | 2026-03-17 |
| 22 | Anthropic | Claude 4.5 Haiku | 15% | 30% | 51.2% | 80 × 5 | 2025-10-15 |
| 23 | Mistral | Mistral Medium 3.5 | 12.5% | 30% | 47.5% | 80 × 5 | 2026-04-29 |
| 24 | MiniMax | MiniMax-M2.7 | 11.3% | 27% | 48.8% | 80 × 5 | 2026-03-18 |
| 25 | MiniMax | MiniMax-M3 | 10% | 44% | 73.8% | 80 × 5 | 2026-06-01 |
| 26 | SpaceXAI | Grok 4.3 (high) | 8.8% | 31.8% | 57.5% | 80 × 5 | 2026-04-30 |
| 27 | Gemini 3.1 Flash-Lite | 8.8% | 24% | 43.8% | 80 × 5 | 2026-03-03 | |
| 28 | OpenAI | GPT-5.5 (Non-reasoning) | 7.5% | 30.5% | 56.3% | 80 × 5 | 2026-04-23 |
| 29 | NVIDIA | Nemotron 3 Ultra | 6.3% | 25% | 43.8% | 80 × 5 | 2026-06-04 |
| 30 | Mistral | Mistral Small 4 | 1.3% | 7.2% | 23.8% | 80 × 5 | 2026-03-16 |
FAQ
回答只使用来源页面可以明确核对的指标定义。
每道题独立运行五次,只有五次全部正确才算该题通过。它强调重复执行的可靠性,不等于常见的至少一次成功。
pass@1 是单次尝试的平均正确率;pass@5 是五次中至少一次正确;pass^5 要求五次全部正确。三者分别观察单次能力、尝试上限与稳定性。
不会。Artificial Analysis 将其作为独立榜单发布,不属于当前 Intelligence Index v4.1.1 的九项组成评测。
用真实电子表格和文档测试定量分析 Agent;每题独立运行五次,只有五次全部正确才计入 pass^5。
评测结果受任务集合、评分方法和模型版本影响。本站保留原始口径,不用它生成新的综合排名。
用于回答一个明确的问题:模型在这一类任务上的相对表现如何,而不是“哪个模型绝对最好”。