数据分析可靠性

AA-AnalystAgent

AA-AnalystAgent 公开榜单,比较 30 个模型处理真实电子表格和文档定量分析任务的 pass^5、pass@1 与 pass@5。

数据快照:2026-08-15查看原始来源 ↗
主要指标pass^5
快照日期2026-08-15
30 / 30 个模型
公开评测完整榜单
排名机构模型pass^5pass@1pass@5任务 × 重复发布日期
1GoogleGemini 3.7 Flash (high)60%70.5%77.5%80 × 52026-08-13
2AnthropicClaude Opus 5 (max)53.8%63.7%73.8%80 × 52026-07-24
3OpenAIGPT-5.5 (xhigh)50%66.3%78.8%80 × 52026-04-23
4AnthropicClaude Fable 548.8%59.8%68.8%80 × 52026-06-09
5OpenAIGPT-5.6 Sol (max)47.5%61.3%70%80 × 52026-07-09
6AnthropicClaude Sonnet 5 (max)46.3%61.5%77.5%80 × 52026-06-30
7AnthropicClaude Opus 4.8 (max)45%63.5%78.8%80 × 52026-05-28
8GoogleGemini 3.5 Flash45%58.5%76.3%80 × 52026-05-19
9AnthropicClaude Opus 4.7 (max)43.8%59.5%72.5%80 × 52026-04-16
10GoogleGemini 3.1 Pro Preview41.3%64%81.3%80 × 52026-02-19
11SpaceXAIGrok 4.6 (high)41.3%60.8%76.3%80 × 52026-08-12
12KimiKimi K3 (max)38.8%57.8%72.5%80 × 52026-07-16
13SpaceXAIGrok 4.5 (high)35%54%76.3%80 × 52026-07-08
14Thinking MachinesInkling Small27.5%57%80%80 × 52026-07-30
15DeepSeekDeepSeek V4 Flash (max)25%47.3%70%80 × 52026-04-24
16Thinking MachinesInkling23.8%52.3%78.8%80 × 52026-07-15
17XiaomiMiMo-V2.5-Pro20%47%68.8%80 × 52026-04-22
18AnthropicClaude Sonnet 4.6 (max)20%46.8%71.3%80 × 52026-02-17
19AlibabaQwen3.7 Max18.8%48.3%75%80 × 52026-05-19
20DeepSeekDeepSeek V4 Pro (max)18.8%45%75%80 × 52026-04-24
21OpenAIGPT-5.4 mini (xhigh)15%41.3%62.5%80 × 52026-03-17
22AnthropicClaude 4.5 Haiku15%30%51.2%80 × 52025-10-15
23MistralMistral Medium 3.512.5%30%47.5%80 × 52026-04-29
24MiniMaxMiniMax-M2.711.3%27%48.8%80 × 52026-03-18
25MiniMaxMiniMax-M310%44%73.8%80 × 52026-06-01
26SpaceXAIGrok 4.3 (high)8.8%31.8%57.5%80 × 52026-04-30
27GoogleGemini 3.1 Flash-Lite8.8%24%43.8%80 × 52026-03-03
28OpenAIGPT-5.5 (Non-reasoning)7.5%30.5%56.3%80 × 52026-04-23
29NVIDIANemotron 3 Ultra6.3%25%43.8%80 × 52026-06-04
30MistralMistral Small 41.3%7.2%23.8%80 × 52026-03-16

FAQ

AA-AnalystAgent 常见问题

回答只使用来源页面可以明确核对的指标定义。

AA-AnalystAgent 的 pass^5 是什么意思?

每道题独立运行五次,只有五次全部正确才算该题通过。它强调重复执行的可靠性,不等于常见的至少一次成功。

pass@1、pass@5 和 pass^5 有什么区别?

pass@1 是单次尝试的平均正确率;pass@5 是五次中至少一次正确;pass^5 要求五次全部正确。三者分别观察单次能力、尝试上限与稳定性。

AA-AnalystAgent 会计入 Artificial Analysis Intelligence Index 吗?

不会。Artificial Analysis 将其作为独立榜单发布,不属于当前 Intelligence Index v4.1.1 的九项组成评测。

这个评测关注什么

用真实电子表格和文档测试定量分析 Agent;每题独立运行五次,只有五次全部正确才计入 pass^5。

阅读时注意

评测结果受任务集合、评分方法和模型版本影响。本站保留原始口径,不用它生成新的综合排名。

适用场景

用于回答一个明确的问题:模型在这一类任务上的相对表现如何,而不是“哪个模型绝对最好”。