MODEL PROVIDERS

Nemotron 3 Super 120B A12B (Reasoning) API Provider 比较

比较 Nemotron 3 Super 120B A12B (Reasoning) 在 3 家 API Provider 上的价格、任务成本、输出速度、延迟和端到端响应。数据来自公开实测,不修改原始数值。

数据快照:2026-08-27查看原始来源 ↗
已测 Provider3CoreWeave、Nebius、DeepInfra
输出最快380.9Nebius · Token/s
首 Token 最快1.0CoreWeave · 秒
单任务成本最低$0.10DeepInfra
API 混合价最低$0.12DeepInfra · 每 1M Token

怎样读这页

同一个模型经不同 Provider 托管时,模型能力通常不变,但价格、限流、输出速度和首字延迟会不同。实时聊天优先看延迟,批处理优先看成本与吞吐,长上下文任务还要单独看对应提示类型。

本页的“输出速度”指开始生成后的 Token/s;“首个回答 Token”指从请求到可见回答的等待;“端到端响应”按输出 500 Token 计算,三者不是同一指标。

API PRICE

Provider API 价格

混合价按 7:2:1 的缓存读取、输入和输出 Token 比例计算,便于同口径比较。

每 1M Token 的 7:2:1 混合价
每 1M Token 的 7:2:1 混合价;公开数据01 美元DeepInfra: 0.12 美元;7:2:1 混合价DeepInfra0.12 美元CoreWeave: 0.26 美元;7:2:1 混合价CoreWeave0.26 美元Nebius: 0.36 美元;7:2:1 混合价Nebius0.36 美元
查看图表数据
项目数值
DeepInfra0.12 美元
CoreWeave0.26 美元
Nebius0.36 美元

COST PER TASK

单次 Intelligence 任务成本

该值来自统一公开任务集的实际 Token 使用,不等于简单的 API 输入标价。

Provider 单任务成本
Provider 单任务成本;公开数据01 美元DeepInfra: 0.1 美元DeepInfra0.1 美元CoreWeave: 0.23 美元CoreWeave0.23 美元Nebius: 0.33 美元Nebius0.33 美元
查看图表数据
项目数值
DeepInfra0.1 美元
CoreWeave0.23 美元
Nebius0.33 美元

SPEED VS PRICE

速度与价格的权衡

更靠左代表价格更低,更靠上代表输出更快;高亮点为当前输出最快 Provider。

Provider 输出速度 vs API 混合价
Provider 输出速度 vs API 混合价API 混合价 / 1M Token输出速度0.117 美元0.36 美元380.9 Token/s59.1 Token/sCoreWeave: API 混合价 / 1M Token 0.26 美元;输出速度 142.31 Token/sNebius: API 混合价 / 1M Token 0.36 美元;输出速度 380.883 Token/sNebiusDeepInfra: API 混合价 / 1M Token 0.117 美元;输出速度 59.099 Token/s

Nebius:API 混合价 / 1M Token 0.36 美元,输出速度 380.883 Token/s

查看图表数据
项目API 混合价 / 1M Token输出速度
CoreWeave0.26 美元142.31 Token/s
Nebius0.36 美元380.883 Token/s
DeepInfra0.117 美元59.099 Token/s

OUTPUT SPEED

回答生成速度

中位输出速度之外,同时在图表说明中保留 P05–P95 范围,避免只看单点。

Provider 输出速度中位数
Provider 输出速度中位数;公开数据0380.9 Token/sNebius: 380.9 Token/s;P05–P95 245.4–508.5Nebius380.9 Token/sCoreWeave: 142.3 Token/s;P05–P95 125.9–149.6CoreWeave142.3 Token/sDeepInfra: 59.1 Token/s;P05–P95 38.3–98.2DeepInfra59.1 Token/s
查看图表数据
项目数值
Nebius380.9 Token/s
CoreWeave142.3 Token/s
DeepInfra59.1 Token/s

LATENCY

首个回答 Token 等待

数值越低越适合实时交互;P05–P95 能反映请求抖动。

Provider 首个回答 Token 延迟
Provider 首个回答 Token 延迟;公开数据029.8 秒CoreWeave: 1 秒;P05–P95 0.9–1.1 秒CoreWeave1 秒Nebius: 1.8 秒;P05–P95 1.7–3.3 秒Nebius1.8 秒DeepInfra: 29.8 秒;P05–P95 3.2–127.4 秒DeepInfra29.8 秒
查看图表数据
项目数值
CoreWeave1 秒
Nebius1.8 秒
DeepInfra29.8 秒

END-TO-END RESPONSE

端到端响应时间

按 500 个输出 Token 计算,拆分输入处理、内部推理和文本生成。

Provider 端到端响应构成
输入处理推理生成 500 Token
Provider 端到端响应构成Nebius: 8.4 秒Nebius8.4 秒CoreWeave: 18.6 秒CoreWeave18.6 秒DeepInfra: 72.1 秒DeepInfra72.1 秒
查看图表数据
项目合计输入处理推理生成 500 Token
Nebius8.4 秒1.8 秒5.3 秒1.3 秒
CoreWeave18.6 秒1 秒14.1 秒3.5 秒
DeepInfra72.1 秒29.8 秒33.8 秒8.5 秒

PROMPT TYPES

不同任务类型下的表现

中等文本、长文本、编码、视觉、并行与 100K 上下文的数据分开呈现,避免用单一中位数替代真实场景。

各任务类型输出速度
各任务类型输出速度;公开数据0380.9 Token/s中等文本 · CoreWeave: 144.7 Token/s中等文本 · CoreWeave144.7 Token/s中等文本 · Nebius: 375.3 Token/s中等文本 · Nebius375.3 Token/s中等文本 · DeepInfra: 54.5 Token/s中等文本 · DeepInfra54.5 Token/s长文本 · CoreWeave: 142.3 Token/s长文本 · CoreWeave142.3 Token/s长文本 · Nebius: 380.9 Token/s长文本 · Nebius380.9 Token/s长文本 · DeepInfra: 59.1 Token/s长文本 · DeepInfra59.1 Token/s100K 上下文 · CoreWeave: 141.8 Token/s100K 上下文 · CoreWeave141.8 Token/s100K 上下文 · Nebius: 207.1 Token/s100K 上下文 · Nebius207.1 Token/s100K 上下文 · DeepInfra: 50.8 Token/s100K 上下文 · DeepInfra50.8 Token/s并行请求 · CoreWeave: 112.6 Token/s并行请求 · CoreWeave112.6 Token/s并行请求 · Nebius: 279.7 Token/s并行请求 · Nebius279.7 Token/s并行请求 · DeepInfra: 60.6 Token/s并行请求 · DeepInfra60.6 Token/s
查看图表数据
项目数值
中等文本 · CoreWeave144.7 Token/s
中等文本 · Nebius375.3 Token/s
中等文本 · DeepInfra54.5 Token/s
长文本 · CoreWeave142.3 Token/s
长文本 · Nebius380.9 Token/s
长文本 · DeepInfra59.1 Token/s
100K 上下文 · CoreWeave141.8 Token/s
100K 上下文 · Nebius207.1 Token/s
100K 上下文 · DeepInfra50.8 Token/s
并行请求 · CoreWeave112.6 Token/s
并行请求 · Nebius279.7 Token/s
并行请求 · DeepInfra60.6 Token/s
各任务类型首块响应
各任务类型首块响应;公开数据049.6 秒中等文本 · CoreWeave: 0.8 秒中等文本 · CoreWeave0.8 秒中等文本 · Nebius: 1.1 秒中等文本 · Nebius1.1 秒中等文本 · DeepInfra: 25.5 秒中等文本 · DeepInfra25.5 秒长文本 · CoreWeave: 1 秒长文本 · CoreWeave1 秒长文本 · Nebius: 1.8 秒长文本 · Nebius1.8 秒长文本 · DeepInfra: 29.8 秒长文本 · DeepInfra29.8 秒100K 上下文 · CoreWeave: 8.7 秒100K 上下文 · CoreWeave8.7 秒100K 上下文 · Nebius: 4.7 秒100K 上下文 · Nebius4.7 秒100K 上下文 · DeepInfra: 49.6 秒100K 上下文 · DeepInfra49.6 秒并行请求 · CoreWeave: 1 秒并行请求 · CoreWeave1 秒并行请求 · Nebius: 1.2 秒并行请求 · Nebius1.2 秒并行请求 · DeepInfra: 28.9 秒并行请求 · DeepInfra28.9 秒
查看图表数据
项目数值
中等文本 · CoreWeave0.8 秒
中等文本 · Nebius1.1 秒
中等文本 · DeepInfra25.5 秒
长文本 · CoreWeave1 秒
长文本 · Nebius1.8 秒
长文本 · DeepInfra29.8 秒
100K 上下文 · CoreWeave8.7 秒
100K 上下文 · Nebius4.7 秒
100K 上下文 · DeepInfra49.6 秒
并行请求 · CoreWeave1 秒
并行请求 · Nebius1.2 秒
并行请求 · DeepInfra28.9 秒
各任务类型端到端响应
各任务类型端到端响应;公开数据098.8 秒中等文本 · CoreWeave: 18.1 秒中等文本 · CoreWeave18.1 秒中等文本 · Nebius: 7.8 秒中等文本 · Nebius7.8 秒中等文本 · DeepInfra: 71.4 秒中等文本 · DeepInfra71.4 秒长文本 · CoreWeave: 18.6 秒长文本 · CoreWeave18.6 秒长文本 · Nebius: 8.4 秒长文本 · Nebius8.4 秒长文本 · DeepInfra: 72.1 秒长文本 · DeepInfra72.1 秒100K 上下文 · CoreWeave: 26.3 秒100K 上下文 · CoreWeave26.3 秒100K 上下文 · Nebius: 16.7 秒100K 上下文 · Nebius16.7 秒100K 上下文 · DeepInfra: 98.8 秒100K 上下文 · DeepInfra98.8 秒并行请求 · CoreWeave: 23.2 秒并行请求 · CoreWeave23.2 秒并行请求 · Nebius: 10.2 秒并行请求 · Nebius10.2 秒并行请求 · DeepInfra: 70.1 秒并行请求 · DeepInfra70.1 秒
查看图表数据
项目数值
中等文本 · CoreWeave18.1 秒
中等文本 · Nebius7.8 秒
中等文本 · DeepInfra71.4 秒
长文本 · CoreWeave18.6 秒
长文本 · Nebius8.4 秒
长文本 · DeepInfra72.1 秒
100K 上下文 · CoreWeave26.3 秒
100K 上下文 · Nebius16.7 秒
100K 上下文 · DeepInfra98.8 秒
并行请求 · CoreWeave23.2 秒
并行请求 · Nebius10.2 秒
并行请求 · DeepInfra70.1 秒

FULL DATA

Provider 完整对照表

图表用于观察关系,表格保留精确数值,便于检索、引用和 AI 系统读取。

Nemotron 3 Super Provider 完整数据
Provider输入 / 1M输出 / 1M缓存命中 / 1M7:2:1 混合价单任务成本输出速度速度 P05–P95首 Token延迟 P05–P95端到端上下文函数调用OpenAI 兼容
CoreWeave ↗$0.20$0.80$0.26$0.23142.3 Token/s125.9–149.61.0 秒0.9–1.1 秒18.6 秒262,144支持支持
Nebius ↗$0.30$0.90$0.36$0.33380.9 Token/s245.4–508.51.8 秒1.7–3.3 秒8.4 秒256,000支持支持
DeepInfra ↗$0.09$0.40$0.12$0.1059.1 Token/s38.3–98.229.8 秒3.2–127.4 秒72.1 秒262,144支持支持

FAQ

常见问题

回答由本页结构化公开数据生成。

Nemotron 3 Super 有哪些 API Provider?

当前公开数据包含 CoreWeave、Nebius、DeepInfra,共 3 家。

哪家 Provider 输出最快?

Nebius 的中位输出速度最高,为 380.9 Token/s。

哪家 Provider 延迟最低?

CoreWeave 的首个回答 Token 中位等待最低,为 1.0 秒。

哪家 Provider 单任务成本最低?

DeepInfra 最低,为 US$0.10。

为什么同一个模型速度不同?

Provider 的推理硬件、批处理、路由、负载和服务配置不同,因此相同模型的吞吐和延迟会出现差异。