MODEL PROVIDERS

DeepSeek V4 Flash (Reasoning, Max Effort) API Provider 比较

比较 DeepSeek V4 Flash (Reasoning, Max Effort) 在 5 家 API Provider 上的价格、任务成本、输出速度、延迟和端到端响应。数据来自公开实测,不修改原始数值。

数据快照:2026-08-27查看原始来源 ↗
已测 Provider5GMI、DeepInfra (FP4)、SiliconFlow (FP8)、Parasail (FP8)、Novita
输出最快117.2Novita · Token/s
首 Token 最快0.9DeepInfra (FP4) · 秒
单任务成本最低$0.04DeepInfra (FP4)
API 混合价最低$0.05DeepInfra (FP4) · 每 1M Token

怎样读这页

同一个模型经不同 Provider 托管时,模型能力通常不变,但价格、限流、输出速度和首字延迟会不同。实时聊天优先看延迟,批处理优先看成本与吞吐,长上下文任务还要单独看对应提示类型。

本页的“输出速度”指开始生成后的 Token/s;“首个回答 Token”指从请求到可见回答的等待;“端到端响应”按输出 500 Token 计算,三者不是同一指标。

API PRICE

Provider API 价格

混合价按 7:2:1 的缓存读取、输入和输出 Token 比例计算,便于同口径比较。

每 1M Token 的 7:2:1 混合价
每 1M Token 的 7:2:1 混合价;公开数据01 美元DeepInfra (FP4): 0.05 美元;7:2:1 混合价DeepInfra (FP4)0.05 美元GMI: 0.05 美元;7:2:1 混合价GMI0.05 美元SiliconFlow (FP8): 0.07 美元;7:2:1 混合价SiliconFlow (FP8)0.07 美元Novita: 0.08 美元;7:2:1 混合价Novita0.08 美元Parasail (FP8): 0.11 美元;7:2:1 混合价Parasail (FP8)0.11 美元
查看图表数据
项目数值
DeepInfra (FP4)0.05 美元
GMI0.05 美元
SiliconFlow (FP8)0.07 美元
Novita0.08 美元
Parasail (FP8)0.11 美元

COST PER TASK

单次 Intelligence 任务成本

该值来自统一公开任务集的实际 Token 使用,不等于简单的 API 输入标价。

Provider 单任务成本
Provider 单任务成本;公开数据01 美元DeepInfra (FP4): 0.04 美元DeepInfra (FP4)0.04 美元Novita: 0.05 美元Novita0.05 美元
查看图表数据
项目数值
DeepInfra (FP4)0.04 美元
Novita0.05 美元

SPEED VS PRICE

速度与价格的权衡

更靠左代表价格更低,更靠上代表输出更快;高亮点为当前输出最快 Provider。

Provider 输出速度 vs API 混合价
Provider 输出速度 vs API 混合价API 混合价 / 1M Token输出速度0.049 美元0.105 美元117.2 Token/s40.4 Token/sDeepInfra (FP4): API 混合价 / 1M Token 0.049 美元;输出速度 40.395 Token/sSiliconFlow (FP8): API 混合价 / 1M Token 0.074 美元;输出速度 83.85 Token/sParasail (FP8): API 混合价 / 1M Token 0.105 美元;输出速度 74.766 Token/sNovita: API 混合价 / 1M Token 0.076 美元;输出速度 117.178 Token/sNovita

Novita:API 混合价 / 1M Token 0.076 美元,输出速度 117.178 Token/s

查看图表数据
项目API 混合价 / 1M Token输出速度
DeepInfra (FP4)0.049 美元40.395 Token/s
SiliconFlow (FP8)0.074 美元83.85 Token/s
Parasail (FP8)0.105 美元74.766 Token/s
Novita0.076 美元117.178 Token/s

OUTPUT SPEED

回答生成速度

中位输出速度之外,同时在图表说明中保留 P05–P95 范围,避免只看单点。

Provider 输出速度中位数
Provider 输出速度中位数;公开数据0117.2 Token/sNovita: 117.2 Token/s;P05–P95 86.8–135.7Novita117.2 Token/sSiliconFlow (FP8): 83.9 Token/s;P05–P95 61.9–131.1SiliconFlow (FP8)83.9 Token/sParasail (FP8): 74.8 Token/s;P05–P95 38.6–114.2Parasail (FP8)74.8 Token/sDeepInfra (FP4): 40.4 Token/s;P05–P95 26.1–114.3DeepInfra (FP4)40.4 Token/s
查看图表数据
项目数值
Novita117.2 Token/s
SiliconFlow (FP8)83.9 Token/s
Parasail (FP8)74.8 Token/s
DeepInfra (FP4)40.4 Token/s

LATENCY

首个回答 Token 等待

数值越低越适合实时交互;P05–P95 能反映请求抖动。

Provider 首个回答 Token 延迟
Provider 首个回答 Token 延迟;公开数据01.9 秒DeepInfra (FP4): 0.9 秒;P05–P95 0.5–2.3 秒DeepInfra (FP4)0.9 秒Parasail (FP8): 1.6 秒;P05–P95 1.3–1.9 秒Parasail (FP8)1.6 秒Novita: 1.8 秒;P05–P95 1.1–3.5 秒Novita1.8 秒SiliconFlow (FP8): 1.9 秒;P05–P95 1.2–3.6 秒SiliconFlow (FP8)1.9 秒
查看图表数据
项目数值
DeepInfra (FP4)0.9 秒
Parasail (FP8)1.6 秒
Novita1.8 秒
SiliconFlow (FP8)1.9 秒

END-TO-END RESPONSE

端到端响应时间

按 500 个输出 Token 计算,拆分输入处理、内部推理和文本生成。

Provider 端到端响应构成
输入处理推理生成 500 Token
Provider 端到端响应构成Novita: 54 秒Novita54 秒SiliconFlow (FP8): 74.8 秒SiliconFlow (FP8)74.8 秒Parasail (FP8): 83.4 秒Parasail (FP8)83.4 秒DeepInfra (FP4): 152.2 秒DeepInfra (FP4)152.2 秒
查看图表数据
项目合计输入处理推理生成 500 Token
Novita54 秒1.8 秒47.9 秒4.3 秒
SiliconFlow (FP8)74.8 秒1.9 秒66.9 秒6 秒
Parasail (FP8)83.4 秒1.6 秒75.1 秒6.7 秒
DeepInfra (FP4)152.2 秒0.9 秒139 秒12.4 秒

PROMPT TYPES

不同任务类型下的表现

中等文本、长文本、编码、视觉、并行与 100K 上下文的数据分开呈现,避免用单一中位数替代真实场景。

各任务类型输出速度
各任务类型输出速度;公开数据0117.2 Token/s长文本 · DeepInfra (FP4): 40.4 Token/s长文本 · DeepInfra (FP4)40.4 Token/s长文本 · SiliconFlow (FP8): 83.9 Token/s长文本 · SiliconFlow (FP8)83.9 Token/s长文本 · Parasail (FP8): 74.8 Token/s长文本 · Parasail (FP8)74.8 Token/s长文本 · Novita: 117.2 Token/s长文本 · Novita117.2 Token/s
查看图表数据
项目数值
长文本 · DeepInfra (FP4)40.4 Token/s
长文本 · SiliconFlow (FP8)83.9 Token/s
长文本 · Parasail (FP8)74.8 Token/s
长文本 · Novita117.2 Token/s
各任务类型首块响应
各任务类型首块响应;公开数据01.9 秒长文本 · DeepInfra (FP4): 0.9 秒长文本 · DeepInfra (FP4)0.9 秒长文本 · SiliconFlow (FP8): 1.9 秒长文本 · SiliconFlow (FP8)1.9 秒长文本 · Parasail (FP8): 1.6 秒长文本 · Parasail (FP8)1.6 秒长文本 · Novita: 1.8 秒长文本 · Novita1.8 秒
查看图表数据
项目数值
长文本 · DeepInfra (FP4)0.9 秒
长文本 · SiliconFlow (FP8)1.9 秒
长文本 · Parasail (FP8)1.6 秒
长文本 · Novita1.8 秒
各任务类型端到端响应
各任务类型端到端响应;公开数据0152.2 秒长文本 · DeepInfra (FP4): 152.2 秒长文本 · DeepInfra (FP4)152.2 秒长文本 · SiliconFlow (FP8): 74.8 秒长文本 · SiliconFlow (FP8)74.8 秒长文本 · Parasail (FP8): 83.4 秒长文本 · Parasail (FP8)83.4 秒长文本 · Novita: 54 秒长文本 · Novita54 秒
查看图表数据
项目数值
长文本 · DeepInfra (FP4)152.2 秒
长文本 · SiliconFlow (FP8)74.8 秒
长文本 · Parasail (FP8)83.4 秒
长文本 · Novita54 秒

FULL DATA

Provider 完整对照表

图表用于观察关系,表格保留精确数值,便于检索、引用和 AI 系统读取。

DeepSeek V4 Flash (max) Provider 完整数据
Provider输入 / 1M输出 / 1M缓存命中 / 1M7:2:1 混合价单任务成本输出速度速度 P05–P95首 Token延迟 P05–P95端到端上下文函数调用OpenAI 兼容
GMI ↗$0.09$0.19$0.02$0.051,048,575支持支持
DeepInfra (FP4) ↗$0.09$0.18$0.02$0.05$0.0440.4 Token/s26.1–114.30.9 秒0.5–2.3 秒152.2 秒1,048,576支持支持
SiliconFlow (FP8) ↗$0.13$0.28$0.03$0.0783.9 Token/s61.9–131.11.9 秒1.2–3.6 秒74.8 秒1,049,000支持支持
Parasail (FP8) ↗$0.14$0.28$0.07$0.1174.8 Token/s38.6–114.21.6 秒1.3–1.9 秒83.4 秒1,048,576支持支持
Novita ↗$0.14$0.28$0.03$0.08$0.05117.2 Token/s86.8–135.71.8 秒1.1–3.5 秒54.0 秒1,048,576支持支持

FAQ

常见问题

回答由本页结构化公开数据生成。

DeepSeek V4 Flash (max) 有哪些 API Provider?

当前公开数据包含 GMI、DeepInfra (FP4)、SiliconFlow (FP8)、Parasail (FP8)、Novita,共 5 家。

哪家 Provider 输出最快?

Novita 的中位输出速度最高,为 117.2 Token/s。

哪家 Provider 延迟最低?

DeepInfra (FP4) 的首个回答 Token 中位等待最低,为 0.9 秒。

哪家 Provider 单任务成本最低?

DeepInfra (FP4) 最低,为 US$0.04。

为什么同一个模型速度不同?

Provider 的推理硬件、批处理、路由、负载和服务配置不同,因此相同模型的吞吐和延迟会出现差异。