DeepSeek

deepseek-v4-flash

模型 IDdeepseek-v4-flash

接入文档Markdown

模型简介

DeepSeek V4-Flash 是 V4 系列的快速经济型开放权重模型,支持 1M 上下文、思考与非思考模式,以及 OpenAI 和 Anthropic 兼容接口。

模型能力

规格来自已列明的模型资料;目录标签用于快速判断接入能力,精确限制以来源文档为准。

OpenAI 兼容Responses APIAnthropic 兼容Gemini 兼容提示词缓存推理

已核验规格

官方定位
快速、高效、经济型 V4 模型
上下文窗口
1,000,000 tokens
最大输出
384,000 tokens
模型规模
284B 总参数 / 13B 激活参数

资料来源: DeepSeek 模型与价格文档

独立能力评测

仅展示与精确模型 ID 和推理档位相符的公开测评,不用相近型号替代。

智能指数

40

同类排名 #11 / 97

输出速度

120.4 tok/s

同类排名 #12 / 97

首字延迟

1.26s

推理,最大投入

以少量综合分数差距换来更高速度与更低价格,是吞吐优先的开放权重选择。

测评档位: 推理,最大投入. Artificial Analysis · 评测方法

模型价格和接入方式

价格直接读取 MoleAPI 控制台目录,并按当前计费分组与上下文档位展示。

实际结算价格以控制台中的账户分组为准。
实时价格来源

价格表

USD / 1M tokens
标准x1default输入 $0.22 · 输出 $0.67

输入

$0.22 / 1M tokens

输出

$0.67 / 1M tokens

缓存读取

$0.0075 / 1M tokens

缓存写入

$0.275 / 1M tokens

特价x0.8discount输入 $0.176 · 输出 $0.536

输入

$0.176 / 1M tokens

输出

$0.536 / 1M tokens

缓存读取

$0.006 / 1M tokens

缓存写入

$0.22 / 1M tokens

转接x0.3relay输入 $0.066 · 输出 $0.201

输入

$0.066 / 1M tokens

输出

$0.201 / 1M tokens

缓存读取

$0.0023 / 1M tokens

缓存写入

$0.0825 / 1M tokens

临时(可用性随缘)x0.1temp输入 $0.022 · 输出 $0.067

输入

$0.022 / 1M tokens

输出

$0.067 / 1M tokens

缓存读取

$0.0008 / 1M tokens

缓存写入

$0.0275 / 1M tokens

接入协议

可用计费分组: 标准, 特价, 转接, 临时(可用性随缘)

openai
POST
/v1/chat/completions
openai-response
POST
/v1/responses
anthropic
POST
/v1/messages
gemini
POST
/v1beta/models/{model}:generateContent
openai-response-compact
POST
/v1/responses/compact
openai-alpha-search
POST
/v1/alpha/search

完整模型指南

基于厂商资料整理,并经过独立审稿。 · 2026-07-28

DeepSeek-V4-Flash 是 DeepSeek V4 系列的 API 模型,支持思考与非思考模式,并提供长上下文、JSON Output、工具调用、对话前缀续写和 FIM 补全等能力。[4]

模型定位与核心能力

DeepSeek-V4-Flash 面向可在思考与非思考模式间切换的文本生成工作流,默认启用思考模式。[4] 模型支持 JSON Output、Tool Calls、对话前缀续写(Beta)与 FIM Completion(Beta)。[4]

思考模式可用于包含推理过程的生成任务,非思考模式则提供另一种生成模式选择。[4] DeepSeek 将 V4 Preview 描述为具备更强的 Agent 能力和推理能力,并已在网页、App 与 API 提供。[6]

能力与规格

DeepSeek-V4-Flash 提供 1M 上下文窗口和最高 384K 输出长度,适合处理长输入及生成较长结果的任务。[4] 官方列出的并发限制为 2500。[4]

规格参数
上下文长度1M tokens [4]
最大输出长度384K tokens [4]
思考模式支持,默认启用 [4]
非思考模式支持 [4]
JSON Output支持 [4]
Tool Calls支持 [4]
对话前缀续写支持,Beta [4]
FIM Completion支持,Beta;仅限非思考模式 [4]
并发限制2500 [4]

使用场景

DeepSeek-V4-Flash 的 1M 上下文窗口支持长文档处理、多轮对话及需要保留大量上下文的文本生成流程。[4] JSON Output 与 Tool Calls 可用于结构化结果生成和工具调用工作流。[4]

对话前缀续写适合由既有文本继续生成内容的流程。[4] FIM Completion 可用于需要在已有内容中完成补全的场景,但该功能仅在非思考模式下提供。[4]

重要限制

FIM Completion 仅支持非思考模式,无法与思考模式同时使用。[4] 对话前缀续写和 FIM Completion 均标注为 Beta 功能。[4]

模型并发限制为 2500,超出该限制时的限流与隔离规则由 DeepSeek 的相关服务规则定义。[4]

来源

[4] DeepSeek 模型 & 价格文档
[6] DeepSeek 官网

代码示例

示例使用 MoleAPI 的 Responses API 地址;替换 API Key 后即可运行。

curl https://api.moleapi.com/v1/responses \
  -H "Authorization: Bearer $MOLEAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "input": "Explain this problem step by step."
  }'

常见问题

deepseek-v4-flash 怎么计费?

本页价格从 MoleAPI 控制台接口动态读取,并随模型价格、上下文档位和账户分组更新。

deepseek-v4-flash 支持哪些接入方式?

本页协议和接口来自 MoleAPI 模型目录的 supported_endpoint_types 字段。

如何在现有项目中切换到 deepseek-v4-flash?

保留 MoleAPI 的 API 地址和密钥,把请求中的 model 参数替换为本页模型 ID;再按照对应协议检查参数差异。

deepseek-v4-flash 的模型资料来自哪里?

模型能力与限制已根据 DeepSeek 等页面核验;价格和可用协议只采用 MoleAPI 控制台数据。