# DeepSeek: deepseek-v4-flash

- 模型 ID: `deepseek-v4-flash`
- 供应商: DeepSeek
- 网页版本: https://www.moleapi.com/zh-CN/models/deepseek/deepseek-v4-flash
- 内容状态: verified

## 模型简介

DeepSeek V4-Flash 是 V4 系列的快速经济型开放权重模型，支持 1M 上下文、思考与非思考模式，以及 OpenAI 和 Anthropic 兼容接口。

## 模型能力

- OpenAI 兼容
- Responses API
- Anthropic 兼容
- Gemini 兼容
- 提示词缓存
- 推理

### 已核验规格

- 官方定位: 快速、高效、经济型 V4 模型
- 上下文窗口: 1,000,000 tokens
- 最大输出: 384,000 tokens
- 模型规模: 284B 总参数 / 13B 激活参数

### 独立能力评测

- 推理，最大投入
- Intelligence: 40 (#11/97)
- Output speed: 120.4 tok/s (#12/97)
- Time to first token: 1.26s
- Source: https://artificialanalysis.ai/models/deepseek-v4-flash

以少量综合分数差距换来更高速度与更低价格，是吞吐优先的开放权重选择。

## 模型价格和接入方式

价格由 MoleAPI 控制台接口动态提供。

### 标准 (default, x1)

- 输入: $0.22 / 1M tokens
- 输出: $0.67 / 1M tokens
- 缓存读取: $0.0075 / 1M tokens
- 缓存写入: $0.275 / 1M tokens

### 特价 (discount, x0.8)

- 输入: $0.176 / 1M tokens
- 输出: $0.536 / 1M tokens
- 缓存读取: $0.006 / 1M tokens
- 缓存写入: $0.22 / 1M tokens

### 转接 (relay, x0.3)

- 输入: $0.066 / 1M tokens
- 输出: $0.201 / 1M tokens
- 缓存读取: $0.0023 / 1M tokens
- 缓存写入: $0.0825 / 1M tokens

### 临时（可用性随缘） (temp, x0.1)

- 输入: $0.022 / 1M tokens
- 输出: $0.067 / 1M tokens
- 缓存读取: $0.0008 / 1M tokens
- 缓存写入: $0.0275 / 1M tokens

### 接入协议

| Protocol | Method | Endpoint |
| --- | --- | --- |
| openai | POST | /v1/chat/completions |
| openai-response | POST | /v1/responses |
| anthropic | POST | /v1/messages |
| gemini | POST | /v1beta/models/{model}:generateContent |
| openai-response-compact | POST | /v1/responses/compact |
| openai-alpha-search | POST | /v1/alpha/search |

- 实时价格来源: https://home.moleapi.com/api/pricing

## deepseek-v4-flash 模型介绍

DeepSeek-V4-Flash 是 DeepSeek V4 系列的 API 模型，支持思考与非思考模式，并提供长上下文、JSON Output、工具调用、对话前缀续写和 FIM 补全等能力。[4]

## 模型定位与核心能力

DeepSeek-V4-Flash 面向可在思考与非思考模式间切换的文本生成工作流，默认启用思考模式。[4] 模型支持 JSON Output、Tool Calls、对话前缀续写（Beta）与 FIM Completion（Beta）。[4]

思考模式可用于包含推理过程的生成任务，非思考模式则提供另一种生成模式选择。[4] DeepSeek 将 V4 Preview 描述为具备更强的 Agent 能力和推理能力，并已在网页、App 与 API 提供。[6]

## 能力与规格

DeepSeek-V4-Flash 提供 1M 上下文窗口和最高 384K 输出长度，适合处理长输入及生成较长结果的任务。[4] 官方列出的并发限制为 2500。[4]

| 规格 | 参数 |
| --- | --- |
| 上下文长度 | 1M tokens [4] |
| 最大输出长度 | 384K tokens [4] |
| 思考模式 | 支持，默认启用 [4] |
| 非思考模式 | 支持 [4] |
| JSON Output | 支持 [4] |
| Tool Calls | 支持 [4] |
| 对话前缀续写 | 支持，Beta [4] |
| FIM Completion | 支持，Beta；仅限非思考模式 [4] |
| 并发限制 | 2500 [4] |

## 使用场景

DeepSeek-V4-Flash 的 1M 上下文窗口支持长文档处理、多轮对话及需要保留大量上下文的文本生成流程。[4] JSON Output 与 Tool Calls 可用于结构化结果生成和工具调用工作流。[4]

对话前缀续写适合由既有文本继续生成内容的流程。[4] FIM Completion 可用于需要在已有内容中完成补全的场景，但该功能仅在非思考模式下提供。[4]

## 重要限制

FIM Completion 仅支持非思考模式，无法与思考模式同时使用。[4] 对话前缀续写和 FIM Completion 均标注为 Beta 功能。[4]

模型并发限制为 2500，超出该限制时的限流与隔离规则由 DeepSeek 的相关服务规则定义。[4]

## 来源

[4] [DeepSeek 模型 & 价格文档](https://api-docs.deepseek.com/zh-cn/quick_start/pricing)  
[6] [DeepSeek 官网](https://deepseek.com/en/index.html)


## 代码示例

### cURL

```bash
curl https://api.moleapi.com/v1/responses \
  -H "Authorization: Bearer $MOLEAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-flash","input":"Explain this problem step by step."}'
```

### Python

```python
from openai import OpenAI

client = OpenAI(base_url="https://api.moleapi.com/v1", api_key="YOUR_MOLEAPI_API_KEY")
response = client.responses.create(model="deepseek-v4-flash", input="Explain this problem step by step.")
print(response.output_text)
```

### TypeScript

```typescript
import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.moleapi.com/v1", apiKey: process.env.MOLEAPI_API_KEY });
const response = await client.responses.create({ model: "deepseek-v4-flash", input: "Explain this problem step by step." });
console.log(response.output_text);
```

## 更多相关模型

- [deepseek-v4-pro](https://www.moleapi.com/zh-CN/models/deepseek/deepseek-v4-pro) — DeepSeek
- [deepseek-v4-flash-260425](https://www.moleapi.com/zh-CN/models/deepseek/deepseek-v4-flash-260425) — DeepSeek
- [deepseek-v4-flash-vision-exp](https://www.moleapi.com/zh-CN/models/deepseek/deepseek-v4-flash-vision-exp) — DeepSeek
- [gpt-5.6-luna](https://www.moleapi.com/zh-CN/models/openai/gpt-5.6-luna) — OpenAI
- [gpt-5.6-sol](https://www.moleapi.com/zh-CN/models/openai/gpt-5.6-sol) — OpenAI
- [gpt-5.6-terra](https://www.moleapi.com/zh-CN/models/openai/gpt-5.6-terra) — OpenAI

## 常见问题

### deepseek-v4-flash 怎么计费？

本页价格从 MoleAPI 控制台接口动态读取，并随模型价格、上下文档位和账户分组更新。

### deepseek-v4-flash 支持哪些接入方式？

当前目录列出的协议是 openai、openai-response、anthropic、gemini、openai-response-compact、openai-alpha-search。

### 如何在现有项目中切换到 deepseek-v4-flash？

保留 MoleAPI 的 API 地址和密钥，替换 model 参数，再检查所用协议的参数差异。

### deepseek-v4-flash 的资料来自哪里？

模型能力与限制根据 DeepSeek 等列明页面核验；价格与协议来自 MoleAPI 控制台。
