DeepSeek V4 Flash API
/v1/chat/completions 该模型使用兼容 OpenAI 的 Chat Completions 接口。同一个 HiAPI API Key 可调用账户分组内已开放模型;切换到图片、视频或音频模型时,需要改用 /v1/tasks 及对应请求结构。
模型概览
| 模型名称 | deepseek-v4-flash |
|---|---|
| 类型 | 文本生成 · Chat Completions |
| 上下文窗口 | 1,000,000 Tokens |
| 最大输出 | 384,000 Tokens |
| 模式 | 思考(默认)与非思考 |
| 能力 | 流式输出、JSON Mode、工具调用 |
| 价格 | 查看 HiAPI 实时定价 |
DeepSeek V4 Flash 是 DeepSeek V4 系列中面向效率的模型。根据 DeepSeek 官方资料,它拥有 2840 亿总参数、每个 Token 激活 130 亿参数,支持 100 万 Token 上下文以及思考与非思考双模式。HiAPI 通过兼容 OpenAI 的 Chat Completions 接口开放该模型。
生产建议
- 同一个 HiAPI API Key 可以调用账户分组内所有已开放模型。
- 文本模型使用 /v1/chat/completions;图片、视频和音频模型使用异步 /v1/tasks 请求结构。
- API Key 只保存在服务端或安全的密钥管理系统中,不要写入浏览器前端代码。
- 上新活动生效期间,符合资格的充值用户可添加请求头 X-HiAPI-Promotion: deepseek-v4-flash-launch,主动使用免费额度。
- 携带活动请求头的调用只使用免费额度,不会自动转为余额付费。
- 每日额度用完后,API 返回 HTTP 429 和 promotion_quota_exhausted;只有应用明确希望转为付费调用时,才移除活动请求头后重试。
适用场景
适合问答、摘要、抽取与内容工作流。
messagesstream使用思考模式处理多步骤分析和代码生成。
thinkingreasoning_effort结合长上下文和工具调用完成多步骤自动化。
toolsmessages使用 JSON Mode 返回机器可读结果。
response_format请求参数
model string 必填 固定填写 deepseek-v4-flash。
messages array 必填 按顺序传入对话消息,每项包含 role 与 content。
role enum 必填 消息角色。
content string 必填 消息文本。
stream boolean 可选 设为 true 时返回 Server-Sent Events 流。
max_tokens integer 可选 最大生成 Token 数;输入与输出总长度不能超过上下文窗口。
thinking object 可选 开启或关闭思考模式;默认开启。
type enum 必填 思考模式开关。
reasoning_effort enum 可选 思考强度;最大档请明确传 max。DeepSeek V4 Flash 接收 xhigh 时实际按 high 执行。
response_format object 可选 JSON Mode 使用 type=json_object,并在提示词中明确要求返回 JSON。
tools array 可选 OpenAI 兼容的函数工具定义。
API 接入示例
调用示例
保持思考模式开启,并将 reasoning_effort 设为 max。
{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "system",
"content": "你是一名回答简洁的技术助手。"
},
{
"role": "user",
"content": "请用三句话解释稀疏注意力。"
}
],
"thinking": {
"type": "enabled"
},
"reasoning_effort": "max",
"stream": false
}将 stream 设为 true,持续读取 SSE 数据直到 [DONE]。
{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "system",
"content": "你是一名回答简洁的技术助手。"
},
{
"role": "user",
"content": "请用三句话解释稀疏注意力。"
}
],
"thinking": {
"type": "enabled"
},
"reasoning_effort": "high",
"stream": true
}关闭思考模式并要求返回 JSON 对象。
{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "user",
"content": "请返回包含 summary 和 risks 字段的 JSON。"
}
],
"thinking": {
"type": "disabled"
},
"response_format": {
"type": "json_object"
}
}响应结构
非流式响应遵循 Chat Completions 结构。思考模式会额外返回 reasoning_content;计费明细以 usage 为准。
{
"id": "chatcmpl_example",
"object": "chat.completion",
"model": "deepseek-v4-flash",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "稀疏注意力只计算部分关键 Token 之间的关联。"
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 24,
"completion_tokens": 18,
"total_tokens": 42,
"prompt_tokens_details": {
"cached_tokens": 0
}
}
} - 从 choices[0].message.content 读取最终回答。
- 思考模式下,从 choices[0].message.reasoning_content 读取推理内容。
- 从 usage 读取输入、输出、缓存及总 Token 数。
- 流式调用逐条处理 SSE data,直到收到 [DONE]。
常见问题
什么是 DeepSeek V4 Flash?
DeepSeek V4 Flash 是 DeepSeek V4 系列中面向速度与成本效率的开源权重 MoE 文本模型。根据 DeepSeek 官方资料,它拥有 2840 亿总参数、每个 Token 激活 130 亿参数,支持 100 万 Token 上下文,并提供非思考、Think High 和 Think Max 三种模式。
如何调整思考模式和推理强度?
模型默认开启思考模式。通过 thinking.type 选择 enabled 或 disabled;开启思考时使用 reasoning_effort=high 或 max。最大思考强度必须明确传 max;DeepSeek V4 Flash 接收 xhigh 时实际按 high 执行。
应该使用哪个端点和模型 ID?
向 /v1/chat/completions 发送 POST 请求,并将 model 设置为 deepseek-v4-flash。
同一个 HiAPI API Key 可以调用媒体模型吗?
可以,但媒体生成使用 POST /v1/tasks,端点和请求结构与文本模型不同。
输入、输出和缓存 Token 如何计费?
输入、输出和缓存读取 Token 分别计费,最终以 HiAPI 实时定价页为准。 查看实时价格。
如何迁移现有 OpenAI SDK 客户端?
保留 Chat Completions 请求结构,将 base_url 改为 https://api.hiapi.ai/v1,使用 HiAPI API Key,并将 model 改为 deepseek-v4-flash。