跳转到内容
中文

DeepSeek V4 Flash API

POST /v1/chat/completions

该模型使用兼容 OpenAI 的 Chat Completions 接口。同一个 HiAPI API Key 可调用账户分组内已开放模型;切换到图片、视频或音频模型时,需要改用 /v1/tasks 及对应请求结构。

模型概览

模型名称deepseek-v4-flash
类型文本生成 · Chat Completions
上下文窗口1,000,000 Tokens
最大输出384,000 Tokens
模式思考(默认)与非思考
能力流式输出、JSON Mode、工具调用
价格查看 HiAPI 实时定价

DeepSeek V4 Flash 是 DeepSeek V4 系列中面向效率的模型。根据 DeepSeek 官方资料,它拥有 2840 亿总参数、每个 Token 激活 130 亿参数,支持 100 万 Token 上下文以及思考与非思考双模式。HiAPI 通过兼容 OpenAI 的 Chat Completions 接口开放该模型。

生产建议

API Key 与端点
  • 同一个 HiAPI API Key 可以调用账户分组内所有已开放模型。
  • 文本模型使用 /v1/chat/completions;图片、视频和音频模型使用异步 /v1/tasks 请求结构。
  • API Key 只保存在服务端或安全的密钥管理系统中,不要写入浏览器前端代码。
限时免费 API 额度
  • 上新活动生效期间,符合资格的充值用户可添加请求头 X-HiAPI-Promotion: deepseek-v4-flash-launch,主动使用免费额度。
  • 携带活动请求头的调用只使用免费额度,不会自动转为余额付费。
  • 每日额度用完后,API 返回 HTTP 429 和 promotion_quota_exhausted;只有应用明确希望转为付费调用时,才移除活动请求头后重试。

适用场景

高吞吐文本生成

适合问答、摘要、抽取与内容工作流。

messagesstream
推理与编程

使用思考模式处理多步骤分析和代码生成。

thinkingreasoning_effort
Agent 工作流

结合长上下文和工具调用完成多步骤自动化。

toolsmessages
结构化输出

使用 JSON Mode 返回机器可读结果。

response_format

请求参数

model string 必填

固定填写 deepseek-v4-flash。

示例 deepseek-v4-flash
messages array 必填

按顺序传入对话消息,每项包含 role 与 content。

role enum 必填

消息角色。

可选值: systemuserassistanttool
content string 必填

消息文本。

示例 请用三句话解释稀疏注意力。
stream boolean 可选

设为 true 时返回 Server-Sent Events 流。

默认 false
max_tokens integer 可选

最大生成 Token 数;输入与输出总长度不能超过上下文窗口。

示例 1024
thinking object 可选

开启或关闭思考模式;默认开启。

type enum 必填

思考模式开关。

默认 enabled 可选值: enableddisabled
reasoning_effort enum 可选

思考强度;最大档请明确传 max。DeepSeek V4 Flash 接收 xhigh 时实际按 high 执行。

默认 high 可选值: highmax
response_format object 可选

JSON Mode 使用 type=json_object,并在提示词中明确要求返回 JSON。

tools array 可选

OpenAI 兼容的函数工具定义。

API 接入示例

调用示例

最大思考强度

保持思考模式开启,并将 reasoning_effort 设为 max。

请求体
{
  "model": "deepseek-v4-flash",
  "messages": [
    {
      "role": "system",
      "content": "你是一名回答简洁的技术助手。"
    },
    {
      "role": "user",
      "content": "请用三句话解释稀疏注意力。"
    }
  ],
  "thinking": {
    "type": "enabled"
  },
  "reasoning_effort": "max",
  "stream": false
}
流式响应

将 stream 设为 true,持续读取 SSE 数据直到 [DONE]。

请求体
{
  "model": "deepseek-v4-flash",
  "messages": [
    {
      "role": "system",
      "content": "你是一名回答简洁的技术助手。"
    },
    {
      "role": "user",
      "content": "请用三句话解释稀疏注意力。"
    }
  ],
  "thinking": {
    "type": "enabled"
  },
  "reasoning_effort": "high",
  "stream": true
}
非思考 JSON 响应

关闭思考模式并要求返回 JSON 对象。

请求体
{
  "model": "deepseek-v4-flash",
  "messages": [
    {
      "role": "user",
      "content": "请返回包含 summary 和 risks 字段的 JSON。"
    }
  ],
  "thinking": {
    "type": "disabled"
  },
  "response_format": {
    "type": "json_object"
  }
}

响应结构

非流式响应遵循 Chat Completions 结构。思考模式会额外返回 reasoning_content;计费明细以 usage 为准。

{
  "id": "chatcmpl_example",
  "object": "chat.completion",
  "model": "deepseek-v4-flash",
  "choices": [
    {
      "index": 0,
      "message": {
        "role": "assistant",
        "content": "稀疏注意力只计算部分关键 Token 之间的关联。"
      },
      "finish_reason": "stop"
    }
  ],
  "usage": {
    "prompt_tokens": 24,
    "completion_tokens": 18,
    "total_tokens": 42,
    "prompt_tokens_details": {
      "cached_tokens": 0
    }
  }
}
  1. 从 choices[0].message.content 读取最终回答。
  2. 思考模式下,从 choices[0].message.reasoning_content 读取推理内容。
  3. 从 usage 读取输入、输出、缓存及总 Token 数。
  4. 流式调用逐条处理 SSE data,直到收到 [DONE]。

常见问题

什么是 DeepSeek V4 Flash?

DeepSeek V4 Flash 是 DeepSeek V4 系列中面向速度与成本效率的开源权重 MoE 文本模型。根据 DeepSeek 官方资料,它拥有 2840 亿总参数、每个 Token 激活 130 亿参数,支持 100 万 Token 上下文,并提供非思考、Think High 和 Think Max 三种模式。

如何调整思考模式和推理强度?

模型默认开启思考模式。通过 thinking.type 选择 enabled 或 disabled;开启思考时使用 reasoning_effort=high 或 max。最大思考强度必须明确传 max;DeepSeek V4 Flash 接收 xhigh 时实际按 high 执行。

应该使用哪个端点和模型 ID?

向 /v1/chat/completions 发送 POST 请求,并将 model 设置为 deepseek-v4-flash。

同一个 HiAPI API Key 可以调用媒体模型吗?

可以,但媒体生成使用 POST /v1/tasks,端点和请求结构与文本模型不同。

输入、输出和缓存 Token 如何计费?

输入、输出和缓存读取 Token 分别计费,最终以 HiAPI 实时定价页为准。 查看实时价格。

如何迁移现有 OpenAI SDK 客户端?

保留 Chat Completions 请求结构,将 base_url 改为 https://api.hiapi.ai/v1,使用 HiAPI API Key,并将 model 改为 deepseek-v4-flash。

下一步