DeepSeek V4 Flash 是面向高吞吐文本生成、推理、编程与 Agent 工作流的开源大语言模型,支持 100 万 Token 上下文、思考与非思考模式、JSON 输出和工具调用。
提供商: DeepSeek
类型: 文本生成
接口: /v1/chat/completions
状态: 已开放
消耗: --
DeepSeek V4 Flash 是面向高吞吐文本生成、推理、编程与 Agent 工作流的开源大语言模型,支持 100 万 Token 上下文、思考与非思考模式、JSON 输出和工具调用。
API 接入
Endpoint
POST /v1/chat/completions
Base URL
https://www.hiapi.ai
兼容 OpenAI Chat Completions;同一个 HiAPI Key 可切换所有已开放模型。
输入价格
$0.14
/ 百万 Token
输出价格
$0.28
/ 百万 Token
Context
1M
上下文窗口
Max output
—
最大输出 Token
输入一个问题,页面会以流式方式展示回答,并在完成后显示 Token 用量、耗时和估算费用。
使用 OpenAI Chat Completions 兼容格式调用 DeepSeek V4 Flash。下面提供 cURL、Python 和 Node.js 三种可直接复制的示例。
/v1/chat/completionscurl -X POST "https://www.hiapi.ai/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"stream": false,
"messages": [
{
"role": "user",
"content": "请用三句话解释量子计算,并给出一个生活化的类比。"
}
],
"thinking": {
"type": "enabled"
},
"reasoning_effort": "high"
}'提示: 请将 YOUR_API_KEY 替换为您在 API 密钥 页面创建的密钥。
兼容 OpenAI Chat Completions 格式,只需替换 base URL、API Key 和模型名即可接入。
示例默认开启思考模式并使用 reasoning_effort=high;最大思考强度改为 max。关闭思考时将 thinking.type 设为 disabled,并省略 reasoning_effort。
按实际输入、输出及缓存 Token 用量计费,以下价格统一按 100 万 Token 展示。
发送给模型的提示词与上下文
模型生成的回答与推理内容
DeepSeek V4 Flash 是 DeepSeek V4 系列中面向速度与成本效率的开源权重 MoE 文本模型。DeepSeek 官方资料显示,它拥有 2840 亿总参数、每个 Token 激活 130 亿参数,支持 100 万 Token 上下文;官方将其定位为参数规模更小、响应更快的 V4 版本,并提供非思考、Think High 和 Think Max 三种模式。
模型默认开启思考模式。在本页 Playground 中可关闭思考模式,或在开启时选择 High(标准思考)和 Max(最大思考强度)。API 请求使用 thinking.type=enabled/disabled 与 reasoning_effort=high/max;最大档必须明确传 max,xhigh 在 DeepSeek V4 Flash 上实际按 high 执行。
向 POST /v1/chat/completions 发送请求,将 model 设置为 deepseek-v4-flash,并使用 HiAPI API Key 鉴权。文本模型使用 Chat Completions;图片、视频和音频模型仍使用 /v1/tasks。
以下规格对应 HiAPI 当前公开的文本请求契约;未披露的能力不会由页面自行推断。
DeepSeek V4 Flash 是面向高吞吐文本生成、推理、编程与 Agent 工作流的开源大语言模型,支持 100 万 Token 上下文、思考与非思考模式、JSON 输出和工具调用。
HiAPI 通过 /v1/chat/completions 提供该模型。你可以先在本页 Playground 验证提示词与参数,再使用同一个 HiAPI API Key 接入服务端。
在线调试与 API 接入共享同一个模型 ID,可以用三个步骤从提示词验证过渡到生产调用。
步骤 1
在 Playground 中测试 system prompt、temperature、输出长度和推理模式。
步骤 2
登录后查看已有密钥或按需新建;同一个密钥可切换所有已开放模型。
步骤 3
向 /v1/chat/completions 发送请求,并根据 usage 字段记录成本。
HiAPI 按实际输入、输出和缓存读取 Token 分别计费;思考模式返回的推理内容属于模型输出。模型页和价格页展示当前实时售价,最终扣费与响应 usage 及使用日志一致。
保留 Chat Completions 的 messages 请求结构,将 base_url 改为 https://api.hiapi.ai/v1,使用 HiAPI API Key,并将 model 改为 deepseek-v4-flash。思考模式需要额外传入 thinking 和 reasoning_effort。