DeepSeek V4.1 Flash Preview API
https://api.hiapi.ai /v1/responses 该模型推荐使用兼容 OpenAI 的 Responses 接口,并继续保留 /v1/chat/completions 兼容入口。同一个 HiAPI API Key 可调用账户分组内已开放模型;图片、视频或音频模型使用 /v1/tasks 及对应请求结构。
模型概览
| 模型名称 | deepseek-v4.1-flash |
|---|---|
| 版本 | 预览版 |
| 类型 | 文本生成 · Responses + Chat Completions |
| 推理档位 | none / high / max |
| 流式输出 | 支持 |
| 价格 | HiAPI 实时定价 |
DeepSeek V4.1 Flash 预览版通过 HiAPI 提供文本生成、推理和流式输出。新接入可使用 Responses,已有客户端可继续使用 Chat Completions。
生产建议
- 每次请求都在 input 中传入需要保留的完整对话。
- 省略 store,不要传 previous_response_id、conversation、background 或 context_management。
- 同一个 HiAPI API Key 可调用已开放模型;媒体生成使用 /v1/tasks 及不同的请求结构。
适用场景
显式选择推理档位与输出预算,生成文本回答。
inputreasoning.effortmax_output_tokens请求参数
model string 必填 固定填写 deepseek-v4.1-flash。
input string | array 必填 文本或消息数组;每轮传入需要保留的完整对话。
stream boolean 可选 true 返回语义化 SSE 事件。
max_output_tokens integer 可选 本次输出预算,包含推理 Token。示例值不是模型输出上限。
reasoning object 可选 示例显式选择 high,请按需求指定档位。
effort enum 可选 none 关闭推理;high、max 开启推理。
API 接入示例
调用示例
使用 none 返回不含推理的回答。
{
"model": "deepseek-v4.1-flash",
"input": "Reply with OK only.",
"reasoning": {
"effort": "none"
},
"max_output_tokens": 128,
"stream": false
}显式选择已验证的 max 档位;较长任务应增加输出预算。
{
"model": "deepseek-v4.1-flash",
"input": "Reply with OK only.",
"reasoning": {
"effort": "max"
},
"max_output_tokens": 128,
"stream": false
}按语义化 SSE 事件读取文本,并读取终态响应中的用量。
{
"model": "deepseek-v4.1-flash",
"input": "Reply with OK only.",
"reasoning": {
"effort": "high"
},
"max_output_tokens": 128,
"stream": true
}响应结构
非流式响应从 output 中读取 output_text;流式响应按事件类型处理。计费明细以 usage 为准。
{
"id": "resp_example",
"object": "response",
"status": "completed",
"model": "deepseek-v4.1-flash",
"output": [
{
"id": "msg_example",
"type": "message",
"role": "assistant",
"status": "completed",
"content": [
{
"type": "output_text",
"text": "稀疏注意力只计算部分关键 Token 之间的关联。"
}
]
}
],
"usage": {
"input_tokens": 24,
"output_tokens": 18,
"total_tokens": 42,
"input_tokens_details": {
"cached_tokens": 0
}
}
} - 非流式响应从 output 中读取 output_text 内容。
- 从 usage.input_tokens、usage.output_tokens、usage.total_tokens 读取用量;返回 output_tokens_details.reasoning_tokens 时可查看推理用量。
- 流式响应从终态事件读取 response.usage,并显式处理未完成或失败的响应。
常见问题
预览版是什么意思?
当前以 DeepSeek V4.1 Flash 预览版提供服务。请使用本文公开模型 ID,并在模型版本变化时验证实际业务效果。
应该使用哪个接口和模型 ID?
使用 POST /v1/responses,model 填 deepseek-v4.1-flash。也保留 POST /v1/chat/completions,后者使用 messages 而非 input。OpenAI SDK 可将 base URL 设置为 https://api.hiapi.ai/v1,并使用 HiAPI API Key。
如何控制推理?
Responses 使用 reasoning.effort,可选 none、high、max。示例显式使用 high,none 关闭推理。不要套用其他模型的档位别名。
如何继续多轮对话?
该模型的 Responses 接口无状态,每轮都在 input 中重新传入需要保留的用户和助手消息。省略 store,不要传 previous_response_id、conversation、background 或 context_management。
流式输出何时结束?
拼接 response.output_text.delta,并从 response.completed 读取 usage。也要将 response.incomplete 和 response.failed 作为终态处理,不要等待 Chat Completions 的 [DONE] 标记。
Token 如何计费?
输入、输出、缓存读取分别计费。推理 Token 占用输出预算;请结合 usage 和 HiAPI 实时定价核对费用,不要把文档示例当成固定价格。 查看实时价格。
可以使用图片、工具和结构化 JSON 吗?
这些能力尚未完成本次 HiAPI 接入验证,本文不作支持承诺。请按本文已验证契约使用文本输入。