DeepSeek V4.1 Flash 预览版,支持原生 Responses、Chat Completions、流式输出与 none/high/max 思考档位。
提供商: DeepSeek
类型: 文本生成
接口: /v1/responses
状态: 已开放
消耗: --
DeepSeek V4.1 Flash 预览版,支持原生 Responses、Chat Completions、流式输出与 none/high/max 思考档位。
API 接入
Endpoint
POST /v1/responses
Base URL
https://api.hiapi.ai
使用 OpenAI Responses 格式调用;同一个 HiAPI Key 可切换所有已开放模型。
输入价格
880 积分
/ 百万 Token
输出价格
2,640 积分
/ 百万 Token
Context
-
上下文窗口
Max output
-
最大输出 Token
输入一个问题,页面会以流式方式展示回答,并在完成后显示 Token 用量、耗时和估算费用。
使用 OpenAI Responses 格式流式调用 DeepSeek V4.1 Flash。下面提供 cURL、Python 和 Node.js 三种可直接复制的示例。
/v1/responsescurl -N -X POST "https://api.hiapi.ai/v1/responses" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4.1-flash",
"input": [
{
"type": "message",
"role": "user",
"content": [
{
"type": "input_text",
"text": "用三句话解释 API 缓存的作用。"
}
]
}
],
"stream": true,
"max_output_tokens": 1024,
"reasoning": {
"effort": "high"
}
}'提示: 请将 YOUR_API_KEY 替换为您在 API 密钥 页面创建的密钥。
使用 OpenAI Responses 格式;请保留 stream: true,input 使用消息数组,并通过 reasoning.effort 设置推理强度。
示例默认使用 reasoning.effort=high;最大推理强度改为 max,关闭推理则改为 none。
Responses API
先完成基础字段,再按任务启用高级能力。
组成一次有效请求的必要信息
设置已验证的思考档位与输出上限
DeepSeek Responses 是无状态接口,不支持 previous_response_id 或 conversation。请在下一轮 input 中重新传入仍需使用的上下文;请求中无需传入 store。
按实际输入、输出及缓存 Token 用量计费,以下价格统一按 100 万 Token 展示。
发送给模型的提示词与上下文
模型生成的回答与推理内容
以下规格对应 HiAPI 当前公开的文本请求契约;未披露的能力不会由页面自行推断。
DeepSeek V4.1 Flash 预览版,支持原生 Responses、Chat Completions、流式输出与 none/high/max 思考档位。
HiAPI 通过 /v1/responses 提供该模型。你可以先在本页 Playground 验证提示词与参数,再使用同一个 HiAPI API Key 接入服务端。
在线调试与 API 接入共享同一个模型 ID,可以用三个步骤从提示词验证过渡到生产调用。
步骤 1
在 Playground 中测试 instructions、input 和 reasoning.effort。
步骤 2
登录后查看已有密钥或按需新建;同一个密钥可切换所有已开放模型。
步骤 3
向 /v1/responses 发送请求,并根据 usage 字段记录成本。
DeepSeek V4.1 Flash 是 DeepSeek 的预览版模型。HiAPI 当前提供文本对话、流式输出及已验证的思考档位;上下文长度、最大输出和其他能力以经过确认的模型规格为准。
model 填写 deepseek-v4.1-flash。可使用 POST /v1/responses,也兼容 POST /v1/chat/completions;两者分别使用 input 和 messages,请勿混用请求结构。
Responses 请求使用 reasoning.effort:none 关闭思考,high 和 max 开启思考。Playground 和默认示例使用 high。Chat Completions 使用 thinking.type=enabled/disabled;开启时通过 reasoning_effort 选择 high 或 max。
此接口为无状态接口。每次在 input 中重新传入需要保留的对话历史;不要传 previous_response_id、conversation、background 或 context_management,也无需传 store。
Responses 使用 response.output_text.delta 接收正文增量,并在 response.completed 中读取最终 usage;response.incomplete 和 response.failed 分别表示未完整生成和失败。Responses 不以 [DONE] 结束;Chat Completions 流仍使用 [DONE]。
输入、输出和缓存命中输入分别按实际 Token 计费,思考 Token 计入输出。Responses 的 usage.input_tokens、usage.output_tokens 和 input_tokens_details.cached_tokens 可用于核对用量,最终扣费以调用日志为准,单价查看实时价格区。
本次接入范围为文本、流式和思考模式。图片输入、工具调用及结构化 JSON 暂未在本页开放;未展示的能力不等于模型不具备该能力,应以 HiAPI 当前验证并开放的范围为准。
可以复用有对应模型权限和可用余额的 HiAPI API Key。使用 OpenAI SDK 时,将 base_url 配置为 https://api.hiapi.ai/v1;Responses 使用 client.responses.create,Chat Completions 使用 client.chat.completions.create。