跳转到内容
中文

DeepSeek V4.1 Flash Preview API

POST Base URL: https://api.hiapi.ai /v1/responses

该模型推荐使用兼容 OpenAI 的 Responses 接口,并继续保留 /v1/chat/completions 兼容入口。同一个 HiAPI API Key 可调用账户分组内已开放模型;图片、视频或音频模型使用 /v1/tasks 及对应请求结构。

模型概览

模型名称deepseek-v4.1-flash
版本预览版
类型文本生成 · Responses + Chat Completions
推理档位none / high / max
流式输出支持
价格HiAPI 实时定价

DeepSeek V4.1 Flash 预览版通过 HiAPI 提供文本生成、推理和流式输出。新接入可使用 Responses,已有客户端可继续使用 Chat Completions。

生产建议

无状态请求
  • 每次请求都在 input 中传入需要保留的完整对话。
  • 省略 store,不要传 previous_response_id、conversation、background 或 context_management。
  • 同一个 HiAPI API Key 可调用已开放模型;媒体生成使用 /v1/tasks 及不同的请求结构。

适用场景

文本回答

显式选择推理档位与输出预算,生成文本回答。

inputreasoning.effortmax_output_tokens

请求参数

model string 必填

固定填写 deepseek-v4.1-flash。

示例 deepseek-v4.1-flash
input string | array 必填

文本或消息数组;每轮传入需要保留的完整对话。

stream boolean 可选

true 返回语义化 SSE 事件。

默认 false
max_output_tokens integer 可选

本次输出预算,包含推理 Token。示例值不是模型输出上限。

示例 128
reasoning object 可选

示例显式选择 high,请按需求指定档位。

effort enum 可选

none 关闭推理;high、max 开启推理。

可选值: nonehighmax

API 接入示例

调用示例

关闭推理

使用 none 返回不含推理的回答。

请求体
{
  "model": "deepseek-v4.1-flash",
  "input": "Reply with OK only.",
  "reasoning": {
    "effort": "none"
  },
  "max_output_tokens": 128,
  "stream": false
}
max 推理

显式选择已验证的 max 档位;较长任务应增加输出预算。

请求体
{
  "model": "deepseek-v4.1-flash",
  "input": "Reply with OK only.",
  "reasoning": {
    "effort": "max"
  },
  "max_output_tokens": 128,
  "stream": false
}
流式输出

按语义化 SSE 事件读取文本,并读取终态响应中的用量。

请求体
{
  "model": "deepseek-v4.1-flash",
  "input": "Reply with OK only.",
  "reasoning": {
    "effort": "high"
  },
  "max_output_tokens": 128,
  "stream": true
}

响应结构

非流式响应从 output 中读取 output_text;流式响应按事件类型处理。计费明细以 usage 为准。

{
  "id": "resp_example",
  "object": "response",
  "status": "completed",
  "model": "deepseek-v4.1-flash",
  "output": [
    {
      "id": "msg_example",
      "type": "message",
      "role": "assistant",
      "status": "completed",
      "content": [
        {
          "type": "output_text",
          "text": "稀疏注意力只计算部分关键 Token 之间的关联。"
        }
      ]
    }
  ],
  "usage": {
    "input_tokens": 24,
    "output_tokens": 18,
    "total_tokens": 42,
    "input_tokens_details": {
      "cached_tokens": 0
    }
  }
}
  1. 非流式响应从 output 中读取 output_text 内容。
  2. 从 usage.input_tokens、usage.output_tokens、usage.total_tokens 读取用量;返回 output_tokens_details.reasoning_tokens 时可查看推理用量。
  3. 流式响应从终态事件读取 response.usage,并显式处理未完成或失败的响应。

常见问题

预览版是什么意思?

当前以 DeepSeek V4.1 Flash 预览版提供服务。请使用本文公开模型 ID,并在模型版本变化时验证实际业务效果。

应该使用哪个接口和模型 ID?

使用 POST /v1/responses,model 填 deepseek-v4.1-flash。也保留 POST /v1/chat/completions,后者使用 messages 而非 input。OpenAI SDK 可将 base URL 设置为 https://api.hiapi.ai/v1,并使用 HiAPI API Key。

如何控制推理?

Responses 使用 reasoning.effort,可选 none、high、max。示例显式使用 high,none 关闭推理。不要套用其他模型的档位别名。

如何继续多轮对话?

该模型的 Responses 接口无状态,每轮都在 input 中重新传入需要保留的用户和助手消息。省略 store,不要传 previous_response_id、conversation、background 或 context_management。

流式输出何时结束?

拼接 response.output_text.delta,并从 response.completed 读取 usage。也要将 response.incomplete 和 response.failed 作为终态处理,不要等待 Chat Completions 的 [DONE] 标记。

Token 如何计费?

输入、输出、缓存读取分别计费。推理 Token 占用输出预算;请结合 usage 和 HiAPI 实时定价核对费用,不要把文档示例当成固定价格。 查看实时价格。

可以使用图片、工具和结构化 JSON 吗?

这些能力尚未完成本次 HiAPI 接入验证,本文不作支持承诺。请按本文已验证契约使用文本输入。

下一步