HiAPI
概览模型广场API 密钥用量统计调用日志充值账单推荐奖励在线试用产物存储更新公告联系我们账号设置
金额单位
N
Powered by hiapi
账号设置

欢迎

联系我们

Kimi K3 是 Moonshot AI 的推理模型。通过 Chat Completions 进行文本对话,支持三档推理强度与流式输出。

提供商: Moonshot AI

类型: 文本生成

接口: /v1/chat/completions

状态: 已开放

消耗: --

返回模型市场
Moonshot AIText API在线

kimi-k3

Kimi K3 是 Moonshot AI 的推理模型。通过 Chat Completions 进行文本对话,支持三档推理强度与流式输出。

在 Agent 中使用

API 接入

Endpoint

POST /v1/chat/completions

Base URL

https://api.hiapi.ai

兼容 OpenAI Chat Completions;同一个 HiAPI Key 可切换所有已开放模型。

输入价格

4,640 积分

/ 百万 Token

输出价格

23,200 积分

/ 百万 Token

Context

1M

上下文窗口

Max output

-

最大输出 Token

在线调试API 接入定价能力参数模型介绍

运行参数

在线调试将使用当前登录账户并从账户余额扣费,无需额外填写 API Key。通过代码调用 API 时,仍需使用 HiAPI API Key。

开始测试 kimi-k3

输入一个问题,页面会以流式方式展示回答,并在完成后显示 Token 用量、耗时和估算费用。

kimi-k3 API 快速开始

使用 OpenAI Chat Completions 兼容格式调用 kimi-k3。下面提供 cURL、Python 和 Node.js 三种可直接复制的示例。

查看完整 API 文档
代码示例
API 端点:/v1/chat/completions
curl -X POST "https://api.hiapi.ai/v1/chat/completions" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "kimi-k3",
  "stream": false,
  "messages": [
    {
      "role": "user",
      "content": "用三句话解释 LRU 缓存策略。"
    }
  ],
  "reasoning_effort": "max"
}'

提示: 请将 YOUR_API_KEY 替换为您在 API 密钥 页面创建的密钥。

兼容 OpenAI Chat Completions 格式,只需替换 base URL、API Key 和模型名即可接入。

kimi-k3 完整 API 文档管理 API Key同一个 HiAPI Key 可切换所有已开放模型。

kimi-k3 API 定价

按 usage 中实际产生的输入、输出及缓存 Token 计费,以下价格统一按 100 万 Token 展示。

输入 Token
4,640 积分/ 100 万 Token

发送给模型的提示词与上下文

输出 Token
23,200 积分/ 100 万 Token

模型生成的回答与推理内容

缓存读取
464 积分/ 100 万 Token

kimi-k3 模型规格

以下规格对应 HiAPI 当前公开的文本请求契约;未披露的能力不会由页面自行推断。

流式响应
支持
Tool calling
支持
结构化 JSON
支持
推理模式
支持
输入模态
text
输出模态
text
推理档位
low · high · max(最大档请使用 max)
最大输出
-

关于 kimi-k3

Kimi K3 是 Moonshot AI 的推理模型。通过 Chat Completions 进行文本对话,支持三档推理强度与流式输出。

HiAPI 通过 /v1/chat/completions 提供该模型。你可以先在本页 Playground 验证提示词与参数,再使用同一个 HiAPI API Key 接入服务端。

提供商
Moonshot AI
接口
/v1/chat/completions
上下文窗口
1M
发布日期
2026-07-17

如何使用 kimi-k3

在线调试与 API 接入共享同一个模型 ID,可以用三个步骤从提示词验证过渡到生产调用。

  1. 步骤 1

    在线验证

    在 Playground 中测试 系统提示词、输出长度和模型支持的推理选项。

  2. 步骤 2

    管理 API Key

    登录后查看已有密钥或按需新建;同一个密钥可切换所有已开放模型。

  3. 步骤 3

    接入服务端

    向 /v1/chat/completions 发送请求,并根据 usage 字段记录成本。

需要比较不同模型和计费档位?查看全部模型实时价格

常见问题

Kimi K3 的 Low、High、Max 怎么选?

日常提取、改写和短问答可以先试 low;需要多步分析时试 high;难题或复杂代码任务再比较 max 的效果。reasoning_effort 默认是 max,只提供 low、high、max 三档,没有 medium 或 none。更高档位可能产生更多思考 Token、等待更久,应结合回答质量和 usage 选择。

为什么没有关闭思考和调节温度的开关?

Kimi K3 在当前接入中始终开启思考,降低开销应先尝试 low,而不是传 thinking.type=disabled。本页不会发送 thinking、temperature 或 top_p;从其他模型迁移时,也应移除这些控制字段,使用顶层 reasoning_effort 选择档位。

回答很短,为什么仍有较多输出 Token 费用?

模型生成的思考内容也按输出 Token 计费,所以最终回答的字数不能代表总输出量。usage.completion_tokens 已包含思考 Token;如返回 completion_tokens_details.reasoning_tokens,它是其中的明细,不要重复相加。费用按普通输入、缓存读取和输出三项分别计算,每项 Token 数除以 100 万,再乘本页对应美元单价。

多轮对话只保存最终回答可以吗?

不建议。下一轮 messages 应按顺序带回所需历史,并保留 API 返回的完整 assistant 消息,包括 content、返回的 reasoning_content,以及可能存在的 tool_calls。只保存最终文字会丢失 Kimi 继续思考或续接工具所需的上下文。本页 Playground 会保留返回的思考内容。

返回 tool_calls 后,工具会自动执行吗?

不会。模型提出调用哪个函数及其参数,工具的实际执行由你的应用负责。执行后,把原 assistant 消息和 role=tool 的结果消息加入 messages;结果中的 tool_call_id 必须对应原调用的 id,再请求 Kimi 继续回答。不要只把工具结果当作一条普通 user 消息发送。

JSON 模式和严格 JSON Schema 有什么区别?

response_format.type=json_object 用于取得 JSON,但业务字段仍需应用校验。需要约束字段和类型时,使用 response_format.type=json_schema,并提供 response_format.json_schema.schema 和 response_format.json_schema.strict=true。最终 JSON 在 choices[0].message.content 中,不能把 reasoning_content 拼进去解析;本页 JSON output 开关使用的是 json_object。

Kimi 官方支持视觉理解,这里也能传图片或视频吗?

当前 HiAPI 的这个 Kimi K3 接入只开放文本输入、文本输出。官方模型具备视觉能力,并不代表本页已经开放图片或视频输入。接入时按文本 messages 构造请求,不要直接套用官方的 image_url 或 video_url 示例;以后是否开放,以本页输入能力和 Playground 控件为准。

可以直接使用 Responses API,或只改模型名就完成迁移吗?

本页 Kimi K3 当前使用 POST /v1/chat/completions,model 为 kimi-k3;Responses 尚未作为此接入的开放端点。OpenAI SDK 客户端应使用 chat.completions.create 和 messages,并调整推理字段、保留完整 assistant 历史。可以复用同一个 HiAPI API Key,但使用 Responses 的旧代码还需要调整请求与响应处理。

重复发送相同上下文,为什么缓存费用不一定一样?

缓存命中是按请求实际返回的 usage.prompt_tokens_details.cached_tokens 计算的,重复文本不保证每次都命中。尽量保持开头的系统提示词、工具定义和固定上下文一致,再追加新消息;切换 reasoning_effort 也可能影响命中。cached_tokens 为 0 时,不能按缓存读取单价估算这部分输入。

1M 上下文代表一次能输出 100 万 Token 吗?

不代表。上下文窗口与单次最大输出是不同的限制。本页没有用 1M 上下文推算最大输出,因此未确认的输出上限显示为“-”。可以用 max_tokens 设置本次输出预算;如果 finish_reason 返回 length,要检查是否触及输出限制,再决定缩小任务或续写。