GPT-6 Astra 通过 Responses API 提供流式文本生成、五档推理、函数调用与 JSON 输出。
提供商: OpenAI
类型: 文本生成
接口: /v1/responses
状态: 已开放
消耗: --
GPT-6 Astra 通过 Responses API 提供流式文本生成、五档推理、函数调用与 JSON 输出。
API 接入
Endpoint
POST /v1/responses
Base URL
https://api.hiapi.ai
使用 OpenAI Responses 格式调用;同一个 HiAPI Key 可切换所有已开放模型。
输入价格
5,000 积分
/ 百万 Token · 总输入 ≤ 272,000 Token
输出价格
25,000 积分
/ 百万 Token · 总输入 ≤ 272,000 Token
Context
1.05M
上下文窗口
Max output
128K
最大输出 Token
输入一个问题,页面会以流式方式展示回答,并在完成后显示 Token 用量、耗时和估算费用。
使用 OpenAI Responses 格式流式调用 GPT-6 Astra。下面提供 cURL、Python 和 Node.js 三种可直接复制的示例。
/v1/responsescurl -N -X POST "https://api.hiapi.ai/v1/responses" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"input": [
{
"type": "message",
"role": "user",
"content": [
{
"type": "input_text",
"text": "Explain one practical way to check an AI-generated answer against its source."
}
]
}
],
"stream": true,
"store": false,
"reasoning": {
"effort": "medium"
}
}'提示: 请将 YOUR_API_KEY 替换为您在 API 密钥 页面创建的密钥。
使用 OpenAI Responses 格式;请保留 stream: true,input 使用消息数组,并通过 reasoning.effort 设置推理强度。
Responses API
先完成基础字段,再按任务启用高级能力。
组成一次有效请求的必要信息
按任务需要启用推理、上下文与工具
Max output 是模型规格上限,不代表每次请求都会生成到该长度。示例仅展示当前已开放并完成验证的运行参数。
按实际输入、输出及缓存 Token 用量计费,以下价格统一按 100 万 Token 展示。
总输入 ≤ 272,000 Token
发送给模型的提示词与上下文
模型生成的回答与推理内容
档位按单次请求的总输入 Token(含缓存读取与写入)确定。超过阈值后,整次请求的输入、输出及缓存均使用该档价格,不只对超出部分加价。
| 计费项目 | 总输入 ≤ 272,000 Token | 总输入 > 272,000 Token |
|---|---|---|
| 输入 | 5,000 积分 | 10,000 积分 |
| 输出 | 25,000 积分 | 37,500 积分 |
| 缓存读取 | 500 积分 | 1,000 积分 |
| 缓存写入 | 6,250 积分 | 12,500 积分 |
以上价格均按 100 万 Token 计算。
以下规格对应 HiAPI 当前公开的文本请求契约;未披露的能力不会由页面自行推断。
GPT-6 Astra 通过 Responses API 提供流式文本生成、五档推理、函数调用与 JSON 输出。
HiAPI 通过 /v1/responses 提供该模型。你可以先在本页 Playground 验证提示词与参数,再使用同一个 HiAPI API Key 接入服务端。
在线调试与 API 接入共享同一个模型 ID,可以用三个步骤从提示词验证过渡到生产调用。
步骤 1
在 Playground 中测试 instructions、input 和 reasoning.effort。
步骤 2
登录后查看已有密钥或按需新建;同一个密钥可切换所有已开放模型。
步骤 3
向 /v1/responses 发送请求,并根据 usage 字段记录成本。
GPT-6 Astra 是 OpenAI 的模型,面向复杂推理、编程、研究和文档工作。适合代码审查、方案分析和需要多步处理的任务。本页接入范围为文本输入与文本输出;图片、音频和视频能力应以各自的接入说明为准。
模型 ID 使用 gpt-6-astra,端点为 POST /v1/responses。OpenAI SDK 的 base_url 设置为 https://api.hiapi.ai/v1,使用 HiAPI API Key,并调用 Responses 接口。已有 Key 可用于账户中已开放的模型;切换到图片或视频的 /v1/tasks 接口时,需要同时改变请求结构。
这是本页接入方式的请求约定:input 传消息数组,stream=true 接收流式事件,store=false 由客户端保存会话上下文。不能直接把 Chat Completions 的 messages 请求或 choices 解析代码搬过来,也不要把整个 SSE 响应当成一个 JSON 对象读取。
通过 reasoning.effort 选择这五档推理强度。示例和 Playground 从 medium 开始;简单任务可尝试 low,复杂分析可比较 high、xhigh 或 max 的效果。提高档位可能增加等待时间和输出 Token 用量,建议用同一组实际任务比较结果与成本。API 调用方应显式传入所需档位。
GPT-6 Astra 不支持 reasoning.effort=none。本页接入不提供 temperature、top_p 和 max_output_tokens 调节项,请按本页示例组织请求,不要照搬其他模型的参数。如果出现参数错误,先检查字段是否适用于这个模型及端点。
官方规格为 1,050,000 Token 上下文和 128,000 Token 最大输出。上下文需要容纳输入和生成内容,推理也会消耗输出预算。最大输出是模型规格上限,并不表示每次请求都会输出这么多;本页接入也不将这个数值作为可调的 max_output_tokens 参数。
流式正文已经通过 response.output_text.delta 或 response.output_item.done 返回,结束事件未必再重复完整内容。应按事件类型累积文本和完成的输出项目,再从结束事件读取状态和 usage。response.failed、response.incomplete 需要单独处理,不能一律当成成功结束。
store=false 时,需要在下一次 input 中回放仍需使用的用户消息、助手消息和工具结果,不依赖服务端替你保存全部对话。回放的历史内容会再次计入输入 Token;其中命中的缓存部分按缓存读取计费。对话较长时,应保留必要上下文,减少无关历史。
这四类 Token 使用各自的单价,具体数值见本页实时定价。输入总量包含缓存读取和写入:计算普通输入费用时应先扣除这两项,避免重复计费。reasoning_tokens 已包含在输出 Token 中,也不应再加一次。页面估算用于参考,最终费用以账户消费日志为准。
按单次请求的总输入 Token 判断,缓存读取和写入也包含在内。总输入为 272,000 Token 时仍使用标准档;从 272,001 Token 起,整次请求的输入、输出及缓存都使用长上下文档位。不是只给超出阈值的那一小部分加价。两档单价可在定价区展开比较。
不一定。缓存是否建立和命中取决于服务端策略、可复用前缀及有效期,应以 usage 中的 cached_tokens 和 cache_write_tokens 为准。两项为 0 表示该次请求没有报告对应缓存用量;不要仅凭提示词重复就自行按缓存优惠估算费用。
函数调用通过 tools 声明函数。收到 function_call 后,由你的应用执行函数,再用同一 call_id 回传 function_call_output,连同所需上下文继续请求。JSON Object 使用 text.format.type=json_object;需要字段约束时使用 json_schema。流式 JSON 应先完整拼接,再解析和校验;具体请求见文档示例。
先检查 API Key、model 是否为 gpt-6-astra,以及端点和参数是否与本页一致。没有正文时检查是否正确处理 SSE,而不是只读取最终 output;费用有疑问时,对照 usage 的输入、缓存、输出数量和所处上下文档位。需要排查时提供请求 ID、错误代码和发生时间,不要公开 API Key。