跳转到内容
中文

GPT-6 Astra API

POST Base URL: https://api.hiapi.ai /v1/responses

该模型使用 OpenAI Responses 接口。同一个 HiAPI API Key 可调用已开放模型;图片、视频或音频模型使用 /v1/tasks 及对应请求结构。

模型概览

模型 IDgpt-6-astra
提供方OpenAI
类型文本生成 · 流式 Responses
推理档位low / medium / high / xhigh / max
示例 / Playground 推理强度medium
价格HiAPI 实时 Token 价格

通过 HiAPI 的流式 Responses 接入 OpenAI GPT-6 Astra,用于文本生成、推理、函数调用和严格 JSON Schema 输出。

生产建议

请求契约
  • 使用 POST /v1/responses、input 数组、stream=true 和 store=false。
  • 此接入暂不开放 Chat Completions、原生非流式调用、图片输入或 compact 请求。
  • 省略 max_output_tokens、temperature 和 top_p,不使用 reasoning.effort=none。
  • 同一个 HiAPI API Key 可调用已开放模型。请保存在服务端;媒体生成使用 /v1/tasks 和不同的请求体。
用量与上下文档位
  • 输入、输出、缓存读取与缓存写入费率以模型页的实时价格区为准,文档不固定销售价格。
  • 按包含缓存读取和写入的总输入 Token 判断档位。总输入超过 272,000 Token 后,整次请求(含输出)使用长上下文费率,不仅对超出部分加价。
  • 缓存读写已包含在 input_tokens 中,普通输入等于总输入减去这两类缓存 Token。reasoning_tokens 已包含在 output_tokens 中,不要重复累加。

适用场景

推理与代码评审

按任务选择推理强度,并实时读取文本增量。

reasoning.effortinput
应用工作流

连接函数调用并验证结构化结果。

toolstext.format

请求参数

model string 必填

使用此完整公共模型 ID。

示例 gpt-6-astra 可选值: gpt-6-astra
input array 必填

消息与函数调用项目数组。每次请求重放所需的对话上下文;不支持直接传字符串。

stream boolean 必填

必须为 true,按 SSE 处理响应。

默认 true
store boolean 必填

必须为 false,由客户端保存对话状态。

默认 false
instructions string 可选

可选的角色和回答要求。

reasoning object 可选

设置推理强度。

effort enum 可选

示例和 Playground 选择 medium。直接调用 API 时请显式设置 reasoning.effort;此处不承诺省略字段时的默认行为。更高的推理强度可能增加延迟和输出用量。

示例 medium 可选值: lowmediumhighxhighmax
text object 可选

结构化输出配置。

format object 可选

json_object 用于 JSON 模式,json_schema 用于严格 Schema 验证。

type enum 必填
可选值: json_objectjson_schema
name string 可选

json_schema 模式必填。

strict boolean 可选

使用严格 json_schema 契约时设为 true。

示例 true
schema object 可选

json_schema 模式必填:声明必填字段,并设置 additionalProperties: false。

tools array 可选

包含 type、name、description 和 parameters 的函数定义。在应用中执行模型请求的函数。

tool_choice string | object 可选

使用 auto,或按下方示例指定函数。

API 接入示例

调用示例

推理强度:low

只调整推理强度,保持相同的流式请求契约。

请求体
{
  "model": "gpt-6-astra",
  "input": [
    {
      "type": "message",
      "role": "user",
      "content": [
        {
          "type": "input_text",
          "text": "评审这个服务设计,并列出最重要的三个风险。"
        }
      ]
    }
  ],
  "stream": true,
  "store": false,
  "reasoning": {
    "effort": "low"
  }
}
推理强度:high

只调整推理强度,保持相同的流式请求契约。

请求体
{
  "model": "gpt-6-astra",
  "input": [
    {
      "type": "message",
      "role": "user",
      "content": [
        {
          "type": "input_text",
          "text": "评审这个服务设计,并列出最重要的三个风险。"
        }
      ]
    }
  ],
  "stream": true,
  "store": false,
  "reasoning": {
    "effort": "high"
  }
}
推理强度:xhigh

只调整推理强度,保持相同的流式请求契约。

请求体
{
  "model": "gpt-6-astra",
  "input": [
    {
      "type": "message",
      "role": "user",
      "content": [
        {
          "type": "input_text",
          "text": "评审这个服务设计,并列出最重要的三个风险。"
        }
      ]
    }
  ],
  "stream": true,
  "store": false,
  "reasoning": {
    "effort": "xhigh"
  }
}
推理强度:max

只调整推理强度,保持相同的流式请求契约。

请求体
{
  "model": "gpt-6-astra",
  "input": [
    {
      "type": "message",
      "role": "user",
      "content": [
        {
          "type": "input_text",
          "text": "评审这个服务设计,并列出最重要的三个风险。"
        }
      ]
    }
  ],
  "stream": true,
  "store": false,
  "reasoning": {
    "effort": "max"
  }
}
严格 JSON Schema

在 response.completed 后收集输出文本并按 Schema 验证。

请求体
{
  "model": "gpt-6-astra",
  "input": [
    {
      "type": "message",
      "role": "user",
      "content": [
        {
          "type": "input_text",
          "text": "返回一个 JSON 对象,将 status 设为 ok。"
        }
      ]
    }
  ],
  "stream": true,
  "store": false,
  "reasoning": {
    "effort": "medium"
  },
  "text": {
    "format": {
      "type": "json_schema",
      "name": "status_result",
      "strict": true,
      "schema": {
        "type": "object",
        "properties": {
          "status": {
            "type": "string",
            "enum": [
              "ok"
            ]
          }
        },
        "required": [
          "status"
        ],
        "additionalProperties": false
      }
    }
  }
}
JSON 对象

不提供 Schema,要求返回有效 JSON;在提示词中明确要求 JSON。

请求体
{
  "model": "gpt-6-astra",
  "input": [
    {
      "type": "message",
      "role": "user",
      "content": [
        {
          "type": "input_text",
          "text": "返回一个 JSON 对象,将 status 设为 ok。"
        }
      ]
    }
  ],
  "stream": true,
  "store": false,
  "reasoning": {
    "effort": "medium"
  },
  "text": {
    "format": {
      "type": "json_object"
    }
  }
}
函数调用

收集函数调用参数,执行函数;下一轮 input 数组重放返回的调用项目,并添加带对应 call_id 的 function_call_output 项目。

请求体
{
  "model": "gpt-6-astra",
  "input": [
    {
      "type": "message",
      "role": "user",
      "content": [
        {
          "type": "input_text",
          "text": "查询任务 demo-123 的状态。"
        }
      ]
    }
  ],
  "stream": true,
  "store": false,
  "reasoning": {
    "effort": "medium"
  },
  "tools": [
    {
      "type": "function",
      "name": "get_task_status",
      "description": "Look up a task by ID.",
      "parameters": {
        "type": "object",
        "properties": {
          "task_id": {
            "type": "string"
          }
        },
        "required": [
          "task_id"
        ],
        "additionalProperties": false
      }
    }
  ],
  "tool_choice": {
    "type": "function",
    "name": "get_task_status"
  }
}

响应结构

以下 SSE 序列仅用于说明结构:文本在完成事件前返回,response.completed.output 可能为空。收集 response.output_text.delta,或用 response.output_item.done 的完整项目兜底,避免重复拼接文本。从 response.usage 读取最终用量。Token 数字仅演示字段,并非缓存写入实测;可选用量字段可能省略。分别处理 response.incomplete 和 response.failed,不要假定采用 Chat Completions 的 [DONE] 结束方式。

event: response.output_text.delta
data: {"type":"response.output_text.delta","delta":"OK"}

event: response.output_item.done
data: {"type":"response.output_item.done","output_index":0,"item":{"id":"msg_example","type":"message","role":"assistant","status":"completed","content":[{"type":"output_text","text":"OK"}]}}

event: response.completed
data: {"type":"response.completed","response":{"id":"resp_example","model":"gpt-6-astra","status":"completed","output":[],"usage":{"input_tokens":100,"input_tokens_details":{"cached_tokens":0,"cache_write_tokens":0},"output_tokens":10,"output_tokens_details":{"reasoning_tokens":8},"total_tokens":110}}}
  1. 按事件类型分发,在终态事件停止,并区分成功、不完整输出与失败。
  2. 收集文本增量,或保留 response.output_item.done 中的 output_text;不要依赖可能为空的 response.completed.output。函数调用使用 function_call 项目和 response.function_call_arguments.delta。
  3. 读取 input_tokens、output_tokens、input_tokens_details.cached_tokens、input_tokens_details.cache_write_tokens 和 total_tokens;最终扣费以账户用量日志为准。

常见问题

应使用哪个端点和模型 ID?

使用 POST /v1/responses,model=gpt-6-astra,input 为数组,stream=true,store=false。

支持哪些推理档位?

可选 low、medium、high、xhigh、max,示例与 Playground 选择 medium;直接调用 API 时请显式设置 reasoning.effort,不支持 none。

如何保留对话上下文?

store=false 时,每轮在 input 中重放所需的消息和工具调用项目,不依赖服务端存储的响应串联。

长上下文和缓存如何计费?

用包含缓存的完整输入量选择上下文档位。输入超过 272,000 Token 后,所选档位适用于全部输入、输出和缓存 Token;当前费率请查看模型页。 查看实时价格。

可以使用 OpenAI SDK 吗?

使用支持 Responses 的客户端,配置 HiAPI base URL 和 API Key,然后迭代流式事件。按本页字段发送请求,不要套用 Chat Completions 示例。

下一步