跳转到内容
中文

Qwen-Audio 3.0 TTS Flash API

POST /v1/tasks

所有模型都通过 统一异步接口 POST /v1/tasks 调用,区别只在 input 字段(见下方 input 参数)。

模型概览

状态 已上线
HiAPI 模型 ID qwen-audio-3.0-tts-flash
Qwen 官方模型 ID qwen-audio-3.0-tts-flash
首发售价 $0.030 / 1,000 characters
类型 音频生成(文生语音)

Qwen-Audio 3.0 TTS Flash 面向低延迟语音工作流,适合 AI 助手、语音智能体和快速交互。HiAPI 支持完整的语音控制参数,并按有效字符数计费。

生产建议

公开参数说明
  • 本页公开合同已通过 HiAPI 生产环境真实任务验证。
  • 公开 input 支持 text、voice、format、sample_rate、volume、rate、pitch、seed、bit_rate、language_hints 和 instruction。
  • format 支持 pcm、wav、mp3、opus,默认 mp3;sample_rate 默认 22050 Hz;bit_rate 仅用于 Opus。
  • Flash 官方系统音色:longanhuan_v3.6、longjielidou_v3.6、loongeva_v3.6、loongjohn。
  • 售价为 $0.030 / 1,000 characters;阿里计费规则为中日韩表意文字每个计 2 个字符,其他字符每个计 1 个。
服务验收结果
  • Plus 与 Flash 均已完成生产环境全参数与最小参数任务验证。
  • MP3 与 Opus 产物均可正常下载,展示样本已转存为长期可访问素材。
  • 本次真实任务的有效字符扣费均与公开价格一致。
接口边界
  • 不向用户暴露供应商凭证、内部请求参数、请求 ID 或时间戳。
  • 服务端固定处理必要的内部元数据;不公开 SSML、克隆音色或实时流式输入。
  • hiAPI 当前统一限制为单次 20,000 个 Unicode 码点,不再为 PCM/WAV 设置缺乏官方依据的 600 字符限制。

适用场景

AI 助手播报

适合快速生成语音回复、状态反馈和提示信息。

textvoicerate
语音智能体

适合以异步任务方式生成短语音片段。

textvoicelanguage_hints
批量通知

适合把通知、提醒和客服文本批量转换为音频。

textformat

请求参数

model string 必填

固定填 qwen-audio-3.0-tts-flash。

示例 qwen-audio-3.0-tts-flash
input object 必填

Qwen-Audio 3.0 TTS Flash 的语音合成参数。

text string 必填

待合成文本,不能为空;hiAPI 单次最多 20,000 个 Unicode 码点,所有输出格式一致。售价为 $0.030 / 1,000 characters。

voice enum 必填

Flash 版本支持的官方系统音色 ID。 查看可用音色

默认 longanhuan_v3.6 可选值: longanhuan_v3.6longjielidou_v3.6loongeva_v3.6loongjohn
format enum 可选

输出格式:PCM、WAV、MP3 或 Opus。

默认 mp3 可选值: pcmwavmp3opus
sample_rate enum 可选

输出采样率,单位 Hz。

默认 22050 可选值: 80001600022050240004410048000
volume integer 可选

音量,范围 0-100。

默认 50
rate number 可选

语速倍率,范围 0.5-2.0。

默认 1
pitch number 可选

音高倍率,范围 0.5-2.0。

默认 1
seed integer 可选

合成随机种子,范围 0-65,535。

默认 0
bit_rate integer 可选

Opus 码率,范围 6-510 kbps,仅在 format=opus 时生效。

默认 32
language_hints string[] 可选

可选语言提示,仅可传一个官方语言码;Qwen 只处理数组第一项。

可选值: zhenfrdejakoruptthid +6
instruction string 可选

可选,用于控制方言、情绪或角色风格。

callback object 可选

可选回调配置;任务进入终态时 HiAPI 可主动通知你的服务。

url string 必填

传入 callback 时必填的 HTTPS 地址。

示例 https://your-domain.com/hiapi/callback
when enum 可选

回调触发时机,固定为 final。

默认 final 可选值: final

Flash 可用音色

下表列出该档官方系统音色。

voice ID状态
longanhuan_v3.6已上线
longjielidou_v3.6已上线
loongeva_v3.6已上线
loongjohn已上线

用例示例

MP3 语音请求

使用默认 MP3 和 22.05 kHz 采样率。

请求体
{
  "model": "qwen-audio-3.0-tts-flash",
  "input": {
    "text": "欢迎来到 HiAPI 音频模型实验室。我们正在比较两种语音合成模型在中文表达、英文切换和数字读法上的表现。Today, we test clarity, rhythm, and natural pauses. 版本三点零,样本编号二零二六。",
    "voice": "longanhuan_v3.6",
    "format": "mp3",
    "sample_rate": 24000,
    "volume": 50,
    "rate": 1,
    "pitch": 1,
    "seed": 2026,
    "language_hints": [
      "zh"
    ],
    "instruction": "请用沉稳、清晰、有亲和力的产品解说语气朗读。中文表达自然,英文发音准确,在句号处稍作停顿。"
  }
}
带语音控制的 PCM 请求

显式设置语速、音高和音量。

请求体
{
  "model": "qwen-audio-3.0-tts-flash",
  "input": {
    "text": "这是一段语音参数测试。",
    "voice": "longanhuan_v3.6",
    "format": "pcm",
    "sample_rate": 24000,
    "volume": 50,
    "rate": 1.1,
    "pitch": 1,
    "seed": 0
  }
}

获取结果

  1. 提交成功会立即返回 taskId,不等待音频生成完成。
  2. 生产环境优先等待 callback.url 终态通知;本地调试可轮询 GET /v1/tasks/:id。
  3. status=success 后从 output[].url 下载音频,并按业务需要转存。

常见问题

如何调用这个模型?

先在控制台创建 API 密钥,再向 POST /v1/tasks 传入模型 ID 和 input。提交后使用 taskId 查询任务状态,或配置 callback 接收终态通知。

正式价格是多少?

Flash 的售价是 $0.030 / 1,000 characters,按有效字符数计费。

字符如何计算?

中文汉字、繁体字、日文汉字和韩文汉字每个计 2 个字符;字母、数字、标点、空格、假名等每个计 1 个。

支持哪些音色?

Flash 官方系统音色为 longanhuan_v3.6、longjielidou_v3.6、loongeva_v3.6、loongjohn。 查看可用音色

单次最多支持多少文本?

hiAPI 单次最多 20,000 个 Unicode 码点,PCM、WAV、MP3 和 Opus 使用同一限制。

支持实时流式或 SSML 吗?

不在公开首发合同内。HiAPI 只提供统一异步任务接口。

任务失败会扣费吗?

进入失败终态的任务不计费;如果提交时已预扣积分,系统会在任务失败后自动退回。

下一步