跳转到内容
中文

音频模型

音频模型与图像、视频模型共用统一的 POST /v1/tasks 端点和 API Key。

模型适用场景说明
ElevenLabs Text to Dialogue v3多说话人对话:有声剧、播客、游戏 NPC67 个预置音色、70+ 语言、逐句指定音色;按字符计费
Qwen-Audio 3.0 TTS Plus高质量配音、视频旁白和有声内容2 个系统音色、PCM/WAV/MP3/Opus、完整语音控制与按有效字符计费
Qwen-Audio 3.0 TTS FlashAI 助手、语音智能体、通知播报和快速语音工作流4 个系统音色、PCM/WAV/MP3/Opus、完整语音控制与按有效字符计费

以下页面是上线前契约。dev 环境验收已通过;生产环境仍保持关闭,待发布门禁解除后开放。

模型计划定位准备状态
Qwen-Audio 3.0 TTS Plus高质量配音、视频旁白和有声内容2 个系统音色、PCM/WAV/MP3/Opus 和完整语音控制;dev 验收已通过
Qwen-Audio 3.0 TTS FlashAI 助手、语音智能体、通知播报和快速语音工作流4 个系统音色、PCM/WAV/MP3/Opus 和完整语音控制;dev 验收已通过

更多音频模型(音乐生成、音效)陆续上线,实时模型列表见价格页