音频与语音能力中心

语音合成 API:音色、控制与音频输出

从端点、音色控制、计费单位、输出流程以及一个可执行的语音请求等方面,对比 TTS 模型。

契约

输入、输出与生命周期

输入

文本,外加一个内置音色,或模型明确支持的声音设计/克隆控制。

输出

模型支持格式的语音音频,或 chat 响应中的音频字段。

端点

POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode

生命周期

同步调用。保存二进制音频响应,或解码 chat 模式返回的音频字段。

支持的任务

每项任务一个定义

语音合成、声音克隆

限制: 音色 ID、克隆授权、语种覆盖、流式输出、字符数限制和输出格式均因模型而异。

匹配的模型目录

7 个模型带有明确的元数据

未知能力一律省略,绝不根据模型名称猜测。价格示例使用已同步的公开数据;价格仍以控制台的实时价格页为准。

mimo-v2.5-tts

Xiaomi MiMo-V2.5-TTS——富有表现力的多语言语音合成,提供内置音色和自然语言风格指令,可控制情感、语速、语气、方言和角色。

任务: 语音合成

端点: POST /v1/chat/completions

费用示例: 1 个 10k 字符单位 × $0 = $0。

stepaudio-2.5-tts

StepAudio 2.5 TTS——结合上下文的语音合成,支持在文本中内嵌自然语言指令,演绎富有表现力,提供内置音色和 OpenAI-compatible 音频输出。

任务: 语音合成、声音克隆

端点: POST /v1/audio/speech

费用示例: 1 个 10k 字符单位 × $0.85 = $0.85。

glm-tts

GLM-TTS——上下文感知的语音合成,演绎富有表现力,支持流式输出、首段音频快速返回,并可控制音色、语速和音量。

任务: 语音合成

端点: POST /v1/audio/speech

费用示例: 1 个 10k 字符单位 × $0.35 = $0.35。

qwen3-tts-flash

Qwen3-TTS-Flash——低延迟的多语言语音合成,支持混合语言输入、内置音色和自动语言匹配,按字符计费。

任务: 语音合成

端点: POST /v1/audio/speech

费用示例: 1 个 10k 字符单位 × $0.11 = $0.11。

speech-2.8-hd

MiniMax Speech 2.8 HD——高保真语音合成,情感演绎自然,支持语言增强、音色控制和生产级音频格式。

任务: 语音合成

端点: POST /v1/audio/speech

费用示例: 1 个 10k 字符单位 × $1 = $1。

speech-2.8-turbo

MiniMax Speech 2.8 Turbo——侧重速度的语音合成,输出自然,支持情感控制、语言增强和常用的生产级音频格式。

任务: 语音合成

端点: POST /v1/audio/speech

费用示例: 1 个 10k 字符单位 × $0.6 = $0.6。

step-tts-2

Step TTS 2——富有表现力的语音合成,支持官方音色与克隆音色、语速和音量控制、发音映射以及多种输出格式。

任务: 语音合成、声音克隆

端点: POST /v1/audio/speech

费用示例: 1 个 10k 字符单位 × $0.414815 = $0.414815。

注册前先试跑或估算

计算 API 费用 · 生成 curl、Python 或 JavaScript 代码

来源与方法: 公开模型价格数据集,更新于 2026-09-28。局限已在上文说明;第三方说法仍附在引用它们的模型页面上。