<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: zh-cn/text-to-speech-api/index.html -->

# 语音合成 API：音色、控制与音频输出

> 从端点、音色控制、计费单位、输出流程以及一个可执行的语音请求等方面，对比 TTS 模型。

- Canonical page: https://chinaapi.ai/zh-cn/text-to-speech-api/
- Human-readable page: https://chinaapi.ai/zh-cn/text-to-speech-api/
- Live pricing: https://dash.chinaapi.ai/models?lang=zh-cn&utm_source=chinaapi&utm_medium=markdown&utm_campaign=text-to-speech-api

从端点、音色控制、计费单位、输出流程以及一个可执行的语音请求等方面，对比 TTS 模型。

[试用 mimo-v2.5-tts](https://dash.chinaapi.ai/start?intent=playground&destination=%2Fconsole%2Fplayground&task=text-to-speech&model=mimo-v2.5-tts&lang=zh-cn&utm_source=chinaapi&utm_medium=capability&utm_campaign=text-to-speech-api)

[生成请求](https://chinaapi.ai/tools/api-request-generator/)

## 输入、输出与生命周期

### 输入

文本，外加一个内置音色，或模型明确支持的声音设计/克隆控制。

### 输出

模型支持格式的语音音频，或 chat 响应中的音频字段。

### 端点

`POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode`

### 生命周期

同步调用。保存二进制音频响应，或解码 chat 模式返回的音频字段。

## 每项任务一个定义

语音合成、声音克隆

**限制：** 音色 ID、克隆授权、语种覆盖、流式输出、字符数限制和输出格式均因模型而异。

## 7 个模型带有明确的元数据

未知能力一律省略，绝不根据模型名称猜测。价格示例使用已同步的公开数据；价格仍以控制台的实时价格页为准。

### [mimo-v2.5-tts](https://chinaapi.ai/zh-cn/models/mimo-v2.5-tts/)

Xiaomi MiMo-V2.5-TTS——富有表现力的多语言语音合成，提供内置音色和自然语言风格指令，可控制情感、语速、语气、方言和角色。

**任务：** 语音合成

**端点：** `POST /v1/chat/completions`

**费用示例：** 1 个 10k 字符单位 × $0 = $0。

### [stepaudio-2.5-tts](https://chinaapi.ai/zh-cn/models/stepaudio-2.5-tts/)

StepAudio 2.5 TTS——结合上下文的语音合成，支持在文本中内嵌自然语言指令，演绎富有表现力，提供内置音色和 OpenAI-compatible 音频输出。

**任务：** 语音合成、声音克隆

**端点：** `POST /v1/audio/speech`

**费用示例：** 1 个 10k 字符单位 × $0.85 = $0.85。

### [glm-tts](https://chinaapi.ai/zh-cn/models/glm-tts/)

GLM-TTS——上下文感知的语音合成，演绎富有表现力，支持流式输出、首段音频快速返回，并可控制音色、语速和音量。

**任务：** 语音合成

**端点：** `POST /v1/audio/speech`

**费用示例：** 1 个 10k 字符单位 × $0.35 = $0.35。

### [qwen3-tts-flash](https://chinaapi.ai/zh-cn/models/qwen3-tts-flash/)

Qwen3-TTS-Flash——低延迟的多语言语音合成，支持混合语言输入、内置音色和自动语言匹配，按字符计费。

**任务：** 语音合成

**端点：** `POST /v1/audio/speech`

**费用示例：** 1 个 10k 字符单位 × $0.11 = $0.11。

### [speech-2.8-hd](https://chinaapi.ai/zh-cn/models/speech-2.8-hd/)

MiniMax Speech 2.8 HD——高保真语音合成，情感演绎自然，支持语言增强、音色控制和生产级音频格式。

**任务：** 语音合成

**端点：** `POST /v1/audio/speech`

**费用示例：** 1 个 10k 字符单位 × $1 = $1。

### [speech-2.8-turbo](https://chinaapi.ai/zh-cn/models/speech-2.8-turbo/)

MiniMax Speech 2.8 Turbo——侧重速度的语音合成，输出自然，支持情感控制、语言增强和常用的生产级音频格式。

**任务：** 语音合成

**端点：** `POST /v1/audio/speech`

**费用示例：** 1 个 10k 字符单位 × $0.6 = $0.6。

### [step-tts-2](https://chinaapi.ai/zh-cn/models/step-tts-2/)

Step TTS 2——富有表现力的语音合成，支持官方音色与克隆音色、语速和音量控制、发音映射以及多种输出格式。

**任务：** 语音合成、声音克隆

**端点：** `POST /v1/audio/speech`

**费用示例：** 1 个 10k 字符单位 × $0.414815 = $0.414815。

## 注册前先试跑或估算

[计算 API 费用](https://chinaapi.ai/tools/api-cost-calculator/) · [生成 curl、Python 或 JavaScript 代码](https://chinaapi.ai/tools/api-request-generator/)

来源与方法： [公开模型价格数据集](https://chinaapi.ai/zh-cn/data/model-pricing/)，更新于 2026-09-28。局限已在上文说明；第三方说法仍附在引用它们的模型页面上。

---

Markdown twin of https://chinaapi.ai/zh-cn/text-to-speech-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
