# Text-to-Speech API: voices, control, and audio output

> Compare TTS models by endpoint, voice controls, billing unit, output workflow, and an executable speech request.

- Canonical: https://chinaapi.ai/text-to-speech-api/
- Updated: 2026-08-08
- Tasks: text-to-speech, voice-cloning, voice-design
- Endpoint: `POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode`
- Inputs: Text, plus a built-in voice or explicitly supported voice design/clone controls.
- Outputs: Speech audio in a model-supported format, or an audio field in the chat response.
- Lifecycle: Synchronous. Save the binary audio response or decode the audio field returned by chat mode.
- Limits: Voice IDs, cloning consent, language coverage, streaming, character limits, and output formats are model-specific.

## Models with matching catalog metadata

### [mimo-v2.5-tts](https://chinaapi.ai/models/mimo-v2.5-tts/)

- Tasks: video-with-audio, text-to-speech
- Endpoint: `POST https://api.chinaapi.ai/v1/chat/completions`
- Cost example: 1 10k characters × $0 = $0.

### [stepaudio-2.5-tts](https://chinaapi.ai/models/stepaudio-2.5-tts/)

- Tasks: video-with-audio, text-to-speech
- Endpoint: `POST https://api.chinaapi.ai/v1/audio/speech`
- Cost example: 1 10k characters × $0.85 = $0.85.

### [glm-tts](https://chinaapi.ai/models/glm-tts/)

- Tasks: video-with-audio, text-to-speech
- Endpoint: `POST https://api.chinaapi.ai/v1/audio/speech`
- Cost example: 1 10k characters × $0.307692 = $0.307692.

### [qwen3-tts-flash](https://chinaapi.ai/models/qwen3-tts-flash/)

- Tasks: video-with-audio, text-to-speech
- Endpoint: `POST https://api.chinaapi.ai/v1/audio/speech`
- Cost example: 1 10k characters × $0.123077 = $0.123077.

### [speech-2.8-hd](https://chinaapi.ai/models/speech-2.8-hd/)

- Tasks: video-with-audio, text-to-speech
- Endpoint: `POST https://api.chinaapi.ai/v1/audio/speech`
- Cost example: 1 10k characters × $0.538462 = $0.538462.

### [speech-2.8-turbo](https://chinaapi.ai/models/speech-2.8-turbo/)

- Tasks: video-with-audio, text-to-speech
- Endpoint: `POST https://api.chinaapi.ai/v1/audio/speech`
- Cost example: 1 10k characters × $0.307692 = $0.307692.

### [step-tts-2](https://chinaapi.ai/models/step-tts-2/)

- Tasks: video-with-audio, text-to-speech
- Endpoint: `POST https://api.chinaapi.ai/v1/audio/speech`
- Cost example: 1 10k characters × $0.4 = $0.4.

### [step-tts-mini](https://chinaapi.ai/models/step-tts-mini/)

- Tasks: video-with-audio, text-to-speech
- Endpoint: `POST https://api.chinaapi.ai/v1/audio/speech`
- Cost example: 1 10k characters × $0.15 = $0.15.

Displayed prices are generated from `scripts/models-data.json`, synchronized against the ChinaAPI gateway. Media service margin, if any, is included in the displayed USD rate and is not added separately.

Source: https://chinaapi.ai/data/model-pricing/ · updated 2026-08-08.
