<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: pt-br/text-to-speech-api/index.html -->

# Texto para fala API : vozes, controle e saída de áudio

> Compare TTS modelos por ponto de extremidade, controles de voz, unidade de faturamento, fluxo de trabalho de saída e uma solicitação de fala executável.

- Canonical page: https://chinaapi.ai/pt-br/text-to-speech-api/
- Human-readable page: https://chinaapi.ai/pt-br/text-to-speech-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=pt-br&utm_source=chinaapi&utm_medium=markdown&utm_campaign=text-to-speech-api

Compare TTS modelos por ponto de extremidade, controles de voz, unidade de faturamento, fluxo de trabalho de saída e uma solicitação de fala executável.

[Experimente mimo-v2.5-tts](https://dash.chinaapi.ai/start?task=video-with-audio&model=mimo-v2.5-tts&lang=pt-br&utm_source=chinaapi&utm_medium=capability&utm_campaign=text-to-speech-api)

[Gerar uma solicitação](https://chinaapi.ai/tools/api-request-generator/)

## Entradas, saídas e ciclo de vida.

### Entradas

Texto, além de uma voz integrada ou controles de design/clonagem de voz explicitamente suportados.

### Saídas

Áudio de voz em um formato compatível com o modelo ou um campo de áudio na resposta do chat.

### Ponto final

`POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode`

### Vida útil

Síncrono. Salve a resposta de áudio binária ou decodifique o campo de áudio retornado pelo modo de bate-papo.

## Uma definição por tarefa.

conversão de texto em fala, clonagem de voz, design de voz

**Limite:** Identificações de voz, consentimento para clonagem, cobertura de idiomas, streaming, limites de caracteres e formatos de saída são específicos de cada modelo.

## 8 com metadados explícitos.

Funcionalidades desconhecidas são omitidas, nunca inferidas a partir do nome do modelo. Os exemplos de preços utilizam os dados públicos sincronizados; o Dash Pricing em tempo real continua sendo a fonte oficial.

### [mimo-v2.5-tts](https://chinaapi.ai/pt-br/models/mimo-v2.5-tts/)

Xiaomi MiMo-V2.5-TTS — síntese de fala multilíngue expressiva com vozes integradas, instruções de estilo de linguagem natural, controle de emoção, ritmo, tom, dialeto e caracteres.

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/chat/completions`

**Exemplo de custo:** 1 10k caracteres × $0 = $0 .

### [stepaudio-2.5-tts](https://chinaapi.ai/pt-br/models/stepaudio-2.5-tts/)

StepAudio 2.5 TTS — síntese de fala contextual com direção de linguagem natural embutida, entrega expressiva, vozes integradas e saída de OpenAI-compatible .

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/audio/speech`

**Exemplo de custo:** 1 10.85k caracteres × $0.85 = $0.85 .

### [glm-tts](https://chinaapi.ai/pt-br/models/glm-tts/)

GLM-TTS síntese de fala sensível ao contexto com entrega expressiva, saída em fluxo contínuo, áudio inicial rápido e controles de voz, velocidade e volume.

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/audio/speech`

**Exemplo de custo:** 1 10.307692k caracteres × $0.307692 = $0.307692 .

### [qwen3-tts-flash](https://chinaapi.ai/pt-br/models/qwen3-tts-flash/)

Qwen3-TTS-Flash Síntese de fala multilíngue de baixa latência com entrada em idiomas mistos, vozes integradas, correspondência automática de idiomas e cobrança baseada em caracteres.

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/audio/speech`

**Exemplo de custo:** 1 10.123077k caracteres × $0.123077 = $0.123077 .

### [speech-2.8-hd](https://chinaapi.ai/pt-br/models/speech-2.8-hd/)

MiniMax Speech 2.8 HD — síntese de fala de alta fidelidade com entrega emocional natural, aprimoramento de linguagem, controles de voz e formatos de áudio de produção.

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/audio/speech`

**Exemplo de custo:** 1 10.538462k caracteres × $0.538462 = $0.538462 .

### [speech-2.8-turbo](https://chinaapi.ai/pt-br/models/speech-2.8-turbo/)

MiniMax Fala 2.8 Turbo — síntese de fala focada na velocidade com saída natural, controles de emoção, aprimoramento de linguagem e formatos de áudio de produção comuns.

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/audio/speech`

**Exemplo de custo:** 1 10.307692k caracteres × $0.307692 = $0.307692 .

### [step-tts-2](https://chinaapi.ai/pt-br/models/step-tts-2/)

Etapa TTS 2 — síntese de fala expressiva com vozes oficiais e clonadas, controle de velocidade e volume, mapeamento de pronúncia e múltiplos formatos de saída.

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/audio/speech`

**Exemplo de custo:** 1 10.4k caracteres × $0.4 = $0.4 .

### [step-tts-mini](https://chinaapi.ai/pt-br/models/step-tts-mini/)

Step TTS — síntese de fala expressiva e econômica para chinês, inglês, japonês, cantonês e sichuanês, com vozes oficiais e clonadas.

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/audio/speech`

**Exemplo de custo:** 1 10.15k caracteres × $0.15 = $0.15 .

## Faça um orçamento ou uma estimativa antes de se inscrever.

[Calcular o custo API](https://chinaapi.ai/tools/api-cost-calculator/) · [Gere um script curl, em Python ou JavaScript.](https://chinaapi.ai/tools/api-request-generator/) · [Instale a receita do Agente Seedance 2](https://chinaapi.ai/agent-recipes/seedance-2/)

Fonte e método: [conjunto de dados de precificação de modelos públicos](https://chinaapi.ai/pt-br/data/model-pricing/), atualizado 2026-08-08 . As limitações estão indicadas acima; as reivindicações de terceiros permanecem junto às páginas do modelo que as citam.

---

Markdown twin of https://chinaapi.ai/pt-br/text-to-speech-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
