<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: pt-br/speech-api/index.html -->

# APIs de fala em chinês para ASR e conversão de texto em fala.

> Utilize 14 modelos de API de fala em chinês para reconhecimento automático de fala (ASR) e conversão de texto em fala por meio da ChinaAPI. Compare endpoints exatos, unidades de faturamento, preços em USD, recursos e solicitações de copiar e colar.

- Canonical page: https://chinaapi.ai/pt-br/speech-api/
- Human-readable page: https://chinaapi.ai/pt-br/speech-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=pt-br&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-api

Compare os modelos de reconhecimento e síntese de fala disponíveis com uma única ChinaAPI key. Cada modelo mantém seu caminho de requisição real. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini usam /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr usam /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts usam /v1/chat/completions com payloads de áudio específicos de cada modelo.

[Comece grátis — crédito $2](https://dash.chinaapi.ai/register?lang=pt-br&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

[Veja os preços em tempo real.](https://dash.chinaapi.ai/pricing?lang=pt-br&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

## 14 modelos de fala, gerados a partir de uma única fonte de dados.

Model IDs , modos de endpoint, unidades de faturamento, recursos e preços exibidos vêm de `scripts/models-data.json`, cujos preços de áudio são conciliados com o gateway ChinaAPI . A taxa de mídia exibida pode incluir uma margem de serviço que cobre faturamento de entrada/saída do provedor, processamento de pagamentos, exposição a estornos e operações. Qualquer margem está incluída na taxa exibida e não é adicionada separadamente. Verifique os preços em tempo real antes do lançamento da produção.

### [stepaudio-2-asr-pro](https://chinaapi.ai/pt-br/models/stepaudio-2-asr-pro/)

Reconhecimento de fala (ASR) · StepFun

**Ponto final:** `POSTAGEM /v1/audio/transcriptions`

**Modo de solicitação:** ponto final OpenAI-compatible transcrição

**Cobrança:** $0.35 por hora de áudio

Audio Speech-to-Text

### [step-asr](https://chinaapi.ai/pt-br/models/step-asr/)

Reconhecimento de fala (ASR) · StepFun

**Ponto final:** `POSTAGEM /v1/audio/transcriptions`

**Modo de solicitação:** ponto final OpenAI-compatible transcrição

**Cobrança:** $0.15 por hora de áudio

Audio Speech-to-Text Chinese Dialects

### [step-asr-1.1](https://chinaapi.ai/pt-br/models/step-asr-1.1/)

Reconhecimento de fala (ASR) · StepFun

**Ponto final:** `POSTAGEM /v1/audio/transcriptions`

**Modo de solicitação:** ponto final OpenAI-compatible transcrição

**Cobrança:** $0.35 por hora de áudio

Audio Speech-to-Text Chinese Dialects

### [mimo-v2.5-asr](https://chinaapi.ai/pt-br/models/mimo-v2.5-asr/)

Reconhecimento de fala (ASR) · Xiaomi

**Ponto final:** `POSTAGEM /v1/chat/completions`

**Modo de solicitação:** Conclusões de bate-papo com uma carga útil input_audio

**Cobrança:** $0.074 por hora de áudio

Audio Speech-to-Text Multilingual Chinese Dialects Noise Robustness

### [mimo-v2.5-tts](https://chinaapi.ai/pt-br/models/mimo-v2.5-tts/)

Texto para fala (TTS) · Xiaomi

**Ponto final:** `POSTAGEM /v1/chat/completions`

**Modo de solicitação:** Conclusão de bate-papo com mensagens e configuração de saída de áudio

**Cobrança:** $0 por 10k caracteres

Preços promocionais gratuitos por tempo limitado; verifique os preços em tempo real antes do lançamento em produção.

Audio Text-to-Speech Multilingual Style Control Built-in Voices

### [stepaudio-2.5-tts](https://chinaapi.ai/pt-br/models/stepaudio-2.5-tts/)

Texto para fala (TTS) · StepFun

**Ponto final:** `POSTAGEM /v1/audio/speech`

**Modo de solicitação:** OpenAI-compatible ponto final da fala

**Cobrança:** $0.85 por 10k caracteres

Audio Text-to-Speech Contextual TTS Style Control Built-in Voices

### [glm-tts](https://chinaapi.ai/pt-br/models/glm-tts/)

Texto para fala (TTS) · Zhipu AI

**Ponto final:** `POSTAGEM /v1/audio/speech`

**Modo de solicitação:** OpenAI-compatible ponto final da fala

**Cobrança:** $0.3077 por 10k caracteres

Audio Text-to-Speech Streaming Emotion Voice Control

### [qwen3-asr-flash](https://chinaapi.ai/pt-br/models/qwen3-asr-flash/)

Reconhecimento de fala (ASR) · Alibaba

**Ponto final:** `POSTAGEM /v1/audio/transcriptions`

**Modo de solicitação:** ponto final OpenAI-compatible transcrição

**Cobrança:** $0.1235 por hora de áudio

Audio Speech-to-Text Multilingual Emotion Recognition ITN

### [qwen3-tts-flash](https://chinaapi.ai/pt-br/models/qwen3-tts-flash/)

Texto para fala (TTS) · Alibaba

**Ponto final:** `POSTAGEM /v1/audio/speech`

**Modo de solicitação:** OpenAI-compatible ponto final da fala

**Cobrança:** $0.1231 por 10k caracteres

Audio Text-to-Speech Multilingual Built-in Voices Streaming

### [speech-2.8-hd](https://chinaapi.ai/pt-br/models/speech-2.8-hd/)

Texto para fala (TTS) · MiniMax

**Ponto final:** `POSTAGEM /v1/audio/speech`

**Modo de solicitação:** OpenAI-compatible ponto final da fala

**Cobrança:** $0.5385 por 10k caracteres

Audio Text-to-Speech High Fidelity Emotion Multilingual

### [speech-2.8-turbo](https://chinaapi.ai/pt-br/models/speech-2.8-turbo/)

Texto para fala (TTS) · MiniMax

**Ponto final:** `POSTAGEM /v1/audio/speech`

**Modo de solicitação:** OpenAI-compatible ponto final da fala

**Cobrança:** $0.3077 por 10k caracteres

Audio Text-to-Speech Low Latency Emotion Multilingual

### [step-tts-2](https://chinaapi.ai/pt-br/models/step-tts-2/)

Texto para fala (TTS) · StepFun

**Ponto final:** `POSTAGEM /v1/audio/speech`

**Modo de solicitação:** OpenAI-compatible ponto final da fala

**Cobrança:** $0.4 por 10k caracteres

Audio Text-to-Speech Voice Cloning Emotion Pronunciation Control

### [step-tts-mini](https://chinaapi.ai/pt-br/models/step-tts-mini/)

Texto para fala (TTS) · StepFun

**Ponto final:** `POSTAGEM /v1/audio/speech`

**Modo de solicitação:** OpenAI-compatible ponto final da fala

**Cobrança:** $0.15 por 10k caracteres

Audio Text-to-Speech Multilingual Voice Cloning Style Control

### [stepaudio-2.5-asr](https://chinaapi.ai/pt-br/models/stepaudio-2.5-asr/)

Reconhecimento de fala (ASR) · StepFun

**Ponto final:** `POSTAGEM /v1/audio/transcriptions`

**Modo de solicitação:** ponto final OpenAI-compatible transcrição

**Cobrança:** $0.022 por hora de áudio

Audio Speech-to-Text Streaming Chinese and English ITN

## ASR para compreensão de áudio; TTS para saída de voz.

### Transcrição e compreensão de áudio

[stepaudio-2-asr-pro](https://chinaapi.ai/pt-br/models/stepaudio-2-asr-pro/): StepFun StepAudio 2 ASR Pro — reconhecimento de fala de 32B parâmetros, a opção que prioriza precisão na linha ASR da StepFun, enquanto stepaudio-2.5-asr é a opção de velocidade e custo. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.

### Transcrição e compreensão de áudio

[step-asr](https://chinaapi.ai/pt-br/models/step-asr/): StepFun step-asr — reconhecimento de fala de uso geral cobrindo chinês, inglês e dialetos chineses, para transcrição, atas de reunião, revisão de qualidade de chamadas e busca por voz. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.

### Transcrição e compreensão de áudio

[step-asr-1.1](https://chinaapi.ai/pt-br/models/step-asr-1.1/): StepFun step-asr-1.1 — o reconhecedor de uso geral atualizado da linha step-asr, cobrindo chinês, inglês e dialetos chineses. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.

### Transcrição e compreensão de áudio

[mimo-v2.5-asr](https://chinaapi.ai/pt-br/models/mimo-v2.5-asr/): Xiaomi MiMo-V2.5-ASR — reconhecimento de fala para chinês, inglês, alternância de código, dialetos regionais, gravações ruidosas, áudio de campo distante, múltiplos falantes e letras de músicas.

### Saída de voz controlável

[mimo-v2.5-tts](https://chinaapi.ai/pt-br/models/mimo-v2.5-tts/): Xiaomi MiMo-V2.5-TTS — síntese de fala multilíngue expressiva com vozes integradas, instruções de estilo de linguagem natural, controle de emoção, ritmo, tom, dialeto e caracteres.

### Saída de voz através de uma rota dedicada

[stepaudio-2.5-tts](https://chinaapi.ai/pt-br/models/stepaudio-2.5-tts/): StepAudio 2.5 TTS — síntese de fala contextual com direção de linguagem natural embutida, entrega expressiva, vozes integradas e saída de OpenAI-compatible .

### Saída de voz através de uma rota dedicada

[glm-tts](https://chinaapi.ai/pt-br/models/glm-tts/): GLM-TTS — síntese de fala sensível ao contexto com entrega expressiva, saída em fluxo contínuo, áudio inicial rápido e controles de voz, velocidade e volume.

### Transcrição e compreensão de áudio

[qwen3-asr-flash](https://chinaapi.ai/pt-br/models/qwen3-asr-flash/): Qwen3-ASR-Flash — transcrição de arquivos multilíngues com dicas de idioma, normalização inversa de texto, reconhecimento de emoções e OpenAI-compatible entrada de áudio.

### Saída de voz através de uma rota dedicada

[qwen3-tts-flash](https://chinaapi.ai/pt-br/models/qwen3-tts-flash/): Qwen3-TTS-Flash — síntese de fala multilíngue de baixa latência com entrada em idiomas mistos, vozes integradas, correspondência automática de idiomas e cobrança baseada em caracteres.

### Saída de voz através de uma rota dedicada

[speech-2.8-hd](https://chinaapi.ai/pt-br/models/speech-2.8-hd/): MiniMax Fala 2.8 HD — síntese de fala de alta fidelidade com entrega emocional natural, aprimoramento de linguagem, controles de voz e formatos de áudio de produção.

### Saída de voz através de uma rota dedicada

[speech-2.8-turbo](https://chinaapi.ai/pt-br/models/speech-2.8-turbo/): MiniMax Fala 2.8 Turbo — síntese de fala focada na velocidade com saída natural, controles de emoção, aprimoramento de linguagem e formatos de áudio de produção comuns.

### Saída de voz através de uma rota dedicada

[step-tts-2](https://chinaapi.ai/pt-br/models/step-tts-2/)Etapa TTS 2 — síntese de fala expressiva com vozes oficiais e clonadas, controle de velocidade e volume, mapeamento de pronúncia e múltiplos formatos de saída.

### Saída de voz através de uma rota dedicada

[step-tts-mini](https://chinaapi.ai/pt-br/models/step-tts-mini/)Step TTS — síntese de fala expressiva e econômica para chinês, inglês, japonês, cantonês e sichuanês, com vozes oficiais e clonadas.

### Transcrição e compreensão de áudio

[stepaudio-2.5-asr](https://chinaapi.ai/pt-br/models/stepaudio-2.5-asr/): StepAudio 2.5 ASR — 4B modelo de transcrição de streaming MTP para reconhecimento rápido de chinês-inglês, normalização ITN, legendas, reuniões e agentes de voz.

## OpenAI-compatible não significa uma rota de áudio universal.

Os nomes das rotas e os envelopes de requisição seguem padrões OpenAI-compatible, mas o cliente deve enviar os campos de áudio exigidos por cada modelo. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini usam /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr usam /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts usam /v1/chat/completions com payloads de áudio específicos de cada modelo.

## Copie o pedido referente ao modelo e ao transporte que você precisa.

### stepaudio-2-asr-pro

Reconhecimento de fala ( ASR ) via `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2-asr-pro" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr

Reconhecimento de fala ( ASR ) via `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr-1.1

Reconhecimento de fala ( ASR ) via `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr-1.1" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### mimo-v2.5-asr

Reconhecimento de fala ( ASR ) via `/v1/chat/completions`

```
AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-asr",
    "messages": [{
      "role": "user",
      "content": [{
        "type": "input_audio",
        "input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
      }]
    }]
  }'
```

### mimo-v2.5-tts

Texto para fala ( TTS ) via `/v1/chat/completions`

```
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "messages": [
      {"role": "user", "content": "Natural, clear, and friendly delivery"},
      {"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
    ],
    "audio": {"format": "wav", "voice": "冰糖"}
  }' > response.json
```

### stepaudio-2.5-tts

Texto para fala ( TTS ) via `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-2.5-tts",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### glm-tts

Texto para fala ( TTS ) via `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "voice": "tongtong",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### qwen3-asr-flash

Reconhecimento de fala ( ASR ) via `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### qwen3-tts-flash

Texto para fala ( TTS ) via `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "voice": "Cherry",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-hd

Texto para fala ( TTS ) via `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-turbo

Texto para fala ( TTS ) via `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-2

Texto para fala ( TTS ) via `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-mini

Texto para fala ( TTS ) via `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-mini",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### stepaudio-2.5-asr

Reconhecimento de fala ( ASR ) via `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2.5-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

## Todos os modelos de fala da ChinaAPI usam o mesmo endpoint de áudio?

No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini usam /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr usam /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts usam /v1/chat/completions com payloads de áudio específicos de cada modelo.

## Como são cobrados os modelos de fala?

stepaudio-2-asr-pro: $0.35 por hora de áudio; step-asr: $0.15 por hora de áudio; step-asr-1.1: $0.35 por hora de áudio; mimo-v2.5-asr: $0.074 por hora de áudio; mimo-v2.5-tts: $0 por 10k caracteres; stepaudio-2.5-tts: $0.85 por 10k caracteres; glm-tts: $0.3077 por 10k caracteres; qwen3-asr-flash: $0.1235 por hora de áudio; qwen3-tts-flash: $0.1231 por 10k caracteres; speech-2.8-hd: $0.5385 por 10k caracteres; speech-2.8-turbo: $0.3077 por 10k caracteres; step-tts-2: $0.4 por 10k caracteres; step-tts-mini: $0.15 por 10k caracteres; stepaudio-2.5-asr: $0.022 por hora de áudio. A tarifa de mídia exibida pode incluir uma margem de serviço que cobre a cobrança de entrada/saída do provedor, o processamento de pagamentos, o risco de chargeback e as operações. Qualquer margem já está incluída na tarifa exibida e não é adicionada à parte. Esses valores são renderizados do catálogo de modelos, não copiados para esta página.

## Posso usar esses modelos sem uma conta da China continental?

Sim. A ChinaAPI fornece acesso sem uma conta ou número de telefone da China continental. Cadastre-se para obter uma chave e, em seguida, use a rota e o payload exatos mostrados para o modelo escolhido.

---

Markdown twin of https://chinaapi.ai/pt-br/speech-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
