<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: pt-br/audio-api/index.html -->

# API : compreensão e elementos básicos da comunicação entre fala

> Use os modos de ponto final de compreensão de áudio verificada, ASR e TTS sem tratar todos os modelos de fala como intercambiáveis.

- Canonical page: https://chinaapi.ai/pt-br/audio-api/
- Human-readable page: https://chinaapi.ai/pt-br/audio-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=pt-br&utm_source=chinaapi&utm_medium=markdown&utm_campaign=audio-api

Use os modos de ponto final de compreensão de áudio verificada, ASR e TTS sem tratar todos os modelos de fala como intercambiáveis.

[Experimente stepaudio-2-asr-pro](https://dash.chinaapi.ai/start?task=video-with-audio&model=stepaudio-2-asr-pro&lang=pt-br&utm_source=chinaapi&utm_medium=capability&utm_campaign=audio-api)

[Gerar uma solicitação](https://chinaapi.ai/tools/api-request-generator/)

## Entradas, saídas e ciclo de vida.

### Entradas

Áudio para compreensão/transcrição ou texto para síntese, usando o modelo exato selecionado api_mode .

### Saídas

Análise/transcrição de texto ou áudio gerado; um resultado direto de transcrição de fala não está implícito, a menos que os metadados do catálogo indiquem o contrário.

### Ponto final

`Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech`

### Vida útil

Os endpoints de áudio listados são síncronos; um fluxo de trabalho de fala para fala encadeia a transcrição ou a compreensão de áudio a uma solicitação TTS .

## Uma definição por tarefa.

compreensão auditiva

**Limite:** Um rótulo TTS ou ASR não comprova compreensão direta de áudio, clonagem de voz, diarização ou suporte de fala para fala.

## 14 com metadados explícitos.

Funcionalidades desconhecidas são omitidas, nunca inferidas a partir do nome do modelo. Os exemplos de preços utilizam os dados públicos sincronizados; o Dash Pricing em tempo real continua sendo a fonte oficial.

### [stepaudio-2-asr-pro](https://chinaapi.ai/pt-br/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro — reconhecimento de fala de 32B parâmetros, a opção que prioriza precisão na linha ASR da StepFun, enquanto stepaudio-2.5-asr é a opção de velocidade e custo. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.

**Tarefas:** vídeo com áudio, transcrição

**Ponto final:** `POST /v1/audio/transcriptions`

**Exemplo de custo:** 1 hora de áudio × $0.35 = $0.35 .

### [step-asr](https://chinaapi.ai/pt-br/models/step-asr/)

StepFun step-asr — reconhecimento de fala de uso geral cobrindo chinês, inglês e dialetos chineses, para transcrição, atas de reunião, revisão de qualidade de chamadas e busca por voz. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.

**Tarefas:** vídeo com áudio, transcrição

**Ponto final:** `POST /v1/audio/transcriptions`

**Exemplo de custo:** 1 hora de áudio × $0.15 = $0.15 .

### [step-asr-1.1](https://chinaapi.ai/pt-br/models/step-asr-1.1/)

StepFun step-asr-1.1 — o reconhecedor de uso geral atualizado da linha step-asr, cobrindo chinês, inglês e dialetos chineses. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.

**Tarefas:** vídeo com áudio, transcrição

**Ponto final:** `POST /v1/audio/transcriptions`

**Exemplo de custo:** 1 hora de áudio × $0.35 = $0.35 .

### [mimo-v2.5-asr](https://chinaapi.ai/pt-br/models/mimo-v2.5-asr/)

Xiaomi reconhecimento de fala para chinês, inglês, alternância de códigos, dialetos regionais, gravações ruidosas, áudio MiMo-V2.5-ASR campo distante, múltiplos falantes e letras de músicas.

**Tarefas:** vídeo com áudio, transcrição

**Ponto final:** `POST /v1/chat/completions`

**Exemplo de custo:** 1 hora de áudio × $0.074 = $0.074 .

### [mimo-v2.5-tts](https://chinaapi.ai/pt-br/models/mimo-v2.5-tts/)

Xiaomi MiMo-V2.5-TTS — síntese de fala multilíngue expressiva com vozes integradas, instruções de estilo de linguagem natural, controle de emoção, ritmo, tom, dialeto e caracteres.

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/chat/completions`

**Exemplo de custo:** 1 10k caracteres × $0 = $0 .

### [stepaudio-2.5-tts](https://chinaapi.ai/pt-br/models/stepaudio-2.5-tts/)

StepAudio 2.5 TTS — síntese de fala contextual com direção de linguagem natural embutida, entrega expressiva, vozes integradas e saída de OpenAI-compatible .

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/audio/speech`

**Exemplo de custo:** 1 10.85k caracteres × $0.85 = $0.85 .

### [glm-tts](https://chinaapi.ai/pt-br/models/glm-tts/)

GLM-TTS síntese de fala sensível ao contexto com entrega expressiva, saída em fluxo contínuo, áudio inicial rápido e controles de voz, velocidade e volume.

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/audio/speech`

**Exemplo de custo:** 1 10.307692k caracteres × $0.307692 = $0.307692 .

### [qwen3-asr-flash](https://chinaapi.ai/pt-br/models/qwen3-asr-flash/)

Qwen3-ASR-Flash — transcrição de arquivos multilíngues com dicas de idioma, normalização inversa de texto, reconhecimento de emoções e OpenAI-compatible entrada de áudio.

**Tarefas:** vídeo com áudio, transcrição

**Ponto final:** `POST /v1/audio/transcriptions`

**Exemplo de custo:** 1 hora de áudio × $0.123539 = $0.123539 .

### [qwen3-tts-flash](https://chinaapi.ai/pt-br/models/qwen3-tts-flash/)

Qwen3-TTS-Flash Síntese de fala multilíngue de baixa latência com entrada em idiomas mistos, vozes integradas, correspondência automática de idiomas e cobrança baseada em caracteres.

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/audio/speech`

**Exemplo de custo:** 1 10.123077k caracteres × $0.123077 = $0.123077 .

### [speech-2.8-hd](https://chinaapi.ai/pt-br/models/speech-2.8-hd/)

MiniMax Speech 2.8 HD — síntese de fala de alta fidelidade com entrega emocional natural, aprimoramento de linguagem, controles de voz e formatos de áudio de produção.

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/audio/speech`

**Exemplo de custo:** 1 10.538462k caracteres × $0.538462 = $0.538462 .

### [speech-2.8-turbo](https://chinaapi.ai/pt-br/models/speech-2.8-turbo/)

MiniMax Fala 2.8 Turbo — síntese de fala focada na velocidade com saída natural, controles de emoção, aprimoramento de linguagem e formatos de áudio de produção comuns.

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/audio/speech`

**Exemplo de custo:** 1 10.307692k caracteres × $0.307692 = $0.307692 .

### [step-tts-2](https://chinaapi.ai/pt-br/models/step-tts-2/)

Etapa TTS 2 — síntese de fala expressiva com vozes oficiais e clonadas, controle de velocidade e volume, mapeamento de pronúncia e múltiplos formatos de saída.

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/audio/speech`

**Exemplo de custo:** 1 10.4k caracteres × $0.4 = $0.4 .

### [step-tts-mini](https://chinaapi.ai/pt-br/models/step-tts-mini/)

Step TTS — síntese de fala expressiva e econômica para chinês, inglês, japonês, cantonês e sichuanês, com vozes oficiais e clonadas.

**Tarefas:** vídeo com áudio, texto para fala

**Ponto final:** `POST /v1/audio/speech`

**Exemplo de custo:** 1 10.15k caracteres × $0.15 = $0.15 .

### [stepaudio-2.5-asr](https://chinaapi.ai/pt-br/models/stepaudio-2.5-asr/)

StepAudio 2.5 modelo ASR transcrição de streaming 4B para reconhecimento rápido de chinês-inglês, normalização ITN, legendas, reuniões e agentes de voz.

**Tarefas:** vídeo com áudio, transcrição

**Ponto final:** `POST /v1/audio/transcriptions`

**Exemplo de custo:** 1 hora de áudio × $0.022 = $0.022 .

## Faça um orçamento ou uma estimativa antes de se inscrever.

[Calcular o custo API](https://chinaapi.ai/tools/api-cost-calculator/) · [Gere um script curl, em Python ou JavaScript.](https://chinaapi.ai/tools/api-request-generator/) · [Instale a receita do Agente Seedance 2](https://chinaapi.ai/agent-recipes/seedance-2/)

Fonte e método: [conjunto de dados de precificação de modelos públicos](https://chinaapi.ai/pt-br/data/model-pricing/), atualizado 2026-08-08 . As limitações estão indicadas acima; as reivindicações de terceiros permanecem junto às páginas do modelo que as citam.

---

Markdown twin of https://chinaapi.ai/pt-br/audio-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
