<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: pt-br/speech-to-text-api/index.html -->

# Conversão de fala em texto e transcrição API

> Compare os modelos de transcrição e ASR por modo de ponto final exato, preço por hora de áudio, entradas, saída de transcrição e limitações.

- Canonical page: https://chinaapi.ai/pt-br/speech-to-text-api/
- Human-readable page: https://chinaapi.ai/pt-br/speech-to-text-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=pt-br&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-to-text-api

Compare os modelos de transcrição e ASR por modo de ponto final exato, preço por hora de áudio, entradas, saída de transcrição e limitações.

[Experimente stepaudio-2-asr-pro](https://dash.chinaapi.ai/start?task=video-with-audio&model=stepaudio-2-asr-pro&lang=pt-br&utm_source=chinaapi&utm_medium=capability&utm_campaign=speech-to-text-api)

[Gerar uma solicitação](https://chinaapi.ai/tools/api-request-generator/)

## Entradas, saídas e ciclo de vida.

### Entradas

Um arquivo de áudio ou base; 64 input_audio carga útil, dependendo do modelo api_mode .

### Saídas

Transcreva o texto ou uma resposta de transcrição estruturada.

### Ponto final

`POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode`

### Vida útil

Síncrono para os modos de endpoint público listados. Persiste a transcrição e lida explicitamente com formatos de arquivo rejeitados.

## Uma definição por tarefa.

transcrição

**Limite:** O tamanho do arquivo, a duração, a diarização, os registros de data e hora, a cobertura de dialetos e os formatos aceitos são desconhecidos, a menos que estejam explicitamente listados para o modelo.

## 6 com metadados explícitos.

Funcionalidades desconhecidas são omitidas, nunca inferidas a partir do nome do modelo. Os exemplos de preços utilizam os dados públicos sincronizados; o Dash Pricing em tempo real continua sendo a fonte oficial.

### [stepaudio-2-asr-pro](https://chinaapi.ai/pt-br/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro — reconhecimento de fala de 32B parâmetros, a opção que prioriza precisão na linha ASR da StepFun, enquanto stepaudio-2.5-asr é a opção de velocidade e custo. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.

**Tarefas:** vídeo com áudio, transcrição

**Ponto final:** `POST /v1/audio/transcriptions`

**Exemplo de custo:** 1 hora de áudio × $0.35 = $0.35 .

### [step-asr](https://chinaapi.ai/pt-br/models/step-asr/)

StepFun step-asr — reconhecimento de fala de uso geral cobrindo chinês, inglês e dialetos chineses, para transcrição, atas de reunião, revisão de qualidade de chamadas e busca por voz. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.

**Tarefas:** vídeo com áudio, transcrição

**Ponto final:** `POST /v1/audio/transcriptions`

**Exemplo de custo:** 1 hora de áudio × $0.15 = $0.15 .

### [step-asr-1.1](https://chinaapi.ai/pt-br/models/step-asr-1.1/)

StepFun step-asr-1.1 — o reconhecedor de uso geral atualizado da linha step-asr, cobrindo chinês, inglês e dialetos chineses. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.

**Tarefas:** vídeo com áudio, transcrição

**Ponto final:** `POST /v1/audio/transcriptions`

**Exemplo de custo:** 1 hora de áudio × $0.35 = $0.35 .

### [mimo-v2.5-asr](https://chinaapi.ai/pt-br/models/mimo-v2.5-asr/)

Xiaomi reconhecimento de fala para chinês, inglês, alternância de códigos, dialetos regionais, gravações ruidosas, áudio MiMo-V2.5-ASR campo distante, múltiplos falantes e letras de músicas.

**Tarefas:** vídeo com áudio, transcrição

**Ponto final:** `POST /v1/chat/completions`

**Exemplo de custo:** 1 hora de áudio × $0.074 = $0.074 .

### [qwen3-asr-flash](https://chinaapi.ai/pt-br/models/qwen3-asr-flash/)

Qwen3-ASR-Flash — transcrição de arquivos multilíngues com dicas de idioma, normalização inversa de texto, reconhecimento de emoções e OpenAI-compatible entrada de áudio.

**Tarefas:** vídeo com áudio, transcrição

**Ponto final:** `POST /v1/audio/transcriptions`

**Exemplo de custo:** 1 hora de áudio × $0.123539 = $0.123539 .

### [stepaudio-2.5-asr](https://chinaapi.ai/pt-br/models/stepaudio-2.5-asr/)

StepAudio 2.5 modelo ASR transcrição de streaming 4B para reconhecimento rápido de chinês-inglês, normalização ITN, legendas, reuniões e agentes de voz.

**Tarefas:** vídeo com áudio, transcrição

**Ponto final:** `POST /v1/audio/transcriptions`

**Exemplo de custo:** 1 hora de áudio × $0.022 = $0.022 .

## Faça um orçamento ou uma estimativa antes de se inscrever.

[Calcular o custo API](https://chinaapi.ai/tools/api-cost-calculator/) · [Gere um script curl, em Python ou JavaScript.](https://chinaapi.ai/tools/api-request-generator/) · [Instale a receita do Agente Seedance 2](https://chinaapi.ai/agent-recipes/seedance-2/)

Fonte e método: [conjunto de dados de precificação de modelos públicos](https://chinaapi.ai/pt-br/data/model-pricing/), atualizado 2026-08-08 . As limitações estão indicadas acima; as reivindicações de terceiros permanecem junto às páginas do modelo que as citam.

---

Markdown twin of https://chinaapi.ai/pt-br/speech-to-text-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
