centro de capacidade de áudio e fala

API : compreensão e elementos básicos da comunicação entre fala

Use os modos de ponto final de compreensão de áudio verificada, ASR e TTS sem tratar todos os modelos de fala como intercambiáveis.

Contrato

Entradas, saídas e ciclo de vida.

Entradas

Áudio para compreensão/transcrição ou texto para síntese, usando o modelo exato selecionado api_mode .

Saídas

Análise/transcrição de texto ou áudio gerado; um resultado direto de transcrição de fala não está implícito, a menos que os metadados do catálogo indiquem o contrário.

Ponto final

Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech

Vida útil

Os endpoints de áudio listados são síncronos; um fluxo de trabalho de fala para fala encadeia a transcrição ou a compreensão de áudio a uma solicitação TTS .

Tarefas suportadas

Uma definição por tarefa.

compreensão auditiva

Limite: Um rótulo TTS ou ASR não comprova compreensão direta de áudio, clonagem de voz, diarização ou suporte de fala para fala.

Catálogo correspondente

14 com metadados explícitos.

Funcionalidades desconhecidas são omitidas, nunca inferidas a partir do nome do modelo. Os exemplos de preços utilizam os dados públicos sincronizados; o Dash Pricing em tempo real continua sendo a fonte oficial.

stepaudio-2-asr-pro

StepFun StepAudio 2 ASR Pro — reconhecimento de fala de 32B parâmetros, a opção que prioriza precisão na linha ASR da StepFun, enquanto stepaudio-2.5-asr é a opção de velocidade e custo. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.

Tarefas: vídeo com áudio, transcrição

Ponto final: POST /v1/audio/transcriptions

Exemplo de custo: 1 hora de áudio × $0.35 = $0.35 .

step-asr

StepFun step-asr — reconhecimento de fala de uso geral cobrindo chinês, inglês e dialetos chineses, para transcrição, atas de reunião, revisão de qualidade de chamadas e busca por voz. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.

Tarefas: vídeo com áudio, transcrição

Ponto final: POST /v1/audio/transcriptions

Exemplo de custo: 1 hora de áudio × $0.15 = $0.15 .

step-asr-1.1

StepFun step-asr-1.1 — o reconhecedor de uso geral atualizado da linha step-asr, cobrindo chinês, inglês e dialetos chineses. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.

Tarefas: vídeo com áudio, transcrição

Ponto final: POST /v1/audio/transcriptions

Exemplo de custo: 1 hora de áudio × $0.35 = $0.35 .

mimo-v2.5-asr

Xiaomi reconhecimento de fala para chinês, inglês, alternância de códigos, dialetos regionais, gravações ruidosas, áudio MiMo-V2.5-ASR campo distante, múltiplos falantes e letras de músicas.

Tarefas: vídeo com áudio, transcrição

Ponto final: POST /v1/chat/completions

Exemplo de custo: 1 hora de áudio × $0.074 = $0.074 .

mimo-v2.5-tts

Xiaomi MiMo-V2.5-TTS — síntese de fala multilíngue expressiva com vozes integradas, instruções de estilo de linguagem natural, controle de emoção, ritmo, tom, dialeto e caracteres.

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/chat/completions

Exemplo de custo: 1 10k caracteres × $0 = $0 .

stepaudio-2.5-tts

StepAudio 2.5 TTS — síntese de fala contextual com direção de linguagem natural embutida, entrega expressiva, vozes integradas e saída de OpenAI-compatible .

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/audio/speech

Exemplo de custo: 1 10.85k caracteres × $0.85 = $0.85 .

glm-tts

GLM-TTS síntese de fala sensível ao contexto com entrega expressiva, saída em fluxo contínuo, áudio inicial rápido e controles de voz, velocidade e volume.

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/audio/speech

Exemplo de custo: 1 10.307692k caracteres × $0.307692 = $0.307692 .

qwen3-asr-flash

Qwen3-ASR-Flash — transcrição de arquivos multilíngues com dicas de idioma, normalização inversa de texto, reconhecimento de emoções e OpenAI-compatible entrada de áudio.

Tarefas: vídeo com áudio, transcrição

Ponto final: POST /v1/audio/transcriptions

Exemplo de custo: 1 hora de áudio × $0.123539 = $0.123539 .

qwen3-tts-flash

Qwen3-TTS-Flash Síntese de fala multilíngue de baixa latência com entrada em idiomas mistos, vozes integradas, correspondência automática de idiomas e cobrança baseada em caracteres.

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/audio/speech

Exemplo de custo: 1 10.123077k caracteres × $0.123077 = $0.123077 .

speech-2.8-hd

MiniMax Speech 2.8 HD — síntese de fala de alta fidelidade com entrega emocional natural, aprimoramento de linguagem, controles de voz e formatos de áudio de produção.

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/audio/speech

Exemplo de custo: 1 10.538462k caracteres × $0.538462 = $0.538462 .

speech-2.8-turbo

MiniMax Fala 2.8 Turbo — síntese de fala focada na velocidade com saída natural, controles de emoção, aprimoramento de linguagem e formatos de áudio de produção comuns.

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/audio/speech

Exemplo de custo: 1 10.307692k caracteres × $0.307692 = $0.307692 .

step-tts-2

Etapa TTS 2 — síntese de fala expressiva com vozes oficiais e clonadas, controle de velocidade e volume, mapeamento de pronúncia e múltiplos formatos de saída.

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/audio/speech

Exemplo de custo: 1 10.4k caracteres × $0.4 = $0.4 .

step-tts-mini

Step TTS — síntese de fala expressiva e econômica para chinês, inglês, japonês, cantonês e sichuanês, com vozes oficiais e clonadas.

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/audio/speech

Exemplo de custo: 1 10.15k caracteres × $0.15 = $0.15 .

stepaudio-2.5-asr

StepAudio 2.5 modelo ASR transcrição de streaming 4B para reconhecimento rápido de chinês-inglês, normalização ITN, legendas, reuniões e agentes de voz.

Tarefas: vídeo com áudio, transcrição

Ponto final: POST /v1/audio/transcriptions

Exemplo de custo: 1 hora de áudio × $0.022 = $0.022 .

Faça um orçamento ou uma estimativa antes de se inscrever.

Calcular o custo API · Gere um script curl, em Python ou JavaScript. · Instale a receita do Agente Seedance 2

Fonte e método: conjunto de dados de precificação de modelos públicos, atualizado 2026-08-08 . As limitações estão indicadas acima; as reivindicações de terceiros permanecem junto às páginas do modelo que as citam.