Entradas
Áudio para compreensão/transcrição ou texto para síntese, usando o modelo exato selecionado api_mode .
centro de capacidade de áudio e fala
Use os modos de ponto final de compreensão de áudio verificada, ASR e TTS sem tratar todos os modelos de fala como intercambiáveis.
Contrato
Áudio para compreensão/transcrição ou texto para síntese, usando o modelo exato selecionado api_mode .
Análise/transcrição de texto ou áudio gerado; um resultado direto de transcrição de fala não está implícito, a menos que os metadados do catálogo indiquem o contrário.
Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech
Os endpoints de áudio listados são síncronos; um fluxo de trabalho de fala para fala encadeia a transcrição ou a compreensão de áudio a uma solicitação TTS .
Tarefas suportadas
compreensão auditiva
Limite: Um rótulo TTS ou ASR não comprova compreensão direta de áudio, clonagem de voz, diarização ou suporte de fala para fala.
Catálogo correspondente
Funcionalidades desconhecidas são omitidas, nunca inferidas a partir do nome do modelo. Os exemplos de preços utilizam os dados públicos sincronizados; o Dash Pricing em tempo real continua sendo a fonte oficial.
StepFun StepAudio 2 ASR Pro — reconhecimento de fala de 32B parâmetros, a opção que prioriza precisão na linha ASR da StepFun, enquanto stepaudio-2.5-asr é a opção de velocidade e custo. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.
Tarefas: vídeo com áudio, transcrição
Ponto final: POST /v1/audio/transcriptions
Exemplo de custo: 1 hora de áudio × $0.35 = $0.35 .
StepFun step-asr — reconhecimento de fala de uso geral cobrindo chinês, inglês e dialetos chineses, para transcrição, atas de reunião, revisão de qualidade de chamadas e busca por voz. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.
Tarefas: vídeo com áudio, transcrição
Ponto final: POST /v1/audio/transcriptions
Exemplo de custo: 1 hora de áudio × $0.15 = $0.15 .
StepFun step-asr-1.1 — o reconhecedor de uso geral atualizado da linha step-asr, cobrindo chinês, inglês e dialetos chineses. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.
Tarefas: vídeo com áudio, transcrição
Ponto final: POST /v1/audio/transcriptions
Exemplo de custo: 1 hora de áudio × $0.35 = $0.35 .
Xiaomi reconhecimento de fala para chinês, inglês, alternância de códigos, dialetos regionais, gravações ruidosas, áudio MiMo-V2.5-ASR campo distante, múltiplos falantes e letras de músicas.
Tarefas: vídeo com áudio, transcrição
Ponto final: POST /v1/chat/completions
Exemplo de custo: 1 hora de áudio × $0.074 = $0.074 .
Xiaomi MiMo-V2.5-TTS — síntese de fala multilíngue expressiva com vozes integradas, instruções de estilo de linguagem natural, controle de emoção, ritmo, tom, dialeto e caracteres.
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/chat/completions
Exemplo de custo: 1 10k caracteres × $0 = $0 .
StepAudio 2.5 TTS — síntese de fala contextual com direção de linguagem natural embutida, entrega expressiva, vozes integradas e saída de OpenAI-compatible .
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/audio/speech
Exemplo de custo: 1 10.85k caracteres × $0.85 = $0.85 .
GLM-TTS síntese de fala sensível ao contexto com entrega expressiva, saída em fluxo contínuo, áudio inicial rápido e controles de voz, velocidade e volume.
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/audio/speech
Exemplo de custo: 1 10.307692k caracteres × $0.307692 = $0.307692 .
Qwen3-ASR-Flash — transcrição de arquivos multilíngues com dicas de idioma, normalização inversa de texto, reconhecimento de emoções e OpenAI-compatible entrada de áudio.
Tarefas: vídeo com áudio, transcrição
Ponto final: POST /v1/audio/transcriptions
Exemplo de custo: 1 hora de áudio × $0.123539 = $0.123539 .
Qwen3-TTS-Flash Síntese de fala multilíngue de baixa latência com entrada em idiomas mistos, vozes integradas, correspondência automática de idiomas e cobrança baseada em caracteres.
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/audio/speech
Exemplo de custo: 1 10.123077k caracteres × $0.123077 = $0.123077 .
MiniMax Speech 2.8 HD — síntese de fala de alta fidelidade com entrega emocional natural, aprimoramento de linguagem, controles de voz e formatos de áudio de produção.
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/audio/speech
Exemplo de custo: 1 10.538462k caracteres × $0.538462 = $0.538462 .
MiniMax Fala 2.8 Turbo — síntese de fala focada na velocidade com saída natural, controles de emoção, aprimoramento de linguagem e formatos de áudio de produção comuns.
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/audio/speech
Exemplo de custo: 1 10.307692k caracteres × $0.307692 = $0.307692 .
Etapa TTS 2 — síntese de fala expressiva com vozes oficiais e clonadas, controle de velocidade e volume, mapeamento de pronúncia e múltiplos formatos de saída.
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/audio/speech
Exemplo de custo: 1 10.4k caracteres × $0.4 = $0.4 .
Step TTS — síntese de fala expressiva e econômica para chinês, inglês, japonês, cantonês e sichuanês, com vozes oficiais e clonadas.
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/audio/speech
Exemplo de custo: 1 10.15k caracteres × $0.15 = $0.15 .
StepAudio 2.5 modelo ASR transcrição de streaming 4B para reconhecimento rápido de chinês-inglês, normalização ITN, legendas, reuniões e agentes de voz.
Tarefas: vídeo com áudio, transcrição
Ponto final: POST /v1/audio/transcriptions
Exemplo de custo: 1 hora de áudio × $0.022 = $0.022 .
Calcular o custo API · Gere um script curl, em Python ou JavaScript. · Instale a receita do Agente Seedance 2
Fonte e método: conjunto de dados de precificação de modelos públicos, atualizado 2026-08-08 . As limitações estão indicadas acima; as reivindicações de terceiros permanecem junto às páginas do modelo que as citam.