Entradas
Um arquivo de áudio ou base; 64 input_audio carga útil, dependendo do modelo api_mode .
centro de capacidade de áudio e fala
Compare os modelos de transcrição e ASR por modo de ponto final exato, preço por hora de áudio, entradas, saída de transcrição e limitações.
Contrato
Um arquivo de áudio ou base; 64 input_audio carga útil, dependendo do modelo api_mode .
Transcreva o texto ou uma resposta de transcrição estruturada.
POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode
Síncrono para os modos de endpoint público listados. Persiste a transcrição e lida explicitamente com formatos de arquivo rejeitados.
Tarefas suportadas
transcrição
Limite: O tamanho do arquivo, a duração, a diarização, os registros de data e hora, a cobertura de dialetos e os formatos aceitos são desconhecidos, a menos que estejam explicitamente listados para o modelo.
Catálogo correspondente
Funcionalidades desconhecidas são omitidas, nunca inferidas a partir do nome do modelo. Os exemplos de preços utilizam os dados públicos sincronizados; o Dash Pricing em tempo real continua sendo a fonte oficial.
StepFun StepAudio 2 ASR Pro — reconhecimento de fala de 32B parâmetros, a opção que prioriza precisão na linha ASR da StepFun, enquanto stepaudio-2.5-asr é a opção de velocidade e custo. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.
Tarefas: vídeo com áudio, transcrição
Ponto final: POST /v1/audio/transcriptions
Exemplo de custo: 1 hora de áudio × $0.35 = $0.35 .
StepFun step-asr — reconhecimento de fala de uso geral cobrindo chinês, inglês e dialetos chineses, para transcrição, atas de reunião, revisão de qualidade de chamadas e busca por voz. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.
Tarefas: vídeo com áudio, transcrição
Ponto final: POST /v1/audio/transcriptions
Exemplo de custo: 1 hora de áudio × $0.15 = $0.15 .
StepFun step-asr-1.1 — o reconhecedor de uso geral atualizado da linha step-asr, cobrindo chinês, inglês e dialetos chineses. Aceita uploads ogg, mp3 e wav; a saída da transcrição não é cobrada.
Tarefas: vídeo com áudio, transcrição
Ponto final: POST /v1/audio/transcriptions
Exemplo de custo: 1 hora de áudio × $0.35 = $0.35 .
Xiaomi reconhecimento de fala para chinês, inglês, alternância de códigos, dialetos regionais, gravações ruidosas, áudio MiMo-V2.5-ASR campo distante, múltiplos falantes e letras de músicas.
Tarefas: vídeo com áudio, transcrição
Ponto final: POST /v1/chat/completions
Exemplo de custo: 1 hora de áudio × $0.074 = $0.074 .
Qwen3-ASR-Flash — transcrição de arquivos multilíngues com dicas de idioma, normalização inversa de texto, reconhecimento de emoções e OpenAI-compatible entrada de áudio.
Tarefas: vídeo com áudio, transcrição
Ponto final: POST /v1/audio/transcriptions
Exemplo de custo: 1 hora de áudio × $0.123539 = $0.123539 .
StepAudio 2.5 modelo ASR transcrição de streaming 4B para reconhecimento rápido de chinês-inglês, normalização ITN, legendas, reuniões e agentes de voz.
Tarefas: vídeo com áudio, transcrição
Ponto final: POST /v1/audio/transcriptions
Exemplo de custo: 1 hora de áudio × $0.022 = $0.022 .
Calcular o custo API · Gere um script curl, em Python ou JavaScript. · Instale a receita do Agente Seedance 2
Fonte e método: conjunto de dados de precificação de modelos públicos, atualizado 2026-08-08 . As limitações estão indicadas acima; as reivindicações de terceiros permanecem junto às páginas do modelo que as citam.