Entradas
Un archivo de audio o base64 input_audio carga útil, dependiendo del modelo api_mode.
centro de capacidad de audio y voz
Compare los modelos de transcripción y ASR según el modo de punto final exacto, el precio por hora de audio, las entradas, la salida de transcripción y las limitaciones.
Contrato
Un archivo de audio o base64 input_audio carga útil, dependiendo del modelo api_mode.
Texto de la transcripción o una respuesta de transcripción estructurada.
POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode
Sincrónico para los modos de punto final público indicados. Conserva la transcripción y gestiona explícitamente los formatos de archivo rechazados.
Tareas compatibles
transcripción
Límite: El tamaño del archivo, la duración, la diarización, las marcas de tiempo, la cobertura de dialectos y los formatos aceptados son desconocidos a menos que se indiquen explícitamente para el modelo.
Catálogo correspondiente
Las funcionalidades desconocidas se omiten y nunca se deducen del nombre del modelo. Los ejemplos de precios utilizan datos públicos sincronizados; la información de precios de Dash en tiempo real sigue siendo la fuente autorizada.
StepFun StepAudio 2 ASR Pro — reconocimiento de voz de 32B parámetros, la opción que prioriza la precisión en la línea ASR de StepFun, mientras que stepaudio-2.5-asr es la opción de velocidad y coste. Acepta subidas ogg, mp3 y wav; la salida de la transcripción no se factura.
Tareas: transcripción
Punto final: POST /v1/audio/transcriptions
Ejemplo de costo: 1 horas de audio × $0.296296 = $0.296296.
Xiaomi MiMo-V2.5-ASR — reconocimiento de voz para chino, inglés, alternancia de códigos, dialectos regionales, grabaciones ruidosas, audio de campo lejano, múltiples hablantes y letras de canciones.
Tareas: transcripción
Punto final: POST /v1/chat/completions
Ejemplo de costo: 1 horas de audio × $0.074 = $0.074.
Qwen3-ASR-Flash — Transcripción de archivos multilingües con sugerencias de idioma, normalización inversa de texto, reconocimiento de emociones y OpenAI-compatible entrada de audio.
Tareas: transcripción
Punto final: POST /v1/audio/transcriptions
Ejemplo de costo: 1 horas de audio × $0.126 = $0.126.
StepAudio 2.5 ASR — un 4B modelo de transcripción en streaming MTP para reconocimiento rápido chino-inglés, normalización ITN, subtítulos, reuniones y agentes de voz.
Tareas: transcripción
Punto final: POST /v1/audio/transcriptions
Ejemplo de costo: 1 horas de audio × $0.022 = $0.022.
Calcular el costo de la API · Generar una petición en curl, Python o JavaScript
Fuente y método: conjunto de datos de precios de modelos públicos, actualizado el 2026-09-28. Las limitaciones se indican arriba; las afirmaciones de terceros se mantienen junto a las páginas de los modelos que las citan.