centro de capacidad de audio y voz

Audio API : comprensión y componentes básicos de la conversión de voz a voz

Utilice los modos de punto final de comprensión de audio verificados, ASR y TTS sin tratar todos los modelos de voz como intercambiables.

Contrato

Entradas, salidas y ciclo de vida.

Entradas

Audio para comprensión/transcripción o texto para síntesis, utilizando el api_mode exacto del modelo seleccionado.

Salidas

Análisis/transcripción de texto o audio generado; no se da por sentado un resultado de conversión directa de voz a voz a menos que así lo indiquen los metadatos del catálogo.

Punto final

Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech

Ciclo vital

Los puntos finales de audio enumerados son síncronos; un flujo de trabajo de voz a voz encadena la transcripción o la comprensión de audio a una solicitud TTS .

Tareas compatibles

Una definición por tarea.

comprensión de audio

Límite: Una etiqueta TTS o ASR no prueba la comprensión directa del audio, la clonación de voz, la diarización o el soporte de voz a voz.

Catálogo correspondiente

14 modelos con metadatos explícitos.

Las funcionalidades desconocidas se omiten y nunca se deducen del nombre del modelo. Los ejemplos de precios utilizan datos públicos sincronizados; la información de precios de Dash en tiempo real sigue siendo la fuente autorizada.

stepaudio-2-asr-pro

StepFun StepAudio 2 ASR Pro — reconocimiento de voz de 32B parámetros, la opción que prioriza la precisión en la línea ASR de StepFun, mientras que stepaudio-2.5-asr es la opción de velocidad y coste. Acepta subidas ogg, mp3 y wav; la salida de la transcripción no se factura.

Tareas: Vídeo con audio, transcripción

Punto final: POST /v1/audio/transcriptions

Ejemplo de costo: 1 horas de audio × $0.35 = $0.35 .

step-asr

StepFun step-asr — reconocimiento de voz de uso general que cubre chino, inglés y dialectos chinos, para transcripción, actas de reuniones, revisión de calidad de llamadas y búsqueda por voz. Acepta subidas ogg, mp3 y wav; la salida de la transcripción no se factura.

Tareas: Vídeo con audio, transcripción

Punto final: POST /v1/audio/transcriptions

Ejemplo de costo: 1 horas de audio × $0.15 = $0.15 .

step-asr-1.1

StepFun step-asr-1.1 — el reconocedor de uso general actualizado de la línea step-asr, que cubre chino, inglés y dialectos chinos. Acepta subidas ogg, mp3 y wav; la salida de la transcripción no se factura.

Tareas: Vídeo con audio, transcripción

Punto final: POST /v1/audio/transcriptions

Ejemplo de costo: 1 horas de audio × $0.35 = $0.35 .

mimo-v2.5-asr

Xiaomi MiMo-V2.5-ASR — reconocimiento de voz para chino, inglés, alternancia de códigos, dialectos regionales, grabaciones ruidosas, audio de campo lejano, múltiples hablantes y letras de canciones.

Tareas: Vídeo con audio, transcripción

Punto final: POST /v1/chat/completions

Ejemplo de costo: 1 horas de audio × $0.074 = $0.074 .

mimo-v2.5-tts

Xiaomi MiMo-V2.5-TTS — Síntesis de voz multilingüe expresiva con voces incorporadas, instrucciones de estilo de lenguaje natural, emoción, ritmo, tono, dialecto y control de caracteres.

Tareas: vídeo con audio, conversión de texto a voz

Punto final: POST /v1/chat/completions

Ejemplo de costo: 1 10k caracteres × $0 = $0 .

stepaudio-2.5-tts

StepAudio 2.5 TTS — síntesis de voz contextual con dirección de lenguaje natural en línea, entrega expresiva, voces incorporadas y OpenAI-compatible salida de audio.

Tareas: vídeo con audio, conversión de texto a voz

Punto final: POST /v1/audio/speech

Ejemplo de costo: 1 10.85k caracteres × $0.85 = $0.85 .

glm-tts

Síntesis de voz sensible al contexto con entrega expresiva, salida en tiempo real, audio inicial rápido y GLM-TTS de voz, velocidad y volumen.

Tareas: vídeo con audio, conversión de texto a voz

Punto final: POST /v1/audio/speech

Ejemplo de costo: 1 10.307692k caracteres × $0.307692 = $0.307692 .

qwen3-asr-flash

Qwen3-ASR-Flash — Transcripción de archivos multilingües con sugerencias de idioma, normalización inversa de texto, reconocimiento de emociones y OpenAI-compatible entrada de audio.

Tareas: Vídeo con audio, transcripción

Punto final: POST /v1/audio/transcriptions

Ejemplo de costo: 1 horas de audio × $0.123539 = $0.123539 .

qwen3-tts-flash

Qwen3-TTS-Flash Síntesis de voz multilingüe de baja latencia con entrada en varios idiomas, voces integradas, coincidencia automática de idiomas y facturación basada en caracteres.

Tareas: vídeo con audio, conversión de texto a voz

Punto final: POST /v1/audio/speech

Ejemplo de costo: 1 10.123077k caracteres × $0.123077 = $0.123077 .

speech-2.8-hd

MiniMax Voz 2.8 HD: síntesis de voz de alta fidelidad con entrega emocional natural, mejora del lenguaje, controles de voz y formatos de audio de producción.

Tareas: vídeo con audio, conversión de texto a voz

Punto final: POST /v1/audio/speech

Ejemplo de costo: 1 10.538462k caracteres × $0.538462 = $0.538462 .

speech-2.8-turbo

MiniMax Voz 2.8 Turbo: síntesis de voz centrada en la velocidad con salida natural, controles de emociones, mejora del lenguaje y formatos de audio de producción comunes.

Tareas: vídeo con audio, conversión de texto a voz

Punto final: POST /v1/audio/speech

Ejemplo de costo: 1 10.307692k caracteres × $0.307692 = $0.307692 .

step-tts-2

Paso TTS 2 — síntesis de voz expresiva con voces oficiales y clonadas, control de velocidad y volumen, mapeo de pronunciación y múltiples formatos de salida.

Tareas: vídeo con audio, conversión de texto a voz

Punto final: POST /v1/audio/speech

Ejemplo de costo: 1 10.4k caracteres × $0.4 = $0.4 .

step-tts-mini

Step TTS Mini: síntesis de voz expresiva y rentable para chino, inglés, japonés, cantonés y sichuanés, con voces oficiales y clonadas.

Tareas: vídeo con audio, conversión de texto a voz

Punto final: POST /v1/audio/speech

Ejemplo de costo: 1 10.15k caracteres × $0.15 = $0.15 .

stepaudio-2.5-asr

StepAudio 2.5 ASR — un 4B modelo de transcripción en streaming MTP para reconocimiento rápido chino-inglés, normalización ITN, subtítulos, reuniones y agentes de voz.

Tareas: Vídeo con audio, transcripción

Punto final: POST /v1/audio/transcriptions

Ejemplo de costo: 1 horas de audio × $0.022 = $0.022 .

Realice una prueba o calcule una estimación antes de registrarse.

Calcular API costo · Genera código curl, Python o JavaScript. · Instalar la receta del agente Seedance 2

Fuente y método: conjunto de datos de precios de modelos públicos, actualizado 2026-08-08 . Las limitaciones se indican más arriba; las reclamaciones de terceros permanecen junto a las páginas del modelo que las citan.