centro de capacidad de audio y voz

Conversión de texto a voz API: voces, control y salida de audio

Compare TTS modelos por punto final, controles de voz, unidad de facturación, flujo de trabajo de salida y una solicitud de voz ejecutable.

Contrato

Entradas, salidas y ciclo de vida.

Entradas

Texto, además de una voz integrada o controles de diseño/clonación de voz compatibles explícitamente.

Salidas

Audio de voz en un formato compatible con el modelo, o un campo de audio en la respuesta del chat.

Punto final

POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode

Ciclo vital

Síncrono. Guarda la respuesta de audio binaria o decodifica el campo de audio devuelto por el modo de chat.

Tareas compatibles

Una definición por tarea.

texto a voz, clonación de voz

Límite: La identificación por voz, el consentimiento para la clonación, la cobertura lingüística, la transmisión en tiempo real, los límites de caracteres y los formatos de salida son específicos de cada modelo.

Catálogo correspondiente

7 modelos con metadatos explícitos.

Las funcionalidades desconocidas se omiten y nunca se deducen del nombre del modelo. Los ejemplos de precios utilizan datos públicos sincronizados; la información de precios de Dash en tiempo real sigue siendo la fuente autorizada.

mimo-v2.5-tts

Xiaomi MiMo-V2.5-TTS — Síntesis de voz multilingüe expresiva con voces incorporadas, instrucciones de estilo de lenguaje natural, emoción, ritmo, tono, dialecto y control de caracteres.

Tareas: texto a voz

Punto final: POST /v1/chat/completions

Ejemplo de costo: 1 10k caracteres × $0 = $0.

stepaudio-2.5-tts

StepAudio 2.5 TTS — síntesis de voz contextual con dirección de lenguaje natural en línea, entrega expresiva, voces incorporadas y OpenAI-compatible salida de audio.

Tareas: texto a voz, clonación de voz

Punto final: POST /v1/audio/speech

Ejemplo de costo: 1 10.85k caracteres × $0.85 = $0.85.

glm-tts

Síntesis de voz sensible al contexto con entrega expresiva, salida en tiempo real, audio inicial rápido y GLM-TTS de voz, velocidad y volumen.

Tareas: texto a voz

Punto final: POST /v1/audio/speech

Ejemplo de costo: 1 10.15k caracteres × $0.35 = $0.35.

qwen3-tts-flash

Qwen3-TTS-Flash Síntesis de voz multilingüe de baja latencia con entrada en varios idiomas, voces integradas, coincidencia automática de idiomas y facturación basada en caracteres.

Tareas: texto a voz

Punto final: POST /v1/audio/speech

Ejemplo de costo: 1 10.4k caracteres × $0.11 = $0.11.

speech-2.8-hd

MiniMax Voz 2.8 HD: síntesis de voz de alta fidelidad con entrega emocional natural, mejora del lenguaje, controles de voz y formatos de audio de producción.

Tareas: texto a voz

Punto final: POST /v1/audio/speech

Ejemplo de costo: 1 10.123077k caracteres × $1 = $1.

speech-2.8-turbo

MiniMax Voz 2.8 Turbo: síntesis de voz centrada en la velocidad con salida natural, controles de emociones, mejora del lenguaje y formatos de audio de producción comunes.

Tareas: texto a voz

Punto final: POST /v1/audio/speech

Ejemplo de costo: 1 10.307692k caracteres × $0.6 = $0.6.

step-tts-2

Paso TTS 2 — síntesis de voz expresiva con voces oficiales y clonadas, control de velocidad y volumen, mapeo de pronunciación y múltiples formatos de salida.

Tareas: texto a voz, clonación de voz

Punto final: POST /v1/audio/speech

Ejemplo de costo: 1 10.538462k caracteres × $0.414815 = $0.414815.

Realice una prueba o calcule una estimación antes de registrarse.

Calcular el costo de la API · Generar una petición en curl, Python o JavaScript

Fuente y método: conjunto de datos de precios de modelos públicos, actualizado el 2026-09-28. Las limitaciones se indican arriba; las afirmaciones de terceros se mantienen junto a las páginas de los modelos que las citan.