<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: es/text-to-speech-api/index.html -->

# Conversión de texto a voz API : voces, control y salida de audio

> Compare TTS modelos por punto final, controles de voz, unidad de facturación, flujo de trabajo de salida y una solicitud de voz ejecutable.

- Canonical page: https://chinaapi.ai/es/text-to-speech-api/
- Human-readable page: https://chinaapi.ai/es/text-to-speech-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=es&utm_source=chinaapi&utm_medium=markdown&utm_campaign=text-to-speech-api

Compare TTS modelos por punto final, controles de voz, unidad de facturación, flujo de trabajo de salida y una solicitud de voz ejecutable.

[Prueba mimo-v2.5-tts](https://dash.chinaapi.ai/start?task=video-with-audio&model=mimo-v2.5-tts&lang=es&utm_source=chinaapi&utm_medium=capability&utm_campaign=text-to-speech-api)

[Generar una solicitud](https://chinaapi.ai/tools/api-request-generator/)

## Entradas, salidas y ciclo de vida.

### Entradas

Texto, además de una voz integrada o controles de diseño/clonación de voz compatibles explícitamente.

### Salidas

Audio de voz en un formato compatible con el modelo, o un campo de audio en la respuesta del chat.

### Punto final

`POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode`

### Ciclo vital

Síncrono. Guarda la respuesta de audio binaria o decodifica el campo de audio devuelto por el modo de chat.

## Una definición por tarea.

conversión de texto a voz, clonación de voz, diseño de voz

**Límite:** La identificación por voz, el consentimiento para la clonación, la cobertura lingüística, la transmisión en tiempo real, los límites de caracteres y los formatos de salida son específicos de cada modelo.

## 8 modelos con metadatos explícitos.

Las funcionalidades desconocidas se omiten y nunca se deducen del nombre del modelo. Los ejemplos de precios utilizan datos públicos sincronizados; la información de precios de Dash en tiempo real sigue siendo la fuente autorizada.

### [mimo-v2.5-tts](https://chinaapi.ai/es/models/mimo-v2.5-tts/)

Xiaomi MiMo-V2.5-TTS — Síntesis de voz multilingüe expresiva con voces incorporadas, instrucciones de estilo de lenguaje natural, emoción, ritmo, tono, dialecto y control de caracteres.

**Tareas:** vídeo con audio, conversión de texto a voz

**Punto final:** `POST /v1/chat/completions`

**Ejemplo de costo:** 1 10k caracteres × $0 = $0 .

### [stepaudio-2.5-tts](https://chinaapi.ai/es/models/stepaudio-2.5-tts/)

StepAudio 2.5 TTS — síntesis de voz contextual con dirección de lenguaje natural en línea, entrega expresiva, voces incorporadas y OpenAI-compatible salida de audio.

**Tareas:** vídeo con audio, conversión de texto a voz

**Punto final:** `POST /v1/audio/speech`

**Ejemplo de costo:** 1 10.85k caracteres × $0.85 = $0.85 .

### [glm-tts](https://chinaapi.ai/es/models/glm-tts/)

Síntesis de voz sensible al contexto con entrega expresiva, salida en tiempo real, audio inicial rápido y GLM-TTS de voz, velocidad y volumen.

**Tareas:** vídeo con audio, conversión de texto a voz

**Punto final:** `POST /v1/audio/speech`

**Ejemplo de costo:** 1 10.307692k caracteres × $0.307692 = $0.307692 .

### [qwen3-tts-flash](https://chinaapi.ai/es/models/qwen3-tts-flash/)

Qwen3-TTS-Flash Síntesis de voz multilingüe de baja latencia con entrada en varios idiomas, voces integradas, coincidencia automática de idiomas y facturación basada en caracteres.

**Tareas:** vídeo con audio, conversión de texto a voz

**Punto final:** `POST /v1/audio/speech`

**Ejemplo de costo:** 1 10.123077k caracteres × $0.123077 = $0.123077 .

### [speech-2.8-hd](https://chinaapi.ai/es/models/speech-2.8-hd/)

MiniMax Voz 2.8 HD: síntesis de voz de alta fidelidad con entrega emocional natural, mejora del lenguaje, controles de voz y formatos de audio de producción.

**Tareas:** vídeo con audio, conversión de texto a voz

**Punto final:** `POST /v1/audio/speech`

**Ejemplo de costo:** 1 10.538462k caracteres × $0.538462 = $0.538462 .

### [speech-2.8-turbo](https://chinaapi.ai/es/models/speech-2.8-turbo/)

MiniMax Voz 2.8 Turbo: síntesis de voz centrada en la velocidad con salida natural, controles de emociones, mejora del lenguaje y formatos de audio de producción comunes.

**Tareas:** vídeo con audio, conversión de texto a voz

**Punto final:** `POST /v1/audio/speech`

**Ejemplo de costo:** 1 10.307692k caracteres × $0.307692 = $0.307692 .

### [step-tts-2](https://chinaapi.ai/es/models/step-tts-2/)

Paso TTS 2 — síntesis de voz expresiva con voces oficiales y clonadas, control de velocidad y volumen, mapeo de pronunciación y múltiples formatos de salida.

**Tareas:** vídeo con audio, conversión de texto a voz

**Punto final:** `POST /v1/audio/speech`

**Ejemplo de costo:** 1 10.4k caracteres × $0.4 = $0.4 .

### [step-tts-mini](https://chinaapi.ai/es/models/step-tts-mini/)

Step TTS Mini: síntesis de voz expresiva y rentable para chino, inglés, japonés, cantonés y sichuanés, con voces oficiales y clonadas.

**Tareas:** vídeo con audio, conversión de texto a voz

**Punto final:** `POST /v1/audio/speech`

**Ejemplo de costo:** 1 10.15k caracteres × $0.15 = $0.15 .

## Realice una prueba o calcule una estimación antes de registrarse.

[Calcular API costo](https://chinaapi.ai/tools/api-cost-calculator/) · [Genera código curl, Python o JavaScript.](https://chinaapi.ai/tools/api-request-generator/) · [Instalar la receta del agente Seedance 2](https://chinaapi.ai/agent-recipes/seedance-2/)

Fuente y método: [conjunto de datos de precios de modelos públicos](https://chinaapi.ai/es/data/model-pricing/), actualizado 2026-08-08 . Las limitaciones se indican más arriba; las reclamaciones de terceros permanecen junto a las páginas del modelo que las citan.

---

Markdown twin of https://chinaapi.ai/es/text-to-speech-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
