<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: es/speech-api/index.html -->

# API de voz chinas para ASR y conversión de texto a voz.

> Utilice 14 modelos de API de voz en chino para ASR y conversión de texto a voz a través de ChinaAPI. Compare los puntos finales exactos, las unidades de facturación, los precios en USD, las capacidades y las solicitudes de copiar y pegar.

- Canonical page: https://chinaapi.ai/es/speech-api/
- Human-readable page: https://chinaapi.ai/es/speech-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=es&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-api

Compara los modelos de reconocimiento y síntesis de voz disponibles con una sola ChinaAPI key. Cada modelo conserva su ruta de petición real. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini usan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr usan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts usan /v1/chat/completions con payloads de audio específicos de cada modelo.

[Comienza gratis: crédito $2](https://dash.chinaapi.ai/register?lang=es&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

[Ver precios en tiempo real](https://dash.chinaapi.ai/pricing?lang=es&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

## 14 modelos de voz, generados a partir de una única fuente de datos.

Model IDs , los modos de punto final, las unidades de facturación, las capacidades y los precios mostrados provienen de `scripts/models-data.json`, cuyos precios de audio se concilian con la pasarela ChinaAPI . La tarifa de medios mostrada puede incluir un margen de servicio que cubre la facturación de entrada/salida del proveedor, el procesamiento de pagos, la exposición a contracargos y las operaciones. Cualquier margen está incluido en la tarifa mostrada y no se agrega por separado. Verifique los precios en tiempo real antes del lanzamiento de producción.

### [stepaudio-2-asr-pro](https://chinaapi.ai/es/models/stepaudio-2-asr-pro/)

Reconocimiento de voz (ASR) · StepFun

**Punto final:** `PUBLICACIÓN /v1/audio/transcriptions`

**Modo de solicitud:** OpenAI-compatible punto final de transcripción

**Facturación:** $0.35 por hora de audio

Audio Speech-to-Text

### [step-asr](https://chinaapi.ai/es/models/step-asr/)

Reconocimiento de voz (ASR) · StepFun

**Punto final:** `PUBLICACIÓN /v1/audio/transcriptions`

**Modo de solicitud:** OpenAI-compatible punto final de transcripción

**Facturación:** $0.15 por hora de audio

Audio Speech-to-Text Chinese Dialects

### [step-asr-1.1](https://chinaapi.ai/es/models/step-asr-1.1/)

Reconocimiento de voz (ASR) · StepFun

**Punto final:** `PUBLICACIÓN /v1/audio/transcriptions`

**Modo de solicitud:** OpenAI-compatible punto final de transcripción

**Facturación:** $0.35 por hora de audio

Audio Speech-to-Text Chinese Dialects

### [mimo-v2.5-asr](https://chinaapi.ai/es/models/mimo-v2.5-asr/)

Reconocimiento de voz (ASR) · Xiaomi

**Punto final:** `PUBLICACIÓN /v1/chat/completions`

**Modo de solicitud:** Finalizaciones de chat con una carga útil input_audio

**Facturación:** $0.074 por hora de audio

Audio Speech-to-Text Multilingual Chinese Dialects Noise Robustness

### [mimo-v2.5-tts](https://chinaapi.ai/es/models/mimo-v2.5-tts/)

Conversión de texto a voz (TTS) · Xiaomi

**Punto final:** `PUBLICACIÓN /v1/chat/completions`

**Modo de solicitud:** Finalización de chats con mensajes más una configuración de salida de audio

**Facturación:** $0 por 10k caracteres

Precios de acceso gratuito por tiempo limitado; consulte los precios en tiempo real antes del lanzamiento de la producción.

Audio Text-to-Speech Multilingual Style Control Built-in Voices

### [stepaudio-2.5-tts](https://chinaapi.ai/es/models/stepaudio-2.5-tts/)

Conversión de texto a voz (TTS) · StepFun

**Punto final:** `PUBLICACIÓN /v1/audio/speech`

**Modo de solicitud:** OpenAI-compatible punto final de voz

**Facturación:** $0.85 por 10k caracteres

Audio Text-to-Speech Contextual TTS Style Control Built-in Voices

### [glm-tts](https://chinaapi.ai/es/models/glm-tts/)

Conversión de texto a voz (TTS) · Zhipu AI

**Punto final:** `PUBLICACIÓN /v1/audio/speech`

**Modo de solicitud:** OpenAI-compatible punto final de voz

**Facturación:** $0.3077 por 10k caracteres

Audio Text-to-Speech Streaming Emotion Voice Control

### [qwen3-asr-flash](https://chinaapi.ai/es/models/qwen3-asr-flash/)

Reconocimiento de voz (ASR) · Alibaba

**Punto final:** `PUBLICACIÓN /v1/audio/transcriptions`

**Modo de solicitud:** OpenAI-compatible punto final de transcripción

**Facturación:** $0.1235 por hora de audio

Audio Speech-to-Text Multilingual Emotion Recognition ITN

### [qwen3-tts-flash](https://chinaapi.ai/es/models/qwen3-tts-flash/)

Conversión de texto a voz (TTS) · Alibaba

**Punto final:** `PUBLICACIÓN /v1/audio/speech`

**Modo de solicitud:** OpenAI-compatible punto final de voz

**Facturación:** $0.1231 por 10k caracteres

Audio Text-to-Speech Multilingual Built-in Voices Streaming

### [speech-2.8-hd](https://chinaapi.ai/es/models/speech-2.8-hd/)

Conversión de texto a voz (TTS) · MiniMax

**Punto final:** `PUBLICACIÓN /v1/audio/speech`

**Modo de solicitud:** OpenAI-compatible punto final de voz

**Facturación:** $0.5385 por 10k caracteres

Audio Text-to-Speech High Fidelity Emotion Multilingual

### [speech-2.8-turbo](https://chinaapi.ai/es/models/speech-2.8-turbo/)

Conversión de texto a voz (TTS) · MiniMax

**Punto final:** `PUBLICACIÓN /v1/audio/speech`

**Modo de solicitud:** OpenAI-compatible punto final de voz

**Facturación:** $0.3077 por 10k caracteres

Audio Text-to-Speech Low Latency Emotion Multilingual

### [step-tts-2](https://chinaapi.ai/es/models/step-tts-2/)

Conversión de texto a voz (TTS) · StepFun

**Punto final:** `PUBLICACIÓN /v1/audio/speech`

**Modo de solicitud:** OpenAI-compatible punto final de voz

**Facturación:** $0.4 por 10k caracteres

Audio Text-to-Speech Voice Cloning Emotion Pronunciation Control

### [step-tts-mini](https://chinaapi.ai/es/models/step-tts-mini/)

Conversión de texto a voz (TTS) · StepFun

**Punto final:** `PUBLICACIÓN /v1/audio/speech`

**Modo de solicitud:** OpenAI-compatible punto final de voz

**Facturación:** $0.15 por 10k caracteres

Audio Text-to-Speech Multilingual Voice Cloning Style Control

### [stepaudio-2.5-asr](https://chinaapi.ai/es/models/stepaudio-2.5-asr/)

Reconocimiento de voz (ASR) · StepFun

**Punto final:** `PUBLICACIÓN /v1/audio/transcriptions`

**Modo de solicitud:** OpenAI-compatible punto final de transcripción

**Facturación:** $0.022 por hora de audio

Audio Speech-to-Text Streaming Chinese and English ITN

## ASR para la comprensión del audio; TTS para la salida de voz.

### Transcripción y comprensión de audio

[stepaudio-2-asr-pro](https://chinaapi.ai/es/models/stepaudio-2-asr-pro/): StepFun StepAudio 2 ASR Pro — reconocimiento de voz de 32B parámetros, la opción que prioriza la precisión en la línea ASR de StepFun, mientras que stepaudio-2.5-asr es la opción de velocidad y coste. Acepta subidas ogg, mp3 y wav; la salida de la transcripción no se factura.

### Transcripción y comprensión de audio

[step-asr](https://chinaapi.ai/es/models/step-asr/): StepFun step-asr — reconocimiento de voz de uso general que cubre chino, inglés y dialectos chinos, para transcripción, actas de reuniones, revisión de calidad de llamadas y búsqueda por voz. Acepta subidas ogg, mp3 y wav; la salida de la transcripción no se factura.

### Transcripción y comprensión de audio

[step-asr-1.1](https://chinaapi.ai/es/models/step-asr-1.1/): StepFun step-asr-1.1 — el reconocedor de uso general actualizado de la línea step-asr, que cubre chino, inglés y dialectos chinos. Acepta subidas ogg, mp3 y wav; la salida de la transcripción no se factura.

### Transcripción y comprensión de audio

[mimo-v2.5-asr](https://chinaapi.ai/es/models/mimo-v2.5-asr/): Xiaomi MiMo-V2.5-ASR — reconocimiento de voz para chino, inglés, alternancia de códigos, dialectos regionales, grabaciones ruidosas, audio de campo lejano, múltiples hablantes y letras de canciones.

### Salida de voz controlable

[mimo-v2.5-tts](https://chinaapi.ai/es/models/mimo-v2.5-tts/): Xiaomi MiMo-V2.5-TTS — síntesis de voz multilingüe expresiva con voces incorporadas, instrucciones de estilo de lenguaje natural, emoción, ritmo, tono, dialecto y control de caracteres.

### Salida de voz a través de una ruta dedicada

[stepaudio-2.5-tts](https://chinaapi.ai/es/models/stepaudio-2.5-tts/): StepAudio 2.5 TTS — síntesis de voz contextual con dirección de lenguaje natural en línea, entrega expresiva, voces incorporadas y OpenAI-compatible salida de audio.

### Salida de voz a través de una ruta dedicada

[glm-tts](https://chinaapi.ai/es/models/glm-tts/): GLM-TTS — síntesis de voz sensible al contexto con entrega expresiva, salida en tiempo real, audio inicial rápido y controles de voz, velocidad y volumen.

### Transcripción y comprensión de audio

[qwen3-asr-flash](https://chinaapi.ai/es/models/qwen3-asr-flash/): Qwen3-ASR-Flash — Transcripción de archivos multilingües con sugerencias de idioma, normalización inversa de texto, reconocimiento de emociones y OpenAI-compatible entrada de audio.

### Salida de voz a través de una ruta dedicada

[qwen3-tts-flash](https://chinaapi.ai/es/models/qwen3-tts-flash/): Qwen3-TTS-Flash — Síntesis de voz multilingüe de baja latencia con entrada de idiomas mixtos, voces incorporadas, coincidencia automática de idiomas y facturación basada en caracteres.

### Salida de voz a través de una ruta dedicada

[speech-2.8-hd](https://chinaapi.ai/es/models/speech-2.8-hd/): MiniMax Voz 2.8 HD: síntesis de voz de alta fidelidad con entrega emocional natural, mejora del lenguaje, controles de voz y formatos de audio de producción.

### Salida de voz a través de una ruta dedicada

[speech-2.8-turbo](https://chinaapi.ai/es/models/speech-2.8-turbo/): MiniMax Voz 2.8 Turbo: síntesis de voz centrada en la velocidad con salida natural, controles de emociones, mejora del lenguaje y formatos de audio de producción comunes.

### Salida de voz a través de una ruta dedicada

[step-tts-2](https://chinaapi.ai/es/models/step-tts-2/): Paso TTS 2 — síntesis de voz expresiva con voces oficiales y clonadas, control de velocidad y volumen, mapeo de pronunciación y múltiples formatos de salida.

### Salida de voz a través de una ruta dedicada

[step-tts-mini](https://chinaapi.ai/es/models/step-tts-mini/): Paso TTS Mini: síntesis de voz expresiva y rentable para chino, inglés, japonés, cantonés y sichuanés, con voces oficiales y clonadas.

### Transcripción y comprensión de audio

[stepaudio-2.5-asr](https://chinaapi.ai/es/models/stepaudio-2.5-asr/): StepAudio 2.5 ASR — un 4B modelo de transcripción en streaming MTP para reconocimiento rápido chino-inglés, normalización ITN, subtítulos, reuniones y agentes de voz.

## OpenAI-compatible no significa una ruta de audio universal.

Los nombres de las rutas y los envoltorios de petición siguen patrones OpenAI-compatible, pero el cliente debe enviar los campos de audio que exige cada modelo. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini usan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr usan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts usan /v1/chat/completions con payloads de audio específicos de cada modelo.

## Copia la solicitud del modelo y el transporte que necesitas.

### stepaudio-2-asr-pro

Reconocimiento de voz ( ASR ) mediante `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2-asr-pro" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr

Reconocimiento de voz ( ASR ) mediante `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr-1.1

Reconocimiento de voz ( ASR ) mediante `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr-1.1" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### mimo-v2.5-asr

Reconocimiento de voz ( ASR ) mediante `/v1/chat/completions`

```
AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-asr",
    "messages": [{
      "role": "user",
      "content": [{
        "type": "input_audio",
        "input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
      }]
    }]
  }'
```

### mimo-v2.5-tts

Texto a voz ( TTS ) vía `/v1/chat/completions`

```
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "messages": [
      {"role": "user", "content": "Natural, clear, and friendly delivery"},
      {"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
    ],
    "audio": {"format": "wav", "voice": "冰糖"}
  }' > response.json
```

### stepaudio-2.5-tts

Texto a voz ( TTS ) vía `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-2.5-tts",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### glm-tts

Texto a voz ( TTS ) vía `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "voice": "tongtong",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### qwen3-asr-flash

Reconocimiento de voz ( ASR ) mediante `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### qwen3-tts-flash

Texto a voz ( TTS ) vía `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "voice": "Cherry",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-hd

Texto a voz ( TTS ) vía `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-turbo

Texto a voz ( TTS ) vía `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-2

Texto a voz ( TTS ) vía `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-mini

Texto a voz ( TTS ) vía `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-mini",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### stepaudio-2.5-asr

Reconocimiento de voz ( ASR ) mediante `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2.5-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

## ¿Todos los modelos de voz de ChinaAPI utilizan el mismo punto final de audio?

No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini usan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr usan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts usan /v1/chat/completions con payloads de audio específicos de cada modelo.

## ¿Cómo se facturan los modelos de voz?

stepaudio-2-asr-pro: $0.35 por hora de audio; step-asr: $0.15 por hora de audio; step-asr-1.1: $0.35 por hora de audio; mimo-v2.5-asr: $0.074 por hora de audio; mimo-v2.5-tts: $0 por 10k caracteres; stepaudio-2.5-tts: $0.85 por 10k caracteres; glm-tts: $0.3077 por 10k caracteres; qwen3-asr-flash: $0.1235 por hora de audio; qwen3-tts-flash: $0.1231 por 10k caracteres; speech-2.8-hd: $0.5385 por 10k caracteres; speech-2.8-turbo: $0.3077 por 10k caracteres; step-tts-2: $0.4 por 10k caracteres; step-tts-mini: $0.15 por 10k caracteres; stepaudio-2.5-asr: $0.022 por hora de audio. La tarifa de medios mostrada puede incluir un margen de servicio que cubre la facturación de entrada/salida del proveedor, el procesamiento de pagos, el riesgo de contracargos y las operaciones. Cualquier margen ya está incluido en la tarifa mostrada y no se añade por separado. Estos valores se renderizan desde el catálogo de modelos, no se copian en esta página.

## ¿Puedo usar estos modelos sin una cuenta de China continental?

Sí. ChinaAPI permite el acceso sin necesidad de una cuenta o número de teléfono de China continental. Regístrese para obtener una clave y, a continuación, utilice la ruta y la carga útil exactas que se muestran para el modelo seleccionado.

---

Markdown twin of https://chinaapi.ai/es/speech-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
