<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: es/speech-to-text-api/index.html -->

# Conversión de voz a texto y transcripción API

> Compare los modelos de transcripción y ASR según el modo de punto final exacto, el precio por hora de audio, las entradas, la salida de transcripción y las limitaciones.

- Canonical page: https://chinaapi.ai/es/speech-to-text-api/
- Human-readable page: https://chinaapi.ai/es/speech-to-text-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=es&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-to-text-api

Compare los modelos de transcripción y ASR según el modo de punto final exacto, el precio por hora de audio, las entradas, la salida de transcripción y las limitaciones.

[Prueba stepaudio-2-asr-pro](https://dash.chinaapi.ai/start?task=video-with-audio&model=stepaudio-2-asr-pro&lang=es&utm_source=chinaapi&utm_medium=capability&utm_campaign=speech-to-text-api)

[Generar una solicitud](https://chinaapi.ai/tools/api-request-generator/)

## Entradas, salidas y ciclo de vida.

### Entradas

Un archivo de audio o base; 64 input_audio carga útil, dependiendo del modelo api_mode .

### Salidas

Texto de la transcripción o una respuesta de transcripción estructurada.

### Punto final

`POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode`

### Ciclo vital

Sincrónico para los modos de punto final público indicados. Conserva la transcripción y gestiona explícitamente los formatos de archivo rechazados.

## Una definición por tarea.

transcripción

**Límite:** El tamaño del archivo, la duración, la diarización, las marcas de tiempo, la cobertura de dialectos y los formatos aceptados son desconocidos a menos que se indiquen explícitamente para el modelo.

## 6 modelos con metadatos explícitos.

Las funcionalidades desconocidas se omiten y nunca se deducen del nombre del modelo. Los ejemplos de precios utilizan datos públicos sincronizados; la información de precios de Dash en tiempo real sigue siendo la fuente autorizada.

### [stepaudio-2-asr-pro](https://chinaapi.ai/es/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro — reconocimiento de voz de 32B parámetros, la opción que prioriza la precisión en la línea ASR de StepFun, mientras que stepaudio-2.5-asr es la opción de velocidad y coste. Acepta subidas ogg, mp3 y wav; la salida de la transcripción no se factura.

**Tareas:** Vídeo con audio, transcripción

**Punto final:** `POST /v1/audio/transcriptions`

**Ejemplo de costo:** 1 horas de audio × $0.35 = $0.35 .

### [step-asr](https://chinaapi.ai/es/models/step-asr/)

StepFun step-asr — reconocimiento de voz de uso general que cubre chino, inglés y dialectos chinos, para transcripción, actas de reuniones, revisión de calidad de llamadas y búsqueda por voz. Acepta subidas ogg, mp3 y wav; la salida de la transcripción no se factura.

**Tareas:** Vídeo con audio, transcripción

**Punto final:** `POST /v1/audio/transcriptions`

**Ejemplo de costo:** 1 horas de audio × $0.15 = $0.15 .

### [step-asr-1.1](https://chinaapi.ai/es/models/step-asr-1.1/)

StepFun step-asr-1.1 — el reconocedor de uso general actualizado de la línea step-asr, que cubre chino, inglés y dialectos chinos. Acepta subidas ogg, mp3 y wav; la salida de la transcripción no se factura.

**Tareas:** Vídeo con audio, transcripción

**Punto final:** `POST /v1/audio/transcriptions`

**Ejemplo de costo:** 1 horas de audio × $0.35 = $0.35 .

### [mimo-v2.5-asr](https://chinaapi.ai/es/models/mimo-v2.5-asr/)

Xiaomi MiMo-V2.5-ASR — reconocimiento de voz para chino, inglés, alternancia de códigos, dialectos regionales, grabaciones ruidosas, audio de campo lejano, múltiples hablantes y letras de canciones.

**Tareas:** Vídeo con audio, transcripción

**Punto final:** `POST /v1/chat/completions`

**Ejemplo de costo:** 1 horas de audio × $0.074 = $0.074 .

### [qwen3-asr-flash](https://chinaapi.ai/es/models/qwen3-asr-flash/)

Qwen3-ASR-Flash — Transcripción de archivos multilingües con sugerencias de idioma, normalización inversa de texto, reconocimiento de emociones y OpenAI-compatible entrada de audio.

**Tareas:** Vídeo con audio, transcripción

**Punto final:** `POST /v1/audio/transcriptions`

**Ejemplo de costo:** 1 horas de audio × $0.123539 = $0.123539 .

### [stepaudio-2.5-asr](https://chinaapi.ai/es/models/stepaudio-2.5-asr/)

StepAudio 2.5 ASR — un 4B modelo de transcripción en streaming MTP para reconocimiento rápido chino-inglés, normalización ITN, subtítulos, reuniones y agentes de voz.

**Tareas:** Vídeo con audio, transcripción

**Punto final:** `POST /v1/audio/transcriptions`

**Ejemplo de costo:** 1 horas de audio × $0.022 = $0.022 .

## Realice una prueba o calcule una estimación antes de registrarse.

[Calcular API costo](https://chinaapi.ai/tools/api-cost-calculator/) · [Genera código curl, Python o JavaScript.](https://chinaapi.ai/tools/api-request-generator/) · [Instalar la receta del agente Seedance 2](https://chinaapi.ai/agent-recipes/seedance-2/)

Fuente y método: [conjunto de datos de precios de modelos públicos](https://chinaapi.ai/es/data/model-pricing/), actualizado 2026-08-08 . Las limitaciones se indican más arriba; las reclamaciones de terceros permanecen junto a las páginas del modelo que las citan.

---

Markdown twin of https://chinaapi.ai/es/speech-to-text-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
