Directorio de API de voz china

API de voz chinas para ASR y conversión de texto a voz.

Compara los modelos de reconocimiento y síntesis de voz disponibles con una sola ChinaAPI key. Cada modelo conserva su ruta de petición real. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini usan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr usan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts usan /v1/chat/completions con payloads de audio específicos de cada modelo.

Catálogo en vivo

14 modelos de voz, generados a partir de una única fuente de datos.

Model IDs , los modos de punto final, las unidades de facturación, las capacidades y los precios mostrados provienen de scripts/models-data.json, cuyos precios de audio se concilian con la pasarela ChinaAPI . La tarifa de medios mostrada puede incluir un margen de servicio que cubre la facturación de entrada/salida del proveedor, el procesamiento de pagos, la exposición a contracargos y las operaciones. Cualquier margen está incluido en la tarifa mostrada y no se agrega por separado. Verifique los precios en tiempo real antes del lanzamiento de producción.

stepaudio-2-asr-pro

Reconocimiento de voz (ASR) · StepFun

Punto final: PUBLICACIÓN /v1/audio/transcriptions

Modo de solicitud: OpenAI-compatible punto final de transcripción

Facturación: $0.35 por hora de audio

AudioSpeech-to-Text

step-asr

Reconocimiento de voz (ASR) · StepFun

Punto final: PUBLICACIÓN /v1/audio/transcriptions

Modo de solicitud: OpenAI-compatible punto final de transcripción

Facturación: $0.15 por hora de audio

AudioSpeech-to-TextChinese Dialects

step-asr-1.1

Reconocimiento de voz (ASR) · StepFun

Punto final: PUBLICACIÓN /v1/audio/transcriptions

Modo de solicitud: OpenAI-compatible punto final de transcripción

Facturación: $0.35 por hora de audio

AudioSpeech-to-TextChinese Dialects

mimo-v2.5-asr

Reconocimiento de voz (ASR) · Xiaomi

Punto final: PUBLICACIÓN /v1/chat/completions

Modo de solicitud: Finalizaciones de chat con una carga útil input_audio

Facturación: $0.074 por hora de audio

AudioSpeech-to-TextMultilingualChinese DialectsNoise Robustness

mimo-v2.5-tts

Conversión de texto a voz (TTS) · Xiaomi

Punto final: PUBLICACIÓN /v1/chat/completions

Modo de solicitud: Finalización de chats con mensajes más una configuración de salida de audio

Facturación: $0 por 10k caracteres

Precios de acceso gratuito por tiempo limitado; consulte los precios en tiempo real antes del lanzamiento de la producción.

AudioText-to-SpeechMultilingualStyle ControlBuilt-in Voices

stepaudio-2.5-tts

Conversión de texto a voz (TTS) · StepFun

Punto final: PUBLICACIÓN /v1/audio/speech

Modo de solicitud: OpenAI-compatible punto final de voz

Facturación: $0.85 por 10k caracteres

AudioText-to-SpeechContextual TTSStyle ControlBuilt-in Voices

glm-tts

Conversión de texto a voz (TTS) · Zhipu AI

Punto final: PUBLICACIÓN /v1/audio/speech

Modo de solicitud: OpenAI-compatible punto final de voz

Facturación: $0.3077 por 10k caracteres

AudioText-to-SpeechStreamingEmotionVoice Control

qwen3-asr-flash

Reconocimiento de voz (ASR) · Alibaba

Punto final: PUBLICACIÓN /v1/audio/transcriptions

Modo de solicitud: OpenAI-compatible punto final de transcripción

Facturación: $0.1235 por hora de audio

AudioSpeech-to-TextMultilingualEmotion RecognitionITN

qwen3-tts-flash

Conversión de texto a voz (TTS) · Alibaba

Punto final: PUBLICACIÓN /v1/audio/speech

Modo de solicitud: OpenAI-compatible punto final de voz

Facturación: $0.1231 por 10k caracteres

AudioText-to-SpeechMultilingualBuilt-in VoicesStreaming

speech-2.8-hd

Conversión de texto a voz (TTS) · MiniMax

Punto final: PUBLICACIÓN /v1/audio/speech

Modo de solicitud: OpenAI-compatible punto final de voz

Facturación: $0.5385 por 10k caracteres

AudioText-to-SpeechHigh FidelityEmotionMultilingual

speech-2.8-turbo

Conversión de texto a voz (TTS) · MiniMax

Punto final: PUBLICACIÓN /v1/audio/speech

Modo de solicitud: OpenAI-compatible punto final de voz

Facturación: $0.3077 por 10k caracteres

AudioText-to-SpeechLow LatencyEmotionMultilingual

step-tts-2

Conversión de texto a voz (TTS) · StepFun

Punto final: PUBLICACIÓN /v1/audio/speech

Modo de solicitud: OpenAI-compatible punto final de voz

Facturación: $0.4 por 10k caracteres

AudioText-to-SpeechVoice CloningEmotionPronunciation Control

step-tts-mini

Conversión de texto a voz (TTS) · StepFun

Punto final: PUBLICACIÓN /v1/audio/speech

Modo de solicitud: OpenAI-compatible punto final de voz

Facturación: $0.15 por 10k caracteres

AudioText-to-SpeechMultilingualVoice CloningStyle Control

stepaudio-2.5-asr

Reconocimiento de voz (ASR) · StepFun

Punto final: PUBLICACIÓN /v1/audio/transcriptions

Modo de solicitud: OpenAI-compatible punto final de transcripción

Facturación: $0.022 por hora de audio

AudioSpeech-to-TextStreamingChinese and EnglishITN

Seleccionar por carga de trabajo

ASR para la comprensión del audio; TTS para la salida de voz.

Transcripción y comprensión de audio

stepaudio-2-asr-pro: StepFun StepAudio 2 ASR Pro — reconocimiento de voz de 32B parámetros, la opción que prioriza la precisión en la línea ASR de StepFun, mientras que stepaudio-2.5-asr es la opción de velocidad y coste. Acepta subidas ogg, mp3 y wav; la salida de la transcripción no se factura.

Transcripción y comprensión de audio

step-asr: StepFun step-asr — reconocimiento de voz de uso general que cubre chino, inglés y dialectos chinos, para transcripción, actas de reuniones, revisión de calidad de llamadas y búsqueda por voz. Acepta subidas ogg, mp3 y wav; la salida de la transcripción no se factura.

Transcripción y comprensión de audio

step-asr-1.1: StepFun step-asr-1.1 — el reconocedor de uso general actualizado de la línea step-asr, que cubre chino, inglés y dialectos chinos. Acepta subidas ogg, mp3 y wav; la salida de la transcripción no se factura.

Transcripción y comprensión de audio

mimo-v2.5-asr: Xiaomi MiMo-V2.5-ASR — reconocimiento de voz para chino, inglés, alternancia de códigos, dialectos regionales, grabaciones ruidosas, audio de campo lejano, múltiples hablantes y letras de canciones.

Salida de voz controlable

mimo-v2.5-tts: Xiaomi MiMo-V2.5-TTS — síntesis de voz multilingüe expresiva con voces incorporadas, instrucciones de estilo de lenguaje natural, emoción, ritmo, tono, dialecto y control de caracteres.

Salida de voz a través de una ruta dedicada

stepaudio-2.5-tts: StepAudio 2.5 TTS — síntesis de voz contextual con dirección de lenguaje natural en línea, entrega expresiva, voces incorporadas y OpenAI-compatible salida de audio.

Salida de voz a través de una ruta dedicada

glm-tts: GLM-TTS — síntesis de voz sensible al contexto con entrega expresiva, salida en tiempo real, audio inicial rápido y controles de voz, velocidad y volumen.

Transcripción y comprensión de audio

qwen3-asr-flash: Qwen3-ASR-Flash — Transcripción de archivos multilingües con sugerencias de idioma, normalización inversa de texto, reconocimiento de emociones y OpenAI-compatible entrada de audio.

Salida de voz a través de una ruta dedicada

qwen3-tts-flash: Qwen3-TTS-Flash — Síntesis de voz multilingüe de baja latencia con entrada de idiomas mixtos, voces incorporadas, coincidencia automática de idiomas y facturación basada en caracteres.

Salida de voz a través de una ruta dedicada

speech-2.8-hd: MiniMax Voz 2.8 HD: síntesis de voz de alta fidelidad con entrega emocional natural, mejora del lenguaje, controles de voz y formatos de audio de producción.

Salida de voz a través de una ruta dedicada

speech-2.8-turbo: MiniMax Voz 2.8 Turbo: síntesis de voz centrada en la velocidad con salida natural, controles de emociones, mejora del lenguaje y formatos de audio de producción comunes.

Salida de voz a través de una ruta dedicada

step-tts-2: Paso TTS 2 — síntesis de voz expresiva con voces oficiales y clonadas, control de velocidad y volumen, mapeo de pronunciación y múltiples formatos de salida.

Salida de voz a través de una ruta dedicada

step-tts-mini: Paso TTS Mini: síntesis de voz expresiva y rentable para chino, inglés, japonés, cantonés y sichuanés, con voces oficiales y clonadas.

Transcripción y comprensión de audio

stepaudio-2.5-asr: StepAudio 2.5 ASR — un 4B modelo de transcripción en streaming MTP para reconocimiento rápido chino-inglés, normalización ITN, subtítulos, reuniones y agentes de voz.

Límite de compatibilidad

OpenAI-compatible no significa una ruta de audio universal.

Los nombres de las rutas y los envoltorios de petición siguen patrones OpenAI-compatible, pero el cliente debe enviar los campos de audio que exige cada modelo. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini usan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr usan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts usan /v1/chat/completions con payloads de audio específicos de cada modelo.

Inicios rápidos

Copia la solicitud del modelo y el transporte que necesitas.

stepaudio-2-asr-pro

Reconocimiento de voz ( ASR ) mediante /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2-asr-pro" \
  -F "[email protected]" \
  -F "response_format=json"

step-asr

Reconocimiento de voz ( ASR ) mediante /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr" \
  -F "[email protected]" \
  -F "response_format=json"

step-asr-1.1

Reconocimiento de voz ( ASR ) mediante /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr-1.1" \
  -F "[email protected]" \
  -F "response_format=json"

mimo-v2.5-asr

Reconocimiento de voz ( ASR ) mediante /v1/chat/completions

AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-asr",
    "messages": [{
      "role": "user",
      "content": [{
        "type": "input_audio",
        "input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
      }]
    }]
  }'

mimo-v2.5-tts

Texto a voz ( TTS ) vía /v1/chat/completions

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "messages": [
      {"role": "user", "content": "Natural, clear, and friendly delivery"},
      {"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
    ],
    "audio": {"format": "wav", "voice": "冰糖"}
  }' > response.json

stepaudio-2.5-tts

Texto a voz ( TTS ) vía /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-2.5-tts",
    "voice": "cixingnansheng",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

glm-tts

Texto a voz ( TTS ) vía /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "voice": "tongtong",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

qwen3-asr-flash

Reconocimiento de voz ( ASR ) mediante /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "[email protected]" \
  -F "response_format=json"

qwen3-tts-flash

Texto a voz ( TTS ) vía /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "voice": "Cherry",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

speech-2.8-hd

Texto a voz ( TTS ) vía /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

speech-2.8-turbo

Texto a voz ( TTS ) vía /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

step-tts-2

Texto a voz ( TTS ) vía /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "voice": "cixingnansheng",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

step-tts-mini

Texto a voz ( TTS ) vía /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-mini",
    "voice": "cixingnansheng",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

stepaudio-2.5-asr

Reconocimiento de voz ( ASR ) mediante /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2.5-asr" \
  -F "[email protected]" \
  -F "response_format=json"

¿Todos los modelos de voz de ChinaAPI utilizan el mismo punto final de audio?

No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini usan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr usan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts usan /v1/chat/completions con payloads de audio específicos de cada modelo.

¿Cómo se facturan los modelos de voz?

stepaudio-2-asr-pro: $0.35 por hora de audio; step-asr: $0.15 por hora de audio; step-asr-1.1: $0.35 por hora de audio; mimo-v2.5-asr: $0.074 por hora de audio; mimo-v2.5-tts: $0 por 10k caracteres; stepaudio-2.5-tts: $0.85 por 10k caracteres; glm-tts: $0.3077 por 10k caracteres; qwen3-asr-flash: $0.1235 por hora de audio; qwen3-tts-flash: $0.1231 por 10k caracteres; speech-2.8-hd: $0.5385 por 10k caracteres; speech-2.8-turbo: $0.3077 por 10k caracteres; step-tts-2: $0.4 por 10k caracteres; step-tts-mini: $0.15 por 10k caracteres; stepaudio-2.5-asr: $0.022 por hora de audio. La tarifa de medios mostrada puede incluir un margen de servicio que cubre la facturación de entrada/salida del proveedor, el procesamiento de pagos, el riesgo de contracargos y las operaciones. Cualquier margen ya está incluido en la tarifa mostrada y no se añade por separado. Estos valores se renderizan desde el catálogo de modelos, no se copian en esta página.

¿Puedo usar estos modelos sin una cuenta de China continental?

Sí. ChinaAPI permite el acceso sin necesidad de una cuenta o número de teléfono de China continental. Regístrese para obtener una clave y, a continuación, utilice la ruta y la carga útil exactas que se muestran para el modelo seleccionado.