Каталог API для китайской речи

API для ASR текста в речь на китайском языке.

Сравните модели распознавания и синтеза речи, доступные по одному ChinaAPI key. Каждая модель сохраняет свой реальный путь запроса. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini используют /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr используют /v1/audio/transcriptions. mimo-v2.5-asr и mimo-v2.5-tts используют /v1/chat/completions с аудио-нагрузкой, специфичной для каждой модели.

Каталог в реальном времени

14 моделей речи, сгенерированных на основе одного источника данных.

Model IDs , режимы работы конечных точек, единицы выставления счетов, возможности и отображаемые цены берутся из scripts/models-data.jsonЦены на аудиоконтент, которые согласовываются с ChinaAPI шлюзом, могут включать в себя сервисную маржу, покрывающую расходы поставщика на ввод/вывод данных, обработку платежей, риск возврата платежей и операционные расходы. Любая маржа включена в отображаемую цену и не добавляется отдельно. Перед запуском в производство проверьте актуальные цены.

stepaudio-2-asr-pro

Распознавание речи (ASR) · StepFun

Конечная точка: ПОСТ /v1/audio/transcriptions

Режим запроса: OpenAI-compatible конечная точка транскрипции

Оплата: $0.35 аудиочас

AudioSpeech-to-Text

step-asr

Распознавание речи (ASR) · StepFun

Конечная точка: ПОСТ /v1/audio/transcriptions

Режим запроса: OpenAI-compatible конечная точка транскрипции

Оплата: $0.15 аудиочас

AudioSpeech-to-TextChinese Dialects

step-asr-1.1

Распознавание речи (ASR) · StepFun

Конечная точка: ПОСТ /v1/audio/transcriptions

Режим запроса: OpenAI-compatible конечная точка транскрипции

Оплата: $0.35 аудиочас

AudioSpeech-to-TextChinese Dialects

mimo-v2.5-asr

Распознавание речи (ASR) · Xiaomi

Конечная точка: ПОСТ /v1/chat/completions

Режим запроса: Завершение чата с полезной нагрузкой input_audio

Оплата: $0.074 аудиочас

AudioSpeech-to-TextMultilingualChinese DialectsNoise Robustness

mimo-v2.5-tts

Преобразование текста в речь (TTS) · Xiaomi

Конечная точка: ПОСТ /v1/chat/completions

Режим запроса: Завершение чата с сообщениями, а также настройка вывода звука.

Оплата: $0 на 10k символов

Ограниченное по времени бесплатное ценообразование на исходящие запросы; проверьте актуальные цены перед запуском в производство.

AudioText-to-SpeechMultilingualStyle ControlBuilt-in Voices

stepaudio-2.5-tts

Преобразование текста в речь (TTS) · StepFun

Конечная точка: ПОСТ /v1/audio/speech

Режим запроса: OpenAI-compatible конечная точка речи

Оплата: $0.85 на 10k символов

AudioText-to-SpeechContextual TTSStyle ControlBuilt-in Voices

glm-tts

Преобразование текста в речь (TTS) · Zhipu AI

Конечная точка: ПОСТ /v1/audio/speech

Режим запроса: OpenAI-compatible конечная точка речи

Оплата: $0.3077 на 10k символов

AudioText-to-SpeechStreamingEmotionVoice Control

qwen3-asr-flash

Распознавание речи (ASR) · Alibaba

Конечная точка: ПОСТ /v1/audio/transcriptions

Режим запроса: OpenAI-compatible конечная точка транскрипции

Оплата: $0.1235 аудиочас

AudioSpeech-to-TextMultilingualEmotion RecognitionITN

qwen3-tts-flash

Преобразование текста в речь (TTS) · Alibaba

Конечная точка: ПОСТ /v1/audio/speech

Режим запроса: OpenAI-compatible конечная точка речи

Оплата: $0.1231 на 10k символов

AudioText-to-SpeechMultilingualBuilt-in VoicesStreaming

speech-2.8-hd

Преобразование текста в речь (TTS) · MiniMax

Конечная точка: ПОСТ /v1/audio/speech

Режим запроса: OpenAI-compatible конечная точка речи

Оплата: $0.5385 на 10k символов

AudioText-to-SpeechHigh FidelityEmotionMultilingual

speech-2.8-turbo

Преобразование текста в речь (TTS) · MiniMax

Конечная точка: ПОСТ /v1/audio/speech

Режим запроса: OpenAI-compatible конечная точка речи

Оплата: $0.3077 на 10k символов

AudioText-to-SpeechLow LatencyEmotionMultilingual

step-tts-2

Преобразование текста в речь (TTS) · StepFun

Конечная точка: ПОСТ /v1/audio/speech

Режим запроса: OpenAI-compatible конечная точка речи

Оплата: $0.4 на 10k символов

AudioText-to-SpeechVoice CloningEmotionPronunciation Control

step-tts-mini

Преобразование текста в речь (TTS) · StepFun

Конечная точка: ПОСТ /v1/audio/speech

Режим запроса: OpenAI-compatible конечная точка речи

Оплата: $0.15 на 10k символов

AudioText-to-SpeechMultilingualVoice CloningStyle Control

stepaudio-2.5-asr

Распознавание речи (ASR) · StepFun

Конечная точка: ПОСТ /v1/audio/transcriptions

Режим запроса: OpenAI-compatible конечная точка транскрипции

Оплата: $0.022 аудиочас

AudioSpeech-to-TextStreamingChinese and EnglishITN

Выберите по объему работы

ASR для распознавания речи; TTS для голосового вывода.

Транскрипция и понимание аудиозаписей

stepaudio-2-asr-pro: StepFun StepAudio 2 ASR Pro — распознавание речи на 32B параметров: вариант линейки StepFun ASR с упором на точность, тогда как stepaudio-2.5-asr ориентирован на скорость и стоимость. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

Транскрипция и понимание аудиозаписей

step-asr: StepFun step-asr — универсальное распознавание речи для китайского, английского и китайских диалектов: расшифровки, протоколы встреч, контроль качества звонков и голосовой поиск. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

Транскрипция и понимание аудиозаписей

step-asr-1.1: StepFun step-asr-1.1 — обновлённый универсальный распознаватель линейки step-asr для китайского, английского и китайских диалектов. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

Транскрипция и понимание аудиозаписей

mimo-v2.5-asr: Xiaomi MiMo-V2.5-ASR — распознавание речи на китайском, английском языках, с переключением кодов, региональными диалектами, зашумленными записями, звуком на большом расстоянии, несколькими говорящими и текстами песен.

Управляемый вывод голоса

mimo-v2.5-tts: Xiaomi MiMo-V2.5-TTS — выразительный многоязычный синтез речи со встроенными голосами, инструкциями по стилю речи на естественном языке, управлением эмоциями, темпом, тоном, диалектом и символикой.

Вывод речи осуществляется по выделенному каналу.

stepaudio-2.5-tts: StepAudio 2.5 TTS — контекстный синтез речи с встроенным управлением естественной речью, выразительной подачей, встроенными голосами и OpenAI-compatible аудиовыходом.

Вывод речи осуществляется по выделенному каналу.

glm-tts: GLM-TTS — контекстно-зависимый синтез речи с выразительной подачей, потоковым выводом, быстрым первым аудиосигналом и элементами управления голосом, скоростью и громкостью.

Транскрипция и понимание аудиозаписей

qwen3-asr-flash: Qwen3-ASR-Flash — многоязычная транскрипция файлов с языковыми подсказками, инверсная нормализация текста, распознавание эмоций и OpenAI-compatible аудиовход.

Вывод речи осуществляется по выделенному каналу.

qwen3-tts-flash: Qwen3-TTS-Flash — многоязычный синтез речи с низкой задержкой, поддержкой ввода на разных языках, встроенными голосами, автоматическим сопоставлением языков и указанием символов.

Вывод речи осуществляется по выделенному каналу.

speech-2.8-hd: MiniMax Speech 2.8 HD — высококачественный синтез речи с естественной передачей эмоций, улучшением речи, управлением голосом и поддержкой аудиоформатов.

Вывод речи осуществляется по выделенному каналу.

speech-2.8-turbo: MiniMax Speech 2.8 Turbo — синтез речи с упором на скорость, обеспечивающий естественный результат, управление эмоциями, улучшение речи и поддержку распространенных аудиоформатов.

Вывод речи осуществляется по выделенному каналу.

step-tts-2Шаг TTS 2 — выразительный синтез речи с использованием официальных и клонированных голосов, регулировка скорости и громкости, сопоставление произношения и несколько форматов вывода.

Вывод речи осуществляется по выделенному каналу.

step-tts-miniStep TTS — экономичный экспрессивный синтез речи для китайского, английского, японского, кантонского и сычуаньского языков, с использованием официальных и клонированных голосов.

Транскрипция и понимание аудиозаписей

stepaudio-2.5-asr: StepAudio 2.5 ASR — модель потоковой транскрипции 4B для быстрого распознавания китайского и английского языков, нормализации ITN, субтитров, совещаний и голосовых агентов.

Граница совместимости

OpenAI-compatible не означает наличие единого универсального аудиомаршрута.

Имена маршрутов и формат запросов следуют OpenAI-compatible шаблонам, но клиент должен передавать аудиополя, требуемые каждой моделью. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini используют /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr используют /v1/audio/transcriptions. mimo-v2.5-asr и mimo-v2.5-tts используют /v1/chat/completions с аудио-нагрузкой, специфичной для каждой модели.

Быстрые старты

Скопируйте запрос, указав необходимую модель и способ транспортировки.

stepaudio-2-asr-pro

Распознавание речи ( ASR ) посредством /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2-asr-pro" \
  -F "[email protected]" \
  -F "response_format=json"

step-asr

Распознавание речи ( ASR ) посредством /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr" \
  -F "[email protected]" \
  -F "response_format=json"

step-asr-1.1

Распознавание речи ( ASR ) посредством /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr-1.1" \
  -F "[email protected]" \
  -F "response_format=json"

mimo-v2.5-asr

Распознавание речи ( ASR ) посредством /v1/chat/completions

AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-asr",
    "messages": [{
      "role": "user",
      "content": [{
        "type": "input_audio",
        "input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
      }]
    }]
  }'

mimo-v2.5-tts

Преобразование текста в речь ( TTS ) через /v1/chat/completions

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "messages": [
      {"role": "user", "content": "Natural, clear, and friendly delivery"},
      {"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
    ],
    "audio": {"format": "wav", "voice": "冰糖"}
  }' > response.json

stepaudio-2.5-tts

Преобразование текста в речь ( TTS ) через /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-2.5-tts",
    "voice": "cixingnansheng",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

glm-tts

Преобразование текста в речь ( TTS ) через /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "voice": "tongtong",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

qwen3-asr-flash

Распознавание речи ( ASR ) посредством /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "[email protected]" \
  -F "response_format=json"

qwen3-tts-flash

Преобразование текста в речь ( TTS ) через /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "voice": "Cherry",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

speech-2.8-hd

Преобразование текста в речь ( TTS ) через /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

speech-2.8-turbo

Преобразование текста в речь ( TTS ) через /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

step-tts-2

Преобразование текста в речь ( TTS ) через /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "voice": "cixingnansheng",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

step-tts-mini

Преобразование текста в речь ( TTS ) через /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-mini",
    "voice": "cixingnansheng",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

stepaudio-2.5-asr

Распознавание речи ( ASR ) посредством /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2.5-asr" \
  -F "[email protected]" \
  -F "response_format=json"

Используют ли все речевые модели ChinaAPI одну и ту же аудиоточку доступа?

No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini используют /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr используют /v1/audio/transcriptions. mimo-v2.5-asr и mimo-v2.5-tts используют /v1/chat/completions с аудио-нагрузкой, специфичной для каждой модели.

Как осуществляется оплата услуг речевых моделей?

stepaudio-2-asr-pro: $0.35 за час аудио; step-asr: $0.15 за час аудио; step-asr-1.1: $0.35 за час аудио; mimo-v2.5-asr: $0.074 за час аудио; mimo-v2.5-tts: $0 за 10k символов; stepaudio-2.5-tts: $0.85 за 10k символов; glm-tts: $0.3077 за 10k символов; qwen3-asr-flash: $0.1235 за час аудио; qwen3-tts-flash: $0.1231 за 10k символов; speech-2.8-hd: $0.5385 за 10k символов; speech-2.8-turbo: $0.3077 за 10k символов; step-tts-2: $0.4 за 10k символов; step-tts-mini: $0.15 за 10k символов; stepaudio-2.5-asr: $0.022 за час аудио. Отображаемая ставка на медиа может включать сервисную маржу, покрывающую тарификацию входа/выхода у провайдера, обработку платежей, риск чарджбэков и операционные расходы. Если маржа есть, она уже включена в отображаемую ставку и отдельно не добавляется. Эти значения рендерятся из каталога моделей, а не скопированы на эту страницу.

Могу ли я использовать эти модели без учетной записи в материковом Китае?

Да. ChinaAPI предоставляет доступ без учетной записи или номера телефона в материковом Китае. Зарегистрируйтесь для получения ключа, а затем используйте точно указанный маршрут и полезную нагрузку для выбранной вами модели.