stepaudio-2-asr-pro
Распознавание речи (ASR) · StepFun
Конечная точка: ПОСТ /v1/audio/transcriptions
Режим запроса: OpenAI-compatible конечная точка транскрипции
Оплата: $0.35 аудиочас
Каталог API для китайской речи
Сравните модели распознавания и синтеза речи, доступные по одному ChinaAPI key. Каждая модель сохраняет свой реальный путь запроса. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini используют /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr используют /v1/audio/transcriptions. mimo-v2.5-asr и mimo-v2.5-tts используют /v1/chat/completions с аудио-нагрузкой, специфичной для каждой модели.
Каталог в реальном времени
Model IDs , режимы работы конечных точек, единицы выставления счетов, возможности и отображаемые цены берутся из scripts/models-data.jsonЦены на аудиоконтент, которые согласовываются с ChinaAPI шлюзом, могут включать в себя сервисную маржу, покрывающую расходы поставщика на ввод/вывод данных, обработку платежей, риск возврата платежей и операционные расходы. Любая маржа включена в отображаемую цену и не добавляется отдельно. Перед запуском в производство проверьте актуальные цены.
Распознавание речи (ASR) · StepFun
Конечная точка: ПОСТ /v1/audio/transcriptions
Режим запроса: OpenAI-compatible конечная точка транскрипции
Оплата: $0.35 аудиочас
Распознавание речи (ASR) · StepFun
Конечная точка: ПОСТ /v1/audio/transcriptions
Режим запроса: OpenAI-compatible конечная точка транскрипции
Оплата: $0.15 аудиочас
Распознавание речи (ASR) · StepFun
Конечная точка: ПОСТ /v1/audio/transcriptions
Режим запроса: OpenAI-compatible конечная точка транскрипции
Оплата: $0.35 аудиочас
Распознавание речи (ASR) · Xiaomi
Конечная точка: ПОСТ /v1/chat/completions
Режим запроса: Завершение чата с полезной нагрузкой input_audio
Оплата: $0.074 аудиочас
Преобразование текста в речь (TTS) · Xiaomi
Конечная точка: ПОСТ /v1/chat/completions
Режим запроса: Завершение чата с сообщениями, а также настройка вывода звука.
Оплата: $0 на 10k символов
Ограниченное по времени бесплатное ценообразование на исходящие запросы; проверьте актуальные цены перед запуском в производство.
Преобразование текста в речь (TTS) · StepFun
Конечная точка: ПОСТ /v1/audio/speech
Режим запроса: OpenAI-compatible конечная точка речи
Оплата: $0.85 на 10k символов
Преобразование текста в речь (TTS) · Zhipu AI
Конечная точка: ПОСТ /v1/audio/speech
Режим запроса: OpenAI-compatible конечная точка речи
Оплата: $0.3077 на 10k символов
Распознавание речи (ASR) · Alibaba
Конечная точка: ПОСТ /v1/audio/transcriptions
Режим запроса: OpenAI-compatible конечная точка транскрипции
Оплата: $0.1235 аудиочас
Преобразование текста в речь (TTS) · Alibaba
Конечная точка: ПОСТ /v1/audio/speech
Режим запроса: OpenAI-compatible конечная точка речи
Оплата: $0.1231 на 10k символов
Преобразование текста в речь (TTS) · MiniMax
Конечная точка: ПОСТ /v1/audio/speech
Режим запроса: OpenAI-compatible конечная точка речи
Оплата: $0.5385 на 10k символов
Преобразование текста в речь (TTS) · MiniMax
Конечная точка: ПОСТ /v1/audio/speech
Режим запроса: OpenAI-compatible конечная точка речи
Оплата: $0.3077 на 10k символов
Преобразование текста в речь (TTS) · StepFun
Конечная точка: ПОСТ /v1/audio/speech
Режим запроса: OpenAI-compatible конечная точка речи
Оплата: $0.4 на 10k символов
Преобразование текста в речь (TTS) · StepFun
Конечная точка: ПОСТ /v1/audio/speech
Режим запроса: OpenAI-compatible конечная точка речи
Оплата: $0.15 на 10k символов
Распознавание речи (ASR) · StepFun
Конечная точка: ПОСТ /v1/audio/transcriptions
Режим запроса: OpenAI-compatible конечная точка транскрипции
Оплата: $0.022 аудиочас
Выберите по объему работы
stepaudio-2-asr-pro: StepFun StepAudio 2 ASR Pro — распознавание речи на 32B параметров: вариант линейки StepFun ASR с упором на точность, тогда как stepaudio-2.5-asr ориентирован на скорость и стоимость. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.
step-asr: StepFun step-asr — универсальное распознавание речи для китайского, английского и китайских диалектов: расшифровки, протоколы встреч, контроль качества звонков и голосовой поиск. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.
step-asr-1.1: StepFun step-asr-1.1 — обновлённый универсальный распознаватель линейки step-asr для китайского, английского и китайских диалектов. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.
mimo-v2.5-asr: Xiaomi MiMo-V2.5-ASR — распознавание речи на китайском, английском языках, с переключением кодов, региональными диалектами, зашумленными записями, звуком на большом расстоянии, несколькими говорящими и текстами песен.
mimo-v2.5-tts: Xiaomi MiMo-V2.5-TTS — выразительный многоязычный синтез речи со встроенными голосами, инструкциями по стилю речи на естественном языке, управлением эмоциями, темпом, тоном, диалектом и символикой.
stepaudio-2.5-tts: StepAudio 2.5 TTS — контекстный синтез речи с встроенным управлением естественной речью, выразительной подачей, встроенными голосами и OpenAI-compatible аудиовыходом.
glm-tts: GLM-TTS — контекстно-зависимый синтез речи с выразительной подачей, потоковым выводом, быстрым первым аудиосигналом и элементами управления голосом, скоростью и громкостью.
qwen3-asr-flash: Qwen3-ASR-Flash — многоязычная транскрипция файлов с языковыми подсказками, инверсная нормализация текста, распознавание эмоций и OpenAI-compatible аудиовход.
qwen3-tts-flash: Qwen3-TTS-Flash — многоязычный синтез речи с низкой задержкой, поддержкой ввода на разных языках, встроенными голосами, автоматическим сопоставлением языков и указанием символов.
speech-2.8-hd: MiniMax Speech 2.8 HD — высококачественный синтез речи с естественной передачей эмоций, улучшением речи, управлением голосом и поддержкой аудиоформатов.
speech-2.8-turbo: MiniMax Speech 2.8 Turbo — синтез речи с упором на скорость, обеспечивающий естественный результат, управление эмоциями, улучшение речи и поддержку распространенных аудиоформатов.
step-tts-2Шаг TTS 2 — выразительный синтез речи с использованием официальных и клонированных голосов, регулировка скорости и громкости, сопоставление произношения и несколько форматов вывода.
step-tts-miniStep TTS — экономичный экспрессивный синтез речи для китайского, английского, японского, кантонского и сычуаньского языков, с использованием официальных и клонированных голосов.
stepaudio-2.5-asr: StepAudio 2.5 ASR — модель потоковой транскрипции 4B для быстрого распознавания китайского и английского языков, нормализации ITN, субтитров, совещаний и голосовых агентов.
Граница совместимости
Имена маршрутов и формат запросов следуют OpenAI-compatible шаблонам, но клиент должен передавать аудиополя, требуемые каждой моделью. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini используют /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr используют /v1/audio/transcriptions. mimo-v2.5-asr и mimo-v2.5-tts используют /v1/chat/completions с аудио-нагрузкой, специфичной для каждой модели.
Быстрые старты
Распознавание речи ( ASR ) посредством /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=stepaudio-2-asr-pro" \
-F "[email protected]" \
-F "response_format=json"
Распознавание речи ( ASR ) посредством /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=step-asr" \
-F "[email protected]" \
-F "response_format=json"
Распознавание речи ( ASR ) посредством /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=step-asr-1.1" \
-F "[email protected]" \
-F "response_format=json"
Распознавание речи ( ASR ) посредством /v1/chat/completions
AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.5-asr",
"messages": [{
"role": "user",
"content": [{
"type": "input_audio",
"input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
}]
}]
}'
Преобразование текста в речь ( TTS ) через /v1/chat/completions
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.5-tts",
"messages": [
{"role": "user", "content": "Natural, clear, and friendly delivery"},
{"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
],
"audio": {"format": "wav", "voice": "冰糖"}
}' > response.json
Преобразование текста в речь ( TTS ) через /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2.5-tts",
"voice": "cixingnansheng",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Преобразование текста в речь ( TTS ) через /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-tts",
"voice": "tongtong",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Распознавание речи ( ASR ) посредством /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=qwen3-asr-flash" \
-F "[email protected]" \
-F "response_format=json"
Преобразование текста в речь ( TTS ) через /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-tts-flash",
"voice": "Cherry",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Преобразование текста в речь ( TTS ) через /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "speech-2.8-hd",
"voice": "Chinese (Mandarin)_Warm_Bestie",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Преобразование текста в речь ( TTS ) через /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "speech-2.8-turbo",
"voice": "Chinese (Mandarin)_Warm_Bestie",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Преобразование текста в речь ( TTS ) через /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-2",
"voice": "cixingnansheng",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Преобразование текста в речь ( TTS ) через /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-mini",
"voice": "cixingnansheng",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Распознавание речи ( ASR ) посредством /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=stepaudio-2.5-asr" \
-F "[email protected]" \
-F "response_format=json"
No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini используют /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr используют /v1/audio/transcriptions. mimo-v2.5-asr и mimo-v2.5-tts используют /v1/chat/completions с аудио-нагрузкой, специфичной для каждой модели.
stepaudio-2-asr-pro: $0.35 за час аудио; step-asr: $0.15 за час аудио; step-asr-1.1: $0.35 за час аудио; mimo-v2.5-asr: $0.074 за час аудио; mimo-v2.5-tts: $0 за 10k символов; stepaudio-2.5-tts: $0.85 за 10k символов; glm-tts: $0.3077 за 10k символов; qwen3-asr-flash: $0.1235 за час аудио; qwen3-tts-flash: $0.1231 за 10k символов; speech-2.8-hd: $0.5385 за 10k символов; speech-2.8-turbo: $0.3077 за 10k символов; step-tts-2: $0.4 за 10k символов; step-tts-mini: $0.15 за 10k символов; stepaudio-2.5-asr: $0.022 за час аудио. Отображаемая ставка на медиа может включать сервисную маржу, покрывающую тарификацию входа/выхода у провайдера, обработку платежей, риск чарджбэков и операционные расходы. Если маржа есть, она уже включена в отображаемую ставку и отдельно не добавляется. Эти значения рендерятся из каталога моделей, а не скопированы на эту страницу.
Да. ChinaAPI предоставляет доступ без учетной записи или номера телефона в материковом Китае. Зарегистрируйтесь для получения ключа, а затем используйте точно указанный маршрут и полезную нагрузку для выбранной вами модели.