Входные данные
Аудиофайл или база данных; 64 input_audio , в зависимости от api_mode .
центр аудио-речевых возможностей
Сравните модели транскрипции и ASR по точному режиму конечной точки, стоимости аудиочаса, входным данным, выходным данным транскрипции и ограничениям.
Договор
Аудиофайл или база данных; 64 input_audio , в зависимости от api_mode .
Текстовая расшифровка или структурированный ответ в виде транскрипции.
POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode
Синхронный режим для перечисленных общедоступных режимов конечных точек. Сохранение записи и явная обработка отклоненных форматов файлов.
Поддерживаемые задачи
транскрипция
Лимит: Размер файла, длительность, тип диаризации, временные метки, охват диалектов и принимаемые форматы неизвестны, если они явно не указаны для модели.
Соответствующий каталог
Неизвестные возможности опускаются и никогда не определяются по названию модели. В примерах цен используются синхронизированные общедоступные данные; актуальные цены Dash Pricing остаются авторитетными.
StepFun StepAudio 2 ASR Pro — распознавание речи на 32B параметров: вариант линейки StepFun ASR с упором на точность, тогда как stepaudio-2.5-asr ориентирован на скорость и стоимость. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.
Задачи: видео со звуком, транскрипция
Конечная точка: POST /v1/audio/transcriptions
Пример расчета стоимости: 1 аудио час × $0.35 = $0.35 .
StepFun step-asr — универсальное распознавание речи для китайского, английского и китайских диалектов: расшифровки, протоколы встреч, контроль качества звонков и голосовой поиск. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.
Задачи: видео со звуком, транскрипция
Конечная точка: POST /v1/audio/transcriptions
Пример расчета стоимости: 1 аудио час × $0.15 = $0.15 .
StepFun step-asr-1.1 — обновлённый универсальный распознаватель линейки step-asr для китайского, английского и китайских диалектов. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.
Задачи: видео со звуком, транскрипция
Конечная точка: POST /v1/audio/transcriptions
Пример расчета стоимости: 1 аудио час × $0.35 = $0.35 .
Xiaomi Распознавание речи на китайском MiMo-V2.5-ASR английском языках, с переключением кодов, региональными диалектами, зашумленными записями, звуком на большом расстоянии, несколькими говорящими и текстами песен.
Задачи: видео со звуком, транскрипция
Конечная точка: POST /v1/chat/completions
Пример расчета стоимости: 1 аудио час × $0.074 = $0.074 .
Qwen3-ASR-Flash — многоязычная транскрипция файлов с языковыми подсказками, обратная нормализация текста, распознавание эмоций и OpenAI-compatible ввод аудио.
Задачи: видео со звуком, транскрипция
Конечная точка: POST /v1/audio/transcriptions
Пример расчета стоимости: 1 аудио час × $0.123539 = $0.123539 .
StepAudio 2.5 ASR — модель потоковой транскрипции 4B для быстрого распознавания китайского и английского языков, нормализации ITN, субтитров, организации совещаний и работы голосовых агентов.
Задачи: видео со звуком, транскрипция
Конечная точка: POST /v1/audio/transcriptions
Пример расчета стоимости: 1 аудио час × $0.022 = $0.022 .
Рассчитайте API · Сгенерируйте curl, Python или JavaScript. · Установите рецепт агента Seedance 2
Источник и метод: общедоступный набор данных о ценообразовании моделей, обновлено 2026-08-08 . Ограничения указаны выше; претензии третьих лиц остаются рядом со страницами моделей, на которые они ссылаются.