центр аудио-речевых возможностей

Преобразование речи в текст и API

Сравните модели транскрипции и ASR по точному режиму конечной точки, стоимости аудиочаса, входным данным, выходным данным транскрипции и ограничениям.

Договор

Входные данные, выходные данные и жизненный цикл.

Входные данные

Аудиофайл или база данных; 64 input_audio , в зависимости от api_mode .

Выходы

Текстовая расшифровка или структурированный ответ в виде транскрипции.

Конечная точка

POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode

Жизненный цикл

Синхронный режим для перечисленных общедоступных режимов конечных точек. Сохранение записи и явная обработка отклоненных форматов файлов.

Поддерживаемые задачи

Одно определение на одно задание.

транскрипция

Лимит: Размер файла, длительность, тип диаризации, временные метки, охват диалектов и принимаемые форматы неизвестны, если они явно не указаны для модели.

Соответствующий каталог

6 модели с явными метаданными.

Неизвестные возможности опускаются и никогда не определяются по названию модели. В примерах цен используются синхронизированные общедоступные данные; актуальные цены Dash Pricing остаются авторитетными.

stepaudio-2-asr-pro

StepFun StepAudio 2 ASR Pro — распознавание речи на 32B параметров: вариант линейки StepFun ASR с упором на точность, тогда как stepaudio-2.5-asr ориентирован на скорость и стоимость. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

Задачи: видео со звуком, транскрипция

Конечная точка: POST /v1/audio/transcriptions

Пример расчета стоимости: 1 аудио час × $0.35 = $0.35 .

step-asr

StepFun step-asr — универсальное распознавание речи для китайского, английского и китайских диалектов: расшифровки, протоколы встреч, контроль качества звонков и голосовой поиск. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

Задачи: видео со звуком, транскрипция

Конечная точка: POST /v1/audio/transcriptions

Пример расчета стоимости: 1 аудио час × $0.15 = $0.15 .

step-asr-1.1

StepFun step-asr-1.1 — обновлённый универсальный распознаватель линейки step-asr для китайского, английского и китайских диалектов. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

Задачи: видео со звуком, транскрипция

Конечная точка: POST /v1/audio/transcriptions

Пример расчета стоимости: 1 аудио час × $0.35 = $0.35 .

mimo-v2.5-asr

Xiaomi Распознавание речи на китайском MiMo-V2.5-ASR английском языках, с переключением кодов, региональными диалектами, зашумленными записями, звуком на большом расстоянии, несколькими говорящими и текстами песен.

Задачи: видео со звуком, транскрипция

Конечная точка: POST /v1/chat/completions

Пример расчета стоимости: 1 аудио час × $0.074 = $0.074 .

qwen3-asr-flash

Qwen3-ASR-Flash — многоязычная транскрипция файлов с языковыми подсказками, обратная нормализация текста, распознавание эмоций и OpenAI-compatible ввод аудио.

Задачи: видео со звуком, транскрипция

Конечная точка: POST /v1/audio/transcriptions

Пример расчета стоимости: 1 аудио час × $0.123539 = $0.123539 .

stepaudio-2.5-asr

StepAudio 2.5 ASR — модель потоковой транскрипции 4B для быстрого распознавания китайского и английского языков, нормализации ITN, субтитров, организации совещаний и работы голосовых агентов.

Задачи: видео со звуком, транскрипция

Конечная точка: POST /v1/audio/transcriptions

Пример расчета стоимости: 1 аудио час × $0.022 = $0.022 .

Проведите замер или сделайте предварительную оценку перед регистрацией.

Рассчитайте API · Сгенерируйте curl, Python или JavaScript. · Установите рецепт агента Seedance 2

Источник и метод: общедоступный набор данных о ценообразовании моделей, обновлено 2026-08-08 . Ограничения указаны выше; претензии третьих лиц остаются рядом со страницами моделей, на которые они ссылаются.