центр аудио-речевых возможностей

Аудио API : элементы понимания и преобразования речи в речь.

Используйте проверенные режимы распознавания звука, ASR и TTS конечных точек, не рассматривая все модели речи как взаимозаменяемые.

Договор

Входные данные, выходные данные и жизненный цикл.

Входные данные

Аудиозапись для понимания/транскрипции или текст для синтеза с использованием точных api_mode выбранной модели.

Выходы

Анализ текста/транскрипция или сгенерированный аудиофайл; прямой результат преобразования речи в речь не подразумевается, если это не указано в метаданных каталога.

Конечная точка

Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech

Жизненный цикл

Указанные аудиотерминалы синхронны; в процессе преобразования речи в речь транскрипция или расшифровка TTS связываются с отдельным запросом.

Поддерживаемые задачи

Одно определение на одно задание.

понимание звука

Лимит: Метка TTS или ASR не подтверждает прямое понимание звука, клонирование голоса, диаризацию или поддержку преобразования речи в речь.

Соответствующий каталог

14 модели с явными метаданными.

Неизвестные возможности опускаются и никогда не определяются по названию модели. В примерах цен используются синхронизированные общедоступные данные; актуальные цены Dash Pricing остаются авторитетными.

stepaudio-2-asr-pro

StepFun StepAudio 2 ASR Pro — распознавание речи на 32B параметров: вариант линейки StepFun ASR с упором на точность, тогда как stepaudio-2.5-asr ориентирован на скорость и стоимость. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

Задачи: видео со звуком, транскрипция

Конечная точка: POST /v1/audio/transcriptions

Пример расчета стоимости: 1 аудио час × $0.35 = $0.35 .

step-asr

StepFun step-asr — универсальное распознавание речи для китайского, английского и китайских диалектов: расшифровки, протоколы встреч, контроль качества звонков и голосовой поиск. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

Задачи: видео со звуком, транскрипция

Конечная точка: POST /v1/audio/transcriptions

Пример расчета стоимости: 1 аудио час × $0.15 = $0.15 .

step-asr-1.1

StepFun step-asr-1.1 — обновлённый универсальный распознаватель линейки step-asr для китайского, английского и китайских диалектов. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

Задачи: видео со звуком, транскрипция

Конечная точка: POST /v1/audio/transcriptions

Пример расчета стоимости: 1 аудио час × $0.35 = $0.35 .

mimo-v2.5-asr

Xiaomi Распознавание речи на китайском MiMo-V2.5-ASR английском языках, с переключением кодов, региональными диалектами, зашумленными записями, звуком на большом расстоянии, несколькими говорящими и текстами песен.

Задачи: видео со звуком, транскрипция

Конечная точка: POST /v1/chat/completions

Пример расчета стоимости: 1 аудио час × $0.074 = $0.074 .

mimo-v2.5-tts

Xiaomi MiMo-V2.5-TTS — выразительный многоязычный синтез речи со встроенными голосами, инструкциями по стилю речи на естественном языке, управлением эмоциями, темпом, тоном, диалектом и символикой.

Задачи: видео со звуком, преобразование текста в речь

Конечная точка: POST /v1/chat/completions

Пример расчета стоимости: 1 10k символов × $0 = $0 .

stepaudio-2.5-tts

StepAudio 2.5 TTS — контекстный синтез речи с встроенным управлением естественной речью, выразительной подачей, встроенными голосами и OpenAI-compatible аудиовыходом.

Задачи: видео со звуком, преобразование текста в речь

Конечная точка: POST /v1/audio/speech

Пример расчета стоимости: 1 10.85k символов × $0.85 = $0.85 .

glm-tts

GLM-TTS — контекстно-зависимый синтез речи с выразительной подачей, потоковым выводом, быстрым первым аудиосигналом и элементами управления голосом, скоростью и громкостью.

Задачи: видео со звуком, преобразование текста в речь

Конечная точка: POST /v1/audio/speech

Пример расчета стоимости: 1 10.307692k символов × $0.307692 = $0.307692 .

qwen3-asr-flash

Qwen3-ASR-Flash — многоязычная транскрипция файлов с языковыми подсказками, обратная нормализация текста, распознавание эмоций и OpenAI-compatible ввод аудио.

Задачи: видео со звуком, транскрипция

Конечная точка: POST /v1/audio/transcriptions

Пример расчета стоимости: 1 аудио час × $0.123539 = $0.123539 .

qwen3-tts-flash

Qwen3-TTS-Flash — Многоязычный синтез речи с низкой задержкой, поддержкой ввода на разных языках, встроенными голосами, автоматическим сопоставлением языков и указанием символов.

Задачи: видео со звуком, преобразование текста в речь

Конечная точка: POST /v1/audio/speech

Пример расчета стоимости: 1 10.123077k символов × $0.123077 = $0.123077 .

speech-2.8-hd

MiniMax Speech 2.8 HD — высококачественный синтез речи с естественной передачей эмоций, улучшением речи, управлением голосом и поддержкой аудиоформатов.

Задачи: видео со звуком, преобразование текста в речь

Конечная точка: POST /v1/audio/speech

Пример расчета стоимости: 1 10.538462k символов × $0.538462 = $0.538462 .

speech-2.8-turbo

MiniMax Speech 2.8 Turbo — синтез речи с упором на скорость, обеспечивающий естественный результат, управление эмоциями, улучшение речи и поддержку распространенных аудиоформатов.

Задачи: видео со звуком, преобразование текста в речь

Конечная точка: POST /v1/audio/speech

Пример расчета стоимости: 1 10.307692k символов × $0.307692 = $0.307692 .

step-tts-2

Шаг TTS 2 — выразительный синтез речи с использованием официальных и клонированных голосов, регулировка скорости и громкости, сопоставление произношения и несколько форматов вывода.

Задачи: видео со звуком, преобразование текста в речь

Конечная точка: POST /v1/audio/speech

Пример расчета стоимости: 1 10.4k символов × $0.4 = $0.4 .

step-tts-mini

Step TTS — экономичный инструмент для выразительного синтеза речи на китайском, английском, японском, кантонском и сычуаньском языках, с использованием официальных и клонированных голосов.

Задачи: видео со звуком, преобразование текста в речь

Конечная точка: POST /v1/audio/speech

Пример расчета стоимости: 1 10.15k символов × $0.15 = $0.15 .

stepaudio-2.5-asr

StepAudio 2.5 ASR — модель потоковой транскрипции 4B для быстрого распознавания китайского и английского языков, нормализации ITN, субтитров, организации совещаний и работы голосовых агентов.

Задачи: видео со звуком, транскрипция

Конечная точка: POST /v1/audio/transcriptions

Пример расчета стоимости: 1 аудио час × $0.022 = $0.022 .

Проведите замер или сделайте предварительную оценку перед регистрацией.

Рассчитайте API · Сгенерируйте curl, Python или JavaScript. · Установите рецепт агента Seedance 2

Источник и метод: общедоступный набор данных о ценообразовании моделей, обновлено 2026-08-08 . Ограничения указаны выше; претензии третьих лиц остаются рядом со страницами моделей, на которые они ссылаются.