<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: ru/speech-to-text-api/index.html -->

# Преобразование речи в текст и API

> Сравните модели транскрипции и ASR по точному режиму конечной точки, стоимости аудиочаса, входным данным, выходным данным транскрипции и ограничениям.

- Canonical page: https://chinaapi.ai/ru/speech-to-text-api/
- Human-readable page: https://chinaapi.ai/ru/speech-to-text-api/
- Live pricing: https://dash.chinaapi-ru.com/pricing?lang=ru&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-to-text-api

Сравните модели транскрипции и ASR по точному режиму конечной точки, стоимости аудиочаса, входным данным, выходным данным транскрипции и ограничениям.

[Попробуйте stepaudio-2-asr-pro](https://dash.chinaapi-ru.com/start?task=video-with-audio&model=stepaudio-2-asr-pro&lang=ru&utm_source=chinaapi&utm_medium=capability&utm_campaign=speech-to-text-api)

[Сгенерировать запрос](https://chinaapi.ai/tools/api-request-generator/)

## Входные данные, выходные данные и жизненный цикл.

### Входные данные

Аудиофайл или база данных; 64 input_audio , в зависимости от api_mode .

### Выходы

Текстовая расшифровка или структурированный ответ в виде транскрипции.

### Конечная точка

`POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode`

### Жизненный цикл

Синхронный режим для перечисленных общедоступных режимов конечных точек. Сохранение записи и явная обработка отклоненных форматов файлов.

## Одно определение на одно задание.

транскрипция

**Лимит:** Размер файла, длительность, тип диаризации, временные метки, охват диалектов и принимаемые форматы неизвестны, если они явно не указаны для модели.

## 6 модели с явными метаданными.

Неизвестные возможности опускаются и никогда не определяются по названию модели. В примерах цен используются синхронизированные общедоступные данные; актуальные цены Dash Pricing остаются авторитетными.

### [stepaudio-2-asr-pro](https://chinaapi.ai/ru/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro — распознавание речи на 32B параметров: вариант линейки StepFun ASR с упором на точность, тогда как stepaudio-2.5-asr ориентирован на скорость и стоимость. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

**Задачи:** видео со звуком, транскрипция

**Конечная точка:** `POST /v1/audio/transcriptions`

**Пример расчета стоимости:** 1 аудио час × $0.35 = $0.35 .

### [step-asr](https://chinaapi.ai/ru/models/step-asr/)

StepFun step-asr — универсальное распознавание речи для китайского, английского и китайских диалектов: расшифровки, протоколы встреч, контроль качества звонков и голосовой поиск. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

**Задачи:** видео со звуком, транскрипция

**Конечная точка:** `POST /v1/audio/transcriptions`

**Пример расчета стоимости:** 1 аудио час × $0.15 = $0.15 .

### [step-asr-1.1](https://chinaapi.ai/ru/models/step-asr-1.1/)

StepFun step-asr-1.1 — обновлённый универсальный распознаватель линейки step-asr для китайского, английского и китайских диалектов. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

**Задачи:** видео со звуком, транскрипция

**Конечная точка:** `POST /v1/audio/transcriptions`

**Пример расчета стоимости:** 1 аудио час × $0.35 = $0.35 .

### [mimo-v2.5-asr](https://chinaapi.ai/ru/models/mimo-v2.5-asr/)

Xiaomi Распознавание речи на китайском MiMo-V2.5-ASR английском языках, с переключением кодов, региональными диалектами, зашумленными записями, звуком на большом расстоянии, несколькими говорящими и текстами песен.

**Задачи:** видео со звуком, транскрипция

**Конечная точка:** `POST /v1/chat/completions`

**Пример расчета стоимости:** 1 аудио час × $0.074 = $0.074 .

### [qwen3-asr-flash](https://chinaapi.ai/ru/models/qwen3-asr-flash/)

Qwen3-ASR-Flash — многоязычная транскрипция файлов с языковыми подсказками, обратная нормализация текста, распознавание эмоций и OpenAI-compatible ввод аудио.

**Задачи:** видео со звуком, транскрипция

**Конечная точка:** `POST /v1/audio/transcriptions`

**Пример расчета стоимости:** 1 аудио час × $0.123539 = $0.123539 .

### [stepaudio-2.5-asr](https://chinaapi.ai/ru/models/stepaudio-2.5-asr/)

StepAudio 2.5 ASR — модель потоковой транскрипции 4B для быстрого распознавания китайского и английского языков, нормализации ITN, субтитров, организации совещаний и работы голосовых агентов.

**Задачи:** видео со звуком, транскрипция

**Конечная точка:** `POST /v1/audio/transcriptions`

**Пример расчета стоимости:** 1 аудио час × $0.022 = $0.022 .

## Проведите замер или сделайте предварительную оценку перед регистрацией.

[Рассчитайте API](https://chinaapi.ai/tools/api-cost-calculator/) · [Сгенерируйте curl, Python или JavaScript.](https://chinaapi.ai/tools/api-request-generator/) · [Установите рецепт агента Seedance 2](https://chinaapi.ai/agent-recipes/seedance-2/)

Источник и метод: [общедоступный набор данных о ценообразовании моделей](https://chinaapi.ai/ru/data/model-pricing/), обновлено 2026-08-08 . Ограничения указаны выше; претензии третьих лиц остаются рядом со страницами моделей, на которые они ссылаются.

---

Markdown twin of https://chinaapi.ai/ru/speech-to-text-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
