<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: ru/audio-api/index.html -->

# Аудио API : элементы понимания и преобразования речи в речь.

> Используйте проверенные режимы распознавания звука, ASR и TTS конечных точек, не рассматривая все модели речи как взаимозаменяемые.

- Canonical page: https://chinaapi.ai/ru/audio-api/
- Human-readable page: https://chinaapi.ai/ru/audio-api/
- Live pricing: https://dash.chinaapi-ru.com/pricing?lang=ru&utm_source=chinaapi&utm_medium=markdown&utm_campaign=audio-api

Используйте проверенные режимы распознавания звука, ASR и TTS конечных точек, не рассматривая все модели речи как взаимозаменяемые.

[Попробуйте stepaudio-2-asr-pro](https://dash.chinaapi-ru.com/start?task=video-with-audio&model=stepaudio-2-asr-pro&lang=ru&utm_source=chinaapi&utm_medium=capability&utm_campaign=audio-api)

[Сгенерировать запрос](https://chinaapi.ai/tools/api-request-generator/)

## Входные данные, выходные данные и жизненный цикл.

### Входные данные

Аудиозапись для понимания/транскрипции или текст для синтеза с использованием точных api_mode выбранной модели.

### Выходы

Анализ текста/транскрипция или сгенерированный аудиофайл; прямой результат преобразования речи в речь не подразумевается, если это не указано в метаданных каталога.

### Конечная точка

`Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech`

### Жизненный цикл

Указанные аудиотерминалы синхронны; в процессе преобразования речи в речь транскрипция или расшифровка TTS связываются с отдельным запросом.

## Одно определение на одно задание.

понимание звука

**Лимит:** Метка TTS или ASR не подтверждает прямое понимание звука, клонирование голоса, диаризацию или поддержку преобразования речи в речь.

## 14 модели с явными метаданными.

Неизвестные возможности опускаются и никогда не определяются по названию модели. В примерах цен используются синхронизированные общедоступные данные; актуальные цены Dash Pricing остаются авторитетными.

### [stepaudio-2-asr-pro](https://chinaapi.ai/ru/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro — распознавание речи на 32B параметров: вариант линейки StepFun ASR с упором на точность, тогда как stepaudio-2.5-asr ориентирован на скорость и стоимость. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

**Задачи:** видео со звуком, транскрипция

**Конечная точка:** `POST /v1/audio/transcriptions`

**Пример расчета стоимости:** 1 аудио час × $0.35 = $0.35 .

### [step-asr](https://chinaapi.ai/ru/models/step-asr/)

StepFun step-asr — универсальное распознавание речи для китайского, английского и китайских диалектов: расшифровки, протоколы встреч, контроль качества звонков и голосовой поиск. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

**Задачи:** видео со звуком, транскрипция

**Конечная точка:** `POST /v1/audio/transcriptions`

**Пример расчета стоимости:** 1 аудио час × $0.15 = $0.15 .

### [step-asr-1.1](https://chinaapi.ai/ru/models/step-asr-1.1/)

StepFun step-asr-1.1 — обновлённый универсальный распознаватель линейки step-asr для китайского, английского и китайских диалектов. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

**Задачи:** видео со звуком, транскрипция

**Конечная точка:** `POST /v1/audio/transcriptions`

**Пример расчета стоимости:** 1 аудио час × $0.35 = $0.35 .

### [mimo-v2.5-asr](https://chinaapi.ai/ru/models/mimo-v2.5-asr/)

Xiaomi Распознавание речи на китайском MiMo-V2.5-ASR английском языках, с переключением кодов, региональными диалектами, зашумленными записями, звуком на большом расстоянии, несколькими говорящими и текстами песен.

**Задачи:** видео со звуком, транскрипция

**Конечная точка:** `POST /v1/chat/completions`

**Пример расчета стоимости:** 1 аудио час × $0.074 = $0.074 .

### [mimo-v2.5-tts](https://chinaapi.ai/ru/models/mimo-v2.5-tts/)

Xiaomi MiMo-V2.5-TTS — выразительный многоязычный синтез речи со встроенными голосами, инструкциями по стилю речи на естественном языке, управлением эмоциями, темпом, тоном, диалектом и символикой.

**Задачи:** видео со звуком, преобразование текста в речь

**Конечная точка:** `POST /v1/chat/completions`

**Пример расчета стоимости:** 1 10k символов × $0 = $0 .

### [stepaudio-2.5-tts](https://chinaapi.ai/ru/models/stepaudio-2.5-tts/)

StepAudio 2.5 TTS — контекстный синтез речи с встроенным управлением естественной речью, выразительной подачей, встроенными голосами и OpenAI-compatible аудиовыходом.

**Задачи:** видео со звуком, преобразование текста в речь

**Конечная точка:** `POST /v1/audio/speech`

**Пример расчета стоимости:** 1 10.85k символов × $0.85 = $0.85 .

### [glm-tts](https://chinaapi.ai/ru/models/glm-tts/)

GLM-TTS — контекстно-зависимый синтез речи с выразительной подачей, потоковым выводом, быстрым первым аудиосигналом и элементами управления голосом, скоростью и громкостью.

**Задачи:** видео со звуком, преобразование текста в речь

**Конечная точка:** `POST /v1/audio/speech`

**Пример расчета стоимости:** 1 10.307692k символов × $0.307692 = $0.307692 .

### [qwen3-asr-flash](https://chinaapi.ai/ru/models/qwen3-asr-flash/)

Qwen3-ASR-Flash — многоязычная транскрипция файлов с языковыми подсказками, обратная нормализация текста, распознавание эмоций и OpenAI-compatible ввод аудио.

**Задачи:** видео со звуком, транскрипция

**Конечная точка:** `POST /v1/audio/transcriptions`

**Пример расчета стоимости:** 1 аудио час × $0.123539 = $0.123539 .

### [qwen3-tts-flash](https://chinaapi.ai/ru/models/qwen3-tts-flash/)

Qwen3-TTS-Flash — Многоязычный синтез речи с низкой задержкой, поддержкой ввода на разных языках, встроенными голосами, автоматическим сопоставлением языков и указанием символов.

**Задачи:** видео со звуком, преобразование текста в речь

**Конечная точка:** `POST /v1/audio/speech`

**Пример расчета стоимости:** 1 10.123077k символов × $0.123077 = $0.123077 .

### [speech-2.8-hd](https://chinaapi.ai/ru/models/speech-2.8-hd/)

MiniMax Speech 2.8 HD — высококачественный синтез речи с естественной передачей эмоций, улучшением речи, управлением голосом и поддержкой аудиоформатов.

**Задачи:** видео со звуком, преобразование текста в речь

**Конечная точка:** `POST /v1/audio/speech`

**Пример расчета стоимости:** 1 10.538462k символов × $0.538462 = $0.538462 .

### [speech-2.8-turbo](https://chinaapi.ai/ru/models/speech-2.8-turbo/)

MiniMax Speech 2.8 Turbo — синтез речи с упором на скорость, обеспечивающий естественный результат, управление эмоциями, улучшение речи и поддержку распространенных аудиоформатов.

**Задачи:** видео со звуком, преобразование текста в речь

**Конечная точка:** `POST /v1/audio/speech`

**Пример расчета стоимости:** 1 10.307692k символов × $0.307692 = $0.307692 .

### [step-tts-2](https://chinaapi.ai/ru/models/step-tts-2/)

Шаг TTS 2 — выразительный синтез речи с использованием официальных и клонированных голосов, регулировка скорости и громкости, сопоставление произношения и несколько форматов вывода.

**Задачи:** видео со звуком, преобразование текста в речь

**Конечная точка:** `POST /v1/audio/speech`

**Пример расчета стоимости:** 1 10.4k символов × $0.4 = $0.4 .

### [step-tts-mini](https://chinaapi.ai/ru/models/step-tts-mini/)

Step TTS — экономичный инструмент для выразительного синтеза речи на китайском, английском, японском, кантонском и сычуаньском языках, с использованием официальных и клонированных голосов.

**Задачи:** видео со звуком, преобразование текста в речь

**Конечная точка:** `POST /v1/audio/speech`

**Пример расчета стоимости:** 1 10.15k символов × $0.15 = $0.15 .

### [stepaudio-2.5-asr](https://chinaapi.ai/ru/models/stepaudio-2.5-asr/)

StepAudio 2.5 ASR — модель потоковой транскрипции 4B для быстрого распознавания китайского и английского языков, нормализации ITN, субтитров, организации совещаний и работы голосовых агентов.

**Задачи:** видео со звуком, транскрипция

**Конечная точка:** `POST /v1/audio/transcriptions`

**Пример расчета стоимости:** 1 аудио час × $0.022 = $0.022 .

## Проведите замер или сделайте предварительную оценку перед регистрацией.

[Рассчитайте API](https://chinaapi.ai/tools/api-cost-calculator/) · [Сгенерируйте curl, Python или JavaScript.](https://chinaapi.ai/tools/api-request-generator/) · [Установите рецепт агента Seedance 2](https://chinaapi.ai/agent-recipes/seedance-2/)

Источник и метод: [общедоступный набор данных о ценообразовании моделей](https://chinaapi.ai/ru/data/model-pricing/), обновлено 2026-08-08 . Ограничения указаны выше; претензии третьих лиц остаются рядом со страницами моделей, на которые они ссылаются.

---

Markdown twin of https://chinaapi.ai/ru/audio-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
