<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: ru/speech-api/index.html -->

# API для ASR текста в речь на китайском языке.

> Используйте модели 14 API для преобразования ASR в ChinaAPI . Сравните точные конечные точки, единицы измерения, цены в долларах США, возможности и запросы на копирование и вставку.

- Canonical page: https://chinaapi.ai/ru/speech-api/
- Human-readable page: https://chinaapi.ai/ru/speech-api/
- Live pricing: https://dash.chinaapi-ru.com/pricing?lang=ru&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-api

Сравните модели распознавания и синтеза речи, доступные по одному ChinaAPI key. Каждая модель сохраняет свой реальный путь запроса. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini используют /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr используют /v1/audio/transcriptions. mimo-v2.5-asr и mimo-v2.5-tts используют /v1/chat/completions с аудио-нагрузкой, специфичной для каждой модели.

[Начните бесплатно — кредит в $2](https://dash.chinaapi-ru.com/register?lang=ru&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

[Посмотреть актуальные цены](https://dash.chinaapi-ru.com/pricing?lang=ru&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

## 14 моделей речи, сгенерированных на основе одного источника данных.

Model IDs , режимы работы конечных точек, единицы выставления счетов, возможности и отображаемые цены берутся из `scripts/models-data.json`Цены на аудиоконтент, которые согласовываются с ChinaAPI шлюзом, могут включать в себя сервисную маржу, покрывающую расходы поставщика на ввод/вывод данных, обработку платежей, риск возврата платежей и операционные расходы. Любая маржа включена в отображаемую цену и не добавляется отдельно. Перед запуском в производство проверьте актуальные цены.

### [stepaudio-2-asr-pro](https://chinaapi.ai/ru/models/stepaudio-2-asr-pro/)

Распознавание речи (ASR) · StepFun

**Конечная точка:** `ПОСТ /v1/audio/transcriptions`

**Режим запроса:** OpenAI-compatible конечная точка транскрипции

**Оплата:** $0.35 аудиочас

Audio Speech-to-Text

### [step-asr](https://chinaapi.ai/ru/models/step-asr/)

Распознавание речи (ASR) · StepFun

**Конечная точка:** `ПОСТ /v1/audio/transcriptions`

**Режим запроса:** OpenAI-compatible конечная точка транскрипции

**Оплата:** $0.15 аудиочас

Audio Speech-to-Text Chinese Dialects

### [step-asr-1.1](https://chinaapi.ai/ru/models/step-asr-1.1/)

Распознавание речи (ASR) · StepFun

**Конечная точка:** `ПОСТ /v1/audio/transcriptions`

**Режим запроса:** OpenAI-compatible конечная точка транскрипции

**Оплата:** $0.35 аудиочас

Audio Speech-to-Text Chinese Dialects

### [mimo-v2.5-asr](https://chinaapi.ai/ru/models/mimo-v2.5-asr/)

Распознавание речи (ASR) · Xiaomi

**Конечная точка:** `ПОСТ /v1/chat/completions`

**Режим запроса:** Завершение чата с полезной нагрузкой input_audio

**Оплата:** $0.074 аудиочас

Audio Speech-to-Text Multilingual Chinese Dialects Noise Robustness

### [mimo-v2.5-tts](https://chinaapi.ai/ru/models/mimo-v2.5-tts/)

Преобразование текста в речь (TTS) · Xiaomi

**Конечная точка:** `ПОСТ /v1/chat/completions`

**Режим запроса:** Завершение чата с сообщениями, а также настройка вывода звука.

**Оплата:** $0 на 10k символов

Ограниченное по времени бесплатное ценообразование на исходящие запросы; проверьте актуальные цены перед запуском в производство.

Audio Text-to-Speech Multilingual Style Control Built-in Voices

### [stepaudio-2.5-tts](https://chinaapi.ai/ru/models/stepaudio-2.5-tts/)

Преобразование текста в речь (TTS) · StepFun

**Конечная точка:** `ПОСТ /v1/audio/speech`

**Режим запроса:** OpenAI-compatible конечная точка речи

**Оплата:** $0.85 на 10k символов

Audio Text-to-Speech Contextual TTS Style Control Built-in Voices

### [glm-tts](https://chinaapi.ai/ru/models/glm-tts/)

Преобразование текста в речь (TTS) · Zhipu AI

**Конечная точка:** `ПОСТ /v1/audio/speech`

**Режим запроса:** OpenAI-compatible конечная точка речи

**Оплата:** $0.3077 на 10k символов

Audio Text-to-Speech Streaming Emotion Voice Control

### [qwen3-asr-flash](https://chinaapi.ai/ru/models/qwen3-asr-flash/)

Распознавание речи (ASR) · Alibaba

**Конечная точка:** `ПОСТ /v1/audio/transcriptions`

**Режим запроса:** OpenAI-compatible конечная точка транскрипции

**Оплата:** $0.1235 аудиочас

Audio Speech-to-Text Multilingual Emotion Recognition ITN

### [qwen3-tts-flash](https://chinaapi.ai/ru/models/qwen3-tts-flash/)

Преобразование текста в речь (TTS) · Alibaba

**Конечная точка:** `ПОСТ /v1/audio/speech`

**Режим запроса:** OpenAI-compatible конечная точка речи

**Оплата:** $0.1231 на 10k символов

Audio Text-to-Speech Multilingual Built-in Voices Streaming

### [speech-2.8-hd](https://chinaapi.ai/ru/models/speech-2.8-hd/)

Преобразование текста в речь (TTS) · MiniMax

**Конечная точка:** `ПОСТ /v1/audio/speech`

**Режим запроса:** OpenAI-compatible конечная точка речи

**Оплата:** $0.5385 на 10k символов

Audio Text-to-Speech High Fidelity Emotion Multilingual

### [speech-2.8-turbo](https://chinaapi.ai/ru/models/speech-2.8-turbo/)

Преобразование текста в речь (TTS) · MiniMax

**Конечная точка:** `ПОСТ /v1/audio/speech`

**Режим запроса:** OpenAI-compatible конечная точка речи

**Оплата:** $0.3077 на 10k символов

Audio Text-to-Speech Low Latency Emotion Multilingual

### [step-tts-2](https://chinaapi.ai/ru/models/step-tts-2/)

Преобразование текста в речь (TTS) · StepFun

**Конечная точка:** `ПОСТ /v1/audio/speech`

**Режим запроса:** OpenAI-compatible конечная точка речи

**Оплата:** $0.4 на 10k символов

Audio Text-to-Speech Voice Cloning Emotion Pronunciation Control

### [step-tts-mini](https://chinaapi.ai/ru/models/step-tts-mini/)

Преобразование текста в речь (TTS) · StepFun

**Конечная точка:** `ПОСТ /v1/audio/speech`

**Режим запроса:** OpenAI-compatible конечная точка речи

**Оплата:** $0.15 на 10k символов

Audio Text-to-Speech Multilingual Voice Cloning Style Control

### [stepaudio-2.5-asr](https://chinaapi.ai/ru/models/stepaudio-2.5-asr/)

Распознавание речи (ASR) · StepFun

**Конечная точка:** `ПОСТ /v1/audio/transcriptions`

**Режим запроса:** OpenAI-compatible конечная точка транскрипции

**Оплата:** $0.022 аудиочас

Audio Speech-to-Text Streaming Chinese and English ITN

## ASR для распознавания речи; TTS для голосового вывода.

### Транскрипция и понимание аудиозаписей

[stepaudio-2-asr-pro](https://chinaapi.ai/ru/models/stepaudio-2-asr-pro/): StepFun StepAudio 2 ASR Pro — распознавание речи на 32B параметров: вариант линейки StepFun ASR с упором на точность, тогда как stepaudio-2.5-asr ориентирован на скорость и стоимость. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

### Транскрипция и понимание аудиозаписей

[step-asr](https://chinaapi.ai/ru/models/step-asr/): StepFun step-asr — универсальное распознавание речи для китайского, английского и китайских диалектов: расшифровки, протоколы встреч, контроль качества звонков и голосовой поиск. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

### Транскрипция и понимание аудиозаписей

[step-asr-1.1](https://chinaapi.ai/ru/models/step-asr-1.1/): StepFun step-asr-1.1 — обновлённый универсальный распознаватель линейки step-asr для китайского, английского и китайских диалектов. Принимает файлы ogg, mp3 и wav; вывод расшифровки не тарифицируется.

### Транскрипция и понимание аудиозаписей

[mimo-v2.5-asr](https://chinaapi.ai/ru/models/mimo-v2.5-asr/): Xiaomi MiMo-V2.5-ASR — распознавание речи на китайском, английском языках, с переключением кодов, региональными диалектами, зашумленными записями, звуком на большом расстоянии, несколькими говорящими и текстами песен.

### Управляемый вывод голоса

[mimo-v2.5-tts](https://chinaapi.ai/ru/models/mimo-v2.5-tts/): Xiaomi MiMo-V2.5-TTS — выразительный многоязычный синтез речи со встроенными голосами, инструкциями по стилю речи на естественном языке, управлением эмоциями, темпом, тоном, диалектом и символикой.

### Вывод речи осуществляется по выделенному каналу.

[stepaudio-2.5-tts](https://chinaapi.ai/ru/models/stepaudio-2.5-tts/): StepAudio 2.5 TTS — контекстный синтез речи с встроенным управлением естественной речью, выразительной подачей, встроенными голосами и OpenAI-compatible аудиовыходом.

### Вывод речи осуществляется по выделенному каналу.

[glm-tts](https://chinaapi.ai/ru/models/glm-tts/): GLM-TTS — контекстно-зависимый синтез речи с выразительной подачей, потоковым выводом, быстрым первым аудиосигналом и элементами управления голосом, скоростью и громкостью.

### Транскрипция и понимание аудиозаписей

[qwen3-asr-flash](https://chinaapi.ai/ru/models/qwen3-asr-flash/): Qwen3-ASR-Flash — многоязычная транскрипция файлов с языковыми подсказками, инверсная нормализация текста, распознавание эмоций и OpenAI-compatible аудиовход.

### Вывод речи осуществляется по выделенному каналу.

[qwen3-tts-flash](https://chinaapi.ai/ru/models/qwen3-tts-flash/): Qwen3-TTS-Flash — многоязычный синтез речи с низкой задержкой, поддержкой ввода на разных языках, встроенными голосами, автоматическим сопоставлением языков и указанием символов.

### Вывод речи осуществляется по выделенному каналу.

[speech-2.8-hd](https://chinaapi.ai/ru/models/speech-2.8-hd/): MiniMax Speech 2.8 HD — высококачественный синтез речи с естественной передачей эмоций, улучшением речи, управлением голосом и поддержкой аудиоформатов.

### Вывод речи осуществляется по выделенному каналу.

[speech-2.8-turbo](https://chinaapi.ai/ru/models/speech-2.8-turbo/): MiniMax Speech 2.8 Turbo — синтез речи с упором на скорость, обеспечивающий естественный результат, управление эмоциями, улучшение речи и поддержку распространенных аудиоформатов.

### Вывод речи осуществляется по выделенному каналу.

[step-tts-2](https://chinaapi.ai/ru/models/step-tts-2/)Шаг TTS 2 — выразительный синтез речи с использованием официальных и клонированных голосов, регулировка скорости и громкости, сопоставление произношения и несколько форматов вывода.

### Вывод речи осуществляется по выделенному каналу.

[step-tts-mini](https://chinaapi.ai/ru/models/step-tts-mini/)Step TTS — экономичный экспрессивный синтез речи для китайского, английского, японского, кантонского и сычуаньского языков, с использованием официальных и клонированных голосов.

### Транскрипция и понимание аудиозаписей

[stepaudio-2.5-asr](https://chinaapi.ai/ru/models/stepaudio-2.5-asr/): StepAudio 2.5 ASR — модель потоковой транскрипции 4B для быстрого распознавания китайского и английского языков, нормализации ITN, субтитров, совещаний и голосовых агентов.

## OpenAI-compatible не означает наличие единого универсального аудиомаршрута.

Имена маршрутов и формат запросов следуют OpenAI-compatible шаблонам, но клиент должен передавать аудиополя, требуемые каждой моделью. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini используют /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr используют /v1/audio/transcriptions. mimo-v2.5-asr и mimo-v2.5-tts используют /v1/chat/completions с аудио-нагрузкой, специфичной для каждой модели.

## Скопируйте запрос, указав необходимую модель и способ транспортировки.

### stepaudio-2-asr-pro

Распознавание речи ( ASR ) посредством `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2-asr-pro" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr

Распознавание речи ( ASR ) посредством `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr-1.1

Распознавание речи ( ASR ) посредством `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr-1.1" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### mimo-v2.5-asr

Распознавание речи ( ASR ) посредством `/v1/chat/completions`

```
AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-asr",
    "messages": [{
      "role": "user",
      "content": [{
        "type": "input_audio",
        "input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
      }]
    }]
  }'
```

### mimo-v2.5-tts

Преобразование текста в речь ( TTS ) через `/v1/chat/completions`

```
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "messages": [
      {"role": "user", "content": "Natural, clear, and friendly delivery"},
      {"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
    ],
    "audio": {"format": "wav", "voice": "冰糖"}
  }' > response.json
```

### stepaudio-2.5-tts

Преобразование текста в речь ( TTS ) через `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-2.5-tts",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### glm-tts

Преобразование текста в речь ( TTS ) через `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "voice": "tongtong",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### qwen3-asr-flash

Распознавание речи ( ASR ) посредством `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### qwen3-tts-flash

Преобразование текста в речь ( TTS ) через `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "voice": "Cherry",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-hd

Преобразование текста в речь ( TTS ) через `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-turbo

Преобразование текста в речь ( TTS ) через `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-2

Преобразование текста в речь ( TTS ) через `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-mini

Преобразование текста в речь ( TTS ) через `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-mini",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### stepaudio-2.5-asr

Распознавание речи ( ASR ) посредством `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2.5-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

## Используют ли все речевые модели ChinaAPI одну и ту же аудиоточку доступа?

No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini используют /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr используют /v1/audio/transcriptions. mimo-v2.5-asr и mimo-v2.5-tts используют /v1/chat/completions с аудио-нагрузкой, специфичной для каждой модели.

## Как осуществляется оплата услуг речевых моделей?

stepaudio-2-asr-pro: $0.35 за час аудио; step-asr: $0.15 за час аудио; step-asr-1.1: $0.35 за час аудио; mimo-v2.5-asr: $0.074 за час аудио; mimo-v2.5-tts: $0 за 10k символов; stepaudio-2.5-tts: $0.85 за 10k символов; glm-tts: $0.3077 за 10k символов; qwen3-asr-flash: $0.1235 за час аудио; qwen3-tts-flash: $0.1231 за 10k символов; speech-2.8-hd: $0.5385 за 10k символов; speech-2.8-turbo: $0.3077 за 10k символов; step-tts-2: $0.4 за 10k символов; step-tts-mini: $0.15 за 10k символов; stepaudio-2.5-asr: $0.022 за час аудио. Отображаемая ставка на медиа может включать сервисную маржу, покрывающую тарификацию входа/выхода у провайдера, обработку платежей, риск чарджбэков и операционные расходы. Если маржа есть, она уже включена в отображаемую ставку и отдельно не добавляется. Эти значения рендерятся из каталога моделей, а не скопированы на эту страницу.

## Могу ли я использовать эти модели без учетной записи в материковом Китае?

Да. ChinaAPI предоставляет доступ без учетной записи или номера телефона в материковом Китае. Зарегистрируйтесь для получения ключа, а затем используйте точно указанный маршрут и полезную нагрузку для выбранной вами модели.

---

Markdown twin of https://chinaapi.ai/ru/speech-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
