<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: zh-cn/speech-api/index.html -->

# 面向 ASR 与语音合成的中国语音 API

> 通过 ChinaAPI 使用 11 个中国语音 API 模型进行 ASR 与语音合成。对比各模型的准确端点、计费单位、美元价格与能力，并获取可直接复制的请求。

- Canonical page: https://chinaapi.ai/zh-cn/speech-api/
- Human-readable page: https://chinaapi.ai/zh-cn/speech-api/
- Live pricing: https://dash.chinaapi.ai/models?lang=zh-cn&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-api

对比可通过一个 ChinaAPI key 调用的语音识别与语音合成模型。每个模型都保留其真实的请求路径。stepaudio-2.5-tts、glm-tts、qwen3-tts-flash、speech-2.8-hd、speech-2.8-turbo、step-tts-2 使用 /v1/audio/speech。stepaudio-2-asr-pro、qwen3-asr-flash、stepaudio-2.5-asr 使用 /v1/audio/transcriptions。mimo-v2.5-asr、mimo-v2.5-tts 使用 /v1/chat/completions，并采用各模型专用的音频载荷。

[免费开始 — 赠送 $2 额度](https://dash.chinaapi.ai/register?lang=zh-cn&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

[查看实时价格](https://dash.chinaapi.ai/models?lang=zh-cn&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

## 11 个语音模型，均由同一数据源生成

Model IDs、端点模式、计费单位、能力与展示价格均来自 `scripts/models-data.json`，其中的音频价格已与 ChinaAPI 网关对账。展示的媒体价格可能包含服务毛利，用于覆盖厂商的输入/输出计费、支付处理、拒付风险与运营成本。所有毛利均已包含在展示价格中，不会另行加收。上线生产环境前，请先查看实时价格。

### [stepaudio-2-asr-pro](https://chinaapi.ai/zh-cn/models/stepaudio-2-asr-pro/)

语音识别（ASR）· StepFun

**端点：** `POST /v1/audio/transcriptions`

**请求模式：** OpenAI-compatible 转写端点

**计费：** 每音频小时 $0.2963

Audio Speech-to-Text

### [mimo-v2.5-asr](https://chinaapi.ai/zh-cn/models/mimo-v2.5-asr/)

语音识别（ASR）· Xiaomi

**端点：** `POST /v1/chat/completions`

**请求模式：** 携带 input_audio 载荷的 Chat Completions

**计费：** 每音频小时 $0.074

Audio Speech-to-Text Multilingual Chinese Dialects Noise Robustness

### [mimo-v2.5-tts](https://chinaapi.ai/zh-cn/models/mimo-v2.5-tts/)

语音合成（TTS）· Xiaomi

**端点：** `POST /v1/chat/completions`

**请求模式：** 携带 messages 与音频输出配置的 Chat Completions

**计费：** 每 10k 字符 $0

上游价格限时免费；上线生产环境前，请先查看实时价格。

Audio Text-to-Speech Multilingual Style Control Built-in Voices

### [stepaudio-2.5-tts](https://chinaapi.ai/zh-cn/models/stepaudio-2.5-tts/)

语音合成（TTS）· StepFun

**端点：** `POST /v1/audio/speech`

**请求模式：** OpenAI-compatible 语音合成端点

**计费：** 每 10k 字符 $0.85

Audio Text-to-Speech Contextual TTS Style Control Built-in Voices

### [glm-tts](https://chinaapi.ai/zh-cn/models/glm-tts/)

语音合成（TTS）· Zhipu AI

**端点：** `POST /v1/audio/speech`

**请求模式：** OpenAI-compatible 语音合成端点

**计费：** 每 10k 字符 $0.35

Audio Text-to-Speech Streaming Emotion Voice Control

### [qwen3-asr-flash](https://chinaapi.ai/zh-cn/models/qwen3-asr-flash/)

语音识别（ASR）· Alibaba

**端点：** `POST /v1/audio/transcriptions`

**请求模式：** OpenAI-compatible 转写端点

**计费：** 每音频小时 $0.126

Audio Speech-to-Text Multilingual Emotion Recognition ITN

### [qwen3-tts-flash](https://chinaapi.ai/zh-cn/models/qwen3-tts-flash/)

语音合成（TTS）· Alibaba

**端点：** `POST /v1/audio/speech`

**请求模式：** OpenAI-compatible 语音合成端点

**计费：** 每 10k 字符 $0.11

Audio Text-to-Speech Multilingual Built-in Voices Streaming

### [speech-2.8-hd](https://chinaapi.ai/zh-cn/models/speech-2.8-hd/)

语音合成（TTS）· MiniMax

**端点：** `POST /v1/audio/speech`

**请求模式：** OpenAI-compatible 语音合成端点

**计费：** 每 10k 字符 $1

Audio Text-to-Speech High Fidelity Emotion Multilingual

### [speech-2.8-turbo](https://chinaapi.ai/zh-cn/models/speech-2.8-turbo/)

语音合成（TTS）· MiniMax

**端点：** `POST /v1/audio/speech`

**请求模式：** OpenAI-compatible 语音合成端点

**计费：** 每 10k 字符 $0.6

Audio Text-to-Speech Low Latency Emotion Multilingual

### [step-tts-2](https://chinaapi.ai/zh-cn/models/step-tts-2/)

语音合成（TTS）· StepFun

**端点：** `POST /v1/audio/speech`

**请求模式：** OpenAI-compatible 语音合成端点

**计费：** 每 10k 字符 $0.4148

Audio Text-to-Speech Voice Cloning Emotion Pronunciation Control

### [stepaudio-2.5-asr](https://chinaapi.ai/zh-cn/models/stepaudio-2.5-asr/)

语音识别（ASR）· StepFun

**端点：** `POST /v1/audio/transcriptions`

**请求模式：** OpenAI-compatible 转写端点

**计费：** 每音频小时 $0.022

Audio Speech-to-Text Streaming Chinese and English ITN

## ASR 用于音频理解，TTS 用于语音输出

### 转写与音频理解

[stepaudio-2-asr-pro](https://chinaapi.ai/zh-cn/models/stepaudio-2-asr-pro/)：StepFun StepAudio 2 ASR Pro——32B 参数的语音识别模型，是 StepFun ASR 系列中精度优先的选项，而 stepaudio-2.5-asr 是速度与成本优先的选项。支持上传 ogg、mp3 与 wav 文件；转写输出不计费。

### 转写与音频理解

[mimo-v2.5-asr](https://chinaapi.ai/zh-cn/models/mimo-v2.5-asr/)：Xiaomi MiMo-V2.5-ASR——面向中文、英文、语种混说、地方方言、嘈杂录音、远场音频、多说话人及歌词的语音识别。

### 可控的语音输出

[mimo-v2.5-tts](https://chinaapi.ai/zh-cn/models/mimo-v2.5-tts/)：Xiaomi MiMo-V2.5-TTS——富有表现力的多语种语音合成，提供内置音色、自然语言风格指令，以及情绪、语速、语气、方言和角色控制。

### 通过专用路由输出语音

[stepaudio-2.5-tts](https://chinaapi.ai/zh-cn/models/stepaudio-2.5-tts/)：StepAudio 2.5 TTS——结合上下文的语音合成，支持行内自然语言指令、富有表现力的演绎、内置音色，以及 OpenAI-compatible 音频输出。

### 通过专用路由输出语音

[glm-tts](https://chinaapi.ai/zh-cn/models/glm-tts/)：GLM-TTS——上下文感知的语音合成，支持富有表现力的演绎、流式输出、首包音频快速返回，以及音色、语速和音量控制。

### 转写与音频理解

[qwen3-asr-flash](https://chinaapi.ai/zh-cn/models/qwen3-asr-flash/)：Qwen3-ASR-Flash——多语种文件转写，支持语种提示、逆文本正则化、情绪识别，以及 OpenAI-compatible 音频输入。

### 通过专用路由输出语音

[qwen3-tts-flash](https://chinaapi.ai/zh-cn/models/qwen3-tts-flash/)：Qwen3-TTS-Flash——低延迟的多语种语音合成，支持混合语种输入、内置音色、自动语种匹配，并按字符计费。

### 通过专用路由输出语音

[speech-2.8-hd](https://chinaapi.ai/zh-cn/models/speech-2.8-hd/)：MiniMax Speech 2.8 HD——高保真语音合成，具备自然的情感表达、语言增强与音色控制，并支持生产级音频格式。

### 通过专用路由输出语音

[speech-2.8-turbo](https://chinaapi.ai/zh-cn/models/speech-2.8-turbo/)：MiniMax Speech 2.8 Turbo——注重速度的语音合成，输出自然，支持情绪控制、语言增强，以及常见的生产级音频格式。

### 通过专用路由输出语音

[step-tts-2](https://chinaapi.ai/zh-cn/models/step-tts-2/)：Step TTS 2——富有表现力的语音合成，支持官方音色与克隆音色、语速与音量控制、发音映射，以及多种输出格式。

### 转写与音频理解

[stepaudio-2.5-asr](https://chinaapi.ai/zh-cn/models/stepaudio-2.5-asr/)：StepAudio 2.5 ASR——4B MTP 流式转写模型，适用于快速中英文识别、ITN 规范化、字幕、会议和语音 Agent。

## OpenAI-compatible 并不意味着只有一个通用音频路由

路由名称与请求封装遵循 OpenAI-compatible 模式，但客户端必须发送每个模型所要求的音频字段。stepaudio-2.5-tts、glm-tts、qwen3-tts-flash、speech-2.8-hd、speech-2.8-turbo、step-tts-2 使用 /v1/audio/speech。stepaudio-2-asr-pro、qwen3-asr-flash、stepaudio-2.5-asr 使用 /v1/audio/transcriptions。mimo-v2.5-asr、mimo-v2.5-tts 使用 /v1/chat/completions，并采用各模型专用的音频载荷。

## 按所需的模型与传输方式复制请求

### stepaudio-2-asr-pro

语音识别（ASR），使用 `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2-asr-pro" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### mimo-v2.5-asr

语音识别（ASR），使用 `/v1/chat/completions`

```
AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-asr",
    "messages": [{
      "role": "user",
      "content": [{
        "type": "input_audio",
        "input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
      }]
    }]
  }'
```

### mimo-v2.5-tts

语音合成（TTS），使用 `/v1/chat/completions`

```
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "messages": [
      {"role": "user", "content": "Natural, clear, and friendly delivery"},
      {"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
    ],
    "audio": {"format": "wav", "voice": "冰糖"}
  }' > response.json
```

### stepaudio-2.5-tts

语音合成（TTS），使用 `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-2.5-tts",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### glm-tts

语音合成（TTS），使用 `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "voice": "tongtong",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### qwen3-asr-flash

语音识别（ASR），使用 `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### qwen3-tts-flash

语音合成（TTS），使用 `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "voice": "Cherry",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-hd

语音合成（TTS），使用 `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-turbo

语音合成（TTS），使用 `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-2

语音合成（TTS），使用 `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### stepaudio-2.5-asr

语音识别（ASR），使用 `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2.5-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

## ChinaAPI 的所有语音模型都使用同一个音频端点吗？

不是。stepaudio-2.5-tts、glm-tts、qwen3-tts-flash、speech-2.8-hd、speech-2.8-turbo、step-tts-2 使用 /v1/audio/speech。stepaudio-2-asr-pro、qwen3-asr-flash、stepaudio-2.5-asr 使用 /v1/audio/transcriptions。mimo-v2.5-asr、mimo-v2.5-tts 使用 /v1/chat/completions，并采用各模型专用的音频载荷。

## 语音模型如何计费？

stepaudio-2-asr-pro：每音频小时 $0.2963；mimo-v2.5-asr：每音频小时 $0.074；mimo-v2.5-tts：每 10k 字符 $0；stepaudio-2.5-tts：每 10k 字符 $0.85；glm-tts：每 10k 字符 $0.35；qwen3-asr-flash：每音频小时 $0.126；qwen3-tts-flash：每 10k 字符 $0.11；speech-2.8-hd：每 10k 字符 $1；speech-2.8-turbo：每 10k 字符 $0.6；step-tts-2：每 10k 字符 $0.4148；stepaudio-2.5-asr：每音频小时 $0.022。展示的媒体价格可能包含服务毛利，用于覆盖厂商的输入/输出计费、支付处理、拒付风险与运营成本。所有毛利均已包含在展示价格中，不会另行加收。这些数值由模型目录渲染生成，而非手动复制到本页。

## 没有中国大陆账号，也能使用这些模型吗？

可以。通过 ChinaAPI 接入无需中国大陆账号或手机号。注册获取 key，然后按所选模型列出的准确路由和请求体发起调用。

---

Markdown twin of https://chinaapi.ai/zh-cn/speech-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
