<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: zh-cn/audio-api/index.html -->

# 音频 API：音频理解与语音到语音的基础组件

> 按已验证的音频理解、ASR 和 TTS 端点模式调用，而不是把所有语音模型都视为可以互换。

- Canonical page: https://chinaapi.ai/zh-cn/audio-api/
- Human-readable page: https://chinaapi.ai/zh-cn/audio-api/
- Live pricing: https://dash.chinaapi.ai/models?lang=zh-cn&utm_source=chinaapi&utm_medium=markdown&utm_campaign=audio-api

按已验证的音频理解、ASR 和 TTS 端点模式调用，而不是把所有语音模型都视为可以互换。

[试用 stepaudio-2.5-chat](https://dash.chinaapi.ai/start?intent=playground&destination=%2Fconsole%2Fplayground&task=audio-understanding&model=stepaudio-2.5-chat&lang=zh-cn&utm_source=chinaapi&utm_medium=capability&utm_campaign=audio-api)

[生成请求](https://chinaapi.ai/tools/api-request-generator/)

## 输入、输出与生命周期

### 输入

音频（用于理解/转写）或文本（用于合成），并使用所选模型确切的 api_mode。

### 输出

文本分析/转写稿，或生成的音频；除非目录元数据明确说明，否则并不意味着可以直接得到语音到语音的结果。

### 端点

`Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech`

### 生命周期

所列音频端点均为同步调用；语音到语音工作流是先做转写或音频理解，再串接一次单独的 TTS 请求。

## 每项任务一个定义

音频理解、转写、语音合成

**限制：** TTS 或 ASR 标签并不能证明模型支持直接音频理解、声音克隆、说话人分离或语音到语音。

## 12 个模型带有明确的元数据

未知能力一律省略，绝不根据模型名称猜测。价格示例使用已同步的公开数据；价格仍以控制台的实时价格页为准。

### [stepaudio-2-asr-pro](https://chinaapi.ai/zh-cn/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro——32B 参数的语音识别模型，是 StepFun ASR 产品线中准确率优先的选择，而 stepaudio-2.5-asr 是该产品线中速度与成本优先的选择。支持上传 ogg、mp3 与 wav 文件；转写输出不计费。

**任务：** 转写

**端点：** `POST /v1/audio/transcriptions`

**费用示例：** 1 音频小时 × $0.296296 = $0.296296。

### [stepaudio-2.5-chat](https://chinaapi.ai/zh-cn/models/stepaudio-2.5-chat/)

StepFun StepAudio 2.5 Chat：端到端语音理解模型，接收音频或文本输入并返回文本，直接从波形本身而非转写文本中读取犹豫、笑声等副语言信号。支持定制人设，涵盖角色性格、说话习惯和情绪范围；音频以 input_audio 内容片段的形式在 chat completions 中传入。如需语音回复，请使用 TTS 模型。

**任务：** 音频理解

**端点：** `POST /v1/chat/completions`

**费用示例：** 按已同步的费率，1,000 输入 + 500 输出 tokens ≈ $0.00325。

### [mimo-v2.5-asr](https://chinaapi.ai/zh-cn/models/mimo-v2.5-asr/)

Xiaomi MiMo-V2.5-ASR——语音识别模型，适用于中文、英文、语码转换、地方方言、嘈杂录音、远场音频、多说话人和歌词。

**任务：** 转写

**端点：** `POST /v1/chat/completions`

**费用示例：** 1 音频小时 × $0.074 = $0.074。

### [mimo-v2.5-tts](https://chinaapi.ai/zh-cn/models/mimo-v2.5-tts/)

Xiaomi MiMo-V2.5-TTS——富有表现力的多语言语音合成，提供内置音色和自然语言风格指令，可控制情感、语速、语气、方言和角色。

**任务：** 语音合成

**端点：** `POST /v1/chat/completions`

**费用示例：** 1 个 10k 字符单位 × $0 = $0。

### [stepaudio-2.5-tts](https://chinaapi.ai/zh-cn/models/stepaudio-2.5-tts/)

StepAudio 2.5 TTS——结合上下文的语音合成，支持在文本中内嵌自然语言指令，演绎富有表现力，提供内置音色和 OpenAI-compatible 音频输出。

**任务：** 语音合成、声音克隆

**端点：** `POST /v1/audio/speech`

**费用示例：** 1 个 10k 字符单位 × $0.85 = $0.85。

### [glm-tts](https://chinaapi.ai/zh-cn/models/glm-tts/)

GLM-TTS——上下文感知的语音合成，演绎富有表现力，支持流式输出、首段音频快速返回，并可控制音色、语速和音量。

**任务：** 语音合成

**端点：** `POST /v1/audio/speech`

**费用示例：** 1 个 10k 字符单位 × $0.35 = $0.35。

### [qwen3-asr-flash](https://chinaapi.ai/zh-cn/models/qwen3-asr-flash/)

Qwen3-ASR-Flash——多语言文件转写，支持语言提示、逆文本规范化、情感识别和 OpenAI-compatible 音频输入。

**任务：** 转写

**端点：** `POST /v1/audio/transcriptions`

**费用示例：** 1 音频小时 × $0.126 = $0.126。

### [qwen3-tts-flash](https://chinaapi.ai/zh-cn/models/qwen3-tts-flash/)

Qwen3-TTS-Flash——低延迟的多语言语音合成，支持混合语言输入、内置音色和自动语言匹配，按字符计费。

**任务：** 语音合成

**端点：** `POST /v1/audio/speech`

**费用示例：** 1 个 10k 字符单位 × $0.11 = $0.11。

### [speech-2.8-hd](https://chinaapi.ai/zh-cn/models/speech-2.8-hd/)

MiniMax Speech 2.8 HD——高保真语音合成，情感演绎自然，支持语言增强、音色控制和生产级音频格式。

**任务：** 语音合成

**端点：** `POST /v1/audio/speech`

**费用示例：** 1 个 10k 字符单位 × $1 = $1。

### [speech-2.8-turbo](https://chinaapi.ai/zh-cn/models/speech-2.8-turbo/)

MiniMax Speech 2.8 Turbo——侧重速度的语音合成，输出自然，支持情感控制、语言增强和常用的生产级音频格式。

**任务：** 语音合成

**端点：** `POST /v1/audio/speech`

**费用示例：** 1 个 10k 字符单位 × $0.6 = $0.6。

### [step-tts-2](https://chinaapi.ai/zh-cn/models/step-tts-2/)

Step TTS 2——富有表现力的语音合成，支持官方音色与克隆音色、语速和音量控制、发音映射以及多种输出格式。

**任务：** 语音合成、声音克隆

**端点：** `POST /v1/audio/speech`

**费用示例：** 1 个 10k 字符单位 × $0.414815 = $0.414815。

### [stepaudio-2.5-asr](https://chinaapi.ai/zh-cn/models/stepaudio-2.5-asr/)

StepAudio 2.5 ASR——一款 4B MTP 流式转写模型，适用于快速中英文识别、ITN 规范化、字幕、会议和语音 Agent。

**任务：** 转写

**端点：** `POST /v1/audio/transcriptions`

**费用示例：** 1 音频小时 × $0.022 = $0.022。

## 注册前先试跑或估算

[计算 API 费用](https://chinaapi.ai/tools/api-cost-calculator/) · [生成 curl、Python 或 JavaScript 代码](https://chinaapi.ai/tools/api-request-generator/)

来源与方法： [公开模型价格数据集](https://chinaapi.ai/zh-cn/data/model-pricing/)，更新于 2026-09-28。局限已在上文说明；第三方说法仍附在引用它们的模型页面上。

---

Markdown twin of https://chinaapi.ai/zh-cn/audio-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
