<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: zh-cn/speech-to-text-api/index.html -->

# 语音识别与转写 API

> 从准确的端点模式、按音频小时计的价格、输入、转写输出与限制等方面，对比转写与 ASR 模型。

- Canonical page: https://chinaapi.ai/zh-cn/speech-to-text-api/
- Human-readable page: https://chinaapi.ai/zh-cn/speech-to-text-api/
- Live pricing: https://dash.chinaapi.ai/models?lang=zh-cn&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-to-text-api

从准确的端点模式、按音频小时计的价格、输入、转写输出与限制等方面，对比转写与 ASR 模型。

[试用 stepaudio-2-asr-pro](https://dash.chinaapi.ai/start?intent=playground&destination=%2Fconsole%2Fplayground&task=transcription&model=stepaudio-2-asr-pro&lang=zh-cn&utm_source=chinaapi&utm_medium=capability&utm_campaign=speech-to-text-api)

[生成请求](https://chinaapi.ai/tools/api-request-generator/)

## 输入、输出与生命周期

### 输入

音频文件，或 base64 编码的 input_audio 载荷，具体取决于模型的 api_mode。

### 输出

转写文本，或结构化的转写响应。

### 端点

`POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode`

### 生命周期

所列公开端点模式均为同步调用。请持久化保存转写结果，并显式处理被拒绝的文件格式。

## 每项任务一个定义

转写

**限制：** 文件大小、时长、说话人分离、时间戳、方言覆盖范围和支持的格式，除非该模型明确列出，否则均视为未知。

## 4 个模型带有明确的元数据

未知能力一律省略，绝不根据模型名称猜测。价格示例使用已同步的公开数据；价格仍以控制台的实时价格页为准。

### [stepaudio-2-asr-pro](https://chinaapi.ai/zh-cn/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro——32B 参数的语音识别模型，是 StepFun ASR 产品线中准确率优先的选择，而 stepaudio-2.5-asr 是该产品线中速度与成本优先的选择。支持上传 ogg、mp3 与 wav 文件；转写输出不计费。

**任务：** 转写

**端点：** `POST /v1/audio/transcriptions`

**费用示例：** 1 音频小时 × $0.296296 = $0.296296。

### [mimo-v2.5-asr](https://chinaapi.ai/zh-cn/models/mimo-v2.5-asr/)

Xiaomi MiMo-V2.5-ASR——语音识别模型，适用于中文、英文、语码转换、地方方言、嘈杂录音、远场音频、多说话人和歌词。

**任务：** 转写

**端点：** `POST /v1/chat/completions`

**费用示例：** 1 音频小时 × $0.074 = $0.074。

### [qwen3-asr-flash](https://chinaapi.ai/zh-cn/models/qwen3-asr-flash/)

Qwen3-ASR-Flash——多语言文件转写，支持语言提示、逆文本规范化、情感识别和 OpenAI-compatible 音频输入。

**任务：** 转写

**端点：** `POST /v1/audio/transcriptions`

**费用示例：** 1 音频小时 × $0.126 = $0.126。

### [stepaudio-2.5-asr](https://chinaapi.ai/zh-cn/models/stepaudio-2.5-asr/)

StepAudio 2.5 ASR——一款 4B MTP 流式转写模型，适用于快速中英文识别、ITN 规范化、字幕、会议和语音 Agent。

**任务：** 转写

**端点：** `POST /v1/audio/transcriptions`

**费用示例：** 1 音频小时 × $0.022 = $0.022。

## 注册前先试跑或估算

[计算 API 费用](https://chinaapi.ai/tools/api-cost-calculator/) · [生成 curl、Python 或 JavaScript 代码](https://chinaapi.ai/tools/api-request-generator/)

来源与方法： [公开模型价格数据集](https://chinaapi.ai/zh-cn/data/model-pricing/)，更新于 2026-09-28。局限已在上文说明；第三方说法仍附在引用它们的模型页面上。

---

Markdown twin of https://chinaapi.ai/zh-cn/speech-to-text-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
