音频与语音能力中心

语音识别与转写 API

从准确的端点模式、按音频小时计的价格、输入、转写输出与限制等方面,对比转写与 ASR 模型。

契约

输入、输出与生命周期

输入

音频文件,或 base64 编码的 input_audio 载荷,具体取决于模型的 api_mode。

输出

转写文本,或结构化的转写响应。

端点

POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode

生命周期

所列公开端点模式均为同步调用。请持久化保存转写结果,并显式处理被拒绝的文件格式。

支持的任务

每项任务一个定义

转写

限制: 文件大小、时长、说话人分离、时间戳、方言覆盖范围和支持的格式,除非该模型明确列出,否则均视为未知。

匹配的模型目录

4 个模型带有明确的元数据

未知能力一律省略,绝不根据模型名称猜测。价格示例使用已同步的公开数据;价格仍以控制台的实时价格页为准。

stepaudio-2-asr-pro

StepFun StepAudio 2 ASR Pro——32B 参数的语音识别模型,是 StepFun ASR 产品线中准确率优先的选择,而 stepaudio-2.5-asr 是该产品线中速度与成本优先的选择。支持上传 ogg、mp3 与 wav 文件;转写输出不计费。

任务: 转写

端点: POST /v1/audio/transcriptions

费用示例: 1 音频小时 × $0.296296 = $0.296296。

mimo-v2.5-asr

Xiaomi MiMo-V2.5-ASR——语音识别模型,适用于中文、英文、语码转换、地方方言、嘈杂录音、远场音频、多说话人和歌词。

任务: 转写

端点: POST /v1/chat/completions

费用示例: 1 音频小时 × $0.074 = $0.074。

qwen3-asr-flash

Qwen3-ASR-Flash——多语言文件转写,支持语言提示、逆文本规范化、情感识别和 OpenAI-compatible 音频输入。

任务: 转写

端点: POST /v1/audio/transcriptions

费用示例: 1 音频小时 × $0.126 = $0.126。

stepaudio-2.5-asr

StepAudio 2.5 ASR——一款 4B MTP 流式转写模型,适用于快速中英文识别、ITN 规范化、字幕、会议和语音 Agent。

任务: 转写

端点: POST /v1/audio/transcriptions

费用示例: 1 音频小时 × $0.022 = $0.022。

注册前先试跑或估算

计算 API 费用 · 生成 curl、Python 或 JavaScript 代码

来源与方法: 公开模型价格数据集,更新于 2026-09-28。局限已在上文说明;第三方说法仍附在引用它们的模型页面上。