输入
音频文件,或 base64 编码的 input_audio 载荷,具体取决于模型的 api_mode。
音频与语音能力中心
从准确的端点模式、按音频小时计的价格、输入、转写输出与限制等方面,对比转写与 ASR 模型。
契约
音频文件,或 base64 编码的 input_audio 载荷,具体取决于模型的 api_mode。
转写文本,或结构化的转写响应。
POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode
所列公开端点模式均为同步调用。请持久化保存转写结果,并显式处理被拒绝的文件格式。
支持的任务
转写
限制: 文件大小、时长、说话人分离、时间戳、方言覆盖范围和支持的格式,除非该模型明确列出,否则均视为未知。
匹配的模型目录
未知能力一律省略,绝不根据模型名称猜测。价格示例使用已同步的公开数据;价格仍以控制台的实时价格页为准。
StepFun StepAudio 2 ASR Pro——32B 参数的语音识别模型,是 StepFun ASR 产品线中准确率优先的选择,而 stepaudio-2.5-asr 是该产品线中速度与成本优先的选择。支持上传 ogg、mp3 与 wav 文件;转写输出不计费。
任务: 转写
端点: POST /v1/audio/transcriptions
费用示例: 1 音频小时 × $0.296296 = $0.296296。
Xiaomi MiMo-V2.5-ASR——语音识别模型,适用于中文、英文、语码转换、地方方言、嘈杂录音、远场音频、多说话人和歌词。
任务: 转写
端点: POST /v1/chat/completions
费用示例: 1 音频小时 × $0.074 = $0.074。
Qwen3-ASR-Flash——多语言文件转写,支持语言提示、逆文本规范化、情感识别和 OpenAI-compatible 音频输入。
任务: 转写
端点: POST /v1/audio/transcriptions
费用示例: 1 音频小时 × $0.126 = $0.126。
StepAudio 2.5 ASR——一款 4B MTP 流式转写模型,适用于快速中英文识别、ITN 规范化、字幕、会议和语音 Agent。
任务: 转写
端点: POST /v1/audio/transcriptions
费用示例: 1 音频小时 × $0.022 = $0.022。
计算 API 费用 · 生成 curl、Python 或 JavaScript 代码
来源与方法: 公开模型价格数据集,更新于 2026-09-28。局限已在上文说明;第三方说法仍附在引用它们的模型页面上。