输入
音频(用于理解/转写)或文本(用于合成),并使用所选模型确切的 api_mode。
音频与语音能力中心
按已验证的音频理解、ASR 和 TTS 端点模式调用,而不是把所有语音模型都视为可以互换。
契约
音频(用于理解/转写)或文本(用于合成),并使用所选模型确切的 api_mode。
文本分析/转写稿,或生成的音频;除非目录元数据明确说明,否则并不意味着可以直接得到语音到语音的结果。
Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech
所列音频端点均为同步调用;语音到语音工作流是先做转写或音频理解,再串接一次单独的 TTS 请求。
支持的任务
音频理解、转写、语音合成
限制: TTS 或 ASR 标签并不能证明模型支持直接音频理解、声音克隆、说话人分离或语音到语音。
匹配的模型目录
未知能力一律省略,绝不根据模型名称猜测。价格示例使用已同步的公开数据;价格仍以控制台的实时价格页为准。
StepFun StepAudio 2 ASR Pro——32B 参数的语音识别模型,是 StepFun ASR 产品线中准确率优先的选择,而 stepaudio-2.5-asr 是该产品线中速度与成本优先的选择。支持上传 ogg、mp3 与 wav 文件;转写输出不计费。
任务: 转写
端点: POST /v1/audio/transcriptions
费用示例: 1 音频小时 × $0.296296 = $0.296296。
StepFun StepAudio 2.5 Chat:端到端语音理解模型,接收音频或文本输入并返回文本,直接从波形本身而非转写文本中读取犹豫、笑声等副语言信号。支持定制人设,涵盖角色性格、说话习惯和情绪范围;音频以 input_audio 内容片段的形式在 chat completions 中传入。如需语音回复,请使用 TTS 模型。
任务: 音频理解
端点: POST /v1/chat/completions
费用示例: 按已同步的费率,1,000 输入 + 500 输出 tokens ≈ $0.00325。
Xiaomi MiMo-V2.5-ASR——语音识别模型,适用于中文、英文、语码转换、地方方言、嘈杂录音、远场音频、多说话人和歌词。
任务: 转写
端点: POST /v1/chat/completions
费用示例: 1 音频小时 × $0.074 = $0.074。
Xiaomi MiMo-V2.5-TTS——富有表现力的多语言语音合成,提供内置音色和自然语言风格指令,可控制情感、语速、语气、方言和角色。
任务: 语音合成
端点: POST /v1/chat/completions
费用示例: 1 个 10k 字符单位 × $0 = $0。
StepAudio 2.5 TTS——结合上下文的语音合成,支持在文本中内嵌自然语言指令,演绎富有表现力,提供内置音色和 OpenAI-compatible 音频输出。
任务: 语音合成、声音克隆
端点: POST /v1/audio/speech
费用示例: 1 个 10k 字符单位 × $0.85 = $0.85。
GLM-TTS——上下文感知的语音合成,演绎富有表现力,支持流式输出、首段音频快速返回,并可控制音色、语速和音量。
任务: 语音合成
端点: POST /v1/audio/speech
费用示例: 1 个 10k 字符单位 × $0.35 = $0.35。
Qwen3-ASR-Flash——多语言文件转写,支持语言提示、逆文本规范化、情感识别和 OpenAI-compatible 音频输入。
任务: 转写
端点: POST /v1/audio/transcriptions
费用示例: 1 音频小时 × $0.126 = $0.126。
Qwen3-TTS-Flash——低延迟的多语言语音合成,支持混合语言输入、内置音色和自动语言匹配,按字符计费。
任务: 语音合成
端点: POST /v1/audio/speech
费用示例: 1 个 10k 字符单位 × $0.11 = $0.11。
MiniMax Speech 2.8 HD——高保真语音合成,情感演绎自然,支持语言增强、音色控制和生产级音频格式。
任务: 语音合成
端点: POST /v1/audio/speech
费用示例: 1 个 10k 字符单位 × $1 = $1。
MiniMax Speech 2.8 Turbo——侧重速度的语音合成,输出自然,支持情感控制、语言增强和常用的生产级音频格式。
任务: 语音合成
端点: POST /v1/audio/speech
费用示例: 1 个 10k 字符单位 × $0.6 = $0.6。
Step TTS 2——富有表现力的语音合成,支持官方音色与克隆音色、语速和音量控制、发音映射以及多种输出格式。
任务: 语音合成、声音克隆
端点: POST /v1/audio/speech
费用示例: 1 个 10k 字符单位 × $0.414815 = $0.414815。
StepAudio 2.5 ASR——一款 4B MTP 流式转写模型,适用于快速中英文识别、ITN 规范化、字幕、会议和语音 Agent。
任务: 转写
端点: POST /v1/audio/transcriptions
费用示例: 1 音频小时 × $0.022 = $0.022。
计算 API 费用 · 生成 curl、Python 或 JavaScript 代码
来源与方法: 公开模型价格数据集,更新于 2026-09-28。局限已在上文说明;第三方说法仍附在引用它们的模型页面上。