stepaudio-2-asr-pro
语音识别(ASR)· StepFun
端点: POST /v1/audio/transcriptions
请求模式: OpenAI-compatible 转写端点
计费: 每音频小时 $0.2963
中国语音 API 目录
对比可通过一个 ChinaAPI key 调用的语音识别与语音合成模型。每个模型都保留其真实的请求路径。stepaudio-2.5-tts、glm-tts、qwen3-tts-flash、speech-2.8-hd、speech-2.8-turbo、step-tts-2 使用 /v1/audio/speech。stepaudio-2-asr-pro、qwen3-asr-flash、stepaudio-2.5-asr 使用 /v1/audio/transcriptions。mimo-v2.5-asr、mimo-v2.5-tts 使用 /v1/chat/completions,并采用各模型专用的音频载荷。
实时目录
Model IDs、端点模式、计费单位、能力与展示价格均来自 scripts/models-data.json,其中的音频价格已与 ChinaAPI 网关对账。展示的媒体价格可能包含服务毛利,用于覆盖厂商的输入/输出计费、支付处理、拒付风险与运营成本。所有毛利均已包含在展示价格中,不会另行加收。上线生产环境前,请先查看实时价格。
语音识别(ASR)· StepFun
端点: POST /v1/audio/transcriptions
请求模式: OpenAI-compatible 转写端点
计费: 每音频小时 $0.2963
语音识别(ASR)· Xiaomi
端点: POST /v1/chat/completions
请求模式: 携带 input_audio 载荷的 Chat Completions
计费: 每音频小时 $0.074
语音合成(TTS)· Xiaomi
端点: POST /v1/chat/completions
请求模式: 携带 messages 与音频输出配置的 Chat Completions
计费: 每 10k 字符 $0
上游价格限时免费;上线生产环境前,请先查看实时价格。
语音合成(TTS)· StepFun
端点: POST /v1/audio/speech
请求模式: OpenAI-compatible 语音合成端点
计费: 每 10k 字符 $0.85
语音合成(TTS)· Zhipu AI
端点: POST /v1/audio/speech
请求模式: OpenAI-compatible 语音合成端点
计费: 每 10k 字符 $0.35
语音识别(ASR)· Alibaba
端点: POST /v1/audio/transcriptions
请求模式: OpenAI-compatible 转写端点
计费: 每音频小时 $0.126
语音合成(TTS)· Alibaba
端点: POST /v1/audio/speech
请求模式: OpenAI-compatible 语音合成端点
计费: 每 10k 字符 $0.11
语音合成(TTS)· MiniMax
端点: POST /v1/audio/speech
请求模式: OpenAI-compatible 语音合成端点
计费: 每 10k 字符 $1
语音合成(TTS)· MiniMax
端点: POST /v1/audio/speech
请求模式: OpenAI-compatible 语音合成端点
计费: 每 10k 字符 $0.6
语音合成(TTS)· StepFun
端点: POST /v1/audio/speech
请求模式: OpenAI-compatible 语音合成端点
计费: 每 10k 字符 $0.4148
语音识别(ASR)· StepFun
端点: POST /v1/audio/transcriptions
请求模式: OpenAI-compatible 转写端点
计费: 每音频小时 $0.022
按工作负载选择
stepaudio-2-asr-pro:StepFun StepAudio 2 ASR Pro——32B 参数的语音识别模型,是 StepFun ASR 系列中精度优先的选项,而 stepaudio-2.5-asr 是速度与成本优先的选项。支持上传 ogg、mp3 与 wav 文件;转写输出不计费。
mimo-v2.5-asr:Xiaomi MiMo-V2.5-ASR——面向中文、英文、语种混说、地方方言、嘈杂录音、远场音频、多说话人及歌词的语音识别。
mimo-v2.5-tts:Xiaomi MiMo-V2.5-TTS——富有表现力的多语种语音合成,提供内置音色、自然语言风格指令,以及情绪、语速、语气、方言和角色控制。
stepaudio-2.5-tts:StepAudio 2.5 TTS——结合上下文的语音合成,支持行内自然语言指令、富有表现力的演绎、内置音色,以及 OpenAI-compatible 音频输出。
glm-tts:GLM-TTS——上下文感知的语音合成,支持富有表现力的演绎、流式输出、首包音频快速返回,以及音色、语速和音量控制。
qwen3-asr-flash:Qwen3-ASR-Flash——多语种文件转写,支持语种提示、逆文本正则化、情绪识别,以及 OpenAI-compatible 音频输入。
qwen3-tts-flash:Qwen3-TTS-Flash——低延迟的多语种语音合成,支持混合语种输入、内置音色、自动语种匹配,并按字符计费。
speech-2.8-hd:MiniMax Speech 2.8 HD——高保真语音合成,具备自然的情感表达、语言增强与音色控制,并支持生产级音频格式。
speech-2.8-turbo:MiniMax Speech 2.8 Turbo——注重速度的语音合成,输出自然,支持情绪控制、语言增强,以及常见的生产级音频格式。
step-tts-2:Step TTS 2——富有表现力的语音合成,支持官方音色与克隆音色、语速与音量控制、发音映射,以及多种输出格式。
stepaudio-2.5-asr:StepAudio 2.5 ASR——4B MTP 流式转写模型,适用于快速中英文识别、ITN 规范化、字幕、会议和语音 Agent。
兼容边界
路由名称与请求封装遵循 OpenAI-compatible 模式,但客户端必须发送每个模型所要求的音频字段。stepaudio-2.5-tts、glm-tts、qwen3-tts-flash、speech-2.8-hd、speech-2.8-turbo、step-tts-2 使用 /v1/audio/speech。stepaudio-2-asr-pro、qwen3-asr-flash、stepaudio-2.5-asr 使用 /v1/audio/transcriptions。mimo-v2.5-asr、mimo-v2.5-tts 使用 /v1/chat/completions,并采用各模型专用的音频载荷。
快速开始
语音识别(ASR),使用 /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=stepaudio-2-asr-pro" \
-F "[email protected]" \
-F "response_format=json"
语音识别(ASR),使用 /v1/chat/completions
AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.5-asr",
"messages": [{
"role": "user",
"content": [{
"type": "input_audio",
"input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
}]
}]
}'
语音合成(TTS),使用 /v1/chat/completions
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.5-tts",
"messages": [
{"role": "user", "content": "Natural, clear, and friendly delivery"},
{"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
],
"audio": {"format": "wav", "voice": "冰糖"}
}' > response.json
语音合成(TTS),使用 /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2.5-tts",
"voice": "cixingnansheng",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
语音合成(TTS),使用 /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-tts",
"voice": "tongtong",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
语音识别(ASR),使用 /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=qwen3-asr-flash" \
-F "[email protected]" \
-F "response_format=json"
语音合成(TTS),使用 /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-tts-flash",
"voice": "Cherry",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
语音合成(TTS),使用 /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "speech-2.8-hd",
"voice": "Chinese (Mandarin)_Warm_Bestie",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
语音合成(TTS),使用 /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "speech-2.8-turbo",
"voice": "Chinese (Mandarin)_Warm_Bestie",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
语音合成(TTS),使用 /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-2",
"voice": "cixingnansheng",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
语音识别(ASR),使用 /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=stepaudio-2.5-asr" \
-F "[email protected]" \
-F "response_format=json"
不是。stepaudio-2.5-tts、glm-tts、qwen3-tts-flash、speech-2.8-hd、speech-2.8-turbo、step-tts-2 使用 /v1/audio/speech。stepaudio-2-asr-pro、qwen3-asr-flash、stepaudio-2.5-asr 使用 /v1/audio/transcriptions。mimo-v2.5-asr、mimo-v2.5-tts 使用 /v1/chat/completions,并采用各模型专用的音频载荷。
stepaudio-2-asr-pro:每音频小时 $0.2963;mimo-v2.5-asr:每音频小时 $0.074;mimo-v2.5-tts:每 10k 字符 $0;stepaudio-2.5-tts:每 10k 字符 $0.85;glm-tts:每 10k 字符 $0.35;qwen3-asr-flash:每音频小时 $0.126;qwen3-tts-flash:每 10k 字符 $0.11;speech-2.8-hd:每 10k 字符 $1;speech-2.8-turbo:每 10k 字符 $0.6;step-tts-2:每 10k 字符 $0.4148;stepaudio-2.5-asr:每音频小时 $0.022。展示的媒体价格可能包含服务毛利,用于覆盖厂商的输入/输出计费、支付处理、拒付风险与运营成本。所有毛利均已包含在展示价格中,不会另行加收。这些数值由模型目录渲染生成,而非手动复制到本页。
可以。通过 ChinaAPI 接入无需中国大陆账号或手机号。注册获取 key,然后按所选模型列出的准确路由和请求体发起调用。