中国语音 API 目录

面向 ASR 与语音合成的中国语音 API

对比可通过一个 ChinaAPI key 调用的语音识别与语音合成模型。每个模型都保留其真实的请求路径。stepaudio-2.5-tts、glm-tts、qwen3-tts-flash、speech-2.8-hd、speech-2.8-turbo、step-tts-2 使用 /v1/audio/speech。stepaudio-2-asr-pro、qwen3-asr-flash、stepaudio-2.5-asr 使用 /v1/audio/transcriptions。mimo-v2.5-asr、mimo-v2.5-tts 使用 /v1/chat/completions,并采用各模型专用的音频载荷。

实时目录

11 个语音模型,均由同一数据源生成

Model IDs、端点模式、计费单位、能力与展示价格均来自 scripts/models-data.json,其中的音频价格已与 ChinaAPI 网关对账。展示的媒体价格可能包含服务毛利,用于覆盖厂商的输入/输出计费、支付处理、拒付风险与运营成本。所有毛利均已包含在展示价格中,不会另行加收。上线生产环境前,请先查看实时价格。

stepaudio-2-asr-pro

语音识别(ASR)· StepFun

端点: POST /v1/audio/transcriptions

请求模式: OpenAI-compatible 转写端点

计费: 每音频小时 $0.2963

AudioSpeech-to-Text

mimo-v2.5-asr

语音识别(ASR)· Xiaomi

端点: POST /v1/chat/completions

请求模式: 携带 input_audio 载荷的 Chat Completions

计费: 每音频小时 $0.074

AudioSpeech-to-TextMultilingualChinese DialectsNoise Robustness

mimo-v2.5-tts

语音合成(TTS)· Xiaomi

端点: POST /v1/chat/completions

请求模式: 携带 messages 与音频输出配置的 Chat Completions

计费: 每 10k 字符 $0

上游价格限时免费;上线生产环境前,请先查看实时价格。

AudioText-to-SpeechMultilingualStyle ControlBuilt-in Voices

stepaudio-2.5-tts

语音合成(TTS)· StepFun

端点: POST /v1/audio/speech

请求模式: OpenAI-compatible 语音合成端点

计费: 每 10k 字符 $0.85

AudioText-to-SpeechContextual TTSStyle ControlBuilt-in Voices

glm-tts

语音合成(TTS)· Zhipu AI

端点: POST /v1/audio/speech

请求模式: OpenAI-compatible 语音合成端点

计费: 每 10k 字符 $0.35

AudioText-to-SpeechStreamingEmotionVoice Control

qwen3-asr-flash

语音识别(ASR)· Alibaba

端点: POST /v1/audio/transcriptions

请求模式: OpenAI-compatible 转写端点

计费: 每音频小时 $0.126

AudioSpeech-to-TextMultilingualEmotion RecognitionITN

qwen3-tts-flash

语音合成(TTS)· Alibaba

端点: POST /v1/audio/speech

请求模式: OpenAI-compatible 语音合成端点

计费: 每 10k 字符 $0.11

AudioText-to-SpeechMultilingualBuilt-in VoicesStreaming

speech-2.8-hd

语音合成(TTS)· MiniMax

端点: POST /v1/audio/speech

请求模式: OpenAI-compatible 语音合成端点

计费: 每 10k 字符 $1

AudioText-to-SpeechHigh FidelityEmotionMultilingual

speech-2.8-turbo

语音合成(TTS)· MiniMax

端点: POST /v1/audio/speech

请求模式: OpenAI-compatible 语音合成端点

计费: 每 10k 字符 $0.6

AudioText-to-SpeechLow LatencyEmotionMultilingual

step-tts-2

语音合成(TTS)· StepFun

端点: POST /v1/audio/speech

请求模式: OpenAI-compatible 语音合成端点

计费: 每 10k 字符 $0.4148

AudioText-to-SpeechVoice CloningEmotionPronunciation Control

stepaudio-2.5-asr

语音识别(ASR)· StepFun

端点: POST /v1/audio/transcriptions

请求模式: OpenAI-compatible 转写端点

计费: 每音频小时 $0.022

AudioSpeech-to-TextStreamingChinese and EnglishITN

按工作负载选择

ASR 用于音频理解,TTS 用于语音输出

转写与音频理解

stepaudio-2-asr-pro:StepFun StepAudio 2 ASR Pro——32B 参数的语音识别模型,是 StepFun ASR 系列中精度优先的选项,而 stepaudio-2.5-asr 是速度与成本优先的选项。支持上传 ogg、mp3 与 wav 文件;转写输出不计费。

转写与音频理解

mimo-v2.5-asr:Xiaomi MiMo-V2.5-ASR——面向中文、英文、语种混说、地方方言、嘈杂录音、远场音频、多说话人及歌词的语音识别。

可控的语音输出

mimo-v2.5-tts:Xiaomi MiMo-V2.5-TTS——富有表现力的多语种语音合成,提供内置音色、自然语言风格指令,以及情绪、语速、语气、方言和角色控制。

通过专用路由输出语音

stepaudio-2.5-tts:StepAudio 2.5 TTS——结合上下文的语音合成,支持行内自然语言指令、富有表现力的演绎、内置音色,以及 OpenAI-compatible 音频输出。

通过专用路由输出语音

glm-tts:GLM-TTS——上下文感知的语音合成,支持富有表现力的演绎、流式输出、首包音频快速返回,以及音色、语速和音量控制。

转写与音频理解

qwen3-asr-flash:Qwen3-ASR-Flash——多语种文件转写,支持语种提示、逆文本正则化、情绪识别,以及 OpenAI-compatible 音频输入。

通过专用路由输出语音

qwen3-tts-flash:Qwen3-TTS-Flash——低延迟的多语种语音合成,支持混合语种输入、内置音色、自动语种匹配,并按字符计费。

通过专用路由输出语音

speech-2.8-hd:MiniMax Speech 2.8 HD——高保真语音合成,具备自然的情感表达、语言增强与音色控制,并支持生产级音频格式。

通过专用路由输出语音

speech-2.8-turbo:MiniMax Speech 2.8 Turbo——注重速度的语音合成,输出自然,支持情绪控制、语言增强,以及常见的生产级音频格式。

通过专用路由输出语音

step-tts-2:Step TTS 2——富有表现力的语音合成,支持官方音色与克隆音色、语速与音量控制、发音映射,以及多种输出格式。

转写与音频理解

stepaudio-2.5-asr:StepAudio 2.5 ASR——4B MTP 流式转写模型,适用于快速中英文识别、ITN 规范化、字幕、会议和语音 Agent。

兼容边界

OpenAI-compatible 并不意味着只有一个通用音频路由

路由名称与请求封装遵循 OpenAI-compatible 模式,但客户端必须发送每个模型所要求的音频字段。stepaudio-2.5-tts、glm-tts、qwen3-tts-flash、speech-2.8-hd、speech-2.8-turbo、step-tts-2 使用 /v1/audio/speech。stepaudio-2-asr-pro、qwen3-asr-flash、stepaudio-2.5-asr 使用 /v1/audio/transcriptions。mimo-v2.5-asr、mimo-v2.5-tts 使用 /v1/chat/completions,并采用各模型专用的音频载荷。

快速开始

按所需的模型与传输方式复制请求

stepaudio-2-asr-pro

语音识别(ASR),使用 /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2-asr-pro" \
  -F "[email protected]" \
  -F "response_format=json"

mimo-v2.5-asr

语音识别(ASR),使用 /v1/chat/completions

AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-asr",
    "messages": [{
      "role": "user",
      "content": [{
        "type": "input_audio",
        "input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
      }]
    }]
  }'

mimo-v2.5-tts

语音合成(TTS),使用 /v1/chat/completions

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "messages": [
      {"role": "user", "content": "Natural, clear, and friendly delivery"},
      {"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
    ],
    "audio": {"format": "wav", "voice": "冰糖"}
  }' > response.json

stepaudio-2.5-tts

语音合成(TTS),使用 /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-2.5-tts",
    "voice": "cixingnansheng",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

glm-tts

语音合成(TTS),使用 /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "voice": "tongtong",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

qwen3-asr-flash

语音识别(ASR),使用 /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "[email protected]" \
  -F "response_format=json"

qwen3-tts-flash

语音合成(TTS),使用 /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "voice": "Cherry",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

speech-2.8-hd

语音合成(TTS),使用 /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

speech-2.8-turbo

语音合成(TTS),使用 /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

step-tts-2

语音合成(TTS),使用 /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "voice": "cixingnansheng",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

stepaudio-2.5-asr

语音识别(ASR),使用 /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2.5-asr" \
  -F "[email protected]" \
  -F "response_format=json"

ChinaAPI 的所有语音模型都使用同一个音频端点吗?

不是。stepaudio-2.5-tts、glm-tts、qwen3-tts-flash、speech-2.8-hd、speech-2.8-turbo、step-tts-2 使用 /v1/audio/speech。stepaudio-2-asr-pro、qwen3-asr-flash、stepaudio-2.5-asr 使用 /v1/audio/transcriptions。mimo-v2.5-asr、mimo-v2.5-tts 使用 /v1/chat/completions,并采用各模型专用的音频载荷。

语音模型如何计费?

stepaudio-2-asr-pro:每音频小时 $0.2963;mimo-v2.5-asr:每音频小时 $0.074;mimo-v2.5-tts:每 10k 字符 $0;stepaudio-2.5-tts:每 10k 字符 $0.85;glm-tts:每 10k 字符 $0.35;qwen3-asr-flash:每音频小时 $0.126;qwen3-tts-flash:每 10k 字符 $0.11;speech-2.8-hd:每 10k 字符 $1;speech-2.8-turbo:每 10k 字符 $0.6;step-tts-2:每 10k 字符 $0.4148;stepaudio-2.5-asr:每音频小时 $0.022。展示的媒体价格可能包含服务毛利,用于覆盖厂商的输入/输出计费、支付处理、拒付风险与运营成本。所有毛利均已包含在展示价格中,不会另行加收。这些数值由模型目录渲染生成,而非手动复制到本页。

没有中国大陆账号,也能使用这些模型吗?

可以。通过 ChinaAPI 接入无需中国大陆账号或手机号。注册获取 key,然后按所选模型列出的准确路由和请求体发起调用。