<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: ja/speech-api/index.html -->

# 音声認識（ASR）およびテキスト読み上げのための中国語音声API。

> ChinaAPI を介して、 14の中国語音声 API モデルを使用して ASR とテキスト読み上げを利用できます。正確なエンドポイント、課金単位、米ドル価格、機能、およびコピー＆ペースト可能なリクエストを比較できます。

- Canonical page: https://chinaapi.ai/ja/speech-api/
- Human-readable page: https://chinaapi.ai/ja/speech-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=ja&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-api

1つの ChinaAPI key で利用できる音声認識・音声合成モデルを比較できます。各モデルは実際のリクエストパスをそのまま使用します。stepaudio-2.5-tts、glm-tts、qwen3-tts-flash、speech-2.8-hd、speech-2.8-turbo、step-tts-2、step-tts-mini は /v1/audio/speech を使用します。stepaudio-2-asr-pro、step-asr、step-asr-1.1、qwen3-asr-flash、stepaudio-2.5-asr は /v1/audio/transcriptions を使用します。mimo-v2.5-asr と mimo-v2.5-tts は、モデル固有の音声ペイロードとともに /v1/chat/completions を使用します。

[無料で始められます — $2クレジット](https://dash.chinaapi.ai/register?lang=ja&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

[リアルタイム価格を表示](https://dash.chinaapi.ai/pricing?lang=ja&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

## 1つのデータソースから生成された14音声モデル。

エンドポイントモード、課金単位、機能、表示価格は以下から取得されますModel IDs `scripts/models-data.json`音声料金はChinaAPIゲートウェイと照合されます。表示されるメディア料金には、プロバイダーの入出力請求、決済処理、チャージバックリスク、および運用をカバーするサービスマージンが含まれる場合があります。マージンはすべて表示料金に含まれており、別途加算されることはありません。本番環境への展開前に、実際の料金をご確認ください。

### [stepaudio-2-asr-pro](https://chinaapi.ai/ja/models/stepaudio-2-asr-pro/)

音声認識（ASR） · StepFun

**終点：** `投稿/v1/audio/transcriptions`

**リクエストモード:** OpenAI-compatible終点

**請求する：** 音声1時間あたり$0.35

Audio Speech-to-Text

### [step-asr](https://chinaapi.ai/ja/models/step-asr/)

音声認識（ASR） · StepFun

**終点：** `投稿/v1/audio/transcriptions`

**リクエストモード:** OpenAI-compatible終点

**請求する：** 音声1時間あたり$0.15

Audio Speech-to-Text Chinese Dialects

### [step-asr-1.1](https://chinaapi.ai/ja/models/step-asr-1.1/)

音声認識（ASR） · StepFun

**終点：** `投稿/v1/audio/transcriptions`

**リクエストモード:** OpenAI-compatible終点

**請求する：** 音声1時間あたり$0.35

Audio Speech-to-Text Chinese Dialects

### [mimo-v2.5-asr](https://chinaapi.ai/ja/models/mimo-v2.5-asr/)

音声認識（ ASR ）· Xiaomi

**終点：** `投稿/v1/chat/completions`

**リクエストモード:** input_audioペイロードを使用したチャット完了

**請求する：** 音声1時間あたり$0.074

Audio Speech-to-Text Multilingual Chinese Dialects Noise Robustness

### [mimo-v2.5-tts](https://chinaapi.ai/ja/models/mimo-v2.5-tts/)

テキスト読み上げ（TTS） · Xiaomi

**終点：** `投稿/v1/chat/completions`

**リクエストモード:** メッセージと音声出力設定を含むチャット完了機能

**請求する：** 10k文字あたり$0

期間限定で上流料金が無料です。本番環境への導入前に、実際の料金をご確認ください。

Audio Text-to-Speech Multilingual Style Control Built-in Voices

### [stepaudio-2.5-tts](https://chinaapi.ai/ja/models/stepaudio-2.5-tts/)

テキスト読み上げ（TTS） · StepFun

**終点：** `投稿/v1/audio/speech`

**リクエストモード:** OpenAI-compatible音声エンドポイント

**請求する：** 10k文字あたり$0.85

Audio Text-to-Speech Contextual TTS Style Control Built-in Voices

### [glm-tts](https://chinaapi.ai/ja/models/glm-tts/)

テキスト読み上げ（TTS） · Zhipu AI

**終点：** `投稿/v1/audio/speech`

**リクエストモード:** OpenAI-compatible音声エンドポイント

**請求する：** 10k文字あたり$0.3077

Audio Text-to-Speech Streaming Emotion Voice Control

### [qwen3-asr-flash](https://chinaapi.ai/ja/models/qwen3-asr-flash/)

音声認識（ ASR ）· Alibaba

**終点：** `投稿/v1/audio/transcriptions`

**リクエストモード:** OpenAI-compatible終点

**請求する：** 音声1時間あたり$0.1235

Audio Speech-to-Text Multilingual Emotion Recognition ITN

### [qwen3-tts-flash](https://chinaapi.ai/ja/models/qwen3-tts-flash/)

テキスト読み上げ（ TTS ）· Alibaba

**終点：** `投稿/v1/audio/speech`

**リクエストモード:** OpenAI-compatible音声エンドポイント

**請求する：** 10k文字あたり$0.1231

Audio Text-to-Speech Multilingual Built-in Voices Streaming

### [speech-2.8-hd](https://chinaapi.ai/ja/models/speech-2.8-hd/)

テキスト読み上げ（TTS） · MiniMax

**終点：** `投稿/v1/audio/speech`

**リクエストモード:** OpenAI-compatible音声エンドポイント

**請求する：** 10k文字あたり$0.5385

Audio Text-to-Speech High Fidelity Emotion Multilingual

### [speech-2.8-turbo](https://chinaapi.ai/ja/models/speech-2.8-turbo/)

テキスト読み上げ（TTS） · MiniMax

**終点：** `投稿/v1/audio/speech`

**リクエストモード:** OpenAI-compatible音声エンドポイント

**請求する：** 10k文字あたり$0.3077

Audio Text-to-Speech Low Latency Emotion Multilingual

### [step-tts-2](https://chinaapi.ai/ja/models/step-tts-2/)

テキスト読み上げ（TTS） · StepFun

**終点：** `投稿/v1/audio/speech`

**リクエストモード:** OpenAI-compatible音声エンドポイント

**請求する：** 10k文字あたり$0.4

Audio Text-to-Speech Voice Cloning Emotion Pronunciation Control

### [step-tts-mini](https://chinaapi.ai/ja/models/step-tts-mini/)

テキスト読み上げ（TTS） · StepFun

**終点：** `投稿/v1/audio/speech`

**リクエストモード:** OpenAI-compatible音声エンドポイント

**請求する：** 10k文字あたり$0.15

Audio Text-to-Speech Multilingual Voice Cloning Style Control

### [stepaudio-2.5-asr](https://chinaapi.ai/ja/models/stepaudio-2.5-asr/)

音声認識（ASR） · StepFun

**終点：** `投稿/v1/audio/transcriptions`

**リクエストモード:** OpenAI-compatible終点

**請求する：** 音声1時間あたり$0.022

Audio Speech-to-Text Streaming Chinese and English ITN

## 音声認識にはASR、音声出力にはTTSを使用します。

### 文字起こしと音声理解

[stepaudio-2-asr-pro](https://chinaapi.ai/ja/models/stepaudio-2-asr-pro/): StepFun StepAudio 2 ASR Pro — パラメータ32Bの音声認識モデルで、StepFunのASR系では精度重視の選択肢、stepaudio-2.5-asrは速度とコスト重視の選択肢です。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

### 文字起こしと音声理解

[step-asr](https://chinaapi.ai/ja/models/step-asr/): StepFun step-asr — 中国語、英語、中国語方言に対応した汎用音声認識。文字起こし、議事録、通話品質のレビュー、音声検索に使えます。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

### 文字起こしと音声理解

[step-asr-1.1](https://chinaapi.ai/ja/models/step-asr-1.1/): StepFun step-asr-1.1 — step-asr系の汎用認識モデルを更新したもので、中国語、英語、中国語方言に対応します。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

### 文字起こしと音声理解

[mimo-v2.5-asr](https://chinaapi.ai/ja/models/mimo-v2.5-asr/): Xiaomi MiMo-V2.5-ASR — 中国語、英語、コードスイッチング、地域方言、ノイズの多い録音、遠距離音声、複数話者、歌詞の音声認識。

### 音声出力の制御が可能

[mimo-v2.5-tts](https://chinaapi.ai/ja/models/mimo-v2.5-tts/): Xiaomi MiMo-V2.5-TTS — 内蔵音声、自然言語スタイルの指示、感情、ペース、トーン、方言、および文字制御を備えた表現力豊かな多言語音声合成。

### 専用経路を介した音声出力

[stepaudio-2.5-tts](https://chinaapi.ai/ja/models/stepaudio-2.5-tts/): StepAudio 2.5 TTS — インラインの自然言語指示、表現力豊かな発話、内蔵音声、およびOpenAI-compatibleオーディオ出力による文脈に応じた音声合成。

### 専用経路を介した音声出力

[glm-tts](https://chinaapi.ai/ja/models/glm-tts/): GLM-TTS — 表現力豊かな音声合成、ストリーミング出力、高速なファーストオーディオ、音声、速度、音量のコントロールを備えたコンテキスト認識型音声合成。

### 文字起こしと音声理解

[qwen3-asr-flash](https://chinaapi.ai/ja/models/qwen3-asr-flash/): Qwen3-ASR-Flash — 言語ヒント、逆テキスト正規化、感情認識、およびOpenAI-compatible音声入力による多言語ファイル文字起こし。

### 専用経路を介した音声出力

[qwen3-tts-flash](https://chinaapi.ai/ja/models/qwen3-tts-flash/): Qwen3-TTS-Flash — 低遅延の多言語音声合成、混合言語入力、内蔵音声、自動言語マッチング、文字ベースの課金。

### 専用経路を介した音声出力

[speech-2.8-hd](https://chinaapi.ai/ja/models/speech-2.8-hd/): MiniMax音声2.8 HD — 自然な感情表現、言語強化、音声制御、および制作用オーディオフォーマットを備えた高忠実度音声合成。

### 専用経路を介した音声出力

[speech-2.8-turbo](https://chinaapi.ai/ja/models/speech-2.8-turbo/): MiniMax音声2.8 Turbo — 自然な出力、感情制御、言語強化、一般的な制作オーディオフォーマットを備えた、速度重視の音声合成。

### 専用経路を介した音声出力

[step-tts-2](https://chinaapi.ai/ja/models/step-tts-2/)ステップTTS 2 — 公式音声とクローン音声による表現力豊かな音声合成、速度と音量のコントロール、発音マッピング、および複数の出力フォーマット。

### 専用経路を介した音声出力

[step-tts-mini](https://chinaapi.ai/ja/models/step-tts-mini/): Step TTS Mini — 中国語、英語、日本語、広東語、四川語に対応した、コスト効率に優れた表現力豊かな音声合成。公式音声とクローン音声に対応。

### 文字起こしと音声理解

[stepaudio-2.5-asr](https://chinaapi.ai/ja/models/stepaudio-2.5-asr/): StepAudio 2.5 ASR — 中国語-英語の高速認識、ITN正規化、字幕、会議、音声エージェントのための4B MTP ストリーミング文字起こしモデル。

## OpenAI-compatible 、単一の普遍的なオーディオ経路を意味するものではありません。

ルート名とリクエストエンベロープは OpenAI-compatible のパターンに従いますが、クライアントは各モデルが必要とする音声フィールドを送信する必要があります。stepaudio-2.5-tts、glm-tts、qwen3-tts-flash、speech-2.8-hd、speech-2.8-turbo、step-tts-2、step-tts-mini は /v1/audio/speech を使用します。stepaudio-2-asr-pro、step-asr、step-asr-1.1、qwen3-asr-flash、stepaudio-2.5-asr は /v1/audio/transcriptions を使用します。mimo-v2.5-asr と mimo-v2.5-tts は、モデル固有の音声ペイロードとともに /v1/chat/completions を使用します。

## 必要なモデルと輸送手段のリクエストをコピーしてください。

### stepaudio-2-asr-pro

音声認識（ ASR ） `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2-asr-pro" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr

音声認識（ ASR ） `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr-1.1

音声認識（ ASR ） `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr-1.1" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### mimo-v2.5-asr

音声認識（ ASR ） `/v1/chat/completions`

```
AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-asr",
    "messages": [{
      "role": "user",
      "content": [{
        "type": "input_audio",
        "input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
      }]
    }]
  }'
```

### mimo-v2.5-tts

テキスト読み上げ（ TTS ） `/v1/chat/completions`

```
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "messages": [
      {"role": "user", "content": "Natural, clear, and friendly delivery"},
      {"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
    ],
    "audio": {"format": "wav", "voice": "冰糖"}
  }' > response.json
```

### stepaudio-2.5-tts

テキスト読み上げ（ TTS ） `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-2.5-tts",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### glm-tts

テキスト読み上げ（ TTS ） `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "voice": "tongtong",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### qwen3-asr-flash

音声認識（ ASR ） `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### qwen3-tts-flash

テキスト読み上げ（ TTS ） `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "voice": "Cherry",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-hd

テキスト読み上げ（ TTS ） `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-turbo

テキスト読み上げ（ TTS ） `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-2

テキスト読み上げ（ TTS ） `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-mini

テキスト読み上げ（ TTS ） `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-mini",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### stepaudio-2.5-asr

音声認識（ ASR ） `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2.5-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

## ChinaAPIの音声モデルはすべて同じオーディオエンドポイントを使用していますか？

No. stepaudio-2.5-tts、glm-tts、qwen3-tts-flash、speech-2.8-hd、speech-2.8-turbo、step-tts-2、step-tts-mini は /v1/audio/speech を使用します。stepaudio-2-asr-pro、step-asr、step-asr-1.1、qwen3-asr-flash、stepaudio-2.5-asr は /v1/audio/transcriptions を使用します。mimo-v2.5-asr と mimo-v2.5-tts は、モデル固有の音声ペイロードとともに /v1/chat/completions を使用します。

## 音声モデルの料金体系はどのようになっていますか？

stepaudio-2-asr-pro：音声1時間あたり$0.35、step-asr：音声1時間あたり$0.15、step-asr-1.1：音声1時間あたり$0.35、mimo-v2.5-asr：音声1時間あたり$0.074、mimo-v2.5-tts：10k文字あたり$0、stepaudio-2.5-tts：10k文字あたり$0.85、glm-tts：10k文字あたり$0.3077、qwen3-asr-flash：音声1時間あたり$0.1235、qwen3-tts-flash：10k文字あたり$0.1231、speech-2.8-hd：10k文字あたり$0.5385、speech-2.8-turbo：10k文字あたり$0.3077、step-tts-2：10k文字あたり$0.4、step-tts-mini：10k文字あたり$0.15、stepaudio-2.5-asr：音声1時間あたり$0.022。表示されているメディア料金には、プロバイダーの入出力課金、決済処理、チャージバックリスク、運用をカバーするサービスマージンが含まれる場合があります。マージンがある場合は表示料金にすでに含まれており、別途加算されることはありません。これらの値はこのページに書き写されたものではなく、モデルカタログから描画されています。

## 中国本土のアカウントがなくても、これらのモデルを使用できますか？

はい。ChinaAPIは、中国本土のアカウントや電話番号がなくてもアクセスできます。キーを登録したら、選択したモデルに表示されているルートとペイロードを正確に使用してください。

---

Markdown twin of https://chinaapi.ai/ja/speech-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
