<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: ja/text-to-speech-api/index.html -->

# テキスト読み上げAPI音声、制御、および音声出力

> エンドポイント、音声制御、課金単位、出力ワークフロー、および実行可能な音声リクエストに基づいて、 TTSモデルを比較します。

- Canonical page: https://chinaapi.ai/ja/text-to-speech-api/
- Human-readable page: https://chinaapi.ai/ja/text-to-speech-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=ja&utm_source=chinaapi&utm_medium=markdown&utm_campaign=text-to-speech-api

エンドポイント、音声制御、課金単位、出力ワークフロー、および実行可能な音声リクエストに基づいて、 TTSモデルを比較します。

[試してみてくださいmimo-v2.5-tts](https://dash.chinaapi.ai/start?task=video-with-audio&model=mimo-v2.5-tts&lang=ja&utm_source=chinaapi&utm_medium=capability&utm_campaign=text-to-speech-api)

[リクエストを生成する](https://chinaapi.ai/tools/api-request-generator/)

## 入力、出力、およびライフサイクル。

### 入力

テキストに加え、内蔵音声または明示的にサポートされている音声デザイン／クローンコントロール。

### 出力

モデルがサポートする形式の音声データ、またはチャット応答内の音声フィールド。

### 終点

`POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode`

### ライフサイクル

同期処理。バイナリ形式の音声応答を保存するか、チャットモードから返された音声フィールドをデコードします。

## タスクごとに定義を1つ。

テキスト読み上げ、音声クローン、音声デザイン

**制限:** 音声ID、クローン作成の同意、対応言語、ストリーミング、文字数制限、出力形式はモデルによって異なります。

## 明示的なメタデータを持つ8 。

不明な機能は省略され、モデル名から推測されることもありません。価格例は同期された公開データを使用していますが、Dashのリアルタイム価格情報が正当です。

### [mimo-v2.5-tts](https://chinaapi.ai/ja/models/mimo-v2.5-tts/)

Xiaomi MiMo-V2.5-TTS — 内蔵音声、自然言語スタイルの指示、感情、ペース、トーン、方言、および文字制御を備えた表現力豊かな多言語音声合成。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/chat/completions`

**費用例：** 1 10k文字 × $0 = $0 。

### [stepaudio-2.5-tts](https://chinaapi.ai/ja/models/stepaudio-2.5-tts/)

StepAudio 2.5 TTS — インラインの自然言語指示、表現力豊かな発話、内蔵音声、およびOpenAI-compatibleオーディオ出力による文脈に応じた音声合成。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/audio/speech`

**費用例：** 1 10.85k文字 × $0.85 = $0.85 。

### [glm-tts](https://chinaapi.ai/ja/models/glm-tts/)

GLM-TTS — 表現力豊かな音声合成、ストリーミング出力、高速なファーストオーディオ、音声、速度、音量のコントロールを備えた、文脈認識型の音声合成。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/audio/speech`

**費用例：** 1 10.307692k文字 × $0.307692 = $0.307692 。

### [qwen3-tts-flash](https://chinaapi.ai/ja/models/qwen3-tts-flash/)

Qwen3-TTS-Flash — 低遅延の多言語音声合成、混合言語入力、内蔵音声、自動言語マッチング、文字ベースの課金機能。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/audio/speech`

**費用例：** 1 10.123077k文字 × $0.123077 = $0.123077 。

### [speech-2.8-hd](https://chinaapi.ai/ja/models/speech-2.8-hd/)

MiniMax音声2.8 HD — 自然な感情表現、言語強化、音声制御、およびプロダクションオーディオフォーマットを備えた高忠実度音声合成。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/audio/speech`

**費用例：** 1 10.538462k文字 × $0.538462 = $0.538462 。

### [speech-2.8-turbo](https://chinaapi.ai/ja/models/speech-2.8-turbo/)

MiniMax音声2.8 Turbo — 自然な出力、感情制御、言語強化、一般的な制作オーディオフォーマットを備えた、速度重視の音声合成。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/audio/speech`

**費用例：** 1 10.307692k文字 × $0.307692 = $0.307692 。

### [step-tts-2](https://chinaapi.ai/ja/models/step-tts-2/)

ステップTTS 2 — 公式音声とクローン音声による表現力豊かな音声合成、速度と音量の調整、発音マッピング、および複数の出力フォーマット。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/audio/speech`

**費用例：** 1 10.4k文字 × $0.4 = $0.4 。

### [step-tts-mini](https://chinaapi.ai/ja/models/step-tts-mini/)

Step TTS Mini — 中国語、英語、日本語、広東語、四川語に対応した、コスト効率に優れた表現力豊かな音声合成。公式音声とクローン音声の両方に対応。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/audio/speech`

**費用例：** 1 10.15k文字 × $0.15 = $0.15 。

## 登録前に実行または概算を行う。

[APIを計算する](https://chinaapi.ai/tools/api-cost-calculator/) ・ [curl、Python、またはJavaScriptを生成する](https://chinaapi.ai/tools/api-request-generator/) ・ [Seedance 2エージェントレシピをインストールします](https://chinaapi.ai/agent-recipes/seedance-2/)

情報源と方法： [公開モデル価格データセット](https://chinaapi.ai/ja/data/model-pricing/)更新済み2026-08-08 。制限事項は上記に記載されています。第三者の主張は、それらを引用しているモデルページの横にそのまま残っています。

---

Markdown twin of https://chinaapi.ai/ja/text-to-speech-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
