<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: ja/audio-api/index.html -->

# 音声API ：音声理解と音声間通信の構成要素

> すべての音声モデルを互換性のあるものとして扱うことなく、検証済みの音声理解、 ASR 、およびTTSエンドポイントモードを使用してください。

- Canonical page: https://chinaapi.ai/ja/audio-api/
- Human-readable page: https://chinaapi.ai/ja/audio-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=ja&utm_source=chinaapi&utm_medium=markdown&utm_campaign=audio-api

すべての音声モデルを互換性のあるものとして扱うことなく、検証済みの音声理解、 ASR 、およびTTSエンドポイントモードを使用してください。

[試してみてくださいstepaudio-2-asr-pro](https://dash.chinaapi.ai/start?task=video-with-audio&model=stepaudio-2-asr-pro&lang=ja&utm_source=chinaapi&utm_medium=capability&utm_campaign=audio-api)

[リクエストを生成する](https://chinaapi.ai/tools/api-request-generator/)

## 入力、出力、およびライフサイクル。

### 入力

選択したモデルの正確なapi_modeを使用して、理解/書き起こし用の音声、または合成用のテキスト。

### 出力

テキスト分析／文字起こし、または生成された音声。カタログのメタデータに明記されていない限り、直接的な音声対音声の結果を意味するものではありません。

### 終点

`Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech`

### ライフサイクル

リストされている音声エンドポイントは同期型です。音声間ワークフローでは、文字起こしまたは音声理解が別のTTSに連鎖されます。

## タスクごとに定義を1つ。

音声理解

**制限:** TTSまたはASRラベルは、直接的な音声理解、音声クローン、音声ダイアリゼーション、または音声間通信のサポートを証明するものではありません。

## 明示的なメタデータを持つ14 。

不明な機能は省略され、モデル名から推測されることもありません。価格例は同期された公開データを使用していますが、Dashのリアルタイム価格情報が正当です。

### [stepaudio-2-asr-pro](https://chinaapi.ai/ja/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro — パラメータ32Bの音声認識モデルで、StepFunのASR系では精度重視の選択肢、stepaudio-2.5-asrは速度とコスト重視の選択肢です。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

**タスク:** 音声付き動画、文字起こし

**終点：** `POST /v1/audio/transcriptions`

**費用例：** 1音声時間 × $0.35 = $0.35 。

### [step-asr](https://chinaapi.ai/ja/models/step-asr/)

StepFun step-asr — 中国語、英語、中国語方言に対応した汎用音声認識。文字起こし、議事録、通話品質のレビュー、音声検索に使えます。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

**タスク:** 音声付き動画、文字起こし

**終点：** `POST /v1/audio/transcriptions`

**費用例：** 1音声時間 × $0.15 = $0.15 。

### [step-asr-1.1](https://chinaapi.ai/ja/models/step-asr-1.1/)

StepFun step-asr-1.1 — step-asr系の汎用認識モデルを更新したもので、中国語、英語、中国語方言に対応します。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

**タスク:** 音声付き動画、文字起こし

**終点：** `POST /v1/audio/transcriptions`

**費用例：** 1音声時間 × $0.35 = $0.35 。

### [mimo-v2.5-asr](https://chinaapi.ai/ja/models/mimo-v2.5-asr/)

Xiaomi MiMo-V2.5-ASR — 中国語、英語、コードスイッチング、地域方言、ノイズの多い録音、遠距離音声、複数話者、歌詞の音声認識。

**タスク:** 音声付き動画、文字起こし

**終点：** `POST /v1/chat/completions`

**費用例：** 1音声時間 × $0.074 = $0.074 。

### [mimo-v2.5-tts](https://chinaapi.ai/ja/models/mimo-v2.5-tts/)

Xiaomi MiMo-V2.5-TTS — 内蔵音声、自然言語スタイルの指示、感情、ペース、トーン、方言、および文字制御を備えた表現力豊かな多言語音声合成。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/chat/completions`

**費用例：** 1 10k文字 × $0 = $0 。

### [stepaudio-2.5-tts](https://chinaapi.ai/ja/models/stepaudio-2.5-tts/)

StepAudio 2.5 TTS — インラインの自然言語指示、表現力豊かな発話、内蔵音声、およびOpenAI-compatibleオーディオ出力による文脈に応じた音声合成。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/audio/speech`

**費用例：** 1 10.85k文字 × $0.85 = $0.85 。

### [glm-tts](https://chinaapi.ai/ja/models/glm-tts/)

GLM-TTS — 表現力豊かな音声合成、ストリーミング出力、高速なファーストオーディオ、音声、速度、音量のコントロールを備えた、文脈認識型の音声合成。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/audio/speech`

**費用例：** 1 10.307692k文字 × $0.307692 = $0.307692 。

### [qwen3-asr-flash](https://chinaapi.ai/ja/models/qwen3-asr-flash/)

Qwen3-ASR-Flash — 言語ヒント、逆テキスト正規化、感情認識、およびOpenAI-compatible音声入力による多言語ファイル文字起こし。

**タスク:** 音声付き動画、文字起こし

**終点：** `POST /v1/audio/transcriptions`

**費用例：** 1音声時間 × $0.123539 = $0.123539 。

### [qwen3-tts-flash](https://chinaapi.ai/ja/models/qwen3-tts-flash/)

Qwen3-TTS-Flash — 低遅延の多言語音声合成、混合言語入力、内蔵音声、自動言語マッチング、文字ベースの課金機能。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/audio/speech`

**費用例：** 1 10.123077k文字 × $0.123077 = $0.123077 。

### [speech-2.8-hd](https://chinaapi.ai/ja/models/speech-2.8-hd/)

MiniMax音声2.8 HD — 自然な感情表現、言語強化、音声制御、およびプロダクションオーディオフォーマットを備えた高忠実度音声合成。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/audio/speech`

**費用例：** 1 10.538462k文字 × $0.538462 = $0.538462 。

### [speech-2.8-turbo](https://chinaapi.ai/ja/models/speech-2.8-turbo/)

MiniMax音声2.8 Turbo — 自然な出力、感情制御、言語強化、一般的な制作オーディオフォーマットを備えた、速度重視の音声合成。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/audio/speech`

**費用例：** 1 10.307692k文字 × $0.307692 = $0.307692 。

### [step-tts-2](https://chinaapi.ai/ja/models/step-tts-2/)

ステップTTS 2 — 公式音声とクローン音声による表現力豊かな音声合成、速度と音量の調整、発音マッピング、および複数の出力フォーマット。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/audio/speech`

**費用例：** 1 10.4k文字 × $0.4 = $0.4 。

### [step-tts-mini](https://chinaapi.ai/ja/models/step-tts-mini/)

Step TTS Mini — 中国語、英語、日本語、広東語、四川語に対応した、コスト効率に優れた表現力豊かな音声合成。公式音声とクローン音声の両方に対応。

**タスク:** 音声付き動画、テキスト読み上げ

**終点：** `POST /v1/audio/speech`

**費用例：** 1 10.15k文字 × $0.15 = $0.15 。

### [stepaudio-2.5-asr](https://chinaapi.ai/ja/models/stepaudio-2.5-asr/)

StepAudio 2.5 ASR — 中国語-英語の高速認識、ITN正規化、字幕、会議、音声エージェントのための4B MTP ストリーミング文字起こしモデル。

**タスク:** 音声付き動画、文字起こし

**終点：** `POST /v1/audio/transcriptions`

**費用例：** 1音声時間 × $0.022 = $0.022 。

## 登録前に実行または概算を行う。

[APIを計算する](https://chinaapi.ai/tools/api-cost-calculator/) ・ [curl、Python、またはJavaScriptを生成する](https://chinaapi.ai/tools/api-request-generator/) ・ [Seedance 2エージェントレシピをインストールします](https://chinaapi.ai/agent-recipes/seedance-2/)

情報源と方法： [公開モデル価格データセット](https://chinaapi.ai/ja/data/model-pricing/)更新済み2026-08-08 。制限事項は上記に記載されています。第三者の主張は、それらを引用しているモデルページの横にそのまま残っています。

---

Markdown twin of https://chinaapi.ai/ja/audio-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
