入力
テキストに加え、内蔵音声または明示的にサポートされている音声デザイン/クローンコントロール。
音声認識機能センター
エンドポイント、音声制御、課金単位、出力ワークフロー、および実行可能な音声リクエストに基づいて、 TTSモデルを比較します。
契約
テキストに加え、内蔵音声または明示的にサポートされている音声デザイン/クローンコントロール。
モデルがサポートする形式の音声データ、またはチャット応答内の音声フィールド。
POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode
同期処理。バイナリ形式の音声応答を保存するか、チャットモードから返された音声フィールドをデコードします。
サポートされているタスク
テキスト読み上げ、音声クローン、音声デザイン
制限: 音声ID、クローン作成の同意、対応言語、ストリーミング、文字数制限、出力形式はモデルによって異なります。
マッチングカタログ
不明な機能は省略され、モデル名から推測されることもありません。価格例は同期された公開データを使用していますが、Dashのリアルタイム価格情報が正当です。
Xiaomi MiMo-V2.5-TTS — 内蔵音声、自然言語スタイルの指示、感情、ペース、トーン、方言、および文字制御を備えた表現力豊かな多言語音声合成。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/chat/completions
費用例: 1 10k文字 × $0 = $0 。
StepAudio 2.5 TTS — インラインの自然言語指示、表現力豊かな発話、内蔵音声、およびOpenAI-compatibleオーディオ出力による文脈に応じた音声合成。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/audio/speech
費用例: 1 10.85k文字 × $0.85 = $0.85 。
GLM-TTS — 表現力豊かな音声合成、ストリーミング出力、高速なファーストオーディオ、音声、速度、音量のコントロールを備えた、文脈認識型の音声合成。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/audio/speech
費用例: 1 10.307692k文字 × $0.307692 = $0.307692 。
Qwen3-TTS-Flash — 低遅延の多言語音声合成、混合言語入力、内蔵音声、自動言語マッチング、文字ベースの課金機能。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/audio/speech
費用例: 1 10.123077k文字 × $0.123077 = $0.123077 。
MiniMax音声2.8 HD — 自然な感情表現、言語強化、音声制御、およびプロダクションオーディオフォーマットを備えた高忠実度音声合成。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/audio/speech
費用例: 1 10.538462k文字 × $0.538462 = $0.538462 。
MiniMax音声2.8 Turbo — 自然な出力、感情制御、言語強化、一般的な制作オーディオフォーマットを備えた、速度重視の音声合成。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/audio/speech
費用例: 1 10.307692k文字 × $0.307692 = $0.307692 。
ステップTTS 2 — 公式音声とクローン音声による表現力豊かな音声合成、速度と音量の調整、発音マッピング、および複数の出力フォーマット。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/audio/speech
費用例: 1 10.4k文字 × $0.4 = $0.4 。
Step TTS Mini — 中国語、英語、日本語、広東語、四川語に対応した、コスト効率に優れた表現力豊かな音声合成。公式音声とクローン音声の両方に対応。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/audio/speech
費用例: 1 10.15k文字 × $0.15 = $0.15 。
APIを計算する ・ curl、Python、またはJavaScriptを生成する ・ Seedance 2エージェントレシピをインストールします
情報源と方法: 公開モデル価格データセット更新済み2026-08-08 。制限事項は上記に記載されています。第三者の主張は、それらを引用しているモデルページの横にそのまま残っています。