入力
選択したモデルの正確なapi_modeを使用して、理解/書き起こし用の音声、または合成用のテキスト。
音声認識機能センター
すべての音声モデルを互換性のあるものとして扱うことなく、検証済みの音声理解、 ASR 、およびTTSエンドポイントモードを使用してください。
契約
選択したモデルの正確なapi_modeを使用して、理解/書き起こし用の音声、または合成用のテキスト。
テキスト分析/文字起こし、または生成された音声。カタログのメタデータに明記されていない限り、直接的な音声対音声の結果を意味するものではありません。
Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech
リストされている音声エンドポイントは同期型です。音声間ワークフローでは、文字起こしまたは音声理解が別のTTSに連鎖されます。
サポートされているタスク
音声理解
制限: TTSまたはASRラベルは、直接的な音声理解、音声クローン、音声ダイアリゼーション、または音声間通信のサポートを証明するものではありません。
マッチングカタログ
不明な機能は省略され、モデル名から推測されることもありません。価格例は同期された公開データを使用していますが、Dashのリアルタイム価格情報が正当です。
StepFun StepAudio 2 ASR Pro — パラメータ32Bの音声認識モデルで、StepFunのASR系では精度重視の選択肢、stepaudio-2.5-asrは速度とコスト重視の選択肢です。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。
タスク: 音声付き動画、文字起こし
終点: POST /v1/audio/transcriptions
費用例: 1音声時間 × $0.35 = $0.35 。
StepFun step-asr — 中国語、英語、中国語方言に対応した汎用音声認識。文字起こし、議事録、通話品質のレビュー、音声検索に使えます。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。
タスク: 音声付き動画、文字起こし
終点: POST /v1/audio/transcriptions
費用例: 1音声時間 × $0.15 = $0.15 。
StepFun step-asr-1.1 — step-asr系の汎用認識モデルを更新したもので、中国語、英語、中国語方言に対応します。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。
タスク: 音声付き動画、文字起こし
終点: POST /v1/audio/transcriptions
費用例: 1音声時間 × $0.35 = $0.35 。
Xiaomi MiMo-V2.5-ASR — 中国語、英語、コードスイッチング、地域方言、ノイズの多い録音、遠距離音声、複数話者、歌詞の音声認識。
タスク: 音声付き動画、文字起こし
終点: POST /v1/chat/completions
費用例: 1音声時間 × $0.074 = $0.074 。
Xiaomi MiMo-V2.5-TTS — 内蔵音声、自然言語スタイルの指示、感情、ペース、トーン、方言、および文字制御を備えた表現力豊かな多言語音声合成。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/chat/completions
費用例: 1 10k文字 × $0 = $0 。
StepAudio 2.5 TTS — インラインの自然言語指示、表現力豊かな発話、内蔵音声、およびOpenAI-compatibleオーディオ出力による文脈に応じた音声合成。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/audio/speech
費用例: 1 10.85k文字 × $0.85 = $0.85 。
GLM-TTS — 表現力豊かな音声合成、ストリーミング出力、高速なファーストオーディオ、音声、速度、音量のコントロールを備えた、文脈認識型の音声合成。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/audio/speech
費用例: 1 10.307692k文字 × $0.307692 = $0.307692 。
Qwen3-ASR-Flash — 言語ヒント、逆テキスト正規化、感情認識、およびOpenAI-compatible音声入力による多言語ファイル文字起こし。
タスク: 音声付き動画、文字起こし
終点: POST /v1/audio/transcriptions
費用例: 1音声時間 × $0.123539 = $0.123539 。
Qwen3-TTS-Flash — 低遅延の多言語音声合成、混合言語入力、内蔵音声、自動言語マッチング、文字ベースの課金機能。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/audio/speech
費用例: 1 10.123077k文字 × $0.123077 = $0.123077 。
MiniMax音声2.8 HD — 自然な感情表現、言語強化、音声制御、およびプロダクションオーディオフォーマットを備えた高忠実度音声合成。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/audio/speech
費用例: 1 10.538462k文字 × $0.538462 = $0.538462 。
MiniMax音声2.8 Turbo — 自然な出力、感情制御、言語強化、一般的な制作オーディオフォーマットを備えた、速度重視の音声合成。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/audio/speech
費用例: 1 10.307692k文字 × $0.307692 = $0.307692 。
ステップTTS 2 — 公式音声とクローン音声による表現力豊かな音声合成、速度と音量の調整、発音マッピング、および複数の出力フォーマット。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/audio/speech
費用例: 1 10.4k文字 × $0.4 = $0.4 。
Step TTS Mini — 中国語、英語、日本語、広東語、四川語に対応した、コスト効率に優れた表現力豊かな音声合成。公式音声とクローン音声の両方に対応。
タスク: 音声付き動画、テキスト読み上げ
終点: POST /v1/audio/speech
費用例: 1 10.15k文字 × $0.15 = $0.15 。
StepAudio 2.5 ASR — 中国語-英語の高速認識、ITN正規化、字幕、会議、音声エージェントのための4B MTP ストリーミング文字起こしモデル。
タスク: 音声付き動画、文字起こし
終点: POST /v1/audio/transcriptions
費用例: 1音声時間 × $0.022 = $0.022 。
APIを計算する ・ curl、Python、またはJavaScriptを生成する ・ Seedance 2エージェントレシピをインストールします
情報源と方法: 公開モデル価格データセット更新済み2026-08-08 。制限事項は上記に記載されています。第三者の主張は、それらを引用しているモデルページの横にそのまま残っています。