音声認識機能センター

音声API :音声理解と音声間通信の構成要素

すべての音声モデルを互換性のあるものとして扱うことなく、検証済みの音声理解、 ASR 、およびTTSエンドポイントモードを使用してください。

契約

入力、出力、およびライフサイクル。

入力

選択したモデルの正確なapi_modeを使用して、理解/書き起こし用の音声、または合成用のテキスト。

出力

テキスト分析/文字起こし、または生成された音声。カタログのメタデータに明記されていない限り、直接的な音声対音声の結果を意味するものではありません。

終点

Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech

ライフサイクル

リストされている音声エンドポイントは同期型です。音声間ワークフローでは、文字起こしまたは音声理解が別のTTSに連鎖されます。

サポートされているタスク

タスクごとに定義を1つ。

音声理解

制限: TTSまたはASRラベルは、直接的な音声理解、音声クローン、音声ダイアリゼーション、または音声間通信のサポートを証明するものではありません。

マッチングカタログ

明示的なメタデータを持つ14 。

不明な機能は省略され、モデル名から推測されることもありません。価格例は同期された公開データを使用していますが、Dashのリアルタイム価格情報が正当です。

stepaudio-2-asr-pro

StepFun StepAudio 2 ASR Pro — パラメータ32Bの音声認識モデルで、StepFunのASR系では精度重視の選択肢、stepaudio-2.5-asrは速度とコスト重視の選択肢です。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

タスク: 音声付き動画、文字起こし

終点: POST /v1/audio/transcriptions

費用例: 1音声時間 × $0.35 = $0.35 。

step-asr

StepFun step-asr — 中国語、英語、中国語方言に対応した汎用音声認識。文字起こし、議事録、通話品質のレビュー、音声検索に使えます。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

タスク: 音声付き動画、文字起こし

終点: POST /v1/audio/transcriptions

費用例: 1音声時間 × $0.15 = $0.15 。

step-asr-1.1

StepFun step-asr-1.1 — step-asr系の汎用認識モデルを更新したもので、中国語、英語、中国語方言に対応します。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

タスク: 音声付き動画、文字起こし

終点: POST /v1/audio/transcriptions

費用例: 1音声時間 × $0.35 = $0.35 。

mimo-v2.5-asr

Xiaomi MiMo-V2.5-ASR — 中国語、英語、コードスイッチング、地域方言、ノイズの多い録音、遠距離音声、複数話者、歌詞の音声認識。

タスク: 音声付き動画、文字起こし

終点: POST /v1/chat/completions

費用例: 1音声時間 × $0.074 = $0.074 。

mimo-v2.5-tts

Xiaomi MiMo-V2.5-TTS — 内蔵音声、自然言語スタイルの指示、感情、ペース、トーン、方言、および文字制御を備えた表現力豊かな多言語音声合成。

タスク: 音声付き動画、テキスト読み上げ

終点: POST /v1/chat/completions

費用例: 1 10k文字 × $0 = $0 。

stepaudio-2.5-tts

StepAudio 2.5 TTS — インラインの自然言語指示、表現力豊かな発話、内蔵音声、およびOpenAI-compatibleオーディオ出力による文脈に応じた音声合成。

タスク: 音声付き動画、テキスト読み上げ

終点: POST /v1/audio/speech

費用例: 1 10.85k文字 × $0.85 = $0.85 。

glm-tts

GLM-TTS — 表現力豊かな音声合成、ストリーミング出力、高速なファーストオーディオ、音声、速度、音量のコントロールを備えた、文脈認識型の音声合成。

タスク: 音声付き動画、テキスト読み上げ

終点: POST /v1/audio/speech

費用例: 1 10.307692k文字 × $0.307692 = $0.307692 。

qwen3-asr-flash

Qwen3-ASR-Flash — 言語ヒント、逆テキスト正規化、感情認識、およびOpenAI-compatible音声入力による多言語ファイル文字起こし。

タスク: 音声付き動画、文字起こし

終点: POST /v1/audio/transcriptions

費用例: 1音声時間 × $0.123539 = $0.123539 。

qwen3-tts-flash

Qwen3-TTS-Flash — 低遅延の多言語音声合成、混合言語入力、内蔵音声、自動言語マッチング、文字ベースの課金機能。

タスク: 音声付き動画、テキスト読み上げ

終点: POST /v1/audio/speech

費用例: 1 10.123077k文字 × $0.123077 = $0.123077 。

speech-2.8-hd

MiniMax音声2.8 HD — 自然な感情表現、言語強化、音声制御、およびプロダクションオーディオフォーマットを備えた高忠実度音声合成。

タスク: 音声付き動画、テキスト読み上げ

終点: POST /v1/audio/speech

費用例: 1 10.538462k文字 × $0.538462 = $0.538462 。

speech-2.8-turbo

MiniMax音声2.8 Turbo — 自然な出力、感情制御、言語強化、一般的な制作オーディオフォーマットを備えた、速度重視の音声合成。

タスク: 音声付き動画、テキスト読み上げ

終点: POST /v1/audio/speech

費用例: 1 10.307692k文字 × $0.307692 = $0.307692 。

step-tts-2

ステップTTS 2 — 公式音声とクローン音声による表現力豊かな音声合成、速度と音量の調整、発音マッピング、および複数の出力フォーマット。

タスク: 音声付き動画、テキスト読み上げ

終点: POST /v1/audio/speech

費用例: 1 10.4k文字 × $0.4 = $0.4 。

step-tts-mini

Step TTS Mini — 中国語、英語、日本語、広東語、四川語に対応した、コスト効率に優れた表現力豊かな音声合成。公式音声とクローン音声の両方に対応。

タスク: 音声付き動画、テキスト読み上げ

終点: POST /v1/audio/speech

費用例: 1 10.15k文字 × $0.15 = $0.15 。

stepaudio-2.5-asr

StepAudio 2.5 ASR — 中国語-英語の高速認識、ITN正規化、字幕、会議、音声エージェントのための4B MTP ストリーミング文字起こしモデル。

タスク: 音声付き動画、文字起こし

終点: POST /v1/audio/transcriptions

費用例: 1音声時間 × $0.022 = $0.022 。

登録前に実行または概算を行う。

APIを計算するcurl、Python、またはJavaScriptを生成するSeedance 2エージェントレシピをインストールします

情報源と方法: 公開モデル価格データセット更新済み2026-08-08 。制限事項は上記に記載されています。第三者の主張は、それらを引用しているモデルページの横にそのまま残っています。