入力
オーディオファイルまたはベース。 api_modeに応じinput_audio 64 。
音声認識機能センター
文字起こしモデルとASRモデルを、正確なエンドポイントモード、音声時間あたりの料金、入力、文字起こし出力、および制限事項に基づいて比較します。
契約
オーディオファイルまたはベース。 api_modeに応じinput_audio 64 。
書き起こしテキスト、または構造化された書き起こし応答。
POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode
記載されている公開エンドポイントモードに対して同期的に動作します。トランスクリプトを永続化し、拒否されたファイル形式を明示的に処理します。
サポートされているタスク
転写
制限: ファイルサイズ、再生時間、音声ダイアライゼーション、タイムスタンプ、方言対応範囲、および対応フォーマットは、モデルに明示的に記載されていない限り不明です。
マッチングカタログ
不明な機能は省略され、モデル名から推測されることもありません。価格例は同期された公開データを使用していますが、Dashのリアルタイム価格情報が正当です。
StepFun StepAudio 2 ASR Pro — パラメータ32Bの音声認識モデルで、StepFunのASR系では精度重視の選択肢、stepaudio-2.5-asrは速度とコスト重視の選択肢です。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。
タスク: 音声付き動画、文字起こし
終点: POST /v1/audio/transcriptions
費用例: 1音声時間 × $0.35 = $0.35 。
StepFun step-asr — 中国語、英語、中国語方言に対応した汎用音声認識。文字起こし、議事録、通話品質のレビュー、音声検索に使えます。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。
タスク: 音声付き動画、文字起こし
終点: POST /v1/audio/transcriptions
費用例: 1音声時間 × $0.15 = $0.15 。
StepFun step-asr-1.1 — step-asr系の汎用認識モデルを更新したもので、中国語、英語、中国語方言に対応します。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。
タスク: 音声付き動画、文字起こし
終点: POST /v1/audio/transcriptions
費用例: 1音声時間 × $0.35 = $0.35 。
Xiaomi MiMo-V2.5-ASR — 中国語、英語、コードスイッチング、地域方言、ノイズの多い録音、遠距離音声、複数話者、歌詞の音声認識。
タスク: 音声付き動画、文字起こし
終点: POST /v1/chat/completions
費用例: 1音声時間 × $0.074 = $0.074 。
Qwen3-ASR-Flash — 言語ヒント、逆テキスト正規化、感情認識、およびOpenAI-compatible音声入力による多言語ファイル文字起こし。
タスク: 音声付き動画、文字起こし
終点: POST /v1/audio/transcriptions
費用例: 1音声時間 × $0.123539 = $0.123539 。
StepAudio 2.5 ASR — 中国語-英語の高速認識、ITN正規化、字幕、会議、音声エージェントのための4B MTP ストリーミング文字起こしモデル。
タスク: 音声付き動画、文字起こし
終点: POST /v1/audio/transcriptions
費用例: 1音声時間 × $0.022 = $0.022 。
APIを計算する ・ curl、Python、またはJavaScriptを生成する ・ Seedance 2エージェントレシピをインストールします
情報源と方法: 公開モデル価格データセット更新済み2026-08-08 。制限事項は上記に記載されています。第三者の主張は、それらを引用しているモデルページの横にそのまま残っています。