入力
モデルのapi_modeに応じて、音声ファイルまたはbase64のinput_audioペイロード。
音声認識機能センター
文字起こしモデルとASRモデルを、正確なエンドポイントモード、音声時間あたりの料金、入力、文字起こし出力、および制限事項に基づいて比較します。
契約
モデルのapi_modeに応じて、音声ファイルまたはbase64のinput_audioペイロード。
書き起こしテキスト、または構造化された書き起こし応答。
POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode
記載されている公開エンドポイントモードに対して同期的に動作します。トランスクリプトを永続化し、拒否されたファイル形式を明示的に処理します。
サポートされているタスク
文字起こし
制限: ファイルサイズ、再生時間、音声ダイアライゼーション、タイムスタンプ、方言対応範囲、および対応フォーマットは、モデルに明示的に記載されていない限り不明です。
マッチングカタログ
不明な機能は省略され、モデル名から推測されることもありません。価格例は同期された公開データを使用していますが、Dashのリアルタイム価格情報が正当です。
StepFun StepAudio 2 ASR Pro — パラメータ32Bの音声認識モデルで、StepFunのASR系では精度重視の選択肢、stepaudio-2.5-asrは速度とコスト重視の選択肢です。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。
タスク: 文字起こし
終点: POST /v1/audio/transcriptions
費用例: 1音声時間 × $0.296296 = $0.296296。
Xiaomi MiMo-V2.5-ASR — 中国語、英語、コードスイッチング、地域方言、ノイズの多い録音、遠距離音声、複数話者、歌詞の音声認識。
タスク: 文字起こし
終点: POST /v1/chat/completions
費用例: 1音声時間 × $0.074 = $0.074。
Qwen3-ASR-Flash — 言語ヒント、逆テキスト正規化、感情認識、およびOpenAI-compatible音声入力による多言語ファイル文字起こし。
タスク: 文字起こし
終点: POST /v1/audio/transcriptions
費用例: 1音声時間 × $0.126 = $0.126。
StepAudio 2.5 ASR — 中国語-英語の高速認識、ITN正規化、字幕、会議、音声エージェントのための4B MTP ストリーミング文字起こしモデル。
タスク: 文字起こし
終点: POST /v1/audio/transcriptions
費用例: 1音声時間 × $0.022 = $0.022。
API コストを計算 ・ curl・Python・JavaScript のリクエストを生成
情報源と方法: 公開モデル価格データセット(2026-09-28 更新)。制限事項は上記のとおりです。第三者の主張は、それを引用するモデルページに掲載しています。