音声認識機能センター

音声認識と文字起こしAPI

文字起こしモデルとASRモデルを、正確なエンドポイントモード、音声時間あたりの料金、入力、文字起こし出力、および制限事項に基づいて比較します。

契約

入力、出力、およびライフサイクル。

入力

モデルのapi_modeに応じて、音声ファイルまたはbase64のinput_audioペイロード。

出力

書き起こしテキスト、または構造化された書き起こし応答。

終点

POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode

ライフサイクル

記載されている公開エンドポイントモードに対して同期的に動作します。トランスクリプトを永続化し、拒否されたファイル形式を明示的に処理します。

サポートされているタスク

タスクごとに定義を1つ。

文字起こし

制限: ファイルサイズ、再生時間、音声ダイアライゼーション、タイムスタンプ、方言対応範囲、および対応フォーマットは、モデルに明示的に記載されていない限り不明です。

マッチングカタログ

明示的なメタデータを持つ4。

不明な機能は省略され、モデル名から推測されることもありません。価格例は同期された公開データを使用していますが、Dashのリアルタイム価格情報が正当です。

stepaudio-2-asr-pro

StepFun StepAudio 2 ASR Pro — パラメータ32Bの音声認識モデルで、StepFunのASR系では精度重視の選択肢、stepaudio-2.5-asrは速度とコスト重視の選択肢です。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

タスク: 文字起こし

終点: POST /v1/audio/transcriptions

費用例: 1音声時間 × $0.296296 = $0.296296。

mimo-v2.5-asr

Xiaomi MiMo-V2.5-ASR — 中国語、英語、コードスイッチング、地域方言、ノイズの多い録音、遠距離音声、複数話者、歌詞の音声認識。

タスク: 文字起こし

終点: POST /v1/chat/completions

費用例: 1音声時間 × $0.074 = $0.074。

qwen3-asr-flash

Qwen3-ASR-Flash — 言語ヒント、逆テキスト正規化、感情認識、およびOpenAI-compatible音声入力による多言語ファイル文字起こし。

タスク: 文字起こし

終点: POST /v1/audio/transcriptions

費用例: 1音声時間 × $0.126 = $0.126。

stepaudio-2.5-asr

StepAudio 2.5 ASR — 中国語-英語の高速認識、ITN正規化、字幕、会議、音声エージェントのための4B MTP ストリーミング文字起こしモデル。

タスク: 文字起こし

終点: POST /v1/audio/transcriptions

費用例: 1音声時間 × $0.022 = $0.022。

登録前に実行または概算を行う。

API コストを計算 ・ curl・Python・JavaScript のリクエストを生成

情報源と方法: 公開モデル価格データセット(2026-09-28 更新)。制限事項は上記のとおりです。第三者の主張は、それを引用するモデルページに掲載しています。