音声認識機能センター

音声認識と文字起こしAPI

文字起こしモデルとASRモデルを、正確なエンドポイントモード、音声時間あたりの料金、入力、文字起こし出力、および制限事項に基づいて比較します。

契約

入力、出力、およびライフサイクル。

入力

オーディオファイルまたはベース。 api_modeに応じinput_audio 64 。

出力

書き起こしテキスト、または構造化された書き起こし応答。

終点

POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode

ライフサイクル

記載されている公開エンドポイントモードに対して同期的に動作します。トランスクリプトを永続化し、拒否されたファイル形式を明示的に処理します。

サポートされているタスク

タスクごとに定義を1つ。

転写

制限: ファイルサイズ、再生時間、音声ダイアライゼーション、タイムスタンプ、方言対応範囲、および対応フォーマットは、モデルに明示的に記載されていない限り不明です。

マッチングカタログ

明示的なメタデータを持つ6 。

不明な機能は省略され、モデル名から推測されることもありません。価格例は同期された公開データを使用していますが、Dashのリアルタイム価格情報が正当です。

stepaudio-2-asr-pro

StepFun StepAudio 2 ASR Pro — パラメータ32Bの音声認識モデルで、StepFunのASR系では精度重視の選択肢、stepaudio-2.5-asrは速度とコスト重視の選択肢です。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

タスク: 音声付き動画、文字起こし

終点: POST /v1/audio/transcriptions

費用例: 1音声時間 × $0.35 = $0.35 。

step-asr

StepFun step-asr — 中国語、英語、中国語方言に対応した汎用音声認識。文字起こし、議事録、通話品質のレビュー、音声検索に使えます。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

タスク: 音声付き動画、文字起こし

終点: POST /v1/audio/transcriptions

費用例: 1音声時間 × $0.15 = $0.15 。

step-asr-1.1

StepFun step-asr-1.1 — step-asr系の汎用認識モデルを更新したもので、中国語、英語、中国語方言に対応します。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

タスク: 音声付き動画、文字起こし

終点: POST /v1/audio/transcriptions

費用例: 1音声時間 × $0.35 = $0.35 。

mimo-v2.5-asr

Xiaomi MiMo-V2.5-ASR — 中国語、英語、コードスイッチング、地域方言、ノイズの多い録音、遠距離音声、複数話者、歌詞の音声認識。

タスク: 音声付き動画、文字起こし

終点: POST /v1/chat/completions

費用例: 1音声時間 × $0.074 = $0.074 。

qwen3-asr-flash

Qwen3-ASR-Flash — 言語ヒント、逆テキスト正規化、感情認識、およびOpenAI-compatible音声入力による多言語ファイル文字起こし。

タスク: 音声付き動画、文字起こし

終点: POST /v1/audio/transcriptions

費用例: 1音声時間 × $0.123539 = $0.123539 。

stepaudio-2.5-asr

StepAudio 2.5 ASR — 中国語-英語の高速認識、ITN正規化、字幕、会議、音声エージェントのための4B MTP ストリーミング文字起こしモデル。

タスク: 音声付き動画、文字起こし

終点: POST /v1/audio/transcriptions

費用例: 1音声時間 × $0.022 = $0.022 。

登録前に実行または概算を行う。

APIを計算するcurl、Python、またはJavaScriptを生成するSeedance 2エージェントレシピをインストールします

情報源と方法: 公開モデル価格データセット更新済み2026-08-08 。制限事項は上記に記載されています。第三者の主張は、それらを引用しているモデルページの横にそのまま残っています。