<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: ja/speech-to-text-api/index.html -->

# 音声認識と文字起こしAPI

> 文字起こしモデルとASRモデルを、正確なエンドポイントモード、音声時間あたりの料金、入力、文字起こし出力、および制限事項に基づいて比較します。

- Canonical page: https://chinaapi.ai/ja/speech-to-text-api/
- Human-readable page: https://chinaapi.ai/ja/speech-to-text-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=ja&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-to-text-api

文字起こしモデルとASRモデルを、正確なエンドポイントモード、音声時間あたりの料金、入力、文字起こし出力、および制限事項に基づいて比較します。

[試してみてくださいstepaudio-2-asr-pro](https://dash.chinaapi.ai/start?task=video-with-audio&model=stepaudio-2-asr-pro&lang=ja&utm_source=chinaapi&utm_medium=capability&utm_campaign=speech-to-text-api)

[リクエストを生成する](https://chinaapi.ai/tools/api-request-generator/)

## 入力、出力、およびライフサイクル。

### 入力

オーディオファイルまたはベース。 api_modeに応じinput_audio 64 。

### 出力

書き起こしテキスト、または構造化された書き起こし応答。

### 終点

`POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode`

### ライフサイクル

記載されている公開エンドポイントモードに対して同期的に動作します。トランスクリプトを永続化し、拒否されたファイル形式を明示的に処理します。

## タスクごとに定義を1つ。

転写

**制限:** ファイルサイズ、再生時間、音声ダイアライゼーション、タイムスタンプ、方言対応範囲、および対応フォーマットは、モデルに明示的に記載されていない限り不明です。

## 明示的なメタデータを持つ6 。

不明な機能は省略され、モデル名から推測されることもありません。価格例は同期された公開データを使用していますが、Dashのリアルタイム価格情報が正当です。

### [stepaudio-2-asr-pro](https://chinaapi.ai/ja/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro — パラメータ32Bの音声認識モデルで、StepFunのASR系では精度重視の選択肢、stepaudio-2.5-asrは速度とコスト重視の選択肢です。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

**タスク:** 音声付き動画、文字起こし

**終点：** `POST /v1/audio/transcriptions`

**費用例：** 1音声時間 × $0.35 = $0.35 。

### [step-asr](https://chinaapi.ai/ja/models/step-asr/)

StepFun step-asr — 中国語、英語、中国語方言に対応した汎用音声認識。文字起こし、議事録、通話品質のレビュー、音声検索に使えます。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

**タスク:** 音声付き動画、文字起こし

**終点：** `POST /v1/audio/transcriptions`

**費用例：** 1音声時間 × $0.15 = $0.15 。

### [step-asr-1.1](https://chinaapi.ai/ja/models/step-asr-1.1/)

StepFun step-asr-1.1 — step-asr系の汎用認識モデルを更新したもので、中国語、英語、中国語方言に対応します。ogg、mp3、wavのアップロードを受け付け、文字起こしの出力は課金されません。

**タスク:** 音声付き動画、文字起こし

**終点：** `POST /v1/audio/transcriptions`

**費用例：** 1音声時間 × $0.35 = $0.35 。

### [mimo-v2.5-asr](https://chinaapi.ai/ja/models/mimo-v2.5-asr/)

Xiaomi MiMo-V2.5-ASR — 中国語、英語、コードスイッチング、地域方言、ノイズの多い録音、遠距離音声、複数話者、歌詞の音声認識。

**タスク:** 音声付き動画、文字起こし

**終点：** `POST /v1/chat/completions`

**費用例：** 1音声時間 × $0.074 = $0.074 。

### [qwen3-asr-flash](https://chinaapi.ai/ja/models/qwen3-asr-flash/)

Qwen3-ASR-Flash — 言語ヒント、逆テキスト正規化、感情認識、およびOpenAI-compatible音声入力による多言語ファイル文字起こし。

**タスク:** 音声付き動画、文字起こし

**終点：** `POST /v1/audio/transcriptions`

**費用例：** 1音声時間 × $0.123539 = $0.123539 。

### [stepaudio-2.5-asr](https://chinaapi.ai/ja/models/stepaudio-2.5-asr/)

StepAudio 2.5 ASR — 中国語-英語の高速認識、ITN正規化、字幕、会議、音声エージェントのための4B MTP ストリーミング文字起こしモデル。

**タスク:** 音声付き動画、文字起こし

**終点：** `POST /v1/audio/transcriptions`

**費用例：** 1音声時間 × $0.022 = $0.022 。

## 登録前に実行または概算を行う。

[APIを計算する](https://chinaapi.ai/tools/api-cost-calculator/) ・ [curl、Python、またはJavaScriptを生成する](https://chinaapi.ai/tools/api-request-generator/) ・ [Seedance 2エージェントレシピをインストールします](https://chinaapi.ai/agent-recipes/seedance-2/)

情報源と方法： [公開モデル価格データセット](https://chinaapi.ai/ja/data/model-pricing/)更新済み2026-08-08 。制限事項は上記に記載されています。第三者の主張は、それらを引用しているモデルページの横にそのまま残っています。

---

Markdown twin of https://chinaapi.ai/ja/speech-to-text-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
