<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: id/speech-to-text-api/index.html -->

# Konversi Ucapan ke Teks dan Transkripsi API

> Bandingkan model transkripsi dan ASR berdasarkan mode titik akhir yang tepat, harga per jam audio, input, output transkrip, dan keterbatasan.

- Canonical page: https://chinaapi.ai/id/speech-to-text-api/
- Human-readable page: https://chinaapi.ai/id/speech-to-text-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=id&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-to-text-api

Bandingkan model transkripsi dan ASR berdasarkan mode titik akhir yang tepat, harga per jam audio, input, output transkrip, dan keterbatasan.

[Coba stepaudio-2-asr-pro](https://dash.chinaapi.ai/start?task=video-with-audio&model=stepaudio-2-asr-pro&lang=id&utm_source=chinaapi&utm_medium=capability&utm_campaign=speech-to-text-api)

[Buat permintaan](https://chinaapi.ai/tools/api-request-generator/)

## Masukan, keluaran, dan siklus hidup.

### Masukan

Berkas audio atau basis; 64 input_audio muatan, tergantung pada modelnya api_mode .

### Keluaran

Transkrip teks atau respons transkripsi terstruktur.

### Titik akhir

`POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode`

### Siklus hidup

Sinkron untuk mode titik akhir publik yang tercantum. Menyimpan transkrip dan menangani format file yang ditolak secara eksplisit.

## Satu definisi untuk setiap tugas.

transkripsi

**Membatasi:** Ukuran file, durasi, diarisasi, stempel waktu, cakupan dialek, dan format yang diterima tidak diketahui kecuali tercantum secara eksplisit untuk model tersebut.

## 6 dengan metadata eksplisit.

Kemampuan yang tidak diketahui dihilangkan, tidak pernah ditebak dari nama model. Contoh harga menggunakan data publik yang disinkronkan; Harga Dash langsung tetap menjadi acuan utama.

### [stepaudio-2-asr-pro](https://chinaapi.ai/id/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro — pengenalan ucapan 32B parameter, opsi yang mengutamakan akurasi dalam lini ASR StepFun, sementara stepaudio-2.5-asr adalah opsi kecepatan dan biaya. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

**Tugas:** video dengan audio, transkripsi

**Titik akhir:** `POST /v1/audio/transcriptions`

**Contoh biaya:** 1 jam audio × $0.35 = $0.35 .

### [step-asr](https://chinaapi.ai/id/models/step-asr/)

StepFun step-asr — pengenalan ucapan serbaguna yang mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa, untuk transkripsi, notulen rapat, tinjauan kualitas panggilan, dan pencarian suara. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

**Tugas:** video dengan audio, transkripsi

**Titik akhir:** `POST /v1/audio/transcriptions`

**Contoh biaya:** 1 jam audio × $0.15 = $0.15 .

### [step-asr-1.1](https://chinaapi.ai/id/models/step-asr-1.1/)

StepFun step-asr-1.1 — pengenal serbaguna versi terbaru dalam lini step-asr, mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

**Tugas:** video dengan audio, transkripsi

**Titik akhir:** `POST /v1/audio/transcriptions`

**Contoh biaya:** 1 jam audio × $0.35 = $0.35 .

### [mimo-v2.5-asr](https://chinaapi.ai/id/models/mimo-v2.5-asr/)

Xiaomi MiMo-V2.5-ASR — pengenalan suara untuk bahasa Mandarin, Inggris, peralihan kode, dialek regional, rekaman bising, audio jarak jauh, banyak pembicara, dan lirik.

**Tugas:** video dengan audio, transkripsi

**Titik akhir:** `POST /v1/chat/completions`

**Contoh biaya:** 1 jam audio × $0.074 = $0.074 .

### [qwen3-asr-flash](https://chinaapi.ai/id/models/qwen3-asr-flash/)

Qwen3-ASR-Flash — transkripsi berkas multibahasa dengan petunjuk bahasa, normalisasi teks terbalik, pengenalan emosi, dan OpenAI-compatible input audio.

**Tugas:** video dengan audio, transkripsi

**Titik akhir:** `POST /v1/audio/transcriptions`

**Contoh biaya:** 1 jam audio × $0.123539 = $0.123539 .

### [stepaudio-2.5-asr](https://chinaapi.ai/id/models/stepaudio-2.5-asr/)

StepAudio 2.5 ASR — sebuah model transkripsi streaming 4B untuk pengenalan bahasa Mandarin-Inggris yang cepat, normalisasi ITN, subtitle, rapat, dan agen suara.

**Tugas:** video dengan audio, transkripsi

**Titik akhir:** `POST /v1/audio/transcriptions`

**Contoh biaya:** 1 jam audio × $0.022 = $0.022 .

## Lakukan simulasi atau estimasi sebelum pendaftaran.

[Hitung API](https://chinaapi.ai/tools/api-cost-calculator/) · [Hasilkan curl, Python, atau JavaScript](https://chinaapi.ai/tools/api-request-generator/) · [Instal Resep Agen Seedance 2](https://chinaapi.ai/agent-recipes/seedance-2/)

Sumber dan metode: [kumpulan data penetapan harga model publik](https://chinaapi.ai/id/data/model-pricing/), diperbarui 2026-08-08 . Batasan-batasan telah disebutkan di atas; klaim pihak ketiga tetap berada di samping halaman model yang mengutipnya.

---

Markdown twin of https://chinaapi.ai/id/speech-to-text-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
