<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: id/audio-api/index.html -->

# Audio API : pemahaman dan blok bangunan komunikasi antar ucapan

> Gunakan mode titik akhir pemahaman audio terverifikasi, ASR , dan TTS tanpa memperlakukan setiap model ucapan sebagai dapat saling menggantikan.

- Canonical page: https://chinaapi.ai/id/audio-api/
- Human-readable page: https://chinaapi.ai/id/audio-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=id&utm_source=chinaapi&utm_medium=markdown&utm_campaign=audio-api

Gunakan mode titik akhir pemahaman audio terverifikasi, ASR , dan TTS tanpa memperlakukan setiap model ucapan sebagai dapat saling menggantikan.

[Coba stepaudio-2-asr-pro](https://dash.chinaapi.ai/start?task=video-with-audio&model=stepaudio-2-asr-pro&lang=id&utm_source=chinaapi&utm_medium=capability&utm_campaign=audio-api)

[Buat permintaan](https://chinaapi.ai/tools/api-request-generator/)

## Masukan, keluaran, dan siklus hidup.

### Masukan

Audio untuk pemahaman/transkripsi, atau teks untuk sintesis, menggunakan api_mode yang tepat dari model yang dipilih.

### Keluaran

Analisis teks/transkrip atau audio yang dihasilkan; hasil ucapan langsung tidak tersirat kecuali metadata katalog menyatakan demikian.

### Titik akhir

`Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech`

### Siklus hidup

Endpoint audio yang tercantum bersifat sinkron; alur kerja ucapan ke ucapan menghubungkan transkripsi atau pemahaman audio ke permintaan TTS terpisah.

## Satu definisi untuk setiap tugas.

pemahaman audio

**Membatasi:** Label TTS atau ASR tidak membuktikan pemahaman audio secara langsung, kloning suara, diarization, atau dukungan ucapan ke ucapan.

## 14 dengan metadata eksplisit.

Kemampuan yang tidak diketahui dihilangkan, tidak pernah ditebak dari nama model. Contoh harga menggunakan data publik yang disinkronkan; Harga Dash langsung tetap menjadi acuan utama.

### [stepaudio-2-asr-pro](https://chinaapi.ai/id/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro — pengenalan ucapan 32B parameter, opsi yang mengutamakan akurasi dalam lini ASR StepFun, sementara stepaudio-2.5-asr adalah opsi kecepatan dan biaya. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

**Tugas:** video dengan audio, transkripsi

**Titik akhir:** `POST /v1/audio/transcriptions`

**Contoh biaya:** 1 jam audio × $0.35 = $0.35 .

### [step-asr](https://chinaapi.ai/id/models/step-asr/)

StepFun step-asr — pengenalan ucapan serbaguna yang mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa, untuk transkripsi, notulen rapat, tinjauan kualitas panggilan, dan pencarian suara. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

**Tugas:** video dengan audio, transkripsi

**Titik akhir:** `POST /v1/audio/transcriptions`

**Contoh biaya:** 1 jam audio × $0.15 = $0.15 .

### [step-asr-1.1](https://chinaapi.ai/id/models/step-asr-1.1/)

StepFun step-asr-1.1 — pengenal serbaguna versi terbaru dalam lini step-asr, mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

**Tugas:** video dengan audio, transkripsi

**Titik akhir:** `POST /v1/audio/transcriptions`

**Contoh biaya:** 1 jam audio × $0.35 = $0.35 .

### [mimo-v2.5-asr](https://chinaapi.ai/id/models/mimo-v2.5-asr/)

Xiaomi MiMo-V2.5-ASR — pengenalan suara untuk bahasa Mandarin, Inggris, peralihan kode, dialek regional, rekaman bising, audio jarak jauh, banyak pembicara, dan lirik.

**Tugas:** video dengan audio, transkripsi

**Titik akhir:** `POST /v1/chat/completions`

**Contoh biaya:** 1 jam audio × $0.074 = $0.074 .

### [mimo-v2.5-tts](https://chinaapi.ai/id/models/mimo-v2.5-tts/)

Xiaomi MiMo-V2.5-TTS — sintesis ucapan multibahasa ekspresif dengan suara bawaan, instruksi bergaya bahasa alami, emosi, kecepatan, nada, dialek, dan kontrol karakter.

**Tugas:** video dengan audio, teks ke ucapan

**Titik akhir:** `POST /v1/chat/completions`

**Contoh biaya:** 1 10k karakter × $0 = $0 .

### [stepaudio-2.5-tts](https://chinaapi.ai/id/models/stepaudio-2.5-tts/)

StepAudio 2.5 TTS — sintesis ucapan kontekstual dengan arahan bahasa alami sebaris, penyampaian ekspresif, suara bawaan, dan keluaran audio OpenAI-compatible .

**Tugas:** video dengan audio, teks ke ucapan

**Titik akhir:** `POST /v1/audio/speech`

**Contoh biaya:** 1 10.85k karakter × $0.85 = $0.85 .

### [glm-tts](https://chinaapi.ai/id/models/glm-tts/)

GLM-TTS — sintesis ucapan yang peka konteks dengan penyampaian ekspresif, output streaming, audio pertama yang cepat, dan kontrol untuk suara, kecepatan, dan volume.

**Tugas:** video dengan audio, teks ke ucapan

**Titik akhir:** `POST /v1/audio/speech`

**Contoh biaya:** 1 10.307692k karakter × $0.307692 = $0.307692 .

### [qwen3-asr-flash](https://chinaapi.ai/id/models/qwen3-asr-flash/)

Qwen3-ASR-Flash — transkripsi berkas multibahasa dengan petunjuk bahasa, normalisasi teks terbalik, pengenalan emosi, dan OpenAI-compatible input audio.

**Tugas:** video dengan audio, transkripsi

**Titik akhir:** `POST /v1/audio/transcriptions`

**Contoh biaya:** 1 jam audio × $0.123539 = $0.123539 .

### [qwen3-tts-flash](https://chinaapi.ai/id/models/qwen3-tts-flash/)

Qwen3-TTS-Flash — Sintesis ucapan multibahasa latensi rendah dengan input bahasa campuran, suara bawaan, pencocokan bahasa otomatis, dan penagihan berbasis karakter.

**Tugas:** video dengan audio, teks ke ucapan

**Titik akhir:** `POST /v1/audio/speech`

**Contoh biaya:** 1 10.123077k karakter × $0.123077 = $0.123077 .

### [speech-2.8-hd](https://chinaapi.ai/id/models/speech-2.8-hd/)

MiniMax 2.8 — sintesis suara fidelitas tinggi dengan penyampaian emosi alami, peningkatan bahasa, kontrol suara, dan format audio produksi.

**Tugas:** video dengan audio, teks ke ucapan

**Titik akhir:** `POST /v1/audio/speech`

**Contoh biaya:** 1 10.538462k karakter × $0.538462 = $0.538462 .

### [speech-2.8-turbo](https://chinaapi.ai/id/models/speech-2.8-turbo/)

MiniMax 2.8 — sintesis suara yang berfokus pada kecepatan dengan keluaran alami, kontrol emosi, peningkatan bahasa, dan format audio produksi umum.

**Tugas:** video dengan audio, teks ke ucapan

**Titik akhir:** `POST /v1/audio/speech`

**Contoh biaya:** 1 10.307692k karakter × $0.307692 = $0.307692 .

### [step-tts-2](https://chinaapi.ai/id/models/step-tts-2/)

Langkah TTS 2 — sintesis ucapan ekspresif dengan suara resmi dan suara tiruan, kontrol kecepatan dan volume, pemetaan pengucapan, dan berbagai format keluaran.

**Tugas:** video dengan audio, teks ke ucapan

**Titik akhir:** `POST /v1/audio/speech`

**Contoh biaya:** 1 10.4k karakter × $0.4 = $0.4 .

### [step-tts-mini](https://chinaapi.ai/id/models/step-tts-mini/)

Step TTS — sintesis ucapan ekspresif yang hemat biaya untuk bahasa Mandarin, Inggris, Jepang, Kanton, dan Sichuan, dengan suara resmi dan suara hasil kloning.

**Tugas:** video dengan audio, teks ke ucapan

**Titik akhir:** `POST /v1/audio/speech`

**Contoh biaya:** 1 10.15k karakter × $0.15 = $0.15 .

### [stepaudio-2.5-asr](https://chinaapi.ai/id/models/stepaudio-2.5-asr/)

StepAudio 2.5 ASR — sebuah model transkripsi streaming 4B untuk pengenalan bahasa Mandarin-Inggris yang cepat, normalisasi ITN, subtitle, rapat, dan agen suara.

**Tugas:** video dengan audio, transkripsi

**Titik akhir:** `POST /v1/audio/transcriptions`

**Contoh biaya:** 1 jam audio × $0.022 = $0.022 .

## Lakukan simulasi atau estimasi sebelum pendaftaran.

[Hitung API](https://chinaapi.ai/tools/api-cost-calculator/) · [Hasilkan curl, Python, atau JavaScript](https://chinaapi.ai/tools/api-request-generator/) · [Instal Resep Agen Seedance 2](https://chinaapi.ai/agent-recipes/seedance-2/)

Sumber dan metode: [kumpulan data penetapan harga model publik](https://chinaapi.ai/id/data/model-pricing/), diperbarui 2026-08-08 . Batasan-batasan telah disebutkan di atas; klaim pihak ketiga tetap berada di samping halaman model yang mengutipnya.

---

Markdown twin of https://chinaapi.ai/id/audio-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
