<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: id/speech-api/index.html -->

# API pengenalan suara bahasa Mandarin untuk ASR (Automatic Speech Recognition) dan teks ke suara.

> Gunakan 14 model API pengenalan suara bahasa Mandarin untuk ASR dan teks-ke-suara melalui ChinaAPI. Bandingkan titik akhir yang tepat, unit penagihan, harga USD, kemampuan, dan permintaan salin-tempel.

- Canonical page: https://chinaapi.ai/id/speech-api/
- Human-readable page: https://chinaapi.ai/id/speech-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=id&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-api

Bandingkan model pengenalan suara dan sintesis suara yang tersedia lewat satu ChinaAPI key. Setiap model tetap memakai jalur permintaan aslinya. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini menggunakan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr menggunakan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts menggunakan /v1/chat/completions dengan payload audio khusus tiap model.

[Mulai gratis — kredit $2](https://dash.chinaapi.ai/register?lang=id&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

[Lihat harga terkini](https://dash.chinaapi.ai/pricing?lang=id&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

## 14 model ucapan, dihasilkan dari satu sumber data.

Model IDs , mode titik akhir, unit penagihan, kemampuan, dan harga yang ditampilkan berasal dari `scripts/models-data.json`, yang harga audionya diselaraskan dengan gateway ChinaAPI . Tarif media yang ditampilkan mungkin termasuk margin layanan yang mencakup penagihan input/output penyedia, pemrosesan pembayaran, risiko penolakan pembayaran, dan operasional. Margin apa pun sudah termasuk dalam tarif yang ditampilkan dan tidak ditambahkan secara terpisah. Periksa harga langsung sebelum peluncuran produksi.

### [stepaudio-2-asr-pro](https://chinaapi.ai/id/models/stepaudio-2-asr-pro/)

Pengenalan suara (ASR) · StepFun

**Titik akhir:** `POSTING /v1/audio/transcriptions`

**Mode permintaan:** titik akhir OpenAI-compatible

**Penagihan:** $0.35 per jam audio

Audio Speech-to-Text

### [step-asr](https://chinaapi.ai/id/models/step-asr/)

Pengenalan suara (ASR) · StepFun

**Titik akhir:** `POSTING /v1/audio/transcriptions`

**Mode permintaan:** titik akhir OpenAI-compatible

**Penagihan:** $0.15 per jam audio

Audio Speech-to-Text Chinese Dialects

### [step-asr-1.1](https://chinaapi.ai/id/models/step-asr-1.1/)

Pengenalan suara (ASR) · StepFun

**Titik akhir:** `POSTING /v1/audio/transcriptions`

**Mode permintaan:** titik akhir OpenAI-compatible

**Penagihan:** $0.35 per jam audio

Audio Speech-to-Text Chinese Dialects

### [mimo-v2.5-asr](https://chinaapi.ai/id/models/mimo-v2.5-asr/)

Pengenalan suara (ASR) · Xiaomi

**Titik akhir:** `POSTING /v1/chat/completions`

**Mode permintaan:** Penyelesaian Obrolan dengan muatan input_audio

**Penagihan:** $0.074 per jam audio

Audio Speech-to-Text Multilingual Chinese Dialects Noise Robustness

### [mimo-v2.5-tts](https://chinaapi.ai/id/models/mimo-v2.5-tts/)

Teks ke suara (TTS) · Xiaomi

**Titik akhir:** `POSTING /v1/chat/completions`

**Mode permintaan:** Fitur penyelesaian obrolan dengan pesan plus konfigurasi keluaran audio.

**Penagihan:** $0 per 10k karakter

Harga upstream gratis untuk waktu terbatas; periksa harga langsung sebelum peluncuran produksi.

Audio Text-to-Speech Multilingual Style Control Built-in Voices

### [stepaudio-2.5-tts](https://chinaapi.ai/id/models/stepaudio-2.5-tts/)

Konversi teks ke suara (TTS) · StepFun

**Titik akhir:** `POSTING /v1/audio/speech`

**Mode permintaan:** titik akhir OpenAI-compatible

**Penagihan:** $0.85 per 10k karakter

Audio Text-to-Speech Contextual TTS Style Control Built-in Voices

### [glm-tts](https://chinaapi.ai/id/models/glm-tts/)

Konversi teks ke suara (TTS) · Zhipu AI

**Titik akhir:** `POSTING /v1/audio/speech`

**Mode permintaan:** titik akhir OpenAI-compatible

**Penagihan:** $0.3077 per 10k karakter

Audio Text-to-Speech Streaming Emotion Voice Control

### [qwen3-asr-flash](https://chinaapi.ai/id/models/qwen3-asr-flash/)

Pengenalan suara (ASR) · Alibaba

**Titik akhir:** `POSTING /v1/audio/transcriptions`

**Mode permintaan:** titik akhir OpenAI-compatible

**Penagihan:** $0.1235 per jam audio

Audio Speech-to-Text Multilingual Emotion Recognition ITN

### [qwen3-tts-flash](https://chinaapi.ai/id/models/qwen3-tts-flash/)

Teks ke ucapan (TTS) · Alibaba

**Titik akhir:** `POSTING /v1/audio/speech`

**Mode permintaan:** titik akhir OpenAI-compatible

**Penagihan:** $0.1231 per 10k karakter

Audio Text-to-Speech Multilingual Built-in Voices Streaming

### [speech-2.8-hd](https://chinaapi.ai/id/models/speech-2.8-hd/)

Konversi teks ke suara (TTS) · MiniMax

**Titik akhir:** `POSTING /v1/audio/speech`

**Mode permintaan:** titik akhir OpenAI-compatible

**Penagihan:** $0.5385 per 10k karakter

Audio Text-to-Speech High Fidelity Emotion Multilingual

### [speech-2.8-turbo](https://chinaapi.ai/id/models/speech-2.8-turbo/)

Konversi teks ke suara (TTS) · MiniMax

**Titik akhir:** `POSTING /v1/audio/speech`

**Mode permintaan:** titik akhir OpenAI-compatible

**Penagihan:** $0.3077 per 10k karakter

Audio Text-to-Speech Low Latency Emotion Multilingual

### [step-tts-2](https://chinaapi.ai/id/models/step-tts-2/)

Konversi teks ke suara (TTS) · StepFun

**Titik akhir:** `POSTING /v1/audio/speech`

**Mode permintaan:** titik akhir OpenAI-compatible

**Penagihan:** $0.4 per 10k karakter

Audio Text-to-Speech Voice Cloning Emotion Pronunciation Control

### [step-tts-mini](https://chinaapi.ai/id/models/step-tts-mini/)

Konversi teks ke suara (TTS) · StepFun

**Titik akhir:** `POSTING /v1/audio/speech`

**Mode permintaan:** titik akhir OpenAI-compatible

**Penagihan:** $0.15 per 10k karakter

Audio Text-to-Speech Multilingual Voice Cloning Style Control

### [stepaudio-2.5-asr](https://chinaapi.ai/id/models/stepaudio-2.5-asr/)

Pengenalan suara (ASR) · StepFun

**Titik akhir:** `POSTING /v1/audio/transcriptions`

**Mode permintaan:** titik akhir OpenAI-compatible

**Penagihan:** $0.022 per jam audio

Audio Speech-to-Text Streaming Chinese and English ITN

## ASR untuk pemahaman audio; TTS untuk keluaran suara.

### Transkripsi dan pemahaman audio

[stepaudio-2-asr-pro](https://chinaapi.ai/id/models/stepaudio-2-asr-pro/): StepFun StepAudio 2 ASR Pro — pengenalan ucapan 32B parameter, opsi yang mengutamakan akurasi dalam lini ASR StepFun, sementara stepaudio-2.5-asr adalah opsi kecepatan dan biaya. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

### Transkripsi dan pemahaman audio

[step-asr](https://chinaapi.ai/id/models/step-asr/): StepFun step-asr — pengenalan ucapan serbaguna yang mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa, untuk transkripsi, notulen rapat, tinjauan kualitas panggilan, dan pencarian suara. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

### Transkripsi dan pemahaman audio

[step-asr-1.1](https://chinaapi.ai/id/models/step-asr-1.1/): StepFun step-asr-1.1 — pengenal serbaguna versi terbaru dalam lini step-asr, mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

### Transkripsi dan pemahaman audio

[mimo-v2.5-asr](https://chinaapi.ai/id/models/mimo-v2.5-asr/): Xiaomi MiMo-V2.5-ASR — pengenalan suara untuk bahasa Mandarin, Inggris, peralihan kode, dialek regional, rekaman bising, audio jarak jauh, banyak pembicara, dan lirik.

### Output suara yang dapat dikontrol

[mimo-v2.5-tts](https://chinaapi.ai/id/models/mimo-v2.5-tts/): Xiaomi MiMo-V2.5-TTS — sintesis ucapan multibahasa ekspresif dengan suara bawaan, instruksi bergaya bahasa alami, emosi, kecepatan, nada, dialek, dan kontrol karakter.

### Output suara melalui jalur khusus.

[stepaudio-2.5-tts](https://chinaapi.ai/id/models/stepaudio-2.5-tts/): StepAudio 2.5 TTS — sintesis ucapan kontekstual dengan arahan bahasa alami sebaris, penyampaian ekspresif, suara bawaan, dan keluaran audio OpenAI-compatible .

### Output suara melalui jalur khusus.

[glm-tts](https://chinaapi.ai/id/models/glm-tts/): GLM-TTS — sintesis ucapan yang peka konteks dengan penyampaian ekspresif, output streaming, audio pertama yang cepat, dan kontrol untuk suara, kecepatan, dan volume.

### Transkripsi dan pemahaman audio

[qwen3-asr-flash](https://chinaapi.ai/id/models/qwen3-asr-flash/): Qwen3-ASR-Flash — transkripsi berkas multibahasa dengan petunjuk bahasa, normalisasi teks terbalik, pengenalan emosi, dan OpenAI-compatible input audio.

### Output suara melalui jalur khusus.

[qwen3-tts-flash](https://chinaapi.ai/id/models/qwen3-tts-flash/): Qwen3-TTS-Flash — sintesis ucapan multibahasa latensi rendah dengan input bahasa campuran, suara bawaan, pencocokan bahasa otomatis, dan penagihan berbasis karakter.

### Output suara melalui jalur khusus.

[speech-2.8-hd](https://chinaapi.ai/id/models/speech-2.8-hd/): MiniMax Speech 2.8 HD — sintesis ucapan fidelitas tinggi dengan penyampaian emosi alami, peningkatan bahasa, kontrol suara, dan format audio produksi.

### Output suara melalui jalur khusus.

[speech-2.8-turbo](https://chinaapi.ai/id/models/speech-2.8-turbo/): MiniMax Speech 2.8 Turbo — sintesis ucapan yang berfokus pada kecepatan dengan keluaran alami, kontrol emosi, peningkatan bahasa, dan format audio produksi umum.

### Output suara melalui jalur khusus.

[step-tts-2](https://chinaapi.ai/id/models/step-tts-2/)Langkah TTS 2 — sintesis ucapan ekspresif dengan suara resmi dan suara tiruan, kontrol kecepatan dan volume, pemetaan pengucapan, dan berbagai format keluaran.

### Output suara melalui jalur khusus.

[step-tts-mini](https://chinaapi.ai/id/models/step-tts-mini/)Step TTS — sintesis ucapan ekspresif yang hemat biaya untuk bahasa Mandarin, Inggris, Jepang, Kanton, dan Sichuan, dengan suara resmi dan suara hasil kloning.

### Transkripsi dan pemahaman audio

[stepaudio-2.5-asr](https://chinaapi.ai/id/models/stepaudio-2.5-asr/): StepAudio 2.5 ASR — sebuah model transkripsi streaming 4B untuk pengenalan bahasa Mandarin-Inggris yang cepat, normalisasi ITN, subtitle, rapat, dan agen suara.

## OpenAI-compatible tidak berarti satu jalur audio universal.

Nama rute dan format permintaan mengikuti pola OpenAI-compatible, tetapi klien harus mengirim field audio yang diwajibkan tiap model. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini menggunakan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr menggunakan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts menggunakan /v1/chat/completions dengan payload audio khusus tiap model.

## Salin permintaan untuk model dan transportasi yang Anda butuhkan.

### stepaudio-2-asr-pro

Pengenalan suara ( ASR ) melalui `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2-asr-pro" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr

Pengenalan suara ( ASR ) melalui `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr-1.1

Pengenalan suara ( ASR ) melalui `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr-1.1" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### mimo-v2.5-asr

Pengenalan suara ( ASR ) melalui `/v1/chat/completions`

```
AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-asr",
    "messages": [{
      "role": "user",
      "content": [{
        "type": "input_audio",
        "input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
      }]
    }]
  }'
```

### mimo-v2.5-tts

Teks ke ucapan ( TTS ) melalui `/v1/chat/completions`

```
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "messages": [
      {"role": "user", "content": "Natural, clear, and friendly delivery"},
      {"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
    ],
    "audio": {"format": "wav", "voice": "冰糖"}
  }' > response.json
```

### stepaudio-2.5-tts

Teks ke ucapan ( TTS ) melalui `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-2.5-tts",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### glm-tts

Teks ke ucapan ( TTS ) melalui `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "voice": "tongtong",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### qwen3-asr-flash

Pengenalan suara ( ASR ) melalui `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### qwen3-tts-flash

Teks ke ucapan ( TTS ) melalui `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "voice": "Cherry",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-hd

Teks ke ucapan ( TTS ) melalui `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-turbo

Teks ke ucapan ( TTS ) melalui `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-2

Teks ke ucapan ( TTS ) melalui `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-mini

Teks ke ucapan ( TTS ) melalui `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-mini",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### stepaudio-2.5-asr

Pengenalan suara ( ASR ) melalui `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2.5-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

## Apakah semua model pengenalan suara ChinaAPI menggunakan endpoint audio yang sama?

No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini menggunakan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr menggunakan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts menggunakan /v1/chat/completions dengan payload audio khusus tiap model.

## Bagaimana cara penagihan untuk model-model bicara tersebut?

stepaudio-2-asr-pro: $0.35 per jam audio; step-asr: $0.15 per jam audio; step-asr-1.1: $0.35 per jam audio; mimo-v2.5-asr: $0.074 per jam audio; mimo-v2.5-tts: $0 per 10k karakter; stepaudio-2.5-tts: $0.85 per 10k karakter; glm-tts: $0.3077 per 10k karakter; qwen3-asr-flash: $0.1235 per jam audio; qwen3-tts-flash: $0.1231 per 10k karakter; speech-2.8-hd: $0.5385 per 10k karakter; speech-2.8-turbo: $0.3077 per 10k karakter; step-tts-2: $0.4 per 10k karakter; step-tts-mini: $0.15 per 10k karakter; stepaudio-2.5-asr: $0.022 per jam audio. Tarif media yang ditampilkan dapat mencakup margin layanan yang menutup penagihan input/output penyedia, pemrosesan pembayaran, risiko chargeback, dan operasional. Margin apa pun sudah termasuk dalam tarif yang ditampilkan dan tidak ditambahkan terpisah. Nilai-nilai ini dirender dari katalog model, bukan disalin ke halaman ini.

## Bisakah saya menggunakan model-model ini tanpa akun Tiongkok daratan?

Ya. ChinaAPI menyediakan akses tanpa akun atau nomor telepon Tiongkok daratan. Daftarkan diri untuk mendapatkan kunci, lalu gunakan rute dan muatan yang tepat seperti yang tertera untuk model yang Anda pilih.

---

Markdown twin of https://chinaapi.ai/id/speech-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
