Direktori API ucapan bahasa Mandarin

API pengenalan suara bahasa Mandarin untuk ASR (Automatic Speech Recognition) dan teks ke suara.

Bandingkan model pengenalan suara dan sintesis suara yang tersedia lewat satu ChinaAPI key. Setiap model tetap memakai jalur permintaan aslinya. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini menggunakan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr menggunakan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts menggunakan /v1/chat/completions dengan payload audio khusus tiap model.

Katalog langsung

14 model ucapan, dihasilkan dari satu sumber data.

Model IDs , mode titik akhir, unit penagihan, kemampuan, dan harga yang ditampilkan berasal dari scripts/models-data.json, yang harga audionya diselaraskan dengan gateway ChinaAPI . Tarif media yang ditampilkan mungkin termasuk margin layanan yang mencakup penagihan input/output penyedia, pemrosesan pembayaran, risiko penolakan pembayaran, dan operasional. Margin apa pun sudah termasuk dalam tarif yang ditampilkan dan tidak ditambahkan secara terpisah. Periksa harga langsung sebelum peluncuran produksi.

stepaudio-2-asr-pro

Pengenalan suara (ASR) · StepFun

Titik akhir: POSTING /v1/audio/transcriptions

Mode permintaan: titik akhir OpenAI-compatible

Penagihan: $0.35 per jam audio

AudioSpeech-to-Text

step-asr

Pengenalan suara (ASR) · StepFun

Titik akhir: POSTING /v1/audio/transcriptions

Mode permintaan: titik akhir OpenAI-compatible

Penagihan: $0.15 per jam audio

AudioSpeech-to-TextChinese Dialects

step-asr-1.1

Pengenalan suara (ASR) · StepFun

Titik akhir: POSTING /v1/audio/transcriptions

Mode permintaan: titik akhir OpenAI-compatible

Penagihan: $0.35 per jam audio

AudioSpeech-to-TextChinese Dialects

mimo-v2.5-asr

Pengenalan suara (ASR) · Xiaomi

Titik akhir: POSTING /v1/chat/completions

Mode permintaan: Penyelesaian Obrolan dengan muatan input_audio

Penagihan: $0.074 per jam audio

AudioSpeech-to-TextMultilingualChinese DialectsNoise Robustness

mimo-v2.5-tts

Teks ke suara (TTS) · Xiaomi

Titik akhir: POSTING /v1/chat/completions

Mode permintaan: Fitur penyelesaian obrolan dengan pesan plus konfigurasi keluaran audio.

Penagihan: $0 per 10k karakter

Harga upstream gratis untuk waktu terbatas; periksa harga langsung sebelum peluncuran produksi.

AudioText-to-SpeechMultilingualStyle ControlBuilt-in Voices

stepaudio-2.5-tts

Konversi teks ke suara (TTS) · StepFun

Titik akhir: POSTING /v1/audio/speech

Mode permintaan: titik akhir OpenAI-compatible

Penagihan: $0.85 per 10k karakter

AudioText-to-SpeechContextual TTSStyle ControlBuilt-in Voices

glm-tts

Konversi teks ke suara (TTS) · Zhipu AI

Titik akhir: POSTING /v1/audio/speech

Mode permintaan: titik akhir OpenAI-compatible

Penagihan: $0.3077 per 10k karakter

AudioText-to-SpeechStreamingEmotionVoice Control

qwen3-asr-flash

Pengenalan suara (ASR) · Alibaba

Titik akhir: POSTING /v1/audio/transcriptions

Mode permintaan: titik akhir OpenAI-compatible

Penagihan: $0.1235 per jam audio

AudioSpeech-to-TextMultilingualEmotion RecognitionITN

qwen3-tts-flash

Teks ke ucapan (TTS) · Alibaba

Titik akhir: POSTING /v1/audio/speech

Mode permintaan: titik akhir OpenAI-compatible

Penagihan: $0.1231 per 10k karakter

AudioText-to-SpeechMultilingualBuilt-in VoicesStreaming

speech-2.8-hd

Konversi teks ke suara (TTS) · MiniMax

Titik akhir: POSTING /v1/audio/speech

Mode permintaan: titik akhir OpenAI-compatible

Penagihan: $0.5385 per 10k karakter

AudioText-to-SpeechHigh FidelityEmotionMultilingual

speech-2.8-turbo

Konversi teks ke suara (TTS) · MiniMax

Titik akhir: POSTING /v1/audio/speech

Mode permintaan: titik akhir OpenAI-compatible

Penagihan: $0.3077 per 10k karakter

AudioText-to-SpeechLow LatencyEmotionMultilingual

step-tts-2

Konversi teks ke suara (TTS) · StepFun

Titik akhir: POSTING /v1/audio/speech

Mode permintaan: titik akhir OpenAI-compatible

Penagihan: $0.4 per 10k karakter

AudioText-to-SpeechVoice CloningEmotionPronunciation Control

step-tts-mini

Konversi teks ke suara (TTS) · StepFun

Titik akhir: POSTING /v1/audio/speech

Mode permintaan: titik akhir OpenAI-compatible

Penagihan: $0.15 per 10k karakter

AudioText-to-SpeechMultilingualVoice CloningStyle Control

stepaudio-2.5-asr

Pengenalan suara (ASR) · StepFun

Titik akhir: POSTING /v1/audio/transcriptions

Mode permintaan: titik akhir OpenAI-compatible

Penagihan: $0.022 per jam audio

AudioSpeech-to-TextStreamingChinese and EnglishITN

Pilih berdasarkan beban kerja

ASR untuk pemahaman audio; TTS untuk keluaran suara.

Transkripsi dan pemahaman audio

stepaudio-2-asr-pro: StepFun StepAudio 2 ASR Pro — pengenalan ucapan 32B parameter, opsi yang mengutamakan akurasi dalam lini ASR StepFun, sementara stepaudio-2.5-asr adalah opsi kecepatan dan biaya. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

Transkripsi dan pemahaman audio

step-asr: StepFun step-asr — pengenalan ucapan serbaguna yang mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa, untuk transkripsi, notulen rapat, tinjauan kualitas panggilan, dan pencarian suara. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

Transkripsi dan pemahaman audio

step-asr-1.1: StepFun step-asr-1.1 — pengenal serbaguna versi terbaru dalam lini step-asr, mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

Transkripsi dan pemahaman audio

mimo-v2.5-asr: Xiaomi MiMo-V2.5-ASR — pengenalan suara untuk bahasa Mandarin, Inggris, peralihan kode, dialek regional, rekaman bising, audio jarak jauh, banyak pembicara, dan lirik.

Output suara yang dapat dikontrol

mimo-v2.5-tts: Xiaomi MiMo-V2.5-TTS — sintesis ucapan multibahasa ekspresif dengan suara bawaan, instruksi bergaya bahasa alami, emosi, kecepatan, nada, dialek, dan kontrol karakter.

Output suara melalui jalur khusus.

stepaudio-2.5-tts: StepAudio 2.5 TTS — sintesis ucapan kontekstual dengan arahan bahasa alami sebaris, penyampaian ekspresif, suara bawaan, dan keluaran audio OpenAI-compatible .

Output suara melalui jalur khusus.

glm-tts: GLM-TTS — sintesis ucapan yang peka konteks dengan penyampaian ekspresif, output streaming, audio pertama yang cepat, dan kontrol untuk suara, kecepatan, dan volume.

Transkripsi dan pemahaman audio

qwen3-asr-flash: Qwen3-ASR-Flash — transkripsi berkas multibahasa dengan petunjuk bahasa, normalisasi teks terbalik, pengenalan emosi, dan OpenAI-compatible input audio.

Output suara melalui jalur khusus.

qwen3-tts-flash: Qwen3-TTS-Flash — sintesis ucapan multibahasa latensi rendah dengan input bahasa campuran, suara bawaan, pencocokan bahasa otomatis, dan penagihan berbasis karakter.

Output suara melalui jalur khusus.

speech-2.8-hd: MiniMax Speech 2.8 HD — sintesis ucapan fidelitas tinggi dengan penyampaian emosi alami, peningkatan bahasa, kontrol suara, dan format audio produksi.

Output suara melalui jalur khusus.

speech-2.8-turbo: MiniMax Speech 2.8 Turbo — sintesis ucapan yang berfokus pada kecepatan dengan keluaran alami, kontrol emosi, peningkatan bahasa, dan format audio produksi umum.

Output suara melalui jalur khusus.

step-tts-2Langkah TTS 2 — sintesis ucapan ekspresif dengan suara resmi dan suara tiruan, kontrol kecepatan dan volume, pemetaan pengucapan, dan berbagai format keluaran.

Output suara melalui jalur khusus.

step-tts-miniStep TTS — sintesis ucapan ekspresif yang hemat biaya untuk bahasa Mandarin, Inggris, Jepang, Kanton, dan Sichuan, dengan suara resmi dan suara hasil kloning.

Transkripsi dan pemahaman audio

stepaudio-2.5-asr: StepAudio 2.5 ASR — sebuah model transkripsi streaming 4B untuk pengenalan bahasa Mandarin-Inggris yang cepat, normalisasi ITN, subtitle, rapat, dan agen suara.

Batas kompatibilitas

OpenAI-compatible tidak berarti satu jalur audio universal.

Nama rute dan format permintaan mengikuti pola OpenAI-compatible, tetapi klien harus mengirim field audio yang diwajibkan tiap model. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini menggunakan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr menggunakan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts menggunakan /v1/chat/completions dengan payload audio khusus tiap model.

Panduan Cepat

Salin permintaan untuk model dan transportasi yang Anda butuhkan.

stepaudio-2-asr-pro

Pengenalan suara ( ASR ) melalui /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2-asr-pro" \
  -F "[email protected]" \
  -F "response_format=json"

step-asr

Pengenalan suara ( ASR ) melalui /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr" \
  -F "[email protected]" \
  -F "response_format=json"

step-asr-1.1

Pengenalan suara ( ASR ) melalui /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr-1.1" \
  -F "[email protected]" \
  -F "response_format=json"

mimo-v2.5-asr

Pengenalan suara ( ASR ) melalui /v1/chat/completions

AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-asr",
    "messages": [{
      "role": "user",
      "content": [{
        "type": "input_audio",
        "input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
      }]
    }]
  }'

mimo-v2.5-tts

Teks ke ucapan ( TTS ) melalui /v1/chat/completions

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "messages": [
      {"role": "user", "content": "Natural, clear, and friendly delivery"},
      {"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
    ],
    "audio": {"format": "wav", "voice": "冰糖"}
  }' > response.json

stepaudio-2.5-tts

Teks ke ucapan ( TTS ) melalui /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-2.5-tts",
    "voice": "cixingnansheng",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

glm-tts

Teks ke ucapan ( TTS ) melalui /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "voice": "tongtong",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

qwen3-asr-flash

Pengenalan suara ( ASR ) melalui /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "[email protected]" \
  -F "response_format=json"

qwen3-tts-flash

Teks ke ucapan ( TTS ) melalui /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "voice": "Cherry",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

speech-2.8-hd

Teks ke ucapan ( TTS ) melalui /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

speech-2.8-turbo

Teks ke ucapan ( TTS ) melalui /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

step-tts-2

Teks ke ucapan ( TTS ) melalui /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "voice": "cixingnansheng",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

step-tts-mini

Teks ke ucapan ( TTS ) melalui /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-mini",
    "voice": "cixingnansheng",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

stepaudio-2.5-asr

Pengenalan suara ( ASR ) melalui /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2.5-asr" \
  -F "[email protected]" \
  -F "response_format=json"

Apakah semua model pengenalan suara ChinaAPI menggunakan endpoint audio yang sama?

No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini menggunakan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr menggunakan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts menggunakan /v1/chat/completions dengan payload audio khusus tiap model.

Bagaimana cara penagihan untuk model-model bicara tersebut?

stepaudio-2-asr-pro: $0.35 per jam audio; step-asr: $0.15 per jam audio; step-asr-1.1: $0.35 per jam audio; mimo-v2.5-asr: $0.074 per jam audio; mimo-v2.5-tts: $0 per 10k karakter; stepaudio-2.5-tts: $0.85 per 10k karakter; glm-tts: $0.3077 per 10k karakter; qwen3-asr-flash: $0.1235 per jam audio; qwen3-tts-flash: $0.1231 per 10k karakter; speech-2.8-hd: $0.5385 per 10k karakter; speech-2.8-turbo: $0.3077 per 10k karakter; step-tts-2: $0.4 per 10k karakter; step-tts-mini: $0.15 per 10k karakter; stepaudio-2.5-asr: $0.022 per jam audio. Tarif media yang ditampilkan dapat mencakup margin layanan yang menutup penagihan input/output penyedia, pemrosesan pembayaran, risiko chargeback, dan operasional. Margin apa pun sudah termasuk dalam tarif yang ditampilkan dan tidak ditambahkan terpisah. Nilai-nilai ini dirender dari katalog model, bukan disalin ke halaman ini.

Bisakah saya menggunakan model-model ini tanpa akun Tiongkok daratan?

Ya. ChinaAPI menyediakan akses tanpa akun atau nomor telepon Tiongkok daratan. Daftarkan diri untuk mendapatkan kunci, lalu gunakan rute dan muatan yang tepat seperti yang tertera untuk model yang Anda pilih.