stepaudio-2-asr-pro
Pengenalan suara (ASR) · StepFun
Titik akhir: POSTING /v1/audio/transcriptions
Mode permintaan: titik akhir OpenAI-compatible
Penagihan: $0.35 per jam audio
Direktori API ucapan bahasa Mandarin
Bandingkan model pengenalan suara dan sintesis suara yang tersedia lewat satu ChinaAPI key. Setiap model tetap memakai jalur permintaan aslinya. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini menggunakan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr menggunakan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts menggunakan /v1/chat/completions dengan payload audio khusus tiap model.
Katalog langsung
Model IDs , mode titik akhir, unit penagihan, kemampuan, dan harga yang ditampilkan berasal dari scripts/models-data.json, yang harga audionya diselaraskan dengan gateway ChinaAPI . Tarif media yang ditampilkan mungkin termasuk margin layanan yang mencakup penagihan input/output penyedia, pemrosesan pembayaran, risiko penolakan pembayaran, dan operasional. Margin apa pun sudah termasuk dalam tarif yang ditampilkan dan tidak ditambahkan secara terpisah. Periksa harga langsung sebelum peluncuran produksi.
Pengenalan suara (ASR) · StepFun
Titik akhir: POSTING /v1/audio/transcriptions
Mode permintaan: titik akhir OpenAI-compatible
Penagihan: $0.35 per jam audio
Pengenalan suara (ASR) · StepFun
Titik akhir: POSTING /v1/audio/transcriptions
Mode permintaan: titik akhir OpenAI-compatible
Penagihan: $0.15 per jam audio
Pengenalan suara (ASR) · StepFun
Titik akhir: POSTING /v1/audio/transcriptions
Mode permintaan: titik akhir OpenAI-compatible
Penagihan: $0.35 per jam audio
Pengenalan suara (ASR) · Xiaomi
Titik akhir: POSTING /v1/chat/completions
Mode permintaan: Penyelesaian Obrolan dengan muatan input_audio
Penagihan: $0.074 per jam audio
Teks ke suara (TTS) · Xiaomi
Titik akhir: POSTING /v1/chat/completions
Mode permintaan: Fitur penyelesaian obrolan dengan pesan plus konfigurasi keluaran audio.
Penagihan: $0 per 10k karakter
Harga upstream gratis untuk waktu terbatas; periksa harga langsung sebelum peluncuran produksi.
Konversi teks ke suara (TTS) · StepFun
Titik akhir: POSTING /v1/audio/speech
Mode permintaan: titik akhir OpenAI-compatible
Penagihan: $0.85 per 10k karakter
Konversi teks ke suara (TTS) · Zhipu AI
Titik akhir: POSTING /v1/audio/speech
Mode permintaan: titik akhir OpenAI-compatible
Penagihan: $0.3077 per 10k karakter
Pengenalan suara (ASR) · Alibaba
Titik akhir: POSTING /v1/audio/transcriptions
Mode permintaan: titik akhir OpenAI-compatible
Penagihan: $0.1235 per jam audio
Teks ke ucapan (TTS) · Alibaba
Titik akhir: POSTING /v1/audio/speech
Mode permintaan: titik akhir OpenAI-compatible
Penagihan: $0.1231 per 10k karakter
Konversi teks ke suara (TTS) · MiniMax
Titik akhir: POSTING /v1/audio/speech
Mode permintaan: titik akhir OpenAI-compatible
Penagihan: $0.5385 per 10k karakter
Konversi teks ke suara (TTS) · MiniMax
Titik akhir: POSTING /v1/audio/speech
Mode permintaan: titik akhir OpenAI-compatible
Penagihan: $0.3077 per 10k karakter
Konversi teks ke suara (TTS) · StepFun
Titik akhir: POSTING /v1/audio/speech
Mode permintaan: titik akhir OpenAI-compatible
Penagihan: $0.4 per 10k karakter
Konversi teks ke suara (TTS) · StepFun
Titik akhir: POSTING /v1/audio/speech
Mode permintaan: titik akhir OpenAI-compatible
Penagihan: $0.15 per 10k karakter
Pengenalan suara (ASR) · StepFun
Titik akhir: POSTING /v1/audio/transcriptions
Mode permintaan: titik akhir OpenAI-compatible
Penagihan: $0.022 per jam audio
Pilih berdasarkan beban kerja
stepaudio-2-asr-pro: StepFun StepAudio 2 ASR Pro — pengenalan ucapan 32B parameter, opsi yang mengutamakan akurasi dalam lini ASR StepFun, sementara stepaudio-2.5-asr adalah opsi kecepatan dan biaya. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
step-asr: StepFun step-asr — pengenalan ucapan serbaguna yang mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa, untuk transkripsi, notulen rapat, tinjauan kualitas panggilan, dan pencarian suara. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
step-asr-1.1: StepFun step-asr-1.1 — pengenal serbaguna versi terbaru dalam lini step-asr, mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
mimo-v2.5-asr: Xiaomi MiMo-V2.5-ASR — pengenalan suara untuk bahasa Mandarin, Inggris, peralihan kode, dialek regional, rekaman bising, audio jarak jauh, banyak pembicara, dan lirik.
mimo-v2.5-tts: Xiaomi MiMo-V2.5-TTS — sintesis ucapan multibahasa ekspresif dengan suara bawaan, instruksi bergaya bahasa alami, emosi, kecepatan, nada, dialek, dan kontrol karakter.
stepaudio-2.5-tts: StepAudio 2.5 TTS — sintesis ucapan kontekstual dengan arahan bahasa alami sebaris, penyampaian ekspresif, suara bawaan, dan keluaran audio OpenAI-compatible .
glm-tts: GLM-TTS — sintesis ucapan yang peka konteks dengan penyampaian ekspresif, output streaming, audio pertama yang cepat, dan kontrol untuk suara, kecepatan, dan volume.
qwen3-asr-flash: Qwen3-ASR-Flash — transkripsi berkas multibahasa dengan petunjuk bahasa, normalisasi teks terbalik, pengenalan emosi, dan OpenAI-compatible input audio.
qwen3-tts-flash: Qwen3-TTS-Flash — sintesis ucapan multibahasa latensi rendah dengan input bahasa campuran, suara bawaan, pencocokan bahasa otomatis, dan penagihan berbasis karakter.
speech-2.8-hd: MiniMax Speech 2.8 HD — sintesis ucapan fidelitas tinggi dengan penyampaian emosi alami, peningkatan bahasa, kontrol suara, dan format audio produksi.
speech-2.8-turbo: MiniMax Speech 2.8 Turbo — sintesis ucapan yang berfokus pada kecepatan dengan keluaran alami, kontrol emosi, peningkatan bahasa, dan format audio produksi umum.
step-tts-2Langkah TTS 2 — sintesis ucapan ekspresif dengan suara resmi dan suara tiruan, kontrol kecepatan dan volume, pemetaan pengucapan, dan berbagai format keluaran.
step-tts-miniStep TTS — sintesis ucapan ekspresif yang hemat biaya untuk bahasa Mandarin, Inggris, Jepang, Kanton, dan Sichuan, dengan suara resmi dan suara hasil kloning.
stepaudio-2.5-asr: StepAudio 2.5 ASR — sebuah model transkripsi streaming 4B untuk pengenalan bahasa Mandarin-Inggris yang cepat, normalisasi ITN, subtitle, rapat, dan agen suara.
Batas kompatibilitas
Nama rute dan format permintaan mengikuti pola OpenAI-compatible, tetapi klien harus mengirim field audio yang diwajibkan tiap model. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini menggunakan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr menggunakan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts menggunakan /v1/chat/completions dengan payload audio khusus tiap model.
Panduan Cepat
Pengenalan suara ( ASR ) melalui /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=stepaudio-2-asr-pro" \
-F "[email protected]" \
-F "response_format=json"
Pengenalan suara ( ASR ) melalui /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=step-asr" \
-F "[email protected]" \
-F "response_format=json"
Pengenalan suara ( ASR ) melalui /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=step-asr-1.1" \
-F "[email protected]" \
-F "response_format=json"
Pengenalan suara ( ASR ) melalui /v1/chat/completions
AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.5-asr",
"messages": [{
"role": "user",
"content": [{
"type": "input_audio",
"input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
}]
}]
}'
Teks ke ucapan ( TTS ) melalui /v1/chat/completions
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.5-tts",
"messages": [
{"role": "user", "content": "Natural, clear, and friendly delivery"},
{"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
],
"audio": {"format": "wav", "voice": "冰糖"}
}' > response.json
Teks ke ucapan ( TTS ) melalui /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2.5-tts",
"voice": "cixingnansheng",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Teks ke ucapan ( TTS ) melalui /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-tts",
"voice": "tongtong",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Pengenalan suara ( ASR ) melalui /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=qwen3-asr-flash" \
-F "[email protected]" \
-F "response_format=json"
Teks ke ucapan ( TTS ) melalui /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-tts-flash",
"voice": "Cherry",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Teks ke ucapan ( TTS ) melalui /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "speech-2.8-hd",
"voice": "Chinese (Mandarin)_Warm_Bestie",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Teks ke ucapan ( TTS ) melalui /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "speech-2.8-turbo",
"voice": "Chinese (Mandarin)_Warm_Bestie",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Teks ke ucapan ( TTS ) melalui /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-2",
"voice": "cixingnansheng",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Teks ke ucapan ( TTS ) melalui /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-mini",
"voice": "cixingnansheng",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Pengenalan suara ( ASR ) melalui /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=stepaudio-2.5-asr" \
-F "[email protected]" \
-F "response_format=json"
No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini menggunakan /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr menggunakan /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts menggunakan /v1/chat/completions dengan payload audio khusus tiap model.
stepaudio-2-asr-pro: $0.35 per jam audio; step-asr: $0.15 per jam audio; step-asr-1.1: $0.35 per jam audio; mimo-v2.5-asr: $0.074 per jam audio; mimo-v2.5-tts: $0 per 10k karakter; stepaudio-2.5-tts: $0.85 per 10k karakter; glm-tts: $0.3077 per 10k karakter; qwen3-asr-flash: $0.1235 per jam audio; qwen3-tts-flash: $0.1231 per 10k karakter; speech-2.8-hd: $0.5385 per 10k karakter; speech-2.8-turbo: $0.3077 per 10k karakter; step-tts-2: $0.4 per 10k karakter; step-tts-mini: $0.15 per 10k karakter; stepaudio-2.5-asr: $0.022 per jam audio. Tarif media yang ditampilkan dapat mencakup margin layanan yang menutup penagihan input/output penyedia, pemrosesan pembayaran, risiko chargeback, dan operasional. Margin apa pun sudah termasuk dalam tarif yang ditampilkan dan tidak ditambahkan terpisah. Nilai-nilai ini dirender dari katalog model, bukan disalin ke halaman ini.
Ya. ChinaAPI menyediakan akses tanpa akun atau nomor telepon Tiongkok daratan. Daftarkan diri untuk mendapatkan kunci, lalu gunakan rute dan muatan yang tepat seperti yang tertera untuk model yang Anda pilih.