Masukan
Berkas audio atau basis; 64 input_audio muatan, tergantung pada modelnya api_mode .
pusat kemampuan audio-ucapan
Bandingkan model transkripsi dan ASR berdasarkan mode titik akhir yang tepat, harga per jam audio, input, output transkrip, dan keterbatasan.
Kontrak
Berkas audio atau basis; 64 input_audio muatan, tergantung pada modelnya api_mode .
Transkrip teks atau respons transkripsi terstruktur.
POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode
Sinkron untuk mode titik akhir publik yang tercantum. Menyimpan transkrip dan menangani format file yang ditolak secara eksplisit.
Tugas yang didukung
transkripsi
Membatasi: Ukuran file, durasi, diarisasi, stempel waktu, cakupan dialek, dan format yang diterima tidak diketahui kecuali tercantum secara eksplisit untuk model tersebut.
Katalog yang cocok
Kemampuan yang tidak diketahui dihilangkan, tidak pernah ditebak dari nama model. Contoh harga menggunakan data publik yang disinkronkan; Harga Dash langsung tetap menjadi acuan utama.
StepFun StepAudio 2 ASR Pro — pengenalan ucapan 32B parameter, opsi yang mengutamakan akurasi dalam lini ASR StepFun, sementara stepaudio-2.5-asr adalah opsi kecepatan dan biaya. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
Tugas: video dengan audio, transkripsi
Titik akhir: POST /v1/audio/transcriptions
Contoh biaya: 1 jam audio × $0.35 = $0.35 .
StepFun step-asr — pengenalan ucapan serbaguna yang mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa, untuk transkripsi, notulen rapat, tinjauan kualitas panggilan, dan pencarian suara. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
Tugas: video dengan audio, transkripsi
Titik akhir: POST /v1/audio/transcriptions
Contoh biaya: 1 jam audio × $0.15 = $0.15 .
StepFun step-asr-1.1 — pengenal serbaguna versi terbaru dalam lini step-asr, mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
Tugas: video dengan audio, transkripsi
Titik akhir: POST /v1/audio/transcriptions
Contoh biaya: 1 jam audio × $0.35 = $0.35 .
Xiaomi MiMo-V2.5-ASR — pengenalan suara untuk bahasa Mandarin, Inggris, peralihan kode, dialek regional, rekaman bising, audio jarak jauh, banyak pembicara, dan lirik.
Tugas: video dengan audio, transkripsi
Titik akhir: POST /v1/chat/completions
Contoh biaya: 1 jam audio × $0.074 = $0.074 .
Qwen3-ASR-Flash — transkripsi berkas multibahasa dengan petunjuk bahasa, normalisasi teks terbalik, pengenalan emosi, dan OpenAI-compatible input audio.
Tugas: video dengan audio, transkripsi
Titik akhir: POST /v1/audio/transcriptions
Contoh biaya: 1 jam audio × $0.123539 = $0.123539 .
StepAudio 2.5 ASR — sebuah model transkripsi streaming 4B untuk pengenalan bahasa Mandarin-Inggris yang cepat, normalisasi ITN, subtitle, rapat, dan agen suara.
Tugas: video dengan audio, transkripsi
Titik akhir: POST /v1/audio/transcriptions
Contoh biaya: 1 jam audio × $0.022 = $0.022 .
Hitung API · Hasilkan curl, Python, atau JavaScript · Instal Resep Agen Seedance 2
Sumber dan metode: kumpulan data penetapan harga model publik, diperbarui 2026-08-08 . Batasan-batasan telah disebutkan di atas; klaim pihak ketiga tetap berada di samping halaman model yang mengutipnya.