pusat kemampuan audio-ucapan

Konversi Ucapan ke Teks dan Transkripsi API

Bandingkan model transkripsi dan ASR berdasarkan mode titik akhir yang tepat, harga per jam audio, input, output transkrip, dan keterbatasan.

Kontrak

Masukan, keluaran, dan siklus hidup.

Masukan

Berkas audio atau basis; 64 input_audio muatan, tergantung pada modelnya api_mode .

Keluaran

Transkrip teks atau respons transkripsi terstruktur.

Titik akhir

POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode

Siklus hidup

Sinkron untuk mode titik akhir publik yang tercantum. Menyimpan transkrip dan menangani format file yang ditolak secara eksplisit.

Tugas yang didukung

Satu definisi untuk setiap tugas.

transkripsi

Membatasi: Ukuran file, durasi, diarisasi, stempel waktu, cakupan dialek, dan format yang diterima tidak diketahui kecuali tercantum secara eksplisit untuk model tersebut.

Katalog yang cocok

6 dengan metadata eksplisit.

Kemampuan yang tidak diketahui dihilangkan, tidak pernah ditebak dari nama model. Contoh harga menggunakan data publik yang disinkronkan; Harga Dash langsung tetap menjadi acuan utama.

stepaudio-2-asr-pro

StepFun StepAudio 2 ASR Pro — pengenalan ucapan 32B parameter, opsi yang mengutamakan akurasi dalam lini ASR StepFun, sementara stepaudio-2.5-asr adalah opsi kecepatan dan biaya. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

Tugas: video dengan audio, transkripsi

Titik akhir: POST /v1/audio/transcriptions

Contoh biaya: 1 jam audio × $0.35 = $0.35 .

step-asr

StepFun step-asr — pengenalan ucapan serbaguna yang mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa, untuk transkripsi, notulen rapat, tinjauan kualitas panggilan, dan pencarian suara. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

Tugas: video dengan audio, transkripsi

Titik akhir: POST /v1/audio/transcriptions

Contoh biaya: 1 jam audio × $0.15 = $0.15 .

step-asr-1.1

StepFun step-asr-1.1 — pengenal serbaguna versi terbaru dalam lini step-asr, mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

Tugas: video dengan audio, transkripsi

Titik akhir: POST /v1/audio/transcriptions

Contoh biaya: 1 jam audio × $0.35 = $0.35 .

mimo-v2.5-asr

Xiaomi MiMo-V2.5-ASR — pengenalan suara untuk bahasa Mandarin, Inggris, peralihan kode, dialek regional, rekaman bising, audio jarak jauh, banyak pembicara, dan lirik.

Tugas: video dengan audio, transkripsi

Titik akhir: POST /v1/chat/completions

Contoh biaya: 1 jam audio × $0.074 = $0.074 .

qwen3-asr-flash

Qwen3-ASR-Flash — transkripsi berkas multibahasa dengan petunjuk bahasa, normalisasi teks terbalik, pengenalan emosi, dan OpenAI-compatible input audio.

Tugas: video dengan audio, transkripsi

Titik akhir: POST /v1/audio/transcriptions

Contoh biaya: 1 jam audio × $0.123539 = $0.123539 .

stepaudio-2.5-asr

StepAudio 2.5 ASR — sebuah model transkripsi streaming 4B untuk pengenalan bahasa Mandarin-Inggris yang cepat, normalisasi ITN, subtitle, rapat, dan agen suara.

Tugas: video dengan audio, transkripsi

Titik akhir: POST /v1/audio/transcriptions

Contoh biaya: 1 jam audio × $0.022 = $0.022 .

Lakukan simulasi atau estimasi sebelum pendaftaran.

Hitung API · Hasilkan curl, Python, atau JavaScript · Instal Resep Agen Seedance 2

Sumber dan metode: kumpulan data penetapan harga model publik, diperbarui 2026-08-08 . Batasan-batasan telah disebutkan di atas; klaim pihak ketiga tetap berada di samping halaman model yang mengutipnya.