Masukan
Audio untuk pemahaman/transkripsi, atau teks untuk sintesis, menggunakan api_mode yang tepat dari model yang dipilih.
pusat kemampuan audio-ucapan
Gunakan mode titik akhir pemahaman audio terverifikasi, ASR , dan TTS tanpa memperlakukan setiap model ucapan sebagai dapat saling menggantikan.
Kontrak
Audio untuk pemahaman/transkripsi, atau teks untuk sintesis, menggunakan api_mode yang tepat dari model yang dipilih.
Analisis teks/transkrip atau audio yang dihasilkan; hasil ucapan langsung tidak tersirat kecuali metadata katalog menyatakan demikian.
Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech
Endpoint audio yang tercantum bersifat sinkron; alur kerja ucapan ke ucapan menghubungkan transkripsi atau pemahaman audio ke permintaan TTS terpisah.
Tugas yang didukung
pemahaman audio
Membatasi: Label TTS atau ASR tidak membuktikan pemahaman audio secara langsung, kloning suara, diarization, atau dukungan ucapan ke ucapan.
Katalog yang cocok
Kemampuan yang tidak diketahui dihilangkan, tidak pernah ditebak dari nama model. Contoh harga menggunakan data publik yang disinkronkan; Harga Dash langsung tetap menjadi acuan utama.
StepFun StepAudio 2 ASR Pro — pengenalan ucapan 32B parameter, opsi yang mengutamakan akurasi dalam lini ASR StepFun, sementara stepaudio-2.5-asr adalah opsi kecepatan dan biaya. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
Tugas: video dengan audio, transkripsi
Titik akhir: POST /v1/audio/transcriptions
Contoh biaya: 1 jam audio × $0.35 = $0.35 .
StepFun step-asr — pengenalan ucapan serbaguna yang mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa, untuk transkripsi, notulen rapat, tinjauan kualitas panggilan, dan pencarian suara. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
Tugas: video dengan audio, transkripsi
Titik akhir: POST /v1/audio/transcriptions
Contoh biaya: 1 jam audio × $0.15 = $0.15 .
StepFun step-asr-1.1 — pengenal serbaguna versi terbaru dalam lini step-asr, mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.
Tugas: video dengan audio, transkripsi
Titik akhir: POST /v1/audio/transcriptions
Contoh biaya: 1 jam audio × $0.35 = $0.35 .
Xiaomi MiMo-V2.5-ASR — pengenalan suara untuk bahasa Mandarin, Inggris, peralihan kode, dialek regional, rekaman bising, audio jarak jauh, banyak pembicara, dan lirik.
Tugas: video dengan audio, transkripsi
Titik akhir: POST /v1/chat/completions
Contoh biaya: 1 jam audio × $0.074 = $0.074 .
Xiaomi MiMo-V2.5-TTS — sintesis ucapan multibahasa ekspresif dengan suara bawaan, instruksi bergaya bahasa alami, emosi, kecepatan, nada, dialek, dan kontrol karakter.
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/chat/completions
Contoh biaya: 1 10k karakter × $0 = $0 .
StepAudio 2.5 TTS — sintesis ucapan kontekstual dengan arahan bahasa alami sebaris, penyampaian ekspresif, suara bawaan, dan keluaran audio OpenAI-compatible .
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/audio/speech
Contoh biaya: 1 10.85k karakter × $0.85 = $0.85 .
GLM-TTS — sintesis ucapan yang peka konteks dengan penyampaian ekspresif, output streaming, audio pertama yang cepat, dan kontrol untuk suara, kecepatan, dan volume.
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/audio/speech
Contoh biaya: 1 10.307692k karakter × $0.307692 = $0.307692 .
Qwen3-ASR-Flash — transkripsi berkas multibahasa dengan petunjuk bahasa, normalisasi teks terbalik, pengenalan emosi, dan OpenAI-compatible input audio.
Tugas: video dengan audio, transkripsi
Titik akhir: POST /v1/audio/transcriptions
Contoh biaya: 1 jam audio × $0.123539 = $0.123539 .
Qwen3-TTS-Flash — Sintesis ucapan multibahasa latensi rendah dengan input bahasa campuran, suara bawaan, pencocokan bahasa otomatis, dan penagihan berbasis karakter.
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/audio/speech
Contoh biaya: 1 10.123077k karakter × $0.123077 = $0.123077 .
MiniMax 2.8 — sintesis suara fidelitas tinggi dengan penyampaian emosi alami, peningkatan bahasa, kontrol suara, dan format audio produksi.
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/audio/speech
Contoh biaya: 1 10.538462k karakter × $0.538462 = $0.538462 .
MiniMax 2.8 — sintesis suara yang berfokus pada kecepatan dengan keluaran alami, kontrol emosi, peningkatan bahasa, dan format audio produksi umum.
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/audio/speech
Contoh biaya: 1 10.307692k karakter × $0.307692 = $0.307692 .
Langkah TTS 2 — sintesis ucapan ekspresif dengan suara resmi dan suara tiruan, kontrol kecepatan dan volume, pemetaan pengucapan, dan berbagai format keluaran.
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/audio/speech
Contoh biaya: 1 10.4k karakter × $0.4 = $0.4 .
Step TTS — sintesis ucapan ekspresif yang hemat biaya untuk bahasa Mandarin, Inggris, Jepang, Kanton, dan Sichuan, dengan suara resmi dan suara hasil kloning.
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/audio/speech
Contoh biaya: 1 10.15k karakter × $0.15 = $0.15 .
StepAudio 2.5 ASR — sebuah model transkripsi streaming 4B untuk pengenalan bahasa Mandarin-Inggris yang cepat, normalisasi ITN, subtitle, rapat, dan agen suara.
Tugas: video dengan audio, transkripsi
Titik akhir: POST /v1/audio/transcriptions
Contoh biaya: 1 jam audio × $0.022 = $0.022 .
Hitung API · Hasilkan curl, Python, atau JavaScript · Instal Resep Agen Seedance 2
Sumber dan metode: kumpulan data penetapan harga model publik, diperbarui 2026-08-08 . Batasan-batasan telah disebutkan di atas; klaim pihak ketiga tetap berada di samping halaman model yang mengutipnya.