pusat kemampuan audio-ucapan

Audio API : pemahaman dan blok bangunan komunikasi antar ucapan

Gunakan mode titik akhir pemahaman audio terverifikasi, ASR , dan TTS tanpa memperlakukan setiap model ucapan sebagai dapat saling menggantikan.

Kontrak

Masukan, keluaran, dan siklus hidup.

Masukan

Audio untuk pemahaman/transkripsi, atau teks untuk sintesis, menggunakan api_mode yang tepat dari model yang dipilih.

Keluaran

Analisis teks/transkrip atau audio yang dihasilkan; hasil ucapan langsung tidak tersirat kecuali metadata katalog menyatakan demikian.

Titik akhir

Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech

Siklus hidup

Endpoint audio yang tercantum bersifat sinkron; alur kerja ucapan ke ucapan menghubungkan transkripsi atau pemahaman audio ke permintaan TTS terpisah.

Tugas yang didukung

Satu definisi untuk setiap tugas.

pemahaman audio

Membatasi: Label TTS atau ASR tidak membuktikan pemahaman audio secara langsung, kloning suara, diarization, atau dukungan ucapan ke ucapan.

Katalog yang cocok

14 dengan metadata eksplisit.

Kemampuan yang tidak diketahui dihilangkan, tidak pernah ditebak dari nama model. Contoh harga menggunakan data publik yang disinkronkan; Harga Dash langsung tetap menjadi acuan utama.

stepaudio-2-asr-pro

StepFun StepAudio 2 ASR Pro — pengenalan ucapan 32B parameter, opsi yang mengutamakan akurasi dalam lini ASR StepFun, sementara stepaudio-2.5-asr adalah opsi kecepatan dan biaya. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

Tugas: video dengan audio, transkripsi

Titik akhir: POST /v1/audio/transcriptions

Contoh biaya: 1 jam audio × $0.35 = $0.35 .

step-asr

StepFun step-asr — pengenalan ucapan serbaguna yang mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa, untuk transkripsi, notulen rapat, tinjauan kualitas panggilan, dan pencarian suara. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

Tugas: video dengan audio, transkripsi

Titik akhir: POST /v1/audio/transcriptions

Contoh biaya: 1 jam audio × $0.15 = $0.15 .

step-asr-1.1

StepFun step-asr-1.1 — pengenal serbaguna versi terbaru dalam lini step-asr, mencakup bahasa Mandarin, Inggris, dan dialek Tionghoa. Menerima unggahan ogg, mp3, dan wav; keluaran transkrip tidak ditagih.

Tugas: video dengan audio, transkripsi

Titik akhir: POST /v1/audio/transcriptions

Contoh biaya: 1 jam audio × $0.35 = $0.35 .

mimo-v2.5-asr

Xiaomi MiMo-V2.5-ASR — pengenalan suara untuk bahasa Mandarin, Inggris, peralihan kode, dialek regional, rekaman bising, audio jarak jauh, banyak pembicara, dan lirik.

Tugas: video dengan audio, transkripsi

Titik akhir: POST /v1/chat/completions

Contoh biaya: 1 jam audio × $0.074 = $0.074 .

mimo-v2.5-tts

Xiaomi MiMo-V2.5-TTS — sintesis ucapan multibahasa ekspresif dengan suara bawaan, instruksi bergaya bahasa alami, emosi, kecepatan, nada, dialek, dan kontrol karakter.

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/chat/completions

Contoh biaya: 1 10k karakter × $0 = $0 .

stepaudio-2.5-tts

StepAudio 2.5 TTS — sintesis ucapan kontekstual dengan arahan bahasa alami sebaris, penyampaian ekspresif, suara bawaan, dan keluaran audio OpenAI-compatible .

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/audio/speech

Contoh biaya: 1 10.85k karakter × $0.85 = $0.85 .

glm-tts

GLM-TTS — sintesis ucapan yang peka konteks dengan penyampaian ekspresif, output streaming, audio pertama yang cepat, dan kontrol untuk suara, kecepatan, dan volume.

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/audio/speech

Contoh biaya: 1 10.307692k karakter × $0.307692 = $0.307692 .

qwen3-asr-flash

Qwen3-ASR-Flash — transkripsi berkas multibahasa dengan petunjuk bahasa, normalisasi teks terbalik, pengenalan emosi, dan OpenAI-compatible input audio.

Tugas: video dengan audio, transkripsi

Titik akhir: POST /v1/audio/transcriptions

Contoh biaya: 1 jam audio × $0.123539 = $0.123539 .

qwen3-tts-flash

Qwen3-TTS-Flash — Sintesis ucapan multibahasa latensi rendah dengan input bahasa campuran, suara bawaan, pencocokan bahasa otomatis, dan penagihan berbasis karakter.

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/audio/speech

Contoh biaya: 1 10.123077k karakter × $0.123077 = $0.123077 .

speech-2.8-hd

MiniMax 2.8 — sintesis suara fidelitas tinggi dengan penyampaian emosi alami, peningkatan bahasa, kontrol suara, dan format audio produksi.

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/audio/speech

Contoh biaya: 1 10.538462k karakter × $0.538462 = $0.538462 .

speech-2.8-turbo

MiniMax 2.8 — sintesis suara yang berfokus pada kecepatan dengan keluaran alami, kontrol emosi, peningkatan bahasa, dan format audio produksi umum.

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/audio/speech

Contoh biaya: 1 10.307692k karakter × $0.307692 = $0.307692 .

step-tts-2

Langkah TTS 2 — sintesis ucapan ekspresif dengan suara resmi dan suara tiruan, kontrol kecepatan dan volume, pemetaan pengucapan, dan berbagai format keluaran.

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/audio/speech

Contoh biaya: 1 10.4k karakter × $0.4 = $0.4 .

step-tts-mini

Step TTS — sintesis ucapan ekspresif yang hemat biaya untuk bahasa Mandarin, Inggris, Jepang, Kanton, dan Sichuan, dengan suara resmi dan suara hasil kloning.

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/audio/speech

Contoh biaya: 1 10.15k karakter × $0.15 = $0.15 .

stepaudio-2.5-asr

StepAudio 2.5 ASR — sebuah model transkripsi streaming 4B untuk pengenalan bahasa Mandarin-Inggris yang cepat, normalisasi ITN, subtitle, rapat, dan agen suara.

Tugas: video dengan audio, transkripsi

Titik akhir: POST /v1/audio/transcriptions

Contoh biaya: 1 jam audio × $0.022 = $0.022 .

Lakukan simulasi atau estimasi sebelum pendaftaran.

Hitung API · Hasilkan curl, Python, atau JavaScript · Instal Resep Agen Seedance 2

Sumber dan metode: kumpulan data penetapan harga model publik, diperbarui 2026-08-08 . Batasan-batasan telah disebutkan di atas; klaim pihak ketiga tetap berada di samping halaman model yang mengutipnya.