Masukan
Teks, ditambah suara bawaan atau kontrol desain/kloning suara yang didukung secara eksplisit.
pusat kemampuan audio-ucapan
Bandingkan model-model TTS berdasarkan titik akhir, kontrol suara, unit penagihan, alur kerja keluaran, dan permintaan ucapan yang dapat dieksekusi.
Kontrak
Teks, ditambah suara bawaan atau kontrol desain/kloning suara yang didukung secara eksplisit.
Audio ucapan dalam format yang didukung model, atau bidang audio dalam respons obrolan.
POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode
Sinkron. Simpan respons audio biner atau dekode bidang audio yang dikembalikan oleh mode obrolan.
Tugas yang didukung
teks-ke-ucapan, kloning suara, desain suara
Membatasi: Identitas suara, persetujuan pengkloningan, cakupan bahasa, streaming, batasan karakter, dan format keluaran bersifat spesifik untuk setiap model.
Katalog yang cocok
Kemampuan yang tidak diketahui dihilangkan, tidak pernah ditebak dari nama model. Contoh harga menggunakan data publik yang disinkronkan; Harga Dash langsung tetap menjadi acuan utama.
Xiaomi MiMo-V2.5-TTS — sintesis ucapan multibahasa ekspresif dengan suara bawaan, instruksi bergaya bahasa alami, emosi, kecepatan, nada, dialek, dan kontrol karakter.
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/chat/completions
Contoh biaya: 1 10k karakter × $0 = $0 .
StepAudio 2.5 TTS — sintesis ucapan kontekstual dengan arahan bahasa alami sebaris, penyampaian ekspresif, suara bawaan, dan keluaran audio OpenAI-compatible .
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/audio/speech
Contoh biaya: 1 10.85k karakter × $0.85 = $0.85 .
GLM-TTS — sintesis ucapan yang peka konteks dengan penyampaian ekspresif, output streaming, audio pertama yang cepat, dan kontrol untuk suara, kecepatan, dan volume.
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/audio/speech
Contoh biaya: 1 10.307692k karakter × $0.307692 = $0.307692 .
Qwen3-TTS-Flash — Sintesis ucapan multibahasa latensi rendah dengan input bahasa campuran, suara bawaan, pencocokan bahasa otomatis, dan penagihan berbasis karakter.
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/audio/speech
Contoh biaya: 1 10.123077k karakter × $0.123077 = $0.123077 .
MiniMax 2.8 — sintesis suara fidelitas tinggi dengan penyampaian emosi alami, peningkatan bahasa, kontrol suara, dan format audio produksi.
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/audio/speech
Contoh biaya: 1 10.538462k karakter × $0.538462 = $0.538462 .
MiniMax 2.8 — sintesis suara yang berfokus pada kecepatan dengan keluaran alami, kontrol emosi, peningkatan bahasa, dan format audio produksi umum.
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/audio/speech
Contoh biaya: 1 10.307692k karakter × $0.307692 = $0.307692 .
Langkah TTS 2 — sintesis ucapan ekspresif dengan suara resmi dan suara tiruan, kontrol kecepatan dan volume, pemetaan pengucapan, dan berbagai format keluaran.
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/audio/speech
Contoh biaya: 1 10.4k karakter × $0.4 = $0.4 .
Step TTS — sintesis ucapan ekspresif yang hemat biaya untuk bahasa Mandarin, Inggris, Jepang, Kanton, dan Sichuan, dengan suara resmi dan suara hasil kloning.
Tugas: video dengan audio, teks ke ucapan
Titik akhir: POST /v1/audio/speech
Contoh biaya: 1 10.15k karakter × $0.15 = $0.15 .
Hitung API · Hasilkan curl, Python, atau JavaScript · Instal Resep Agen Seedance 2
Sumber dan metode: kumpulan data penetapan harga model publik, diperbarui 2026-08-08 . Batasan-batasan telah disebutkan di atas; klaim pihak ketiga tetap berada di samping halaman model yang mengutipnya.