pusat kemampuan audio-ucapan

Konversi Teks ke Suara API : suara, kontrol, dan keluaran audio

Bandingkan model-model TTS berdasarkan titik akhir, kontrol suara, unit penagihan, alur kerja keluaran, dan permintaan ucapan yang dapat dieksekusi.

Kontrak

Masukan, keluaran, dan siklus hidup.

Masukan

Teks, ditambah suara bawaan atau kontrol desain/kloning suara yang didukung secara eksplisit.

Keluaran

Audio ucapan dalam format yang didukung model, atau bidang audio dalam respons obrolan.

Titik akhir

POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode

Siklus hidup

Sinkron. Simpan respons audio biner atau dekode bidang audio yang dikembalikan oleh mode obrolan.

Tugas yang didukung

Satu definisi untuk setiap tugas.

teks-ke-ucapan, kloning suara, desain suara

Membatasi: Identitas suara, persetujuan pengkloningan, cakupan bahasa, streaming, batasan karakter, dan format keluaran bersifat spesifik untuk setiap model.

Katalog yang cocok

8 dengan metadata eksplisit.

Kemampuan yang tidak diketahui dihilangkan, tidak pernah ditebak dari nama model. Contoh harga menggunakan data publik yang disinkronkan; Harga Dash langsung tetap menjadi acuan utama.

mimo-v2.5-tts

Xiaomi MiMo-V2.5-TTS — sintesis ucapan multibahasa ekspresif dengan suara bawaan, instruksi bergaya bahasa alami, emosi, kecepatan, nada, dialek, dan kontrol karakter.

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/chat/completions

Contoh biaya: 1 10k karakter × $0 = $0 .

stepaudio-2.5-tts

StepAudio 2.5 TTS — sintesis ucapan kontekstual dengan arahan bahasa alami sebaris, penyampaian ekspresif, suara bawaan, dan keluaran audio OpenAI-compatible .

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/audio/speech

Contoh biaya: 1 10.85k karakter × $0.85 = $0.85 .

glm-tts

GLM-TTS — sintesis ucapan yang peka konteks dengan penyampaian ekspresif, output streaming, audio pertama yang cepat, dan kontrol untuk suara, kecepatan, dan volume.

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/audio/speech

Contoh biaya: 1 10.307692k karakter × $0.307692 = $0.307692 .

qwen3-tts-flash

Qwen3-TTS-Flash — Sintesis ucapan multibahasa latensi rendah dengan input bahasa campuran, suara bawaan, pencocokan bahasa otomatis, dan penagihan berbasis karakter.

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/audio/speech

Contoh biaya: 1 10.123077k karakter × $0.123077 = $0.123077 .

speech-2.8-hd

MiniMax 2.8 — sintesis suara fidelitas tinggi dengan penyampaian emosi alami, peningkatan bahasa, kontrol suara, dan format audio produksi.

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/audio/speech

Contoh biaya: 1 10.538462k karakter × $0.538462 = $0.538462 .

speech-2.8-turbo

MiniMax 2.8 — sintesis suara yang berfokus pada kecepatan dengan keluaran alami, kontrol emosi, peningkatan bahasa, dan format audio produksi umum.

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/audio/speech

Contoh biaya: 1 10.307692k karakter × $0.307692 = $0.307692 .

step-tts-2

Langkah TTS 2 — sintesis ucapan ekspresif dengan suara resmi dan suara tiruan, kontrol kecepatan dan volume, pemetaan pengucapan, dan berbagai format keluaran.

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/audio/speech

Contoh biaya: 1 10.4k karakter × $0.4 = $0.4 .

step-tts-mini

Step TTS — sintesis ucapan ekspresif yang hemat biaya untuk bahasa Mandarin, Inggris, Jepang, Kanton, dan Sichuan, dengan suara resmi dan suara hasil kloning.

Tugas: video dengan audio, teks ke ucapan

Titik akhir: POST /v1/audio/speech

Contoh biaya: 1 10.15k karakter × $0.15 = $0.15 .

Lakukan simulasi atau estimasi sebelum pendaftaran.

Hitung API · Hasilkan curl, Python, atau JavaScript · Instal Resep Agen Seedance 2

Sumber dan metode: kumpulan data penetapan harga model publik, diperbarui 2026-08-08 . Batasan-batasan telah disebutkan di atas; klaim pihak ketiga tetap berada di samping halaman model yang mengutipnya.