ข้อมูลนำเข้า
ข้อความ พร้อมด้วยเสียงในตัว หรือการควบคุมการออกแบบ/คัดลอกเสียงที่รองรับอย่างชัดเจน
ศูนย์ความสามารถด้านเสียงและการพูด
เปรียบเทียบโมเดล TTS โดยพิจารณาจากจุดสิ้นสุด การควบคุมด้วยเสียง หน่วยการเรียกเก็บเงิน ขั้นตอนการทำงานของเอาต์พุต และคำขอเสียงที่สามารถดำเนินการได้
สัญญา
ข้อความ พร้อมด้วยเสียงในตัว หรือการควบคุมการออกแบบ/คัดลอกเสียงที่รองรับอย่างชัดเจน
ไฟล์เสียงพูดในรูปแบบที่รองรับโดยโมเดล หรือช่องเสียงในข้อความตอบกลับแชท
POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode
ซิงโครนัส บันทึกการตอบสนองเสียงแบบไบนารี หรือถอดรหัสฟิลด์เสียงที่ส่งคืนโดยโหมดแชท
งานที่ได้รับการสนับสนุน
การแปลงข้อความเป็นเสียงพูด, การโคลนเสียง, การออกแบบเสียง
ขีดจำกัด: ระบบระบุเสียงอัตโนมัติ การขอความยินยอมในการโคลนนิ่ง การรองรับภาษา การสตรีมมิ่ง ข้อจำกัดจำนวนตัวอักษร และรูปแบบเอาต์พุตนั้นขึ้นอยู่กับรุ่นของอุปกรณ์
แคตตาล็อกที่ตรงกัน
ฟังก์ชันที่ไม่ทราบจะถูกละเว้น และจะไม่คาดเดาจากชื่อรุ่น ตัวอย่างการกำหนดราคาใช้ข้อมูลสาธารณะที่ซิงโครไนซ์ไว้ ราคา Dash แบบเรียลไทม์ยังคงเป็นข้อมูลที่ถูกต้องที่สุด
Xiaomi การสังเคราะห์เสียงหลายภาษาที่แสดงอารมณ์ได้ MiMo-V2.5-TTS ดีเยี่ยม พร้อมเสียงพูดในตัว คำแนะนำในรูปแบบภาษาธรรมชาติ อารมณ์ จังหวะ น้ำเสียง สำเนียง และการควบคุมตัวอักษร
หน้าที่: วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด
จุดสิ้นสุด: POST /v1/chat/completions
ตัวอย่างค่าใช้จ่าย: 1 10k ตัวอักษร × $0 = $0 .
StepAudio การสังเคราะห์เสียงพูดตาม TTS พร้อมการ 2.5 ภาษาธรรมชาติแบบอินไลน์ การแสดงออกทางอารมณ์ เสียงพูดในตัว และเอาต์พุต OpenAI-compatible
หน้าที่: วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด
จุดสิ้นสุด: POST /v1/audio/speech
ตัวอย่างค่าใช้จ่าย: 1 10.85k ตัวอักษร × $0.85 = $0.85 .
GLM-TTS การสังเคราะห์เสียงพูดที่คำนึงถึงบริบท พร้อมการถ่ายทอดอารมณ์ การส่งออกเสียงแบบสตรีมมิ่ง เสียงเริ่มต้นที่รวดเร็ว และการควบคุมเสียง ความเร็ว และระดับเสียง
หน้าที่: วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด
จุดสิ้นสุด: POST /v1/audio/speech
ตัวอย่างค่าใช้จ่าย: 1 10.307692k ตัวอักษร × $0.307692 = $0.307692 .
Qwen3-TTS-Flash การสังเคราะห์เสียงหลายภาษาที่มีความหน่วงต่ำ พร้อมการป้อนข้อมูลแบบผสมภาษา เสียงพูดในตัว การจับคู่ภาษาอัตโนมัติ และการคิดค่าบริการตามจำนวนตัวอักษร
หน้าที่: วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด
จุดสิ้นสุด: POST /v1/audio/speech
ตัวอย่างค่าใช้จ่าย: 1 10.123077k ตัวอักษร × $0.123077 = $0.123077 .
MiniMax พูด 2.8 HD — การสังเคราะห์เสียงพูดคุณภาพสูง พร้อมการถ่ายทอดอารมณ์ที่เป็นธรรมชาติ การปรับปรุงคุณภาพภาษา การควบคุมด้วยเสียง และรูปแบบเสียงสำหรับการผลิต
หน้าที่: วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด
จุดสิ้นสุด: POST /v1/audio/speech
ตัวอย่างค่าใช้จ่าย: 1 10.538462k ตัวอักษร × $0.538462 = $0.538462 .
MiniMax Speech 2.8 Turbo — การสังเคราะห์เสียงพูดที่เน้นความเร็ว ให้เสียงที่เป็นธรรมชาติ ควบคุมอารมณ์ ปรับปรุงคุณภาพภาษา และรองรับรูปแบบเสียงที่ใช้กันทั่วไปในการผลิต
หน้าที่: วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด
จุดสิ้นสุด: POST /v1/audio/speech
ตัวอย่างค่าใช้จ่าย: 1 10.307692k ตัวอักษร × $0.307692 = $0.307692 .
ขั้นตอนที่ TTS 2 — การสังเคราะห์เสียงพูดที่แสดงอารมณ์ด้วยเสียงทางการและเสียงจำลอง การควบคุมความเร็วและระดับเสียง การแมปการออกเสียง และรูปแบบเอาต์พุตหลายรูปแบบ
หน้าที่: วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด
จุดสิ้นสุด: POST /v1/audio/speech
ตัวอย่างค่าใช้จ่าย: 1 10.4k ตัวอักษร × $0.4 = $0.4 .
Step TTS — ระบบสังเคราะห์เสียงพูดที่มีประสิทธิภาพและคุ้มค่าสำหรับภาษาจีน อังกฤษ ญี่ปุ่น กวางตุ้ง และเสฉวน พร้อมเสียงทางการและเสียงเลียนแบบ
หน้าที่: วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด
จุดสิ้นสุด: POST /v1/audio/speech
ตัวอย่างค่าใช้จ่าย: 1 10.15k ตัวอักษร × $0.15 = $0.15 .
คำนวณ API · สร้างคำสั่ง curl, Python หรือ JavaScript · ติดตั้งสูตรเอเจนต์ Seedance 2
แหล่งที่มาและวิธีการ: ชุดข้อมูลการกำหนดราคาโมเดลสาธารณะอัปเดตแล้ว 2026-08-08 ข้อจำกัดต่างๆ ระบุไว้ข้างต้นแล้ว การเรียกร้องของบุคคลที่สามยังคงอยู่ถัดจากหน้าตัวอย่างที่อ้างอิงถึงพวกเขา