Đầu vào
Văn bản, kèm theo giọng nói tích hợp hoặc các điều khiển thiết kế/sao chép giọng nói được hỗ trợ rõ ràng.
trung tâm năng lực âm thanh-giọng nói
So sánh các mô hình TTS dựa trên điểm cuối, điều khiển bằng giọng nói, đơn vị thanh toán, quy trình làm việc đầu ra và yêu cầu giọng nói có thể thực thi.
Hợp đồng
Văn bản, kèm theo giọng nói tích hợp hoặc các điều khiển thiết kế/sao chép giọng nói được hỗ trợ rõ ràng.
Âm thanh giọng nói ở định dạng được mô hình hỗ trợ, hoặc trường âm thanh trong phản hồi trò chuyện.
POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode
Đồng bộ. Lưu phản hồi âm thanh nhị phân hoặc giải mã trường âm thanh được trả về từ chế độ trò chuyện.
Các tác vụ được hỗ trợ
chuyển văn bản thành giọng nói, sao chép giọng nói, thiết kế giọng nói
Giới hạn: Nhận dạng giọng nói, sự đồng ý sao chép, phạm vi ngôn ngữ, phát trực tuyến, giới hạn ký tự và định dạng đầu ra là tùy thuộc vào từng mẫu máy.
Danh mục phù hợp
Các tính năng chưa biết sẽ bị lược bỏ, và không bao giờ được suy đoán từ tên model. Các ví dụ về giá cả sử dụng dữ liệu công khai được đồng bộ hóa; giá Dash trực tiếp vẫn là giá trị chính xác.
MiMo-V2.5-TTS Tổng hợp giọng nói đa ngôn ngữ biểu cảm với giọng nói tích hợp sẵn, hướng dẫn theo phong cách ngôn ngữ tự nhiên, cảm xúc, tốc độ, âm điệu, phương ngữ và khả năng điều Xiaomi ký tự.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/chat/completions
Ví dụ về chi phí: 1 10k ký tự × $0 = $0 .
2.5 tổng TTS giọng nói theo ngữ cảnh với hướng dẫn ngôn ngữ tự nhiên trực tiếp, truyền StepAudio biểu cảm, giọng nói tích hợp và đầu ra OpenAI-compatible thanh.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/audio/speech
Ví dụ về chi phí: 1 10.85k ký tự × $0.85 = $0.85 .
GLM-TTS Tổng hợp giọng nói nhận biết ngữ cảnh với khả năng truyền đạt biểu cảm, đầu ra dạng luồng, âm thanh đầu tiên nhanh và các điều khiển cho giọng nói, tốc độ và âm lượng.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/audio/speech
Ví dụ về chi phí: 1 10.307692k ký tự × $0.307692 = $0.307692 .
Qwen3-TTS-Flash Tổng hợp giọng nói đa ngôn ngữ độ trễ thấp với đầu vào hỗn hợp nhiều ngôn ngữ, giọng nói tích hợp sẵn, khớp ngôn ngữ tự động và lập hóa đơn dựa trên ký tự.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/audio/speech
Ví dụ về chi phí: 1 10.123077k ký tự × $0.123077 = $0.123077 .
MiniMax Giọng nói 2.8 HD — tổng hợp giọng nói chất lượng cao với khả năng truyền đạt cảm xúc tự nhiên, cải thiện ngôn ngữ, điều khiển bằng giọng nói và các định dạng âm thanh chuyên nghiệp.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/audio/speech
Ví dụ về chi phí: 1 10.538462k ký tự × $0.538462 = $0.538462 .
MiniMax Giọng nói 2.8 Turbo — tổng hợp giọng nói tập trung vào tốc độ với đầu ra tự nhiên, kiểm soát cảm xúc, tăng cường ngôn ngữ và các định dạng âm thanh sản xuất phổ biến.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/audio/speech
Ví dụ về chi phí: 1 10.307692k ký tự × $0.307692 = $0.307692 .
Bước TTS 2 — tổng hợp giọng nói biểu cảm với giọng nói chính thức và giọng nói sao chép, điều khiển tốc độ và âm lượng, ánh xạ phát âm và nhiều định dạng đầu ra.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/audio/speech
Ví dụ về chi phí: 1 10.4k ký tự × $0.4 = $0.4 .
Step TTS Mini — phần mềm tổng hợp giọng nói hiệu quả về chi phí, biểu cảm dành cho tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Quảng Đông và tiếng Tứ Xuyên, với cả giọng nói chính thức và giọng nói được sao chép.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/audio/speech
Ví dụ về chi phí: 1 10.15k ký tự × $0.15 = $0.15 .
Tính toán API phí · Tạo tệp curl, Python hoặc JavaScript. · Cài đặt công thức tác nhân Seedance 2
Nguồn và phương pháp: bộ dữ liệu định giá mô hình công khai, đã cập nhật 2026-08-08 . Các hạn chế đã được nêu ở trên; các khiếu nại của bên thứ ba vẫn nằm cạnh các trang mô hình trích dẫn chúng.