Đầu vào
Âm thanh để nghe/chép lại, hoặc văn bản để tổng hợp, sử dụng chính xác api_mode của mô hình đã chọn.
trung tâm năng lực âm thanh-giọng nói
Sử dụng các chế độ điểm cuối hiểu âm thanh đã được xác minh, ASR và TTS mà không coi mọi mô hình giọng nói là có thể thay thế cho nhau.
Hợp đồng
Âm thanh để nghe/chép lại, hoặc văn bản để tổng hợp, sử dụng chính xác api_mode của mô hình đã chọn.
Phân tích văn bản/bản ghi hoặc âm thanh được tạo ra; kết quả chuyển đổi giọng nói trực tiếp không được ngụ ý trừ khi siêu dữ liệu trong danh mục có ghi rõ điều đó.
Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech
Các điểm cuối âm thanh được liệt kê là đồng bộ; quy trình làm việc chuyển đổi giọng nói thành giọng nói sẽ kết hợp việc phiên âm hoặc hiểu âm TTS với một yêu cầu riêng biệt.
Các tác vụ được hỗ trợ
hiểu âm thanh
Giới hạn: Việc gắn nhãn TTS hoặc ASR không chứng minh khả năng hiểu âm thanh trực tiếp, sao chép giọng nói, phân tách giọng nói hoặc hỗ trợ chuyển đổi giọng nói sang giọng nói.
Danh mục phù hợp
Các tính năng chưa biết sẽ bị lược bỏ, và không bao giờ được suy đoán từ tên model. Các ví dụ về giá cả sử dụng dữ liệu công khai được đồng bộ hóa; giá Dash trực tiếp vẫn là giá trị chính xác.
StepFun StepAudio 2 ASR Pro — nhận dạng giọng nói 32B tham số, lựa chọn ưu tiên độ chính xác trong dòng ASR của StepFun, còn stepaudio-2.5-asr là lựa chọn ưu tiên tốc độ và chi phí. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.
Nhiệm vụ: video kèm âm thanh, bản ghi
Điểm cuối: POST /v1/audio/transcriptions
Ví dụ về chi phí: 1 giờ âm thanh × $0.35 = $0.35 .
StepFun step-asr — nhận dạng giọng nói đa dụng cho tiếng Trung, tiếng Anh và các phương ngữ Trung Quốc, dùng cho phiên âm, biên bản họp, rà soát chất lượng cuộc gọi và tìm kiếm bằng giọng nói. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.
Nhiệm vụ: video kèm âm thanh, bản ghi
Điểm cuối: POST /v1/audio/transcriptions
Ví dụ về chi phí: 1 giờ âm thanh × $0.15 = $0.15 .
StepFun step-asr-1.1 — bản cập nhật của bộ nhận dạng đa dụng trong dòng step-asr, hỗ trợ tiếng Trung, tiếng Anh và các phương ngữ Trung Quốc. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.
Nhiệm vụ: video kèm âm thanh, bản ghi
Điểm cuối: POST /v1/audio/transcriptions
Ví dụ về chi phí: 1 giờ âm thanh × $0.35 = $0.35 .
MiMo-V2.5-ASR Nhận dạng giọng nói cho tiếng Trung, tiếng Anh, chuyển đổi mã ngôn ngữ, phương ngữ vùng miền, bản ghi Xiaomi nhiễu, âm thanh từ xa, nhiều người nói và lời bài hát.
Nhiệm vụ: video kèm âm thanh, bản ghi
Điểm cuối: POST /v1/chat/completions
Ví dụ về chi phí: 1 giờ âm thanh × $0.074 = $0.074 .
MiMo-V2.5-TTS Tổng hợp giọng nói đa ngôn ngữ biểu cảm với giọng nói tích hợp sẵn, hướng dẫn theo phong cách ngôn ngữ tự nhiên, cảm xúc, tốc độ, âm điệu, phương ngữ và khả năng điều Xiaomi ký tự.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/chat/completions
Ví dụ về chi phí: 1 10k ký tự × $0 = $0 .
2.5 tổng TTS giọng nói theo ngữ cảnh với hướng dẫn ngôn ngữ tự nhiên trực tiếp, truyền StepAudio biểu cảm, giọng nói tích hợp và đầu ra OpenAI-compatible thanh.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/audio/speech
Ví dụ về chi phí: 1 10.85k ký tự × $0.85 = $0.85 .
GLM-TTS Tổng hợp giọng nói nhận biết ngữ cảnh với khả năng truyền đạt biểu cảm, đầu ra dạng luồng, âm thanh đầu tiên nhanh và các điều khiển cho giọng nói, tốc độ và âm lượng.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/audio/speech
Ví dụ về chi phí: 1 10.307692k ký tự × $0.307692 = $0.307692 .
Qwen3-ASR-Flash — Chuyển đổi tệp đa ngôn ngữ thành văn bản với gợi ý ngôn ngữ, chuẩn hóa văn bản ngược, nhận diện cảm xúc và OpenAI-compatible đầu vào âm thanh.
Nhiệm vụ: video kèm âm thanh, bản ghi
Điểm cuối: POST /v1/audio/transcriptions
Ví dụ về chi phí: 1 giờ âm thanh × $0.123539 = $0.123539 .
Qwen3-TTS-Flash Tổng hợp giọng nói đa ngôn ngữ độ trễ thấp với đầu vào hỗn hợp nhiều ngôn ngữ, giọng nói tích hợp sẵn, khớp ngôn ngữ tự động và lập hóa đơn dựa trên ký tự.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/audio/speech
Ví dụ về chi phí: 1 10.123077k ký tự × $0.123077 = $0.123077 .
MiniMax Giọng nói 2.8 HD — tổng hợp giọng nói chất lượng cao với khả năng truyền đạt cảm xúc tự nhiên, cải thiện ngôn ngữ, điều khiển bằng giọng nói và các định dạng âm thanh chuyên nghiệp.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/audio/speech
Ví dụ về chi phí: 1 10.538462k ký tự × $0.538462 = $0.538462 .
MiniMax Giọng nói 2.8 Turbo — tổng hợp giọng nói tập trung vào tốc độ với đầu ra tự nhiên, kiểm soát cảm xúc, tăng cường ngôn ngữ và các định dạng âm thanh sản xuất phổ biến.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/audio/speech
Ví dụ về chi phí: 1 10.307692k ký tự × $0.307692 = $0.307692 .
Bước TTS 2 — tổng hợp giọng nói biểu cảm với giọng nói chính thức và giọng nói sao chép, điều khiển tốc độ và âm lượng, ánh xạ phát âm và nhiều định dạng đầu ra.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/audio/speech
Ví dụ về chi phí: 1 10.4k ký tự × $0.4 = $0.4 .
Step TTS Mini — phần mềm tổng hợp giọng nói hiệu quả về chi phí, biểu cảm dành cho tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Quảng Đông và tiếng Tứ Xuyên, với cả giọng nói chính thức và giọng nói được sao chép.
Nhiệm vụ: video có âm thanh, chuyển văn bản thành giọng nói
Điểm cuối: POST /v1/audio/speech
Ví dụ về chi phí: 1 10.15k ký tự × $0.15 = $0.15 .
2.5 một mô hình phiên ASR trực tuyến 4B để nhận StepAudio nhanh tiếng Trung-tiếng Anh, chuẩn hóa ITN, phụ đề, cuộc họp và trợ lý giọng nói.
Nhiệm vụ: video kèm âm thanh, bản ghi
Điểm cuối: POST /v1/audio/transcriptions
Ví dụ về chi phí: 1 giờ âm thanh × $0.022 = $0.022 .
Tính toán API phí · Tạo tệp curl, Python hoặc JavaScript. · Cài đặt công thức tác nhân Seedance 2
Nguồn và phương pháp: bộ dữ liệu định giá mô hình công khai, đã cập nhật 2026-08-08 . Các hạn chế đã được nêu ở trên; các khiếu nại của bên thứ ba vẫn nằm cạnh các trang mô hình trích dẫn chúng.