Đầu vào
Một tệp âm thanh hoặc dữ liệu gốc; 64 input_audio tải trọng, tùy thuộc vào mô hình api_mode .
trung tâm năng lực âm thanh-giọng nói
So sánh các mô hình phiên âm và mô hình ASR dựa trên chế độ điểm cuối chính xác, giá mỗi giờ âm thanh, đầu vào, đầu ra bản ghi và các hạn chế.
Hợp đồng
Một tệp âm thanh hoặc dữ liệu gốc; 64 input_audio tải trọng, tùy thuộc vào mô hình api_mode .
Văn bản phiên âm hoặc phản hồi phiên âm có cấu trúc.
POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode
Chế độ đồng bộ cho các điểm cuối công khai được liệt kê. Lưu trữ bản ghi và xử lý rõ ràng các định dạng tệp bị từ chối.
Các tác vụ được hỗ trợ
phiên mã
Giới hạn: Kích thước tệp, thời lượng, nhật ký ghi âm, dấu thời gian, phạm vi phương ngữ và các định dạng được chấp nhận đều không được biết trừ khi được liệt kê rõ ràng cho mô hình.
Danh mục phù hợp
Các tính năng chưa biết sẽ bị lược bỏ, và không bao giờ được suy đoán từ tên model. Các ví dụ về giá cả sử dụng dữ liệu công khai được đồng bộ hóa; giá Dash trực tiếp vẫn là giá trị chính xác.
StepFun StepAudio 2 ASR Pro — nhận dạng giọng nói 32B tham số, lựa chọn ưu tiên độ chính xác trong dòng ASR của StepFun, còn stepaudio-2.5-asr là lựa chọn ưu tiên tốc độ và chi phí. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.
Nhiệm vụ: video kèm âm thanh, bản ghi
Điểm cuối: POST /v1/audio/transcriptions
Ví dụ về chi phí: 1 giờ âm thanh × $0.35 = $0.35 .
StepFun step-asr — nhận dạng giọng nói đa dụng cho tiếng Trung, tiếng Anh và các phương ngữ Trung Quốc, dùng cho phiên âm, biên bản họp, rà soát chất lượng cuộc gọi và tìm kiếm bằng giọng nói. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.
Nhiệm vụ: video kèm âm thanh, bản ghi
Điểm cuối: POST /v1/audio/transcriptions
Ví dụ về chi phí: 1 giờ âm thanh × $0.15 = $0.15 .
StepFun step-asr-1.1 — bản cập nhật của bộ nhận dạng đa dụng trong dòng step-asr, hỗ trợ tiếng Trung, tiếng Anh và các phương ngữ Trung Quốc. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.
Nhiệm vụ: video kèm âm thanh, bản ghi
Điểm cuối: POST /v1/audio/transcriptions
Ví dụ về chi phí: 1 giờ âm thanh × $0.35 = $0.35 .
MiMo-V2.5-ASR Nhận dạng giọng nói cho tiếng Trung, tiếng Anh, chuyển đổi mã ngôn ngữ, phương ngữ vùng miền, bản ghi Xiaomi nhiễu, âm thanh từ xa, nhiều người nói và lời bài hát.
Nhiệm vụ: video kèm âm thanh, bản ghi
Điểm cuối: POST /v1/chat/completions
Ví dụ về chi phí: 1 giờ âm thanh × $0.074 = $0.074 .
Qwen3-ASR-Flash — Chuyển đổi tệp đa ngôn ngữ thành văn bản với gợi ý ngôn ngữ, chuẩn hóa văn bản ngược, nhận diện cảm xúc và OpenAI-compatible đầu vào âm thanh.
Nhiệm vụ: video kèm âm thanh, bản ghi
Điểm cuối: POST /v1/audio/transcriptions
Ví dụ về chi phí: 1 giờ âm thanh × $0.123539 = $0.123539 .
2.5 một mô hình phiên ASR trực tuyến 4B để nhận StepAudio nhanh tiếng Trung-tiếng Anh, chuẩn hóa ITN, phụ đề, cuộc họp và trợ lý giọng nói.
Nhiệm vụ: video kèm âm thanh, bản ghi
Điểm cuối: POST /v1/audio/transcriptions
Ví dụ về chi phí: 1 giờ âm thanh × $0.022 = $0.022 .
Tính toán API phí · Tạo tệp curl, Python hoặc JavaScript. · Cài đặt công thức tác nhân Seedance 2
Nguồn và phương pháp: bộ dữ liệu định giá mô hình công khai, đã cập nhật 2026-08-08 . Các hạn chế đã được nêu ở trên; các khiếu nại của bên thứ ba vẫn nằm cạnh các trang mô hình trích dẫn chúng.