ข้อมูลนำเข้า
ไฟล์เสียงหรือไฟล์พื้นฐาน; 64 input_audio โหลด ขึ้นอยู่กับโมเดล api_mode
ศูนย์ความสามารถด้านเสียงและการพูด
เปรียบเทียบโมเดลการถอดเสียงและโมเดล ASR โดยพิจารณาจากโหมดปลายทางที่แน่นอน ราคาต่อชั่วโมงเสียง ข้อมูลนำเข้า เอาต์พุตการถอดเสียง และข้อจำกัดต่างๆ
สัญญา
ไฟล์เสียงหรือไฟล์พื้นฐาน; 64 input_audio โหลด ขึ้นอยู่กับโมเดล api_mode
ข้อความถอดเสียงหรือคำตอบการถอดเสียงที่มีโครงสร้าง
POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode
ทำงานแบบซิงโครนัสสำหรับโหมดปลายทางสาธารณะที่ระบุไว้ บันทึกการถอดเสียงและจัดการรูปแบบไฟล์ที่ถูกปฏิเสธอย่างชัดเจน
งานที่ได้รับการสนับสนุน
การถอดเสียง
ขีดจำกัด: ขนาดไฟล์ ระยะเวลา การแยกเสียงพูด การประทับเวลา การครอบคลุมของสำเนียง และรูปแบบที่ยอมรับได้นั้นไม่ทราบแน่ชัด เว้นแต่จะระบุไว้อย่างชัดเจนสำหรับแบบจำลองนั้น ๆ
แคตตาล็อกที่ตรงกัน
ฟังก์ชันที่ไม่ทราบจะถูกละเว้น และจะไม่คาดเดาจากชื่อรุ่น ตัวอย่างการกำหนดราคาใช้ข้อมูลสาธารณะที่ซิงโครไนซ์ไว้ ราคา Dash แบบเรียลไทม์ยังคงเป็นข้อมูลที่ถูกต้องที่สุด
StepFun StepAudio 2 ASR Pro — การรู้จำเสียงพูดขนาด 32B พารามิเตอร์ เป็นตัวเลือกที่เน้นความแม่นยำในสาย ASR ของ StepFun ขณะที่ stepaudio-2.5-asr เป็นตัวเลือกที่เน้นความเร็วและต้นทุน รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง
หน้าที่: วิดีโอพร้อมเสียงและคำบรรยาย
จุดสิ้นสุด: POST /v1/audio/transcriptions
ตัวอย่างค่าใช้จ่าย: 1 ชั่วโมงเสียง × $0.35 = $0.35 .
StepFun step-asr — การรู้จำเสียงพูดอเนกประสงค์ ครอบคลุมภาษาจีน ภาษาอังกฤษ และภาษาถิ่นจีน สำหรับการถอดเสียง บันทึกการประชุม การตรวจสอบคุณภาพสายสนทนา และการค้นหาด้วยเสียง รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง
หน้าที่: วิดีโอพร้อมเสียงและคำบรรยาย
จุดสิ้นสุด: POST /v1/audio/transcriptions
ตัวอย่างค่าใช้จ่าย: 1 ชั่วโมงเสียง × $0.15 = $0.15 .
StepFun step-asr-1.1 — โมเดลรู้จำเสียงอเนกประสงค์รุ่นปรับปรุงในสาย step-asr ครอบคลุมภาษาจีน ภาษาอังกฤษ และภาษาถิ่นจีน รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง
หน้าที่: วิดีโอพร้อมเสียงและคำบรรยาย
จุดสิ้นสุด: POST /v1/audio/transcriptions
ตัวอย่างค่าใช้จ่าย: 1 ชั่วโมงเสียง × $0.35 = $0.35 .
Xiaomi การรู้จำเสียงพูดสำหรับภาษาจีน ภาษาอังกฤษ การสลับภาษา สำเนียงท้องถิ่น การ MiMo-V2.5-ASR ที่มีเสียงรบกวน เสียงจากระยะไกล ผู้พูดหลายคน และเนื้อเพลง
หน้าที่: วิดีโอพร้อมเสียงและคำบรรยาย
จุดสิ้นสุด: POST /v1/chat/completions
ตัวอย่างค่าใช้จ่าย: 1 ชั่วโมงเสียง × $0.074 = $0.074 .
Qwen3-ASR-Flash การถอดเสียงไฟล์หลายภาษาพร้อมคำแนะนำภาษา การปรับข้อความให้เป็นมาตรฐานแบบผกผัน การจดจำอารมณ์ และการป้อนข้อมูล OpenAI-compatible
หน้าที่: วิดีโอพร้อมเสียงและคำบรรยาย
จุดสิ้นสุด: POST /v1/audio/transcriptions
ตัวอย่างค่าใช้จ่าย: 1 ชั่วโมงเสียง × $0.123539 = $0.123539 .
StepAudio โมเดลการถอด 2.5 สตรี 4B ASR MTP สำหรับการจดจำภาษาจีน-อังกฤษอย่างรวดเร็ว การปรับมาตรฐาน ITN คำบรรยาย การประชุม และตัวแทนเสียง
หน้าที่: วิดีโอพร้อมเสียงและคำบรรยาย
จุดสิ้นสุด: POST /v1/audio/transcriptions
ตัวอย่างค่าใช้จ่าย: 1 ชั่วโมงเสียง × $0.022 = $0.022 .
คำนวณ API · สร้างคำสั่ง curl, Python หรือ JavaScript · ติดตั้งสูตรเอเจนต์ Seedance 2
แหล่งที่มาและวิธีการ: ชุดข้อมูลการกำหนดราคาโมเดลสาธารณะอัปเดตแล้ว 2026-08-08 ข้อจำกัดต่างๆ ระบุไว้ข้างต้นแล้ว การเรียกร้องของบุคคลที่สามยังคงอยู่ถัดจากหน้าตัวอย่างที่อ้างอิงถึงพวกเขา