ศูนย์ความสามารถด้านเสียงและการพูด

การแปลงเสียงเป็นข้อความและการถอดเสียง API

เปรียบเทียบโมเดลการถอดเสียงและโมเดล ASR โดยพิจารณาจากโหมดปลายทางที่แน่นอน ราคาต่อชั่วโมงเสียง ข้อมูลนำเข้า เอาต์พุตการถอดเสียง และข้อจำกัดต่างๆ

สัญญา

ข้อมูลนำเข้า ข้อมูลส่งออก และวงจรชีวิต

ข้อมูลนำเข้า

ไฟล์เสียงหรือไฟล์พื้นฐาน; 64 input_audio โหลด ขึ้นอยู่กับโมเดล api_mode

เอาต์พุต

ข้อความถอดเสียงหรือคำตอบการถอดเสียงที่มีโครงสร้าง

จุดสิ้นสุด

POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode

วงจรชีวิต

ทำงานแบบซิงโครนัสสำหรับโหมดปลายทางสาธารณะที่ระบุไว้ บันทึกการถอดเสียงและจัดการรูปแบบไฟล์ที่ถูกปฏิเสธอย่างชัดเจน

งานที่ได้รับการสนับสนุน

หนึ่งคำจำกัดความต่อหนึ่งงาน

การถอดเสียง

ขีดจำกัด: ขนาดไฟล์ ระยะเวลา การแยกเสียงพูด การประทับเวลา การครอบคลุมของสำเนียง และรูปแบบที่ยอมรับได้นั้นไม่ทราบแน่ชัด เว้นแต่จะระบุไว้อย่างชัดเจนสำหรับแบบจำลองนั้น ๆ

แคตตาล็อกที่ตรงกัน

6 ที่มีเมตาเดตาที่ระบุอย่างชัดเจน

ฟังก์ชันที่ไม่ทราบจะถูกละเว้น และจะไม่คาดเดาจากชื่อรุ่น ตัวอย่างการกำหนดราคาใช้ข้อมูลสาธารณะที่ซิงโครไนซ์ไว้ ราคา Dash แบบเรียลไทม์ยังคงเป็นข้อมูลที่ถูกต้องที่สุด

stepaudio-2-asr-pro

StepFun StepAudio 2 ASR Pro — การรู้จำเสียงพูดขนาด 32B พารามิเตอร์ เป็นตัวเลือกที่เน้นความแม่นยำในสาย ASR ของ StepFun ขณะที่ stepaudio-2.5-asr เป็นตัวเลือกที่เน้นความเร็วและต้นทุน รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง

หน้าที่: วิดีโอพร้อมเสียงและคำบรรยาย

จุดสิ้นสุด: POST /v1/audio/transcriptions

ตัวอย่างค่าใช้จ่าย: 1 ชั่วโมงเสียง × $0.35 = $0.35 .

step-asr

StepFun step-asr — การรู้จำเสียงพูดอเนกประสงค์ ครอบคลุมภาษาจีน ภาษาอังกฤษ และภาษาถิ่นจีน สำหรับการถอดเสียง บันทึกการประชุม การตรวจสอบคุณภาพสายสนทนา และการค้นหาด้วยเสียง รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง

หน้าที่: วิดีโอพร้อมเสียงและคำบรรยาย

จุดสิ้นสุด: POST /v1/audio/transcriptions

ตัวอย่างค่าใช้จ่าย: 1 ชั่วโมงเสียง × $0.15 = $0.15 .

step-asr-1.1

StepFun step-asr-1.1 — โมเดลรู้จำเสียงอเนกประสงค์รุ่นปรับปรุงในสาย step-asr ครอบคลุมภาษาจีน ภาษาอังกฤษ และภาษาถิ่นจีน รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง

หน้าที่: วิดีโอพร้อมเสียงและคำบรรยาย

จุดสิ้นสุด: POST /v1/audio/transcriptions

ตัวอย่างค่าใช้จ่าย: 1 ชั่วโมงเสียง × $0.35 = $0.35 .

mimo-v2.5-asr

Xiaomi การรู้จำเสียงพูดสำหรับภาษาจีน ภาษาอังกฤษ การสลับภาษา สำเนียงท้องถิ่น การ MiMo-V2.5-ASR ที่มีเสียงรบกวน เสียงจากระยะไกล ผู้พูดหลายคน และเนื้อเพลง

หน้าที่: วิดีโอพร้อมเสียงและคำบรรยาย

จุดสิ้นสุด: POST /v1/chat/completions

ตัวอย่างค่าใช้จ่าย: 1 ชั่วโมงเสียง × $0.074 = $0.074 .

qwen3-asr-flash

Qwen3-ASR-Flash การถอดเสียงไฟล์หลายภาษาพร้อมคำแนะนำภาษา การปรับข้อความให้เป็นมาตรฐานแบบผกผัน การจดจำอารมณ์ และการป้อนข้อมูล OpenAI-compatible

หน้าที่: วิดีโอพร้อมเสียงและคำบรรยาย

จุดสิ้นสุด: POST /v1/audio/transcriptions

ตัวอย่างค่าใช้จ่าย: 1 ชั่วโมงเสียง × $0.123539 = $0.123539 .

stepaudio-2.5-asr

StepAudio โมเดลการถอด 2.5 สตรี 4B ASR MTP สำหรับการจดจำภาษาจีน-อังกฤษอย่างรวดเร็ว การปรับมาตรฐาน ITN คำบรรยาย การประชุม และตัวแทนเสียง

หน้าที่: วิดีโอพร้อมเสียงและคำบรรยาย

จุดสิ้นสุด: POST /v1/audio/transcriptions

ตัวอย่างค่าใช้จ่าย: 1 ชั่วโมงเสียง × $0.022 = $0.022 .

ดำเนินการหรือประเมินก่อนลงทะเบียน

คำนวณ API · สร้างคำสั่ง curl, Python หรือ JavaScript · ติดตั้งสูตรเอเจนต์ Seedance 2

แหล่งที่มาและวิธีการ: ชุดข้อมูลการกำหนดราคาโมเดลสาธารณะอัปเดตแล้ว 2026-08-08 ข้อจำกัดต่างๆ ระบุไว้ข้างต้นแล้ว การเรียกร้องของบุคคลที่สามยังคงอยู่ถัดจากหน้าตัวอย่างที่อ้างอิงถึงพวกเขา