<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: th/speech-to-text-api/index.html -->

# การแปลงเสียงเป็นข้อความและการถอดเสียง API

> เปรียบเทียบโมเดลการถอดเสียงและโมเดล ASR โดยพิจารณาจากโหมดปลายทางที่แน่นอน ราคาต่อชั่วโมงเสียง ข้อมูลนำเข้า เอาต์พุตการถอดเสียง และข้อจำกัดต่างๆ

- Canonical page: https://chinaapi.ai/th/speech-to-text-api/
- Human-readable page: https://chinaapi.ai/th/speech-to-text-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=th&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-to-text-api

เปรียบเทียบโมเดลการถอดเสียงและโมเดล ASR โดยพิจารณาจากโหมดปลายทางที่แน่นอน ราคาต่อชั่วโมงเสียง ข้อมูลนำเข้า เอาต์พุตการถอดเสียง และข้อจำกัดต่างๆ

[ลองดู stepaudio-2-asr-pro](https://dash.chinaapi.ai/start?task=video-with-audio&model=stepaudio-2-asr-pro&lang=th&utm_source=chinaapi&utm_medium=capability&utm_campaign=speech-to-text-api)

[สร้างคำขอ](https://chinaapi.ai/tools/api-request-generator/)

## ข้อมูลนำเข้า ข้อมูลส่งออก และวงจรชีวิต

### ข้อมูลนำเข้า

ไฟล์เสียงหรือไฟล์พื้นฐาน; 64 input_audio โหลด ขึ้นอยู่กับโมเดล api_mode

### เอาต์พุต

ข้อความถอดเสียงหรือคำตอบการถอดเสียงที่มีโครงสร้าง

### จุดสิ้นสุด

`POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode`

### วงจรชีวิต

ทำงานแบบซิงโครนัสสำหรับโหมดปลายทางสาธารณะที่ระบุไว้ บันทึกการถอดเสียงและจัดการรูปแบบไฟล์ที่ถูกปฏิเสธอย่างชัดเจน

## หนึ่งคำจำกัดความต่อหนึ่งงาน

การถอดเสียง

**ขีดจำกัด:** ขนาดไฟล์ ระยะเวลา การแยกเสียงพูด การประทับเวลา การครอบคลุมของสำเนียง และรูปแบบที่ยอมรับได้นั้นไม่ทราบแน่ชัด เว้นแต่จะระบุไว้อย่างชัดเจนสำหรับแบบจำลองนั้น ๆ

## 6 ที่มีเมตาเดตาที่ระบุอย่างชัดเจน

ฟังก์ชันที่ไม่ทราบจะถูกละเว้น และจะไม่คาดเดาจากชื่อรุ่น ตัวอย่างการกำหนดราคาใช้ข้อมูลสาธารณะที่ซิงโครไนซ์ไว้ ราคา Dash แบบเรียลไทม์ยังคงเป็นข้อมูลที่ถูกต้องที่สุด

### [stepaudio-2-asr-pro](https://chinaapi.ai/th/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro — การรู้จำเสียงพูดขนาด 32B พารามิเตอร์ เป็นตัวเลือกที่เน้นความแม่นยำในสาย ASR ของ StepFun ขณะที่ stepaudio-2.5-asr เป็นตัวเลือกที่เน้นความเร็วและต้นทุน รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง

**หน้าที่:** วิดีโอพร้อมเสียงและคำบรรยาย

**จุดสิ้นสุด:** `POST /v1/audio/transcriptions`

**ตัวอย่างค่าใช้จ่าย:** 1 ชั่วโมงเสียง × $0.35 = $0.35 .

### [step-asr](https://chinaapi.ai/th/models/step-asr/)

StepFun step-asr — การรู้จำเสียงพูดอเนกประสงค์ ครอบคลุมภาษาจีน ภาษาอังกฤษ และภาษาถิ่นจีน สำหรับการถอดเสียง บันทึกการประชุม การตรวจสอบคุณภาพสายสนทนา และการค้นหาด้วยเสียง รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง

**หน้าที่:** วิดีโอพร้อมเสียงและคำบรรยาย

**จุดสิ้นสุด:** `POST /v1/audio/transcriptions`

**ตัวอย่างค่าใช้จ่าย:** 1 ชั่วโมงเสียง × $0.15 = $0.15 .

### [step-asr-1.1](https://chinaapi.ai/th/models/step-asr-1.1/)

StepFun step-asr-1.1 — โมเดลรู้จำเสียงอเนกประสงค์รุ่นปรับปรุงในสาย step-asr ครอบคลุมภาษาจีน ภาษาอังกฤษ และภาษาถิ่นจีน รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง

**หน้าที่:** วิดีโอพร้อมเสียงและคำบรรยาย

**จุดสิ้นสุด:** `POST /v1/audio/transcriptions`

**ตัวอย่างค่าใช้จ่าย:** 1 ชั่วโมงเสียง × $0.35 = $0.35 .

### [mimo-v2.5-asr](https://chinaapi.ai/th/models/mimo-v2.5-asr/)

Xiaomi การรู้จำเสียงพูดสำหรับภาษาจีน ภาษาอังกฤษ การสลับภาษา สำเนียงท้องถิ่น การ MiMo-V2.5-ASR ที่มีเสียงรบกวน เสียงจากระยะไกล ผู้พูดหลายคน และเนื้อเพลง

**หน้าที่:** วิดีโอพร้อมเสียงและคำบรรยาย

**จุดสิ้นสุด:** `POST /v1/chat/completions`

**ตัวอย่างค่าใช้จ่าย:** 1 ชั่วโมงเสียง × $0.074 = $0.074 .

### [qwen3-asr-flash](https://chinaapi.ai/th/models/qwen3-asr-flash/)

Qwen3-ASR-Flash การถอดเสียงไฟล์หลายภาษาพร้อมคำแนะนำภาษา การปรับข้อความให้เป็นมาตรฐานแบบผกผัน การจดจำอารมณ์ และการป้อนข้อมูล OpenAI-compatible

**หน้าที่:** วิดีโอพร้อมเสียงและคำบรรยาย

**จุดสิ้นสุด:** `POST /v1/audio/transcriptions`

**ตัวอย่างค่าใช้จ่าย:** 1 ชั่วโมงเสียง × $0.123539 = $0.123539 .

### [stepaudio-2.5-asr](https://chinaapi.ai/th/models/stepaudio-2.5-asr/)

StepAudio โมเดลการถอด 2.5 สตรี 4B ASR MTP สำหรับการจดจำภาษาจีน-อังกฤษอย่างรวดเร็ว การปรับมาตรฐาน ITN คำบรรยาย การประชุม และตัวแทนเสียง

**หน้าที่:** วิดีโอพร้อมเสียงและคำบรรยาย

**จุดสิ้นสุด:** `POST /v1/audio/transcriptions`

**ตัวอย่างค่าใช้จ่าย:** 1 ชั่วโมงเสียง × $0.022 = $0.022 .

## ดำเนินการหรือประเมินก่อนลงทะเบียน

[คำนวณ API](https://chinaapi.ai/tools/api-cost-calculator/) · [สร้างคำสั่ง curl, Python หรือ JavaScript](https://chinaapi.ai/tools/api-request-generator/) · [ติดตั้งสูตรเอเจนต์ Seedance 2](https://chinaapi.ai/agent-recipes/seedance-2/)

แหล่งที่มาและวิธีการ: [ชุดข้อมูลการกำหนดราคาโมเดลสาธารณะ](https://chinaapi.ai/th/data/model-pricing/)อัปเดตแล้ว 2026-08-08 ข้อจำกัดต่างๆ ระบุไว้ข้างต้นแล้ว การเรียกร้องของบุคคลที่สามยังคงอยู่ถัดจากหน้าตัวอย่างที่อ้างอิงถึงพวกเขา

---

Markdown twin of https://chinaapi.ai/th/speech-to-text-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
