<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: th/audio-api/index.html -->

# เสียง API : ความเข้าใจและการสร้างองค์ประกอบพื้นฐานจากเสียงพูดสู่เสียงพูด

> ใช้โหมดปลายทางที่ตรวจสอบความเข้าใจเสียง ASR และ TTS โดยไม่ต้องถือว่าโมเดลการพูดทุกแบบสามารถใช้แทนกันได้

- Canonical page: https://chinaapi.ai/th/audio-api/
- Human-readable page: https://chinaapi.ai/th/audio-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=th&utm_source=chinaapi&utm_medium=markdown&utm_campaign=audio-api

ใช้โหมดปลายทางที่ตรวจสอบความเข้าใจเสียง ASR และ TTS โดยไม่ต้องถือว่าโมเดลการพูดทุกแบบสามารถใช้แทนกันได้

[ลองดู stepaudio-2-asr-pro](https://dash.chinaapi.ai/start?task=video-with-audio&model=stepaudio-2-asr-pro&lang=th&utm_source=chinaapi&utm_medium=capability&utm_campaign=audio-api)

[สร้างคำขอ](https://chinaapi.ai/tools/api-request-generator/)

## ข้อมูลนำเข้า ข้อมูลส่งออก และวงจรชีวิต

### ข้อมูลนำเข้า

ไฟล์เสียงสำหรับทำความเข้าใจ/ถอดเสียง หรือข้อความสำหรับการสังเคราะห์ โดยใช้ค่าที่แน่นอนของโมเดลที่เลือก api_mode

### เอาต์พุต

การวิเคราะห์ข้อความ/ถอดเสียง หรือการสร้างเสียงพูด ไม่ได้หมายความว่าจะได้ผลลัพธ์เป็นเสียงพูดโดยตรง เว้นแต่ว่าข้อมูลเมตาของแคตตาล็อกจะระบุไว้เช่นนั้น

### จุดสิ้นสุด

`Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech`

### วงจรชีวิต

ปลายทางเสียงที่ระบุไว้เป็นแบบซิงโครนัส กระบวนการทำงานแบบเสียงต่อเสียงจะเชื่อมโยงการถอดเสียงหรือการทำความเข้าใจเสียงเข้ากับ TTS แยกต่างหาก

## หนึ่งคำจำกัดความต่อหนึ่งงาน

ความเข้าใจด้านเสียง

**ขีดจำกัด:** เครื่องหมาย TTS หรือ ASR ไม่ได้พิสูจน์ถึงความเข้าใจเสียงโดยตรง การโคลนเสียง การแยกเสียง หรือการสนับสนุนเสียงพูดต่อเสียงพูด

## 14 ที่มีเมตาเดตาที่ระบุอย่างชัดเจน

ฟังก์ชันที่ไม่ทราบจะถูกละเว้น และจะไม่คาดเดาจากชื่อรุ่น ตัวอย่างการกำหนดราคาใช้ข้อมูลสาธารณะที่ซิงโครไนซ์ไว้ ราคา Dash แบบเรียลไทม์ยังคงเป็นข้อมูลที่ถูกต้องที่สุด

### [stepaudio-2-asr-pro](https://chinaapi.ai/th/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro — การรู้จำเสียงพูดขนาด 32B พารามิเตอร์ เป็นตัวเลือกที่เน้นความแม่นยำในสาย ASR ของ StepFun ขณะที่ stepaudio-2.5-asr เป็นตัวเลือกที่เน้นความเร็วและต้นทุน รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง

**หน้าที่:** วิดีโอพร้อมเสียงและคำบรรยาย

**จุดสิ้นสุด:** `POST /v1/audio/transcriptions`

**ตัวอย่างค่าใช้จ่าย:** 1 ชั่วโมงเสียง × $0.35 = $0.35 .

### [step-asr](https://chinaapi.ai/th/models/step-asr/)

StepFun step-asr — การรู้จำเสียงพูดอเนกประสงค์ ครอบคลุมภาษาจีน ภาษาอังกฤษ และภาษาถิ่นจีน สำหรับการถอดเสียง บันทึกการประชุม การตรวจสอบคุณภาพสายสนทนา และการค้นหาด้วยเสียง รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง

**หน้าที่:** วิดีโอพร้อมเสียงและคำบรรยาย

**จุดสิ้นสุด:** `POST /v1/audio/transcriptions`

**ตัวอย่างค่าใช้จ่าย:** 1 ชั่วโมงเสียง × $0.15 = $0.15 .

### [step-asr-1.1](https://chinaapi.ai/th/models/step-asr-1.1/)

StepFun step-asr-1.1 — โมเดลรู้จำเสียงอเนกประสงค์รุ่นปรับปรุงในสาย step-asr ครอบคลุมภาษาจีน ภาษาอังกฤษ และภาษาถิ่นจีน รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง

**หน้าที่:** วิดีโอพร้อมเสียงและคำบรรยาย

**จุดสิ้นสุด:** `POST /v1/audio/transcriptions`

**ตัวอย่างค่าใช้จ่าย:** 1 ชั่วโมงเสียง × $0.35 = $0.35 .

### [mimo-v2.5-asr](https://chinaapi.ai/th/models/mimo-v2.5-asr/)

Xiaomi การรู้จำเสียงพูดสำหรับภาษาจีน ภาษาอังกฤษ การสลับภาษา สำเนียงท้องถิ่น การ MiMo-V2.5-ASR ที่มีเสียงรบกวน เสียงจากระยะไกล ผู้พูดหลายคน และเนื้อเพลง

**หน้าที่:** วิดีโอพร้อมเสียงและคำบรรยาย

**จุดสิ้นสุด:** `POST /v1/chat/completions`

**ตัวอย่างค่าใช้จ่าย:** 1 ชั่วโมงเสียง × $0.074 = $0.074 .

### [mimo-v2.5-tts](https://chinaapi.ai/th/models/mimo-v2.5-tts/)

Xiaomi การสังเคราะห์เสียงหลายภาษาที่แสดงอารมณ์ได้ MiMo-V2.5-TTS ดีเยี่ยม พร้อมเสียงพูดในตัว คำแนะนำในรูปแบบภาษาธรรมชาติ อารมณ์ จังหวะ น้ำเสียง สำเนียง และการควบคุมตัวอักษร

**หน้าที่:** วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด

**จุดสิ้นสุด:** `POST /v1/chat/completions`

**ตัวอย่างค่าใช้จ่าย:** 1 10k ตัวอักษร × $0 = $0 .

### [stepaudio-2.5-tts](https://chinaapi.ai/th/models/stepaudio-2.5-tts/)

StepAudio การสังเคราะห์เสียงพูดตาม TTS พร้อมการ 2.5 ภาษาธรรมชาติแบบอินไลน์ การแสดงออกทางอารมณ์ เสียงพูดในตัว และเอาต์พุต OpenAI-compatible

**หน้าที่:** วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด

**จุดสิ้นสุด:** `POST /v1/audio/speech`

**ตัวอย่างค่าใช้จ่าย:** 1 10.85k ตัวอักษร × $0.85 = $0.85 .

### [glm-tts](https://chinaapi.ai/th/models/glm-tts/)

GLM-TTS การสังเคราะห์เสียงพูดที่คำนึงถึงบริบท พร้อมการถ่ายทอดอารมณ์ การส่งออกเสียงแบบสตรีมมิ่ง เสียงเริ่มต้นที่รวดเร็ว และการควบคุมเสียง ความเร็ว และระดับเสียง

**หน้าที่:** วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด

**จุดสิ้นสุด:** `POST /v1/audio/speech`

**ตัวอย่างค่าใช้จ่าย:** 1 10.307692k ตัวอักษร × $0.307692 = $0.307692 .

### [qwen3-asr-flash](https://chinaapi.ai/th/models/qwen3-asr-flash/)

Qwen3-ASR-Flash การถอดเสียงไฟล์หลายภาษาพร้อมคำแนะนำภาษา การปรับข้อความให้เป็นมาตรฐานแบบผกผัน การจดจำอารมณ์ และการป้อนข้อมูล OpenAI-compatible

**หน้าที่:** วิดีโอพร้อมเสียงและคำบรรยาย

**จุดสิ้นสุด:** `POST /v1/audio/transcriptions`

**ตัวอย่างค่าใช้จ่าย:** 1 ชั่วโมงเสียง × $0.123539 = $0.123539 .

### [qwen3-tts-flash](https://chinaapi.ai/th/models/qwen3-tts-flash/)

Qwen3-TTS-Flash การสังเคราะห์เสียงหลายภาษาที่มีความหน่วงต่ำ พร้อมการป้อนข้อมูลแบบผสมภาษา เสียงพูดในตัว การจับคู่ภาษาอัตโนมัติ และการคิดค่าบริการตามจำนวนตัวอักษร

**หน้าที่:** วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด

**จุดสิ้นสุด:** `POST /v1/audio/speech`

**ตัวอย่างค่าใช้จ่าย:** 1 10.123077k ตัวอักษร × $0.123077 = $0.123077 .

### [speech-2.8-hd](https://chinaapi.ai/th/models/speech-2.8-hd/)

MiniMax พูด 2.8 HD — การสังเคราะห์เสียงพูดคุณภาพสูง พร้อมการถ่ายทอดอารมณ์ที่เป็นธรรมชาติ การปรับปรุงคุณภาพภาษา การควบคุมด้วยเสียง และรูปแบบเสียงสำหรับการผลิต

**หน้าที่:** วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด

**จุดสิ้นสุด:** `POST /v1/audio/speech`

**ตัวอย่างค่าใช้จ่าย:** 1 10.538462k ตัวอักษร × $0.538462 = $0.538462 .

### [speech-2.8-turbo](https://chinaapi.ai/th/models/speech-2.8-turbo/)

MiniMax Speech 2.8 Turbo — การสังเคราะห์เสียงพูดที่เน้นความเร็ว ให้เสียงที่เป็นธรรมชาติ ควบคุมอารมณ์ ปรับปรุงคุณภาพภาษา และรองรับรูปแบบเสียงที่ใช้กันทั่วไปในการผลิต

**หน้าที่:** วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด

**จุดสิ้นสุด:** `POST /v1/audio/speech`

**ตัวอย่างค่าใช้จ่าย:** 1 10.307692k ตัวอักษร × $0.307692 = $0.307692 .

### [step-tts-2](https://chinaapi.ai/th/models/step-tts-2/)

ขั้นตอนที่ TTS 2 — การสังเคราะห์เสียงพูดที่แสดงอารมณ์ด้วยเสียงทางการและเสียงจำลอง การควบคุมความเร็วและระดับเสียง การแมปการออกเสียง และรูปแบบเอาต์พุตหลายรูปแบบ

**หน้าที่:** วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด

**จุดสิ้นสุด:** `POST /v1/audio/speech`

**ตัวอย่างค่าใช้จ่าย:** 1 10.4k ตัวอักษร × $0.4 = $0.4 .

### [step-tts-mini](https://chinaapi.ai/th/models/step-tts-mini/)

Step TTS — ระบบสังเคราะห์เสียงพูดที่มีประสิทธิภาพและคุ้มค่าสำหรับภาษาจีน อังกฤษ ญี่ปุ่น กวางตุ้ง และเสฉวน พร้อมเสียงทางการและเสียงเลียนแบบ

**หน้าที่:** วิดีโอพร้อมเสียง, การแปลงข้อความเป็นเสียงพูด

**จุดสิ้นสุด:** `POST /v1/audio/speech`

**ตัวอย่างค่าใช้จ่าย:** 1 10.15k ตัวอักษร × $0.15 = $0.15 .

### [stepaudio-2.5-asr](https://chinaapi.ai/th/models/stepaudio-2.5-asr/)

StepAudio โมเดลการถอด 2.5 สตรี 4B ASR MTP สำหรับการจดจำภาษาจีน-อังกฤษอย่างรวดเร็ว การปรับมาตรฐาน ITN คำบรรยาย การประชุม และตัวแทนเสียง

**หน้าที่:** วิดีโอพร้อมเสียงและคำบรรยาย

**จุดสิ้นสุด:** `POST /v1/audio/transcriptions`

**ตัวอย่างค่าใช้จ่าย:** 1 ชั่วโมงเสียง × $0.022 = $0.022 .

## ดำเนินการหรือประเมินก่อนลงทะเบียน

[คำนวณ API](https://chinaapi.ai/tools/api-cost-calculator/) · [สร้างคำสั่ง curl, Python หรือ JavaScript](https://chinaapi.ai/tools/api-request-generator/) · [ติดตั้งสูตรเอเจนต์ Seedance 2](https://chinaapi.ai/agent-recipes/seedance-2/)

แหล่งที่มาและวิธีการ: [ชุดข้อมูลการกำหนดราคาโมเดลสาธารณะ](https://chinaapi.ai/th/data/model-pricing/)อัปเดตแล้ว 2026-08-08 ข้อจำกัดต่างๆ ระบุไว้ข้างต้นแล้ว การเรียกร้องของบุคคลที่สามยังคงอยู่ถัดจากหน้าตัวอย่างที่อ้างอิงถึงพวกเขา

---

Markdown twin of https://chinaapi.ai/th/audio-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
