<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: th/speech-api/index.html -->

# API สำหรับการประมวลผลเสียงภาษาจีนสำหรับระบบรู้จำเสียงพูดอัตโนมัติ (ASR) และการแปลงข้อความให้เป็นเสียงพูด (Text-to-Speech)

> ใช้โมเดล API เสียงภาษาจีน 14 สำหรับ ASR และการแปลงข้อความเป็นเสียงพูดผ่าน ChinaAPI เปรียบเทียบปลายทางที่แน่นอน หน่วยการเรียกเก็บเงิน ราคาเป็นดอลลาร์สหรัฐ ความสามารถ และการคัดลอกและวางคำขอ

- Canonical page: https://chinaapi.ai/th/speech-api/
- Human-readable page: https://chinaapi.ai/th/speech-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=th&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-api

เปรียบเทียบโมเดลรู้จำเสียงพูดและสังเคราะห์เสียงพูดที่ใช้ได้ผ่าน ChinaAPI key เดียว แต่ละโมเดลใช้เส้นทางคำขอจริงของตัวเอง stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini ใช้ /v1/audio/speech ส่วน stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr ใช้ /v1/audio/transcriptions และ mimo-v2.5-asr, mimo-v2.5-tts ใช้ /v1/chat/completions พร้อมเพย์โหลดเสียงเฉพาะของแต่ละโมเดล

[เริ่มใช้งานฟรี — รับเครดิต $2](https://dash.chinaapi.ai/register?lang=th&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

[ดูราคาแบบเรียลไทม์](https://dash.chinaapi.ai/pricing?lang=th&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

## โมเดลเสียงพูด 14 สร้างขึ้นจากแหล่งข้อมูลเดียว

โหมดปลายทาง หน่วยการเรียกเก็บเงิน ความ Model IDs และราคาที่แสดง มาจาก `scripts/models-data.json`ซึ่งราคาเสียงจะได้รับการกระทบยอดกับเกตเวย์ ChinaAPI อัตราค่าบริการสื่อที่แสดงอาจรวมส่วนต่างค่าบริการที่ครอบคลุมค่าใช้จ่ายในการรับ/ส่งข้อมูลของผู้ให้บริการ การประมวลผลการชำระเงิน ความเสี่ยงจากการเรียกเก็บเงินคืน และการดำเนินงาน ส่วนต่างใดๆ จะรวมอยู่ในอัตราที่แสดงและจะไม่ถูกเพิ่มแยกต่างหาก ตรวจสอบราคาจริงก่อนการเปิดตัวใช้งานจริง

### [stepaudio-2-asr-pro](https://chinaapi.ai/th/models/stepaudio-2-asr-pro/)

การรู้จำเสียงพูด (ASR) · StepFun

**จุดสิ้นสุด:** `โพสต์ /v1/audio/transcriptions`

**โหมดการร้องขอ:** จุด OpenAI-compatible การถอดรหัส

**การเรียกเก็บเงิน:** $0.35 ต่อชั่วโมงเสียง

Audio Speech-to-Text

### [step-asr](https://chinaapi.ai/th/models/step-asr/)

การรู้จำเสียงพูด (ASR) · StepFun

**จุดสิ้นสุด:** `โพสต์ /v1/audio/transcriptions`

**โหมดการร้องขอ:** จุด OpenAI-compatible การถอดรหัส

**การเรียกเก็บเงิน:** $0.15 ต่อชั่วโมงเสียง

Audio Speech-to-Text Chinese Dialects

### [step-asr-1.1](https://chinaapi.ai/th/models/step-asr-1.1/)

การรู้จำเสียงพูด (ASR) · StepFun

**จุดสิ้นสุด:** `โพสต์ /v1/audio/transcriptions`

**โหมดการร้องขอ:** จุด OpenAI-compatible การถอดรหัส

**การเรียกเก็บเงิน:** $0.35 ต่อชั่วโมงเสียง

Audio Speech-to-Text Chinese Dialects

### [mimo-v2.5-asr](https://chinaapi.ai/th/models/mimo-v2.5-asr/)

ระบบรู้จำเสียงพูด (ASR) · Xiaomi

**จุดสิ้นสุด:** `โพสต์ /v1/chat/completions`

**โหมดการร้องขอ:** แชทเสร็จสมบูรณ์พร้อมเพย์โหลด input_audio

**การเรียกเก็บเงิน:** $0.074 ต่อชั่วโมงเสียง

Audio Speech-to-Text Multilingual Chinese Dialects Noise Robustness

### [mimo-v2.5-tts](https://chinaapi.ai/th/models/mimo-v2.5-tts/)

การแปลงข้อความเป็นเสียงพูด (TTS) · Xiaomi

**จุดสิ้นสุด:** `โพสต์ /v1/chat/completions`

**โหมดการร้องขอ:** การแสดงผลการสนทนาเมื่อจบการสนทนา พร้อมการตั้งค่าเอาต์พุตเสียง

**การเรียกเก็บเงิน:** $0 10k ตัวอักษร

ราคาอัปโหลดฟรีในช่วงเวลาจำกัด โปรดตรวจสอบราคาจริงก่อนเปิดใช้งานจริง

Audio Text-to-Speech Multilingual Style Control Built-in Voices

### [stepaudio-2.5-tts](https://chinaapi.ai/th/models/stepaudio-2.5-tts/)

การแปลงข้อความเป็นเสียงพูด (TTS) · StepFun

**จุดสิ้นสุด:** `โพสต์ /v1/audio/speech`

**โหมดการร้องขอ:** จุด OpenAI-compatible การพูด

**การเรียกเก็บเงิน:** $0.85 10k ตัวอักษร

Audio Text-to-Speech Contextual TTS Style Control Built-in Voices

### [glm-tts](https://chinaapi.ai/th/models/glm-tts/)

การแปลงข้อความเป็นเสียงพูด (TTS) · Zhipu AI

**จุดสิ้นสุด:** `โพสต์ /v1/audio/speech`

**โหมดการร้องขอ:** จุด OpenAI-compatible การพูด

**การเรียกเก็บเงิน:** $0.3077 10k ตัวอักษร

Audio Text-to-Speech Streaming Emotion Voice Control

### [qwen3-asr-flash](https://chinaapi.ai/th/models/qwen3-asr-flash/)

การรู้จำเสียงพูด ( ASR ) · Alibaba

**จุดสิ้นสุด:** `โพสต์ /v1/audio/transcriptions`

**โหมดการร้องขอ:** จุด OpenAI-compatible การถอดรหัส

**การเรียกเก็บเงิน:** $0.1235 ต่อชั่วโมงเสียง

Audio Speech-to-Text Multilingual Emotion Recognition ITN

### [qwen3-tts-flash](https://chinaapi.ai/th/models/qwen3-tts-flash/)

แปลงข้อความเป็นเสียงพูด ( TTS ) · Alibaba

**จุดสิ้นสุด:** `โพสต์ /v1/audio/speech`

**โหมดการร้องขอ:** จุด OpenAI-compatible การพูด

**การเรียกเก็บเงิน:** $0.1231 10k ตัวอักษร

Audio Text-to-Speech Multilingual Built-in Voices Streaming

### [speech-2.8-hd](https://chinaapi.ai/th/models/speech-2.8-hd/)

การแปลงข้อความเป็นเสียงพูด (TTS) · MiniMax

**จุดสิ้นสุด:** `โพสต์ /v1/audio/speech`

**โหมดการร้องขอ:** จุด OpenAI-compatible การพูด

**การเรียกเก็บเงิน:** $0.5385 10k ตัวอักษร

Audio Text-to-Speech High Fidelity Emotion Multilingual

### [speech-2.8-turbo](https://chinaapi.ai/th/models/speech-2.8-turbo/)

การแปลงข้อความเป็นเสียงพูด (TTS) · MiniMax

**จุดสิ้นสุด:** `โพสต์ /v1/audio/speech`

**โหมดการร้องขอ:** จุด OpenAI-compatible การพูด

**การเรียกเก็บเงิน:** $0.3077 10k ตัวอักษร

Audio Text-to-Speech Low Latency Emotion Multilingual

### [step-tts-2](https://chinaapi.ai/th/models/step-tts-2/)

การแปลงข้อความเป็นเสียงพูด (TTS) · StepFun

**จุดสิ้นสุด:** `โพสต์ /v1/audio/speech`

**โหมดการร้องขอ:** จุด OpenAI-compatible การพูด

**การเรียกเก็บเงิน:** $0.4 10k ตัวอักษร

Audio Text-to-Speech Voice Cloning Emotion Pronunciation Control

### [step-tts-mini](https://chinaapi.ai/th/models/step-tts-mini/)

การแปลงข้อความเป็นเสียงพูด (TTS) · StepFun

**จุดสิ้นสุด:** `โพสต์ /v1/audio/speech`

**โหมดการร้องขอ:** จุด OpenAI-compatible การพูด

**การเรียกเก็บเงิน:** $0.15 10k ตัวอักษร

Audio Text-to-Speech Multilingual Voice Cloning Style Control

### [stepaudio-2.5-asr](https://chinaapi.ai/th/models/stepaudio-2.5-asr/)

การรู้จำเสียงพูด (ASR) · StepFun

**จุดสิ้นสุด:** `โพสต์ /v1/audio/transcriptions`

**โหมดการร้องขอ:** จุด OpenAI-compatible การถอดรหัส

**การเรียกเก็บเงิน:** $0.022 ต่อชั่วโมงเสียง

Audio Speech-to-Text Streaming Chinese and English ITN

## ASR สำหรับการเข้าใจเสียง; TTS สำหรับการแปลงเสียงเป็นข้อความ

### การถอดเสียงและความเข้าใจด้านเสียง

[stepaudio-2-asr-pro](https://chinaapi.ai/th/models/stepaudio-2-asr-pro/): StepFun StepAudio 2 ASR Pro — การรู้จำเสียงพูดขนาด 32B พารามิเตอร์ เป็นตัวเลือกที่เน้นความแม่นยำในสาย ASR ของ StepFun ขณะที่ stepaudio-2.5-asr เป็นตัวเลือกที่เน้นความเร็วและต้นทุน รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง

### การถอดเสียงและความเข้าใจด้านเสียง

[step-asr](https://chinaapi.ai/th/models/step-asr/): StepFun step-asr — การรู้จำเสียงพูดอเนกประสงค์ ครอบคลุมภาษาจีน ภาษาอังกฤษ และภาษาถิ่นจีน สำหรับการถอดเสียง บันทึกการประชุม การตรวจสอบคุณภาพสายสนทนา และการค้นหาด้วยเสียง รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง

### การถอดเสียงและความเข้าใจด้านเสียง

[step-asr-1.1](https://chinaapi.ai/th/models/step-asr-1.1/): StepFun step-asr-1.1 — โมเดลรู้จำเสียงอเนกประสงค์รุ่นปรับปรุงในสาย step-asr ครอบคลุมภาษาจีน ภาษาอังกฤษ และภาษาถิ่นจีน รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง

### การถอดเสียงและความเข้าใจด้านเสียง

[mimo-v2.5-asr](https://chinaapi.ai/th/models/mimo-v2.5-asr/): Xiaomi MiMo-V2.5-ASR — การรู้จำเสียงพูดสำหรับภาษาจีน อังกฤษ การสลับภาษา สำเนียงท้องถิ่น การบันทึกที่มีเสียงรบกวน เสียงจากระยะไกล ผู้พูดหลายคน และเนื้อเพลง

### สามารถควบคุมการส่งสัญญาณเสียงได้

[mimo-v2.5-tts](https://chinaapi.ai/th/models/mimo-v2.5-tts/): Xiaomi MiMo-V2.5-TTS — การสังเคราะห์เสียงหลายภาษาที่แสดงอารมณ์ได้อย่างดีเยี่ยม พร้อมเสียงพูดในตัว คำแนะนำในรูปแบบภาษาธรรมชาติ อารมณ์ จังหวะ น้ำเสียง สำเนียง และการควบคุมตัวอักษร

### การส่งสัญญาณเสียงออกผ่านเส้นทางเฉพาะ

[stepaudio-2.5-tts](https://chinaapi.ai/th/models/stepaudio-2.5-tts/): StepAudio 2.5 TTS — การสังเคราะห์เสียงพูดตามบริบทพร้อมการกำกับภาษาธรรมชาติแบบอินไลน์ การแสดงออกทางอารมณ์ เสียงพูดในตัว และเอาต์พุต OpenAI-compatible

### การส่งสัญญาณเสียงออกผ่านเส้นทางเฉพาะ

[glm-tts](https://chinaapi.ai/th/models/glm-tts/): GLM-TTS — การสังเคราะห์เสียงพูดที่คำนึงถึงบริบท พร้อมการถ่ายทอดอารมณ์ การส่งออกเสียงแบบสตรีมมิ่ง เสียงเริ่มต้นที่รวดเร็ว และการควบคุมเสียง ความเร็ว และระดับเสียง

### การถอดเสียงและความเข้าใจด้านเสียง

[qwen3-asr-flash](https://chinaapi.ai/th/models/qwen3-asr-flash/): Qwen3-ASR-Flash — การถอดเสียงไฟล์หลายภาษาพร้อมคำแนะนำภาษา การปรับข้อความให้เป็นมาตรฐานแบบผกผัน การจดจำอารมณ์ และ OpenAI-compatible การป้อนข้อมูลเสียง

### การส่งสัญญาณเสียงออกผ่านเส้นทางเฉพาะ

[qwen3-tts-flash](https://chinaapi.ai/th/models/qwen3-tts-flash/): Qwen3-TTS-Flash — การสังเคราะห์เสียงหลายภาษาที่มีความหน่วงต่ำ พร้อมการป้อนข้อมูลแบบผสมภาษา เสียงในตัว การจับคู่ภาษาอัตโนมัติ และการคิดค่าบริการตามจำนวนตัวอักษร

### การส่งสัญญาณเสียงออกผ่านเส้นทางเฉพาะ

[speech-2.8-hd](https://chinaapi.ai/th/models/speech-2.8-hd/): MiniMax เสียงพูด 2.8 HD — การสังเคราะห์เสียงพูดคุณภาพสูง พร้อมการถ่ายทอดอารมณ์ที่เป็นธรรมชาติ การปรับปรุงคุณภาพภาษา การควบคุมด้วยเสียง และรูปแบบเสียงสำหรับการผลิต

### การส่งสัญญาณเสียงออกผ่านเส้นทางเฉพาะ

[speech-2.8-turbo](https://chinaapi.ai/th/models/speech-2.8-turbo/): MiniMax Speech 2.8 Turbo — การสังเคราะห์เสียงพูดที่เน้นความเร็ว ให้เสียงที่เป็นธรรมชาติ ควบคุมอารมณ์ ปรับปรุงคุณภาพภาษา และรองรับรูปแบบเสียงที่ใช้กันทั่วไปในการผลิต

### การส่งสัญญาณเสียงออกผ่านเส้นทางเฉพาะ

[step-tts-2](https://chinaapi.ai/th/models/step-tts-2/): ขั้นตอนที่ TTS 2 — การสังเคราะห์เสียงพูดที่แสดงอารมณ์ด้วยเสียงทางการและเสียงเลียนแบบ การควบคุมความเร็วและระดับเสียง การแมปการออกเสียง และรูปแบบเอาต์พุตหลายรูปแบบ

### การส่งสัญญาณเสียงออกผ่านเส้นทางเฉพาะ

[step-tts-mini](https://chinaapi.ai/th/models/step-tts-mini/): Step TTS Mini — ระบบสังเคราะห์เสียงพูดที่มีประสิทธิภาพและคุ้มค่าสำหรับภาษาจีน อังกฤษ ญี่ปุ่น กวางตุ้ง และเสฉวน พร้อมเสียงทางการและเสียงเลียนแบบ

### การถอดเสียงและความเข้าใจด้านเสียง

[stepaudio-2.5-asr](https://chinaapi.ai/th/models/stepaudio-2.5-asr/): StepAudio 2.5 ASR — โมเดลการถอดเสียงสตรีม 4B MTP สำหรับการจดจำภาษาจีน-อังกฤษอย่างรวดเร็ว การปรับมาตรฐาน ITN คำบรรยาย การประชุม และตัวแทนเสียง

## OpenAI-compatible ไม่ได้หมายความว่าจะมีเส้นทางเสียงสากลเพียงเส้นทางเดียว

ชื่อเส้นทางและรูปแบบคำขอเป็นไปตามแพทเทิร์น OpenAI-compatible แต่ไคลเอนต์ต้องส่งฟิลด์เสียงที่แต่ละโมเดลกำหนด stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini ใช้ /v1/audio/speech ส่วน stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr ใช้ /v1/audio/transcriptions และ mimo-v2.5-asr, mimo-v2.5-tts ใช้ /v1/chat/completions พร้อมเพย์โหลดเสียงเฉพาะของแต่ละโมเดล

## คัดลอกคำขอสำหรับรุ่นและวิธีการขนส่งที่คุณต้องการ

### stepaudio-2-asr-pro

การรู้จำเสียงพูด ( ASR ) ผ่านทาง `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2-asr-pro" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr

การรู้จำเสียงพูด ( ASR ) ผ่านทาง `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr-1.1

การรู้จำเสียงพูด ( ASR ) ผ่านทาง `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr-1.1" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### mimo-v2.5-asr

การรู้จำเสียงพูด ( ASR ) ผ่านทาง `/v1/chat/completions`

```
AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-asr",
    "messages": [{
      "role": "user",
      "content": [{
        "type": "input_audio",
        "input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
      }]
    }]
  }'
```

### mimo-v2.5-tts

แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน `/v1/chat/completions`

```
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "messages": [
      {"role": "user", "content": "Natural, clear, and friendly delivery"},
      {"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
    ],
    "audio": {"format": "wav", "voice": "冰糖"}
  }' > response.json
```

### stepaudio-2.5-tts

แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-2.5-tts",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### glm-tts

แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "voice": "tongtong",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### qwen3-asr-flash

การรู้จำเสียงพูด ( ASR ) ผ่านทาง `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### qwen3-tts-flash

แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "voice": "Cherry",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-hd

แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-turbo

แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-2

แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-mini

แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-mini",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### stepaudio-2.5-asr

การรู้จำเสียงพูด ( ASR ) ผ่านทาง `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2.5-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

## โมเดลการป้อนเสียงของ ChinaAPI ทั้งหมดใช้ปลายทางเสียงเดียวกันหรือไม่?

No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini ใช้ /v1/audio/speech ส่วน stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr ใช้ /v1/audio/transcriptions และ mimo-v2.5-asr, mimo-v2.5-tts ใช้ /v1/chat/completions พร้อมเพย์โหลดเสียงเฉพาะของแต่ละโมเดล

## แบบจำลองการพูดคิดค่าบริการอย่างไร?

stepaudio-2-asr-pro: $0.35 ต่อชั่วโมงเสียง; step-asr: $0.15 ต่อชั่วโมงเสียง; step-asr-1.1: $0.35 ต่อชั่วโมงเสียง; mimo-v2.5-asr: $0.074 ต่อชั่วโมงเสียง; mimo-v2.5-tts: $0 ต่อ 10k อักขระ; stepaudio-2.5-tts: $0.85 ต่อ 10k อักขระ; glm-tts: $0.3077 ต่อ 10k อักขระ; qwen3-asr-flash: $0.1235 ต่อชั่วโมงเสียง; qwen3-tts-flash: $0.1231 ต่อ 10k อักขระ; speech-2.8-hd: $0.5385 ต่อ 10k อักขระ; speech-2.8-turbo: $0.3077 ต่อ 10k อักขระ; step-tts-2: $0.4 ต่อ 10k อักขระ; step-tts-mini: $0.15 ต่อ 10k อักขระ; stepaudio-2.5-asr: $0.022 ต่อชั่วโมงเสียง อัตราสื่อที่แสดงอาจรวมมาร์จิ้นบริการที่ครอบคลุมการคิดค่าอินพุต/เอาต์พุตของผู้ให้บริการ การประมวลผลการชำระเงิน ความเสี่ยงชาร์จแบ็ก และการดำเนินงาน มาร์จิ้นใด ๆ รวมอยู่ในอัตราที่แสดงแล้วและไม่ถูกบวกเพิ่มแยกต่างหาก ค่าเหล่านี้เรนเดอร์จากแคตตาล็อกโมเดล ไม่ได้คัดลอกมาไว้ในหน้านี้

## ฉันสามารถใช้โมเดลเหล่านี้ได้โดยไม่ต้องมีบัญชีในประเทศจีนแผ่นดินใหญ่หรือไม่?

ใช่แล้ว ChinaAPI ให้สิทธิ์การเข้าถึงโดยไม่ต้องมีบัญชีหรือหมายเลขโทรศัพท์ในจีนแผ่นดินใหญ่ เพียงลงทะเบียนเพื่อขอคีย์ จากนั้นใช้เส้นทางและข้อมูลที่ส่งไปตามที่แสดงสำหรับรุ่นที่คุณเลือก

---

Markdown twin of https://chinaapi.ai/th/speech-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
