<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: vi/speech-api/index.html -->

# API giọng nói tiếng Trung dành cho nhận dạng giọng nói tự động (ASR) và chuyển văn bản thành giọng nói.

> Sử dụng 14 mô hình API giọng nói tiếng Trung cho nhận dạng giọng nói tự động (ASR) và chuyển văn bản thành giọng nói thông qua ChinaAPI. So sánh các điểm cuối chính xác, đơn vị tính phí, giá USD, khả năng và các yêu cầu sao chép-dán.

- Canonical page: https://chinaapi.ai/vi/speech-api/
- Human-readable page: https://chinaapi.ai/vi/speech-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=vi&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-api

So sánh các mô hình nhận dạng giọng nói và tổng hợp giọng nói dùng được qua một ChinaAPI key. Mỗi mô hình giữ nguyên đường dẫn yêu cầu thực của nó. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini dùng /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr dùng /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts dùng /v1/chat/completions với payload âm thanh riêng của từng mô hình.

[Bắt đầu miễn phí — nhận $2 tiền thưởng](https://dash.chinaapi.ai/register?lang=vi&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

[Xem giá trực tiếp](https://dash.chinaapi.ai/pricing?lang=vi&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

## 14 mô hình giọng nói, được tạo ra từ một nguồn dữ liệu duy nhất.

Các chế độ điểm cuối, đơn vị thanh toán, khả Model IDs và giá hiển thị đều đến từ... `scripts/models-data.json`Giá âm thanh được đối chiếu với cổng ChinaAPI . Mức giá phương tiện hiển thị có thể bao gồm phí dịch vụ bao gồm phí lập hóa đơn đầu vào/đầu ra của nhà cung cấp, xử lý thanh toán, rủi ro hoàn trả và hoạt động. Bất kỳ khoản phí nào cũng được bao gồm trong mức giá hiển thị và không được cộng thêm riêng. Kiểm tra giá thực tế trước khi triển khai sản xuất.

### [stepaudio-2-asr-pro](https://chinaapi.ai/vi/models/stepaudio-2-asr-pro/)

Nhận dạng giọng nói (ASR) · StepFun

**Điểm cuối:** `BÀI VIẾT /v1/audio/transcriptions`

**Chế độ yêu cầu:** OpenAI-compatible điểm cuối phiên mã

**Thanh toán:** $0.35 mỗi giờ âm thanh

Audio Speech-to-Text

### [step-asr](https://chinaapi.ai/vi/models/step-asr/)

Nhận dạng giọng nói (ASR) · StepFun

**Điểm cuối:** `BÀI VIẾT /v1/audio/transcriptions`

**Chế độ yêu cầu:** OpenAI-compatible điểm cuối phiên mã

**Thanh toán:** $0.15 mỗi giờ âm thanh

Audio Speech-to-Text Chinese Dialects

### [step-asr-1.1](https://chinaapi.ai/vi/models/step-asr-1.1/)

Nhận dạng giọng nói (ASR) · StepFun

**Điểm cuối:** `BÀI VIẾT /v1/audio/transcriptions`

**Chế độ yêu cầu:** OpenAI-compatible điểm cuối phiên mã

**Thanh toán:** $0.35 mỗi giờ âm thanh

Audio Speech-to-Text Chinese Dialects

### [mimo-v2.5-asr](https://chinaapi.ai/vi/models/mimo-v2.5-asr/)

Nhận dạng giọng nói (ASR) · Xiaomi

**Điểm cuối:** `BÀI VIẾT /v1/chat/completions`

**Chế độ yêu cầu:** Hoàn thành cuộc trò chuyện với tải trọng input_audio

**Thanh toán:** $0.074 mỗi giờ âm thanh

Audio Speech-to-Text Multilingual Chinese Dialects Noise Robustness

### [mimo-v2.5-tts](https://chinaapi.ai/vi/models/mimo-v2.5-tts/)

Chuyển văn bản thành giọng nói (TTS) · Xiaomi

**Điểm cuối:** `BÀI VIẾT /v1/chat/completions`

**Chế độ yêu cầu:** Hoàn thành cuộc trò chuyện với cấu hình tin nhắn và đầu ra âm thanh

**Thanh toán:** $0 mỗi 10k ký tự

Ưu đãi giá gốc miễn phí trong thời gian có hạn; kiểm tra giá trực tiếp trước khi triển khai sản phẩm.

Audio Text-to-Speech Multilingual Style Control Built-in Voices

### [stepaudio-2.5-tts](https://chinaapi.ai/vi/models/stepaudio-2.5-tts/)

Chuyển văn bản thành giọng nói (TTS) · StepFun

**Điểm cuối:** `BÀI VIẾT /v1/audio/speech`

**Chế độ yêu cầu:** OpenAI-compatible điểm cuối lời nói

**Thanh toán:** $0.85 mỗi 10k ký tự

Audio Text-to-Speech Contextual TTS Style Control Built-in Voices

### [glm-tts](https://chinaapi.ai/vi/models/glm-tts/)

Chuyển văn bản thành giọng nói ( TTS ) · Zhipu AI

**Điểm cuối:** `BÀI VIẾT /v1/audio/speech`

**Chế độ yêu cầu:** OpenAI-compatible điểm cuối lời nói

**Thanh toán:** $0.3077 mỗi 10k ký tự

Audio Text-to-Speech Streaming Emotion Voice Control

### [qwen3-asr-flash](https://chinaapi.ai/vi/models/qwen3-asr-flash/)

Nhận dạng giọng nói (ASR) · Alibaba

**Điểm cuối:** `BÀI VIẾT /v1/audio/transcriptions`

**Chế độ yêu cầu:** OpenAI-compatible điểm cuối phiên mã

**Thanh toán:** $0.1235 mỗi giờ âm thanh

Audio Speech-to-Text Multilingual Emotion Recognition ITN

### [qwen3-tts-flash](https://chinaapi.ai/vi/models/qwen3-tts-flash/)

Chuyển văn bản thành giọng nói (TTS) · Alibaba

**Điểm cuối:** `BÀI VIẾT /v1/audio/speech`

**Chế độ yêu cầu:** OpenAI-compatible điểm cuối lời nói

**Thanh toán:** $0.1231 mỗi 10k ký tự

Audio Text-to-Speech Multilingual Built-in Voices Streaming

### [speech-2.8-hd](https://chinaapi.ai/vi/models/speech-2.8-hd/)

Chuyển văn bản thành giọng nói (TTS) · MiniMax

**Điểm cuối:** `BÀI VIẾT /v1/audio/speech`

**Chế độ yêu cầu:** OpenAI-compatible điểm cuối lời nói

**Thanh toán:** $0.5385 mỗi 10k ký tự

Audio Text-to-Speech High Fidelity Emotion Multilingual

### [speech-2.8-turbo](https://chinaapi.ai/vi/models/speech-2.8-turbo/)

Chuyển văn bản thành giọng nói (TTS) · MiniMax

**Điểm cuối:** `BÀI VIẾT /v1/audio/speech`

**Chế độ yêu cầu:** OpenAI-compatible điểm cuối lời nói

**Thanh toán:** $0.3077 mỗi 10k ký tự

Audio Text-to-Speech Low Latency Emotion Multilingual

### [step-tts-2](https://chinaapi.ai/vi/models/step-tts-2/)

Chuyển văn bản thành giọng nói (TTS) · StepFun

**Điểm cuối:** `BÀI VIẾT /v1/audio/speech`

**Chế độ yêu cầu:** OpenAI-compatible điểm cuối lời nói

**Thanh toán:** $0.4 mỗi 10k ký tự

Audio Text-to-Speech Voice Cloning Emotion Pronunciation Control

### [step-tts-mini](https://chinaapi.ai/vi/models/step-tts-mini/)

Chuyển văn bản thành giọng nói (TTS) · StepFun

**Điểm cuối:** `BÀI VIẾT /v1/audio/speech`

**Chế độ yêu cầu:** OpenAI-compatible điểm cuối lời nói

**Thanh toán:** $0.15 mỗi 10k ký tự

Audio Text-to-Speech Multilingual Voice Cloning Style Control

### [stepaudio-2.5-asr](https://chinaapi.ai/vi/models/stepaudio-2.5-asr/)

Nhận dạng giọng nói (ASR) · StepFun

**Điểm cuối:** `BÀI VIẾT /v1/audio/transcriptions`

**Chế độ yêu cầu:** OpenAI-compatible điểm cuối phiên mã

**Thanh toán:** $0.022 mỗi giờ âm thanh

Audio Speech-to-Text Streaming Chinese and English ITN

## ASR (Nhận dạng giọng nói tự động); TTS (Chuyển văn bản thành giọng nói) để xuất giọng nói.

### Phiên âm và hiểu âm thanh

[stepaudio-2-asr-pro](https://chinaapi.ai/vi/models/stepaudio-2-asr-pro/): StepFun StepAudio 2 ASR Pro — nhận dạng giọng nói 32B tham số, lựa chọn ưu tiên độ chính xác trong dòng ASR của StepFun, còn stepaudio-2.5-asr là lựa chọn ưu tiên tốc độ và chi phí. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.

### Phiên âm và hiểu âm thanh

[step-asr](https://chinaapi.ai/vi/models/step-asr/): StepFun step-asr — nhận dạng giọng nói đa dụng cho tiếng Trung, tiếng Anh và các phương ngữ Trung Quốc, dùng cho phiên âm, biên bản họp, rà soát chất lượng cuộc gọi và tìm kiếm bằng giọng nói. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.

### Phiên âm và hiểu âm thanh

[step-asr-1.1](https://chinaapi.ai/vi/models/step-asr-1.1/): StepFun step-asr-1.1 — bản cập nhật của bộ nhận dạng đa dụng trong dòng step-asr, hỗ trợ tiếng Trung, tiếng Anh và các phương ngữ Trung Quốc. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.

### Phiên âm và hiểu âm thanh

[mimo-v2.5-asr](https://chinaapi.ai/vi/models/mimo-v2.5-asr/): Xiaomi MiMo-V2.5-ASR — nhận dạng giọng nói cho tiếng Trung, tiếng Anh, chuyển đổi mã ngôn ngữ, phương ngữ vùng miền, bản ghi âm nhiễu, âm thanh từ xa, nhiều người nói và lời bài hát.

### Đầu ra giọng nói có thể điều khiển

[mimo-v2.5-tts](https://chinaapi.ai/vi/models/mimo-v2.5-tts/): Xiaomi MiMo-V2.5-TTS — tổng hợp giọng nói đa ngôn ngữ biểu cảm với giọng nói tích hợp sẵn, hướng dẫn theo phong cách ngôn ngữ tự nhiên, cảm xúc, tốc độ, âm điệu, phương ngữ và điều khiển ký tự.

### Đầu ra giọng nói thông qua một tuyến đường chuyên dụng

[stepaudio-2.5-tts](https://chinaapi.ai/vi/models/stepaudio-2.5-tts/): StepAudio 2.5 TTS — tổng hợp giọng nói theo ngữ cảnh với hướng dẫn ngôn ngữ tự nhiên trực tiếp, truyền đạt biểu cảm, giọng nói tích hợp và đầu ra OpenAI-compatible thanh.

### Đầu ra giọng nói thông qua một tuyến đường chuyên dụng

[glm-tts](https://chinaapi.ai/vi/models/glm-tts/): GLM-TTS — tổng hợp giọng nói nhận biết ngữ cảnh với khả năng truyền đạt biểu cảm, đầu ra dạng luồng, âm thanh đầu tiên nhanh và các điều khiển cho giọng nói, tốc độ và âm lượng.

### Phiên âm và hiểu âm thanh

[qwen3-asr-flash](https://chinaapi.ai/vi/models/qwen3-asr-flash/): Qwen3-ASR-Flash — Chuyển đổi tệp đa ngôn ngữ thành văn bản với gợi ý ngôn ngữ, chuẩn hóa văn bản ngược, nhận diện cảm xúc và OpenAI-compatible đầu vào âm thanh.

### Đầu ra giọng nói thông qua một tuyến đường chuyên dụng

[qwen3-tts-flash](https://chinaapi.ai/vi/models/qwen3-tts-flash/): Qwen3-TTS-Flash — Tổng hợp giọng nói đa ngôn ngữ độ trễ thấp với đầu vào hỗn hợp nhiều ngôn ngữ, giọng nói tích hợp sẵn, khớp ngôn ngữ tự động và lập hóa đơn dựa trên ký tự.

### Đầu ra giọng nói thông qua một tuyến đường chuyên dụng

[speech-2.8-hd](https://chinaapi.ai/vi/models/speech-2.8-hd/): MiniMax Giọng nói 2.8 HD — tổng hợp giọng nói chất lượng cao với khả năng truyền đạt cảm xúc tự nhiên, cải thiện ngôn ngữ, điều khiển bằng giọng nói và các định dạng âm thanh chuyên nghiệp.

### Đầu ra giọng nói thông qua một tuyến đường chuyên dụng

[speech-2.8-turbo](https://chinaapi.ai/vi/models/speech-2.8-turbo/): MiniMax Speech 2.8 Turbo — tổng hợp giọng nói tập trung vào tốc độ với đầu ra tự nhiên, kiểm soát cảm xúc, tăng cường ngôn ngữ và các định dạng âm thanh sản xuất phổ biến.

### Đầu ra giọng nói thông qua một tuyến đường chuyên dụng

[step-tts-2](https://chinaapi.ai/vi/models/step-tts-2/)Bước TTS 2 — tổng hợp giọng nói biểu cảm với giọng nói chính thức và giọng nói sao chép, điều khiển tốc độ và âm lượng, ánh xạ phát âm và nhiều định dạng đầu ra.

### Đầu ra giọng nói thông qua một tuyến đường chuyên dụng

[step-tts-mini](https://chinaapi.ai/vi/models/step-tts-mini/)Step TTS — phần mềm tổng hợp giọng nói hiệu quả về chi phí, hỗ trợ tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Quảng Đông và tiếng Tứ Xuyên, với cả giọng nói chính thức và giọng nói được sao chép.

### Phiên âm và hiểu âm thanh

[stepaudio-2.5-asr](https://chinaapi.ai/vi/models/stepaudio-2.5-asr/): StepAudio 2.5 ASR — một mô hình phiên âm trực tuyến 4B để nhận dạng nhanh tiếng Trung-tiếng Anh, chuẩn hóa ITN, phụ đề, cuộc họp và trợ lý giọng nói.

## OpenAI-compatible không có nghĩa là chỉ có một đường dẫn âm thanh duy nhất.

Tên route và cấu trúc yêu cầu tuân theo mẫu OpenAI-compatible, nhưng client phải gửi các trường âm thanh mà từng mô hình yêu cầu. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini dùng /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr dùng /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts dùng /v1/chat/completions với payload âm thanh riêng của từng mô hình.

## Sao chép yêu cầu về mẫu xe và phương tiện vận chuyển bạn cần.

### stepaudio-2-asr-pro

Nhận dạng giọng nói ( ASR ) thông qua `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2-asr-pro" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr

Nhận dạng giọng nói ( ASR ) thông qua `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr-1.1

Nhận dạng giọng nói ( ASR ) thông qua `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr-1.1" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### mimo-v2.5-asr

Nhận dạng giọng nói ( ASR ) thông qua `/v1/chat/completions`

```
AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-asr",
    "messages": [{
      "role": "user",
      "content": [{
        "type": "input_audio",
        "input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
      }]
    }]
  }'
```

### mimo-v2.5-tts

Chuyển văn bản thành giọng nói ( TTS ) qua `/v1/chat/completions`

```
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "messages": [
      {"role": "user", "content": "Natural, clear, and friendly delivery"},
      {"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
    ],
    "audio": {"format": "wav", "voice": "冰糖"}
  }' > response.json
```

### stepaudio-2.5-tts

Chuyển văn bản thành giọng nói ( TTS ) qua `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-2.5-tts",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### glm-tts

Chuyển văn bản thành giọng nói ( TTS ) qua `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "voice": "tongtong",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### qwen3-asr-flash

Nhận dạng giọng nói ( ASR ) thông qua `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### qwen3-tts-flash

Chuyển văn bản thành giọng nói ( TTS ) qua `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "voice": "Cherry",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-hd

Chuyển văn bản thành giọng nói ( TTS ) qua `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-turbo

Chuyển văn bản thành giọng nói ( TTS ) qua `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-2

Chuyển văn bản thành giọng nói ( TTS ) qua `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-mini

Chuyển văn bản thành giọng nói ( TTS ) qua `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-mini",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### stepaudio-2.5-asr

Nhận dạng giọng nói ( ASR ) thông qua `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2.5-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

## Liệu tất cả các mô hình nhận dạng giọng nói của ChinaAPI có sử dụng cùng một điểm cuối âm thanh không?

No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini dùng /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr dùng /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts dùng /v1/chat/completions với payload âm thanh riêng của từng mô hình.

## Các mô hình giọng nói được tính phí như thế nào?

stepaudio-2-asr-pro: $0.35 mỗi giờ âm thanh; step-asr: $0.15 mỗi giờ âm thanh; step-asr-1.1: $0.35 mỗi giờ âm thanh; mimo-v2.5-asr: $0.074 mỗi giờ âm thanh; mimo-v2.5-tts: $0 mỗi 10k ký tự; stepaudio-2.5-tts: $0.85 mỗi 10k ký tự; glm-tts: $0.3077 mỗi 10k ký tự; qwen3-asr-flash: $0.1235 mỗi giờ âm thanh; qwen3-tts-flash: $0.1231 mỗi 10k ký tự; speech-2.8-hd: $0.5385 mỗi 10k ký tự; speech-2.8-turbo: $0.3077 mỗi 10k ký tự; step-tts-2: $0.4 mỗi 10k ký tự; step-tts-mini: $0.15 mỗi 10k ký tự; stepaudio-2.5-asr: $0.022 mỗi giờ âm thanh. Mức giá media hiển thị có thể bao gồm biên dịch vụ trang trải chi phí đầu vào/đầu ra của nhà cung cấp, xử lý thanh toán, rủi ro chargeback và vận hành. Nếu có, biên này đã nằm trong mức giá hiển thị và không bị cộng thêm riêng. Các giá trị này được render từ danh mục mô hình chứ không phải chép vào trang này.

## Tôi có thể sử dụng các mô hình này mà không cần tài khoản tại Trung Quốc đại lục không?

Đúng vậy. ChinaAPI cung cấp quyền truy cập mà không cần tài khoản hoặc số điện thoại tại Trung Quốc đại lục. Hãy đăng ký để nhận khóa, sau đó sử dụng chính xác tuyến đường và dữ liệu được hiển thị cho kiểu máy bạn đã chọn.

---

Markdown twin of https://chinaapi.ai/vi/speech-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
