<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: vi/text-to-speech-api/index.html -->

# Chuyển văn bản thành giọng nói API : giọng nói, điều khiển và đầu ra âm thanh

> So sánh các mô hình TTS dựa trên điểm cuối, điều khiển bằng giọng nói, đơn vị thanh toán, quy trình làm việc đầu ra và yêu cầu giọng nói có thể thực thi.

- Canonical page: https://chinaapi.ai/vi/text-to-speech-api/
- Human-readable page: https://chinaapi.ai/vi/text-to-speech-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=vi&utm_source=chinaapi&utm_medium=markdown&utm_campaign=text-to-speech-api

So sánh các mô hình TTS dựa trên điểm cuối, điều khiển bằng giọng nói, đơn vị thanh toán, quy trình làm việc đầu ra và yêu cầu giọng nói có thể thực thi.

[Hãy thử mimo-v2.5-tts](https://dash.chinaapi.ai/start?task=video-with-audio&model=mimo-v2.5-tts&lang=vi&utm_source=chinaapi&utm_medium=capability&utm_campaign=text-to-speech-api)

[Tạo yêu cầu](https://chinaapi.ai/tools/api-request-generator/)

## Đầu vào, đầu ra và vòng đời.

### Đầu vào

Văn bản, kèm theo giọng nói tích hợp hoặc các điều khiển thiết kế/sao chép giọng nói được hỗ trợ rõ ràng.

### Đầu ra

Âm thanh giọng nói ở định dạng được mô hình hỗ trợ, hoặc trường âm thanh trong phản hồi trò chuyện.

### Điểm cuối

`POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode`

### Vòng đời

Đồng bộ. Lưu phản hồi âm thanh nhị phân hoặc giải mã trường âm thanh được trả về từ chế độ trò chuyện.

## Mỗi nhiệm vụ chỉ có một định nghĩa riêng.

chuyển văn bản thành giọng nói, sao chép giọng nói, thiết kế giọng nói

**Giới hạn:** Nhận dạng giọng nói, sự đồng ý sao chép, phạm vi ngôn ngữ, phát trực tuyến, giới hạn ký tự và định dạng đầu ra là tùy thuộc vào từng mẫu máy.

## 8 mô hình với siêu dữ liệu rõ ràng.

Các tính năng chưa biết sẽ bị lược bỏ, và không bao giờ được suy đoán từ tên model. Các ví dụ về giá cả sử dụng dữ liệu công khai được đồng bộ hóa; giá Dash trực tiếp vẫn là giá trị chính xác.

### [mimo-v2.5-tts](https://chinaapi.ai/vi/models/mimo-v2.5-tts/)

MiMo-V2.5-TTS Tổng hợp giọng nói đa ngôn ngữ biểu cảm với giọng nói tích hợp sẵn, hướng dẫn theo phong cách ngôn ngữ tự nhiên, cảm xúc, tốc độ, âm điệu, phương ngữ và khả năng điều Xiaomi ký tự.

**Nhiệm vụ:** video có âm thanh, chuyển văn bản thành giọng nói

**Điểm cuối:** `POST /v1/chat/completions`

**Ví dụ về chi phí:** 1 10k ký tự × $0 = $0 .

### [stepaudio-2.5-tts](https://chinaapi.ai/vi/models/stepaudio-2.5-tts/)

2.5 tổng TTS giọng nói theo ngữ cảnh với hướng dẫn ngôn ngữ tự nhiên trực tiếp, truyền StepAudio biểu cảm, giọng nói tích hợp và đầu ra OpenAI-compatible thanh.

**Nhiệm vụ:** video có âm thanh, chuyển văn bản thành giọng nói

**Điểm cuối:** `POST /v1/audio/speech`

**Ví dụ về chi phí:** 1 10.85k ký tự × $0.85 = $0.85 .

### [glm-tts](https://chinaapi.ai/vi/models/glm-tts/)

GLM-TTS Tổng hợp giọng nói nhận biết ngữ cảnh với khả năng truyền đạt biểu cảm, đầu ra dạng luồng, âm thanh đầu tiên nhanh và các điều khiển cho giọng nói, tốc độ và âm lượng.

**Nhiệm vụ:** video có âm thanh, chuyển văn bản thành giọng nói

**Điểm cuối:** `POST /v1/audio/speech`

**Ví dụ về chi phí:** 1 10.307692k ký tự × $0.307692 = $0.307692 .

### [qwen3-tts-flash](https://chinaapi.ai/vi/models/qwen3-tts-flash/)

Qwen3-TTS-Flash Tổng hợp giọng nói đa ngôn ngữ độ trễ thấp với đầu vào hỗn hợp nhiều ngôn ngữ, giọng nói tích hợp sẵn, khớp ngôn ngữ tự động và lập hóa đơn dựa trên ký tự.

**Nhiệm vụ:** video có âm thanh, chuyển văn bản thành giọng nói

**Điểm cuối:** `POST /v1/audio/speech`

**Ví dụ về chi phí:** 1 10.123077k ký tự × $0.123077 = $0.123077 .

### [speech-2.8-hd](https://chinaapi.ai/vi/models/speech-2.8-hd/)

MiniMax Giọng nói 2.8 HD — tổng hợp giọng nói chất lượng cao với khả năng truyền đạt cảm xúc tự nhiên, cải thiện ngôn ngữ, điều khiển bằng giọng nói và các định dạng âm thanh chuyên nghiệp.

**Nhiệm vụ:** video có âm thanh, chuyển văn bản thành giọng nói

**Điểm cuối:** `POST /v1/audio/speech`

**Ví dụ về chi phí:** 1 10.538462k ký tự × $0.538462 = $0.538462 .

### [speech-2.8-turbo](https://chinaapi.ai/vi/models/speech-2.8-turbo/)

MiniMax Giọng nói 2.8 Turbo — tổng hợp giọng nói tập trung vào tốc độ với đầu ra tự nhiên, kiểm soát cảm xúc, tăng cường ngôn ngữ và các định dạng âm thanh sản xuất phổ biến.

**Nhiệm vụ:** video có âm thanh, chuyển văn bản thành giọng nói

**Điểm cuối:** `POST /v1/audio/speech`

**Ví dụ về chi phí:** 1 10.307692k ký tự × $0.307692 = $0.307692 .

### [step-tts-2](https://chinaapi.ai/vi/models/step-tts-2/)

Bước TTS 2 — tổng hợp giọng nói biểu cảm với giọng nói chính thức và giọng nói sao chép, điều khiển tốc độ và âm lượng, ánh xạ phát âm và nhiều định dạng đầu ra.

**Nhiệm vụ:** video có âm thanh, chuyển văn bản thành giọng nói

**Điểm cuối:** `POST /v1/audio/speech`

**Ví dụ về chi phí:** 1 10.4k ký tự × $0.4 = $0.4 .

### [step-tts-mini](https://chinaapi.ai/vi/models/step-tts-mini/)

Step TTS Mini — phần mềm tổng hợp giọng nói hiệu quả về chi phí, biểu cảm dành cho tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Quảng Đông và tiếng Tứ Xuyên, với cả giọng nói chính thức và giọng nói được sao chép.

**Nhiệm vụ:** video có âm thanh, chuyển văn bản thành giọng nói

**Điểm cuối:** `POST /v1/audio/speech`

**Ví dụ về chi phí:** 1 10.15k ký tự × $0.15 = $0.15 .

## Hãy chạy thử hoặc ước tính trước khi đăng ký.

[Tính toán API phí](https://chinaapi.ai/tools/api-cost-calculator/) · [Tạo tệp curl, Python hoặc JavaScript.](https://chinaapi.ai/tools/api-request-generator/) · [Cài đặt công thức tác nhân Seedance 2](https://chinaapi.ai/agent-recipes/seedance-2/)

Nguồn và phương pháp: [bộ dữ liệu định giá mô hình công khai](https://chinaapi.ai/vi/data/model-pricing/), đã cập nhật 2026-08-08 . Các hạn chế đã được nêu ở trên; các khiếu nại của bên thứ ba vẫn nằm cạnh các trang mô hình trích dẫn chúng.

---

Markdown twin of https://chinaapi.ai/vi/text-to-speech-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
