<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: vi/speech-to-text-api/index.html -->

# Chuyển đổi giọng nói thành văn bản và phiên âm API

> So sánh các mô hình phiên âm và mô hình ASR dựa trên chế độ điểm cuối chính xác, giá mỗi giờ âm thanh, đầu vào, đầu ra bản ghi và các hạn chế.

- Canonical page: https://chinaapi.ai/vi/speech-to-text-api/
- Human-readable page: https://chinaapi.ai/vi/speech-to-text-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=vi&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-to-text-api

So sánh các mô hình phiên âm và mô hình ASR dựa trên chế độ điểm cuối chính xác, giá mỗi giờ âm thanh, đầu vào, đầu ra bản ghi và các hạn chế.

[Hãy thử stepaudio-2-asr-pro](https://dash.chinaapi.ai/start?task=video-with-audio&model=stepaudio-2-asr-pro&lang=vi&utm_source=chinaapi&utm_medium=capability&utm_campaign=speech-to-text-api)

[Tạo yêu cầu](https://chinaapi.ai/tools/api-request-generator/)

## Đầu vào, đầu ra và vòng đời.

### Đầu vào

Một tệp âm thanh hoặc dữ liệu gốc; 64 input_audio tải trọng, tùy thuộc vào mô hình api_mode .

### Đầu ra

Văn bản phiên âm hoặc phản hồi phiên âm có cấu trúc.

### Điểm cuối

`POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode`

### Vòng đời

Chế độ đồng bộ cho các điểm cuối công khai được liệt kê. Lưu trữ bản ghi và xử lý rõ ràng các định dạng tệp bị từ chối.

## Mỗi nhiệm vụ chỉ có một định nghĩa riêng.

phiên mã

**Giới hạn:** Kích thước tệp, thời lượng, nhật ký ghi âm, dấu thời gian, phạm vi phương ngữ và các định dạng được chấp nhận đều không được biết trừ khi được liệt kê rõ ràng cho mô hình.

## 6 mô hình với siêu dữ liệu rõ ràng.

Các tính năng chưa biết sẽ bị lược bỏ, và không bao giờ được suy đoán từ tên model. Các ví dụ về giá cả sử dụng dữ liệu công khai được đồng bộ hóa; giá Dash trực tiếp vẫn là giá trị chính xác.

### [stepaudio-2-asr-pro](https://chinaapi.ai/vi/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro — nhận dạng giọng nói 32B tham số, lựa chọn ưu tiên độ chính xác trong dòng ASR của StepFun, còn stepaudio-2.5-asr là lựa chọn ưu tiên tốc độ và chi phí. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.

**Nhiệm vụ:** video kèm âm thanh, bản ghi

**Điểm cuối:** `POST /v1/audio/transcriptions`

**Ví dụ về chi phí:** 1 giờ âm thanh × $0.35 = $0.35 .

### [step-asr](https://chinaapi.ai/vi/models/step-asr/)

StepFun step-asr — nhận dạng giọng nói đa dụng cho tiếng Trung, tiếng Anh và các phương ngữ Trung Quốc, dùng cho phiên âm, biên bản họp, rà soát chất lượng cuộc gọi và tìm kiếm bằng giọng nói. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.

**Nhiệm vụ:** video kèm âm thanh, bản ghi

**Điểm cuối:** `POST /v1/audio/transcriptions`

**Ví dụ về chi phí:** 1 giờ âm thanh × $0.15 = $0.15 .

### [step-asr-1.1](https://chinaapi.ai/vi/models/step-asr-1.1/)

StepFun step-asr-1.1 — bản cập nhật của bộ nhận dạng đa dụng trong dòng step-asr, hỗ trợ tiếng Trung, tiếng Anh và các phương ngữ Trung Quốc. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.

**Nhiệm vụ:** video kèm âm thanh, bản ghi

**Điểm cuối:** `POST /v1/audio/transcriptions`

**Ví dụ về chi phí:** 1 giờ âm thanh × $0.35 = $0.35 .

### [mimo-v2.5-asr](https://chinaapi.ai/vi/models/mimo-v2.5-asr/)

MiMo-V2.5-ASR Nhận dạng giọng nói cho tiếng Trung, tiếng Anh, chuyển đổi mã ngôn ngữ, phương ngữ vùng miền, bản ghi Xiaomi nhiễu, âm thanh từ xa, nhiều người nói và lời bài hát.

**Nhiệm vụ:** video kèm âm thanh, bản ghi

**Điểm cuối:** `POST /v1/chat/completions`

**Ví dụ về chi phí:** 1 giờ âm thanh × $0.074 = $0.074 .

### [qwen3-asr-flash](https://chinaapi.ai/vi/models/qwen3-asr-flash/)

Qwen3-ASR-Flash — Chuyển đổi tệp đa ngôn ngữ thành văn bản với gợi ý ngôn ngữ, chuẩn hóa văn bản ngược, nhận diện cảm xúc và OpenAI-compatible đầu vào âm thanh.

**Nhiệm vụ:** video kèm âm thanh, bản ghi

**Điểm cuối:** `POST /v1/audio/transcriptions`

**Ví dụ về chi phí:** 1 giờ âm thanh × $0.123539 = $0.123539 .

### [stepaudio-2.5-asr](https://chinaapi.ai/vi/models/stepaudio-2.5-asr/)

2.5 một mô hình phiên ASR trực tuyến 4B để nhận StepAudio nhanh tiếng Trung-tiếng Anh, chuẩn hóa ITN, phụ đề, cuộc họp và trợ lý giọng nói.

**Nhiệm vụ:** video kèm âm thanh, bản ghi

**Điểm cuối:** `POST /v1/audio/transcriptions`

**Ví dụ về chi phí:** 1 giờ âm thanh × $0.022 = $0.022 .

## Hãy chạy thử hoặc ước tính trước khi đăng ký.

[Tính toán API phí](https://chinaapi.ai/tools/api-cost-calculator/) · [Tạo tệp curl, Python hoặc JavaScript.](https://chinaapi.ai/tools/api-request-generator/) · [Cài đặt công thức tác nhân Seedance 2](https://chinaapi.ai/agent-recipes/seedance-2/)

Nguồn và phương pháp: [bộ dữ liệu định giá mô hình công khai](https://chinaapi.ai/vi/data/model-pricing/), đã cập nhật 2026-08-08 . Các hạn chế đã được nêu ở trên; các khiếu nại của bên thứ ba vẫn nằm cạnh các trang mô hình trích dẫn chúng.

---

Markdown twin of https://chinaapi.ai/vi/speech-to-text-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
