stepaudio-2-asr-pro
Nhận dạng giọng nói (ASR) · StepFun
Điểm cuối: BÀI VIẾT /v1/audio/transcriptions
Chế độ yêu cầu: OpenAI-compatible điểm cuối phiên mã
Thanh toán: $0.35 mỗi giờ âm thanh
Thư mục API giọng nói tiếng Trung
So sánh các mô hình nhận dạng giọng nói và tổng hợp giọng nói dùng được qua một ChinaAPI key. Mỗi mô hình giữ nguyên đường dẫn yêu cầu thực của nó. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini dùng /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr dùng /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts dùng /v1/chat/completions với payload âm thanh riêng của từng mô hình.
Danh mục trực tiếp
Các chế độ điểm cuối, đơn vị thanh toán, khả Model IDs và giá hiển thị đều đến từ... scripts/models-data.jsonGiá âm thanh được đối chiếu với cổng ChinaAPI . Mức giá phương tiện hiển thị có thể bao gồm phí dịch vụ bao gồm phí lập hóa đơn đầu vào/đầu ra của nhà cung cấp, xử lý thanh toán, rủi ro hoàn trả và hoạt động. Bất kỳ khoản phí nào cũng được bao gồm trong mức giá hiển thị và không được cộng thêm riêng. Kiểm tra giá thực tế trước khi triển khai sản xuất.
Nhận dạng giọng nói (ASR) · StepFun
Điểm cuối: BÀI VIẾT /v1/audio/transcriptions
Chế độ yêu cầu: OpenAI-compatible điểm cuối phiên mã
Thanh toán: $0.35 mỗi giờ âm thanh
Nhận dạng giọng nói (ASR) · StepFun
Điểm cuối: BÀI VIẾT /v1/audio/transcriptions
Chế độ yêu cầu: OpenAI-compatible điểm cuối phiên mã
Thanh toán: $0.15 mỗi giờ âm thanh
Nhận dạng giọng nói (ASR) · StepFun
Điểm cuối: BÀI VIẾT /v1/audio/transcriptions
Chế độ yêu cầu: OpenAI-compatible điểm cuối phiên mã
Thanh toán: $0.35 mỗi giờ âm thanh
Nhận dạng giọng nói (ASR) · Xiaomi
Điểm cuối: BÀI VIẾT /v1/chat/completions
Chế độ yêu cầu: Hoàn thành cuộc trò chuyện với tải trọng input_audio
Thanh toán: $0.074 mỗi giờ âm thanh
Chuyển văn bản thành giọng nói (TTS) · Xiaomi
Điểm cuối: BÀI VIẾT /v1/chat/completions
Chế độ yêu cầu: Hoàn thành cuộc trò chuyện với cấu hình tin nhắn và đầu ra âm thanh
Thanh toán: $0 mỗi 10k ký tự
Ưu đãi giá gốc miễn phí trong thời gian có hạn; kiểm tra giá trực tiếp trước khi triển khai sản phẩm.
Chuyển văn bản thành giọng nói (TTS) · StepFun
Điểm cuối: BÀI VIẾT /v1/audio/speech
Chế độ yêu cầu: OpenAI-compatible điểm cuối lời nói
Thanh toán: $0.85 mỗi 10k ký tự
Chuyển văn bản thành giọng nói ( TTS ) · Zhipu AI
Điểm cuối: BÀI VIẾT /v1/audio/speech
Chế độ yêu cầu: OpenAI-compatible điểm cuối lời nói
Thanh toán: $0.3077 mỗi 10k ký tự
Nhận dạng giọng nói (ASR) · Alibaba
Điểm cuối: BÀI VIẾT /v1/audio/transcriptions
Chế độ yêu cầu: OpenAI-compatible điểm cuối phiên mã
Thanh toán: $0.1235 mỗi giờ âm thanh
Chuyển văn bản thành giọng nói (TTS) · Alibaba
Điểm cuối: BÀI VIẾT /v1/audio/speech
Chế độ yêu cầu: OpenAI-compatible điểm cuối lời nói
Thanh toán: $0.1231 mỗi 10k ký tự
Chuyển văn bản thành giọng nói (TTS) · MiniMax
Điểm cuối: BÀI VIẾT /v1/audio/speech
Chế độ yêu cầu: OpenAI-compatible điểm cuối lời nói
Thanh toán: $0.5385 mỗi 10k ký tự
Chuyển văn bản thành giọng nói (TTS) · MiniMax
Điểm cuối: BÀI VIẾT /v1/audio/speech
Chế độ yêu cầu: OpenAI-compatible điểm cuối lời nói
Thanh toán: $0.3077 mỗi 10k ký tự
Chuyển văn bản thành giọng nói (TTS) · StepFun
Điểm cuối: BÀI VIẾT /v1/audio/speech
Chế độ yêu cầu: OpenAI-compatible điểm cuối lời nói
Thanh toán: $0.4 mỗi 10k ký tự
Chuyển văn bản thành giọng nói (TTS) · StepFun
Điểm cuối: BÀI VIẾT /v1/audio/speech
Chế độ yêu cầu: OpenAI-compatible điểm cuối lời nói
Thanh toán: $0.15 mỗi 10k ký tự
Nhận dạng giọng nói (ASR) · StepFun
Điểm cuối: BÀI VIẾT /v1/audio/transcriptions
Chế độ yêu cầu: OpenAI-compatible điểm cuối phiên mã
Thanh toán: $0.022 mỗi giờ âm thanh
Chọn theo khối lượng công việc
stepaudio-2-asr-pro: StepFun StepAudio 2 ASR Pro — nhận dạng giọng nói 32B tham số, lựa chọn ưu tiên độ chính xác trong dòng ASR của StepFun, còn stepaudio-2.5-asr là lựa chọn ưu tiên tốc độ và chi phí. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.
step-asr: StepFun step-asr — nhận dạng giọng nói đa dụng cho tiếng Trung, tiếng Anh và các phương ngữ Trung Quốc, dùng cho phiên âm, biên bản họp, rà soát chất lượng cuộc gọi và tìm kiếm bằng giọng nói. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.
step-asr-1.1: StepFun step-asr-1.1 — bản cập nhật của bộ nhận dạng đa dụng trong dòng step-asr, hỗ trợ tiếng Trung, tiếng Anh và các phương ngữ Trung Quốc. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.
mimo-v2.5-asr: Xiaomi MiMo-V2.5-ASR — nhận dạng giọng nói cho tiếng Trung, tiếng Anh, chuyển đổi mã ngôn ngữ, phương ngữ vùng miền, bản ghi âm nhiễu, âm thanh từ xa, nhiều người nói và lời bài hát.
mimo-v2.5-tts: Xiaomi MiMo-V2.5-TTS — tổng hợp giọng nói đa ngôn ngữ biểu cảm với giọng nói tích hợp sẵn, hướng dẫn theo phong cách ngôn ngữ tự nhiên, cảm xúc, tốc độ, âm điệu, phương ngữ và điều khiển ký tự.
stepaudio-2.5-tts: StepAudio 2.5 TTS — tổng hợp giọng nói theo ngữ cảnh với hướng dẫn ngôn ngữ tự nhiên trực tiếp, truyền đạt biểu cảm, giọng nói tích hợp và đầu ra OpenAI-compatible thanh.
glm-tts: GLM-TTS — tổng hợp giọng nói nhận biết ngữ cảnh với khả năng truyền đạt biểu cảm, đầu ra dạng luồng, âm thanh đầu tiên nhanh và các điều khiển cho giọng nói, tốc độ và âm lượng.
qwen3-asr-flash: Qwen3-ASR-Flash — Chuyển đổi tệp đa ngôn ngữ thành văn bản với gợi ý ngôn ngữ, chuẩn hóa văn bản ngược, nhận diện cảm xúc và OpenAI-compatible đầu vào âm thanh.
qwen3-tts-flash: Qwen3-TTS-Flash — Tổng hợp giọng nói đa ngôn ngữ độ trễ thấp với đầu vào hỗn hợp nhiều ngôn ngữ, giọng nói tích hợp sẵn, khớp ngôn ngữ tự động và lập hóa đơn dựa trên ký tự.
speech-2.8-hd: MiniMax Giọng nói 2.8 HD — tổng hợp giọng nói chất lượng cao với khả năng truyền đạt cảm xúc tự nhiên, cải thiện ngôn ngữ, điều khiển bằng giọng nói và các định dạng âm thanh chuyên nghiệp.
speech-2.8-turbo: MiniMax Speech 2.8 Turbo — tổng hợp giọng nói tập trung vào tốc độ với đầu ra tự nhiên, kiểm soát cảm xúc, tăng cường ngôn ngữ và các định dạng âm thanh sản xuất phổ biến.
step-tts-2Bước TTS 2 — tổng hợp giọng nói biểu cảm với giọng nói chính thức và giọng nói sao chép, điều khiển tốc độ và âm lượng, ánh xạ phát âm và nhiều định dạng đầu ra.
step-tts-miniStep TTS — phần mềm tổng hợp giọng nói hiệu quả về chi phí, hỗ trợ tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Quảng Đông và tiếng Tứ Xuyên, với cả giọng nói chính thức và giọng nói được sao chép.
stepaudio-2.5-asr: StepAudio 2.5 ASR — một mô hình phiên âm trực tuyến 4B để nhận dạng nhanh tiếng Trung-tiếng Anh, chuẩn hóa ITN, phụ đề, cuộc họp và trợ lý giọng nói.
ranh giới tương thích
Tên route và cấu trúc yêu cầu tuân theo mẫu OpenAI-compatible, nhưng client phải gửi các trường âm thanh mà từng mô hình yêu cầu. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini dùng /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr dùng /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts dùng /v1/chat/completions với payload âm thanh riêng của từng mô hình.
Hướng dẫn nhanh
Nhận dạng giọng nói ( ASR ) thông qua /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=stepaudio-2-asr-pro" \
-F "[email protected]" \
-F "response_format=json"
Nhận dạng giọng nói ( ASR ) thông qua /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=step-asr" \
-F "[email protected]" \
-F "response_format=json"
Nhận dạng giọng nói ( ASR ) thông qua /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=step-asr-1.1" \
-F "[email protected]" \
-F "response_format=json"
Nhận dạng giọng nói ( ASR ) thông qua /v1/chat/completions
AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.5-asr",
"messages": [{
"role": "user",
"content": [{
"type": "input_audio",
"input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
}]
}]
}'
Chuyển văn bản thành giọng nói ( TTS ) qua /v1/chat/completions
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.5-tts",
"messages": [
{"role": "user", "content": "Natural, clear, and friendly delivery"},
{"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
],
"audio": {"format": "wav", "voice": "冰糖"}
}' > response.json
Chuyển văn bản thành giọng nói ( TTS ) qua /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2.5-tts",
"voice": "cixingnansheng",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Chuyển văn bản thành giọng nói ( TTS ) qua /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-tts",
"voice": "tongtong",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Nhận dạng giọng nói ( ASR ) thông qua /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=qwen3-asr-flash" \
-F "[email protected]" \
-F "response_format=json"
Chuyển văn bản thành giọng nói ( TTS ) qua /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-tts-flash",
"voice": "Cherry",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Chuyển văn bản thành giọng nói ( TTS ) qua /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "speech-2.8-hd",
"voice": "Chinese (Mandarin)_Warm_Bestie",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Chuyển văn bản thành giọng nói ( TTS ) qua /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "speech-2.8-turbo",
"voice": "Chinese (Mandarin)_Warm_Bestie",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Chuyển văn bản thành giọng nói ( TTS ) qua /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-2",
"voice": "cixingnansheng",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Chuyển văn bản thành giọng nói ( TTS ) qua /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-mini",
"voice": "cixingnansheng",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
Nhận dạng giọng nói ( ASR ) thông qua /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=stepaudio-2.5-asr" \
-F "[email protected]" \
-F "response_format=json"
No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini dùng /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr dùng /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts dùng /v1/chat/completions với payload âm thanh riêng của từng mô hình.
stepaudio-2-asr-pro: $0.35 mỗi giờ âm thanh; step-asr: $0.15 mỗi giờ âm thanh; step-asr-1.1: $0.35 mỗi giờ âm thanh; mimo-v2.5-asr: $0.074 mỗi giờ âm thanh; mimo-v2.5-tts: $0 mỗi 10k ký tự; stepaudio-2.5-tts: $0.85 mỗi 10k ký tự; glm-tts: $0.3077 mỗi 10k ký tự; qwen3-asr-flash: $0.1235 mỗi giờ âm thanh; qwen3-tts-flash: $0.1231 mỗi 10k ký tự; speech-2.8-hd: $0.5385 mỗi 10k ký tự; speech-2.8-turbo: $0.3077 mỗi 10k ký tự; step-tts-2: $0.4 mỗi 10k ký tự; step-tts-mini: $0.15 mỗi 10k ký tự; stepaudio-2.5-asr: $0.022 mỗi giờ âm thanh. Mức giá media hiển thị có thể bao gồm biên dịch vụ trang trải chi phí đầu vào/đầu ra của nhà cung cấp, xử lý thanh toán, rủi ro chargeback và vận hành. Nếu có, biên này đã nằm trong mức giá hiển thị và không bị cộng thêm riêng. Các giá trị này được render từ danh mục mô hình chứ không phải chép vào trang này.
Đúng vậy. ChinaAPI cung cấp quyền truy cập mà không cần tài khoản hoặc số điện thoại tại Trung Quốc đại lục. Hãy đăng ký để nhận khóa, sau đó sử dụng chính xác tuyến đường và dữ liệu được hiển thị cho kiểu máy bạn đã chọn.