Thư mục API giọng nói tiếng Trung

API giọng nói tiếng Trung dành cho nhận dạng giọng nói tự động (ASR) và chuyển văn bản thành giọng nói.

So sánh các mô hình nhận dạng giọng nói và tổng hợp giọng nói dùng được qua một ChinaAPI key. Mỗi mô hình giữ nguyên đường dẫn yêu cầu thực của nó. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini dùng /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr dùng /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts dùng /v1/chat/completions với payload âm thanh riêng của từng mô hình.

Danh mục trực tiếp

14 mô hình giọng nói, được tạo ra từ một nguồn dữ liệu duy nhất.

Các chế độ điểm cuối, đơn vị thanh toán, khả Model IDs và giá hiển thị đều đến từ... scripts/models-data.jsonGiá âm thanh được đối chiếu với cổng ChinaAPI . Mức giá phương tiện hiển thị có thể bao gồm phí dịch vụ bao gồm phí lập hóa đơn đầu vào/đầu ra của nhà cung cấp, xử lý thanh toán, rủi ro hoàn trả và hoạt động. Bất kỳ khoản phí nào cũng được bao gồm trong mức giá hiển thị và không được cộng thêm riêng. Kiểm tra giá thực tế trước khi triển khai sản xuất.

stepaudio-2-asr-pro

Nhận dạng giọng nói (ASR) · StepFun

Điểm cuối: BÀI VIẾT /v1/audio/transcriptions

Chế độ yêu cầu: OpenAI-compatible điểm cuối phiên mã

Thanh toán: $0.35 mỗi giờ âm thanh

AudioSpeech-to-Text

step-asr

Nhận dạng giọng nói (ASR) · StepFun

Điểm cuối: BÀI VIẾT /v1/audio/transcriptions

Chế độ yêu cầu: OpenAI-compatible điểm cuối phiên mã

Thanh toán: $0.15 mỗi giờ âm thanh

AudioSpeech-to-TextChinese Dialects

step-asr-1.1

Nhận dạng giọng nói (ASR) · StepFun

Điểm cuối: BÀI VIẾT /v1/audio/transcriptions

Chế độ yêu cầu: OpenAI-compatible điểm cuối phiên mã

Thanh toán: $0.35 mỗi giờ âm thanh

AudioSpeech-to-TextChinese Dialects

mimo-v2.5-asr

Nhận dạng giọng nói (ASR) · Xiaomi

Điểm cuối: BÀI VIẾT /v1/chat/completions

Chế độ yêu cầu: Hoàn thành cuộc trò chuyện với tải trọng input_audio

Thanh toán: $0.074 mỗi giờ âm thanh

AudioSpeech-to-TextMultilingualChinese DialectsNoise Robustness

mimo-v2.5-tts

Chuyển văn bản thành giọng nói (TTS) · Xiaomi

Điểm cuối: BÀI VIẾT /v1/chat/completions

Chế độ yêu cầu: Hoàn thành cuộc trò chuyện với cấu hình tin nhắn và đầu ra âm thanh

Thanh toán: $0 mỗi 10k ký tự

Ưu đãi giá gốc miễn phí trong thời gian có hạn; kiểm tra giá trực tiếp trước khi triển khai sản phẩm.

AudioText-to-SpeechMultilingualStyle ControlBuilt-in Voices

stepaudio-2.5-tts

Chuyển văn bản thành giọng nói (TTS) · StepFun

Điểm cuối: BÀI VIẾT /v1/audio/speech

Chế độ yêu cầu: OpenAI-compatible điểm cuối lời nói

Thanh toán: $0.85 mỗi 10k ký tự

AudioText-to-SpeechContextual TTSStyle ControlBuilt-in Voices

glm-tts

Chuyển văn bản thành giọng nói ( TTS ) · Zhipu AI

Điểm cuối: BÀI VIẾT /v1/audio/speech

Chế độ yêu cầu: OpenAI-compatible điểm cuối lời nói

Thanh toán: $0.3077 mỗi 10k ký tự

AudioText-to-SpeechStreamingEmotionVoice Control

qwen3-asr-flash

Nhận dạng giọng nói (ASR) · Alibaba

Điểm cuối: BÀI VIẾT /v1/audio/transcriptions

Chế độ yêu cầu: OpenAI-compatible điểm cuối phiên mã

Thanh toán: $0.1235 mỗi giờ âm thanh

AudioSpeech-to-TextMultilingualEmotion RecognitionITN

qwen3-tts-flash

Chuyển văn bản thành giọng nói (TTS) · Alibaba

Điểm cuối: BÀI VIẾT /v1/audio/speech

Chế độ yêu cầu: OpenAI-compatible điểm cuối lời nói

Thanh toán: $0.1231 mỗi 10k ký tự

AudioText-to-SpeechMultilingualBuilt-in VoicesStreaming

speech-2.8-hd

Chuyển văn bản thành giọng nói (TTS) · MiniMax

Điểm cuối: BÀI VIẾT /v1/audio/speech

Chế độ yêu cầu: OpenAI-compatible điểm cuối lời nói

Thanh toán: $0.5385 mỗi 10k ký tự

AudioText-to-SpeechHigh FidelityEmotionMultilingual

speech-2.8-turbo

Chuyển văn bản thành giọng nói (TTS) · MiniMax

Điểm cuối: BÀI VIẾT /v1/audio/speech

Chế độ yêu cầu: OpenAI-compatible điểm cuối lời nói

Thanh toán: $0.3077 mỗi 10k ký tự

AudioText-to-SpeechLow LatencyEmotionMultilingual

step-tts-2

Chuyển văn bản thành giọng nói (TTS) · StepFun

Điểm cuối: BÀI VIẾT /v1/audio/speech

Chế độ yêu cầu: OpenAI-compatible điểm cuối lời nói

Thanh toán: $0.4 mỗi 10k ký tự

AudioText-to-SpeechVoice CloningEmotionPronunciation Control

step-tts-mini

Chuyển văn bản thành giọng nói (TTS) · StepFun

Điểm cuối: BÀI VIẾT /v1/audio/speech

Chế độ yêu cầu: OpenAI-compatible điểm cuối lời nói

Thanh toán: $0.15 mỗi 10k ký tự

AudioText-to-SpeechMultilingualVoice CloningStyle Control

stepaudio-2.5-asr

Nhận dạng giọng nói (ASR) · StepFun

Điểm cuối: BÀI VIẾT /v1/audio/transcriptions

Chế độ yêu cầu: OpenAI-compatible điểm cuối phiên mã

Thanh toán: $0.022 mỗi giờ âm thanh

AudioSpeech-to-TextStreamingChinese and EnglishITN

Chọn theo khối lượng công việc

ASR (Nhận dạng giọng nói tự động); TTS (Chuyển văn bản thành giọng nói) để xuất giọng nói.

Phiên âm và hiểu âm thanh

stepaudio-2-asr-pro: StepFun StepAudio 2 ASR Pro — nhận dạng giọng nói 32B tham số, lựa chọn ưu tiên độ chính xác trong dòng ASR của StepFun, còn stepaudio-2.5-asr là lựa chọn ưu tiên tốc độ và chi phí. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.

Phiên âm và hiểu âm thanh

step-asr: StepFun step-asr — nhận dạng giọng nói đa dụng cho tiếng Trung, tiếng Anh và các phương ngữ Trung Quốc, dùng cho phiên âm, biên bản họp, rà soát chất lượng cuộc gọi và tìm kiếm bằng giọng nói. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.

Phiên âm và hiểu âm thanh

step-asr-1.1: StepFun step-asr-1.1 — bản cập nhật của bộ nhận dạng đa dụng trong dòng step-asr, hỗ trợ tiếng Trung, tiếng Anh và các phương ngữ Trung Quốc. Nhận tệp tải lên ogg, mp3 và wav; đầu ra bản ghi không bị tính phí.

Phiên âm và hiểu âm thanh

mimo-v2.5-asr: Xiaomi MiMo-V2.5-ASR — nhận dạng giọng nói cho tiếng Trung, tiếng Anh, chuyển đổi mã ngôn ngữ, phương ngữ vùng miền, bản ghi âm nhiễu, âm thanh từ xa, nhiều người nói và lời bài hát.

Đầu ra giọng nói có thể điều khiển

mimo-v2.5-tts: Xiaomi MiMo-V2.5-TTS — tổng hợp giọng nói đa ngôn ngữ biểu cảm với giọng nói tích hợp sẵn, hướng dẫn theo phong cách ngôn ngữ tự nhiên, cảm xúc, tốc độ, âm điệu, phương ngữ và điều khiển ký tự.

Đầu ra giọng nói thông qua một tuyến đường chuyên dụng

stepaudio-2.5-tts: StepAudio 2.5 TTS — tổng hợp giọng nói theo ngữ cảnh với hướng dẫn ngôn ngữ tự nhiên trực tiếp, truyền đạt biểu cảm, giọng nói tích hợp và đầu ra OpenAI-compatible thanh.

Đầu ra giọng nói thông qua một tuyến đường chuyên dụng

glm-tts: GLM-TTS — tổng hợp giọng nói nhận biết ngữ cảnh với khả năng truyền đạt biểu cảm, đầu ra dạng luồng, âm thanh đầu tiên nhanh và các điều khiển cho giọng nói, tốc độ và âm lượng.

Phiên âm và hiểu âm thanh

qwen3-asr-flash: Qwen3-ASR-Flash — Chuyển đổi tệp đa ngôn ngữ thành văn bản với gợi ý ngôn ngữ, chuẩn hóa văn bản ngược, nhận diện cảm xúc và OpenAI-compatible đầu vào âm thanh.

Đầu ra giọng nói thông qua một tuyến đường chuyên dụng

qwen3-tts-flash: Qwen3-TTS-Flash — Tổng hợp giọng nói đa ngôn ngữ độ trễ thấp với đầu vào hỗn hợp nhiều ngôn ngữ, giọng nói tích hợp sẵn, khớp ngôn ngữ tự động và lập hóa đơn dựa trên ký tự.

Đầu ra giọng nói thông qua một tuyến đường chuyên dụng

speech-2.8-hd: MiniMax Giọng nói 2.8 HD — tổng hợp giọng nói chất lượng cao với khả năng truyền đạt cảm xúc tự nhiên, cải thiện ngôn ngữ, điều khiển bằng giọng nói và các định dạng âm thanh chuyên nghiệp.

Đầu ra giọng nói thông qua một tuyến đường chuyên dụng

speech-2.8-turbo: MiniMax Speech 2.8 Turbo — tổng hợp giọng nói tập trung vào tốc độ với đầu ra tự nhiên, kiểm soát cảm xúc, tăng cường ngôn ngữ và các định dạng âm thanh sản xuất phổ biến.

Đầu ra giọng nói thông qua một tuyến đường chuyên dụng

step-tts-2Bước TTS 2 — tổng hợp giọng nói biểu cảm với giọng nói chính thức và giọng nói sao chép, điều khiển tốc độ và âm lượng, ánh xạ phát âm và nhiều định dạng đầu ra.

Đầu ra giọng nói thông qua một tuyến đường chuyên dụng

step-tts-miniStep TTS — phần mềm tổng hợp giọng nói hiệu quả về chi phí, hỗ trợ tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Quảng Đông và tiếng Tứ Xuyên, với cả giọng nói chính thức và giọng nói được sao chép.

Phiên âm và hiểu âm thanh

stepaudio-2.5-asr: StepAudio 2.5 ASR — một mô hình phiên âm trực tuyến 4B để nhận dạng nhanh tiếng Trung-tiếng Anh, chuẩn hóa ITN, phụ đề, cuộc họp và trợ lý giọng nói.

ranh giới tương thích

OpenAI-compatible không có nghĩa là chỉ có một đường dẫn âm thanh duy nhất.

Tên route và cấu trúc yêu cầu tuân theo mẫu OpenAI-compatible, nhưng client phải gửi các trường âm thanh mà từng mô hình yêu cầu. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini dùng /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr dùng /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts dùng /v1/chat/completions với payload âm thanh riêng của từng mô hình.

Hướng dẫn nhanh

Sao chép yêu cầu về mẫu xe và phương tiện vận chuyển bạn cần.

stepaudio-2-asr-pro

Nhận dạng giọng nói ( ASR ) thông qua /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2-asr-pro" \
  -F "[email protected]" \
  -F "response_format=json"

step-asr

Nhận dạng giọng nói ( ASR ) thông qua /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr" \
  -F "[email protected]" \
  -F "response_format=json"

step-asr-1.1

Nhận dạng giọng nói ( ASR ) thông qua /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr-1.1" \
  -F "[email protected]" \
  -F "response_format=json"

mimo-v2.5-asr

Nhận dạng giọng nói ( ASR ) thông qua /v1/chat/completions

AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-asr",
    "messages": [{
      "role": "user",
      "content": [{
        "type": "input_audio",
        "input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
      }]
    }]
  }'

mimo-v2.5-tts

Chuyển văn bản thành giọng nói ( TTS ) qua /v1/chat/completions

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "messages": [
      {"role": "user", "content": "Natural, clear, and friendly delivery"},
      {"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
    ],
    "audio": {"format": "wav", "voice": "冰糖"}
  }' > response.json

stepaudio-2.5-tts

Chuyển văn bản thành giọng nói ( TTS ) qua /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-2.5-tts",
    "voice": "cixingnansheng",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

glm-tts

Chuyển văn bản thành giọng nói ( TTS ) qua /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "voice": "tongtong",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

qwen3-asr-flash

Nhận dạng giọng nói ( ASR ) thông qua /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "[email protected]" \
  -F "response_format=json"

qwen3-tts-flash

Chuyển văn bản thành giọng nói ( TTS ) qua /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "voice": "Cherry",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

speech-2.8-hd

Chuyển văn bản thành giọng nói ( TTS ) qua /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

speech-2.8-turbo

Chuyển văn bản thành giọng nói ( TTS ) qua /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

step-tts-2

Chuyển văn bản thành giọng nói ( TTS ) qua /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "voice": "cixingnansheng",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

step-tts-mini

Chuyển văn bản thành giọng nói ( TTS ) qua /v1/audio/speech

curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-mini",
    "voice": "cixingnansheng",
    "input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3

stepaudio-2.5-asr

Nhận dạng giọng nói ( ASR ) thông qua /v1/audio/transcriptions

curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2.5-asr" \
  -F "[email protected]" \
  -F "response_format=json"

Liệu tất cả các mô hình nhận dạng giọng nói của ChinaAPI có sử dụng cùng một điểm cuối âm thanh không?

No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini dùng /v1/audio/speech. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr dùng /v1/audio/transcriptions. mimo-v2.5-asr, mimo-v2.5-tts dùng /v1/chat/completions với payload âm thanh riêng của từng mô hình.

Các mô hình giọng nói được tính phí như thế nào?

stepaudio-2-asr-pro: $0.35 mỗi giờ âm thanh; step-asr: $0.15 mỗi giờ âm thanh; step-asr-1.1: $0.35 mỗi giờ âm thanh; mimo-v2.5-asr: $0.074 mỗi giờ âm thanh; mimo-v2.5-tts: $0 mỗi 10k ký tự; stepaudio-2.5-tts: $0.85 mỗi 10k ký tự; glm-tts: $0.3077 mỗi 10k ký tự; qwen3-asr-flash: $0.1235 mỗi giờ âm thanh; qwen3-tts-flash: $0.1231 mỗi 10k ký tự; speech-2.8-hd: $0.5385 mỗi 10k ký tự; speech-2.8-turbo: $0.3077 mỗi 10k ký tự; step-tts-2: $0.4 mỗi 10k ký tự; step-tts-mini: $0.15 mỗi 10k ký tự; stepaudio-2.5-asr: $0.022 mỗi giờ âm thanh. Mức giá media hiển thị có thể bao gồm biên dịch vụ trang trải chi phí đầu vào/đầu ra của nhà cung cấp, xử lý thanh toán, rủi ro chargeback và vận hành. Nếu có, biên này đã nằm trong mức giá hiển thị và không bị cộng thêm riêng. Các giá trị này được render từ danh mục mô hình chứ không phải chép vào trang này.

Tôi có thể sử dụng các mô hình này mà không cần tài khoản tại Trung Quốc đại lục không?

Đúng vậy. ChinaAPI cung cấp quyền truy cập mà không cần tài khoản hoặc số điện thoại tại Trung Quốc đại lục. Hãy đăng ký để nhận khóa, sau đó sử dụng chính xác tuyến đường và dữ liệu được hiển thị cho kiểu máy bạn đã chọn.