stepaudio-2-asr-pro
การรู้จำเสียงพูด (ASR) · StepFun
จุดสิ้นสุด: โพสต์ /v1/audio/transcriptions
โหมดการร้องขอ: จุด OpenAI-compatible การถอดรหัส
การเรียกเก็บเงิน: $0.35 ต่อชั่วโมงเสียง
ไดเร็กทอรี API การพูดภาษาจีน
เปรียบเทียบโมเดลรู้จำเสียงพูดและสังเคราะห์เสียงพูดที่ใช้ได้ผ่าน ChinaAPI key เดียว แต่ละโมเดลใช้เส้นทางคำขอจริงของตัวเอง stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini ใช้ /v1/audio/speech ส่วน stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr ใช้ /v1/audio/transcriptions และ mimo-v2.5-asr, mimo-v2.5-tts ใช้ /v1/chat/completions พร้อมเพย์โหลดเสียงเฉพาะของแต่ละโมเดล
แคตตาล็อกสด
โหมดปลายทาง หน่วยการเรียกเก็บเงิน ความ Model IDs และราคาที่แสดง มาจาก scripts/models-data.jsonซึ่งราคาเสียงจะได้รับการกระทบยอดกับเกตเวย์ ChinaAPI อัตราค่าบริการสื่อที่แสดงอาจรวมส่วนต่างค่าบริการที่ครอบคลุมค่าใช้จ่ายในการรับ/ส่งข้อมูลของผู้ให้บริการ การประมวลผลการชำระเงิน ความเสี่ยงจากการเรียกเก็บเงินคืน และการดำเนินงาน ส่วนต่างใดๆ จะรวมอยู่ในอัตราที่แสดงและจะไม่ถูกเพิ่มแยกต่างหาก ตรวจสอบราคาจริงก่อนการเปิดตัวใช้งานจริง
การรู้จำเสียงพูด (ASR) · StepFun
จุดสิ้นสุด: โพสต์ /v1/audio/transcriptions
โหมดการร้องขอ: จุด OpenAI-compatible การถอดรหัส
การเรียกเก็บเงิน: $0.35 ต่อชั่วโมงเสียง
การรู้จำเสียงพูด (ASR) · StepFun
จุดสิ้นสุด: โพสต์ /v1/audio/transcriptions
โหมดการร้องขอ: จุด OpenAI-compatible การถอดรหัส
การเรียกเก็บเงิน: $0.15 ต่อชั่วโมงเสียง
การรู้จำเสียงพูด (ASR) · StepFun
จุดสิ้นสุด: โพสต์ /v1/audio/transcriptions
โหมดการร้องขอ: จุด OpenAI-compatible การถอดรหัส
การเรียกเก็บเงิน: $0.35 ต่อชั่วโมงเสียง
ระบบรู้จำเสียงพูด (ASR) · Xiaomi
จุดสิ้นสุด: โพสต์ /v1/chat/completions
โหมดการร้องขอ: แชทเสร็จสมบูรณ์พร้อมเพย์โหลด input_audio
การเรียกเก็บเงิน: $0.074 ต่อชั่วโมงเสียง
การแปลงข้อความเป็นเสียงพูด (TTS) · Xiaomi
จุดสิ้นสุด: โพสต์ /v1/chat/completions
โหมดการร้องขอ: การแสดงผลการสนทนาเมื่อจบการสนทนา พร้อมการตั้งค่าเอาต์พุตเสียง
การเรียกเก็บเงิน: $0 10k ตัวอักษร
ราคาอัปโหลดฟรีในช่วงเวลาจำกัด โปรดตรวจสอบราคาจริงก่อนเปิดใช้งานจริง
การแปลงข้อความเป็นเสียงพูด (TTS) · StepFun
จุดสิ้นสุด: โพสต์ /v1/audio/speech
โหมดการร้องขอ: จุด OpenAI-compatible การพูด
การเรียกเก็บเงิน: $0.85 10k ตัวอักษร
การแปลงข้อความเป็นเสียงพูด (TTS) · Zhipu AI
จุดสิ้นสุด: โพสต์ /v1/audio/speech
โหมดการร้องขอ: จุด OpenAI-compatible การพูด
การเรียกเก็บเงิน: $0.3077 10k ตัวอักษร
การรู้จำเสียงพูด ( ASR ) · Alibaba
จุดสิ้นสุด: โพสต์ /v1/audio/transcriptions
โหมดการร้องขอ: จุด OpenAI-compatible การถอดรหัส
การเรียกเก็บเงิน: $0.1235 ต่อชั่วโมงเสียง
แปลงข้อความเป็นเสียงพูด ( TTS ) · Alibaba
จุดสิ้นสุด: โพสต์ /v1/audio/speech
โหมดการร้องขอ: จุด OpenAI-compatible การพูด
การเรียกเก็บเงิน: $0.1231 10k ตัวอักษร
การแปลงข้อความเป็นเสียงพูด (TTS) · MiniMax
จุดสิ้นสุด: โพสต์ /v1/audio/speech
โหมดการร้องขอ: จุด OpenAI-compatible การพูด
การเรียกเก็บเงิน: $0.5385 10k ตัวอักษร
การแปลงข้อความเป็นเสียงพูด (TTS) · MiniMax
จุดสิ้นสุด: โพสต์ /v1/audio/speech
โหมดการร้องขอ: จุด OpenAI-compatible การพูด
การเรียกเก็บเงิน: $0.3077 10k ตัวอักษร
การแปลงข้อความเป็นเสียงพูด (TTS) · StepFun
จุดสิ้นสุด: โพสต์ /v1/audio/speech
โหมดการร้องขอ: จุด OpenAI-compatible การพูด
การเรียกเก็บเงิน: $0.4 10k ตัวอักษร
การแปลงข้อความเป็นเสียงพูด (TTS) · StepFun
จุดสิ้นสุด: โพสต์ /v1/audio/speech
โหมดการร้องขอ: จุด OpenAI-compatible การพูด
การเรียกเก็บเงิน: $0.15 10k ตัวอักษร
การรู้จำเสียงพูด (ASR) · StepFun
จุดสิ้นสุด: โพสต์ /v1/audio/transcriptions
โหมดการร้องขอ: จุด OpenAI-compatible การถอดรหัส
การเรียกเก็บเงิน: $0.022 ต่อชั่วโมงเสียง
เลือกตามปริมาณงาน
stepaudio-2-asr-pro: StepFun StepAudio 2 ASR Pro — การรู้จำเสียงพูดขนาด 32B พารามิเตอร์ เป็นตัวเลือกที่เน้นความแม่นยำในสาย ASR ของ StepFun ขณะที่ stepaudio-2.5-asr เป็นตัวเลือกที่เน้นความเร็วและต้นทุน รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง
step-asr: StepFun step-asr — การรู้จำเสียงพูดอเนกประสงค์ ครอบคลุมภาษาจีน ภาษาอังกฤษ และภาษาถิ่นจีน สำหรับการถอดเสียง บันทึกการประชุม การตรวจสอบคุณภาพสายสนทนา และการค้นหาด้วยเสียง รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง
step-asr-1.1: StepFun step-asr-1.1 — โมเดลรู้จำเสียงอเนกประสงค์รุ่นปรับปรุงในสาย step-asr ครอบคลุมภาษาจีน ภาษาอังกฤษ และภาษาถิ่นจีน รับไฟล์ ogg, mp3 และ wav โดยไม่คิดค่าบริการสำหรับผลลัพธ์การถอดเสียง
mimo-v2.5-asr: Xiaomi MiMo-V2.5-ASR — การรู้จำเสียงพูดสำหรับภาษาจีน อังกฤษ การสลับภาษา สำเนียงท้องถิ่น การบันทึกที่มีเสียงรบกวน เสียงจากระยะไกล ผู้พูดหลายคน และเนื้อเพลง
mimo-v2.5-tts: Xiaomi MiMo-V2.5-TTS — การสังเคราะห์เสียงหลายภาษาที่แสดงอารมณ์ได้อย่างดีเยี่ยม พร้อมเสียงพูดในตัว คำแนะนำในรูปแบบภาษาธรรมชาติ อารมณ์ จังหวะ น้ำเสียง สำเนียง และการควบคุมตัวอักษร
stepaudio-2.5-tts: StepAudio 2.5 TTS — การสังเคราะห์เสียงพูดตามบริบทพร้อมการกำกับภาษาธรรมชาติแบบอินไลน์ การแสดงออกทางอารมณ์ เสียงพูดในตัว และเอาต์พุต OpenAI-compatible
glm-tts: GLM-TTS — การสังเคราะห์เสียงพูดที่คำนึงถึงบริบท พร้อมการถ่ายทอดอารมณ์ การส่งออกเสียงแบบสตรีมมิ่ง เสียงเริ่มต้นที่รวดเร็ว และการควบคุมเสียง ความเร็ว และระดับเสียง
qwen3-asr-flash: Qwen3-ASR-Flash — การถอดเสียงไฟล์หลายภาษาพร้อมคำแนะนำภาษา การปรับข้อความให้เป็นมาตรฐานแบบผกผัน การจดจำอารมณ์ และ OpenAI-compatible การป้อนข้อมูลเสียง
qwen3-tts-flash: Qwen3-TTS-Flash — การสังเคราะห์เสียงหลายภาษาที่มีความหน่วงต่ำ พร้อมการป้อนข้อมูลแบบผสมภาษา เสียงในตัว การจับคู่ภาษาอัตโนมัติ และการคิดค่าบริการตามจำนวนตัวอักษร
speech-2.8-hd: MiniMax เสียงพูด 2.8 HD — การสังเคราะห์เสียงพูดคุณภาพสูง พร้อมการถ่ายทอดอารมณ์ที่เป็นธรรมชาติ การปรับปรุงคุณภาพภาษา การควบคุมด้วยเสียง และรูปแบบเสียงสำหรับการผลิต
speech-2.8-turbo: MiniMax Speech 2.8 Turbo — การสังเคราะห์เสียงพูดที่เน้นความเร็ว ให้เสียงที่เป็นธรรมชาติ ควบคุมอารมณ์ ปรับปรุงคุณภาพภาษา และรองรับรูปแบบเสียงที่ใช้กันทั่วไปในการผลิต
step-tts-2: ขั้นตอนที่ TTS 2 — การสังเคราะห์เสียงพูดที่แสดงอารมณ์ด้วยเสียงทางการและเสียงเลียนแบบ การควบคุมความเร็วและระดับเสียง การแมปการออกเสียง และรูปแบบเอาต์พุตหลายรูปแบบ
step-tts-mini: Step TTS Mini — ระบบสังเคราะห์เสียงพูดที่มีประสิทธิภาพและคุ้มค่าสำหรับภาษาจีน อังกฤษ ญี่ปุ่น กวางตุ้ง และเสฉวน พร้อมเสียงทางการและเสียงเลียนแบบ
stepaudio-2.5-asr: StepAudio 2.5 ASR — โมเดลการถอดเสียงสตรีม 4B MTP สำหรับการจดจำภาษาจีน-อังกฤษอย่างรวดเร็ว การปรับมาตรฐาน ITN คำบรรยาย การประชุม และตัวแทนเสียง
ขอบเขตความเข้ากันได้
ชื่อเส้นทางและรูปแบบคำขอเป็นไปตามแพทเทิร์น OpenAI-compatible แต่ไคลเอนต์ต้องส่งฟิลด์เสียงที่แต่ละโมเดลกำหนด stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini ใช้ /v1/audio/speech ส่วน stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr ใช้ /v1/audio/transcriptions และ mimo-v2.5-asr, mimo-v2.5-tts ใช้ /v1/chat/completions พร้อมเพย์โหลดเสียงเฉพาะของแต่ละโมเดล
คู่มือเริ่มต้นใช้งานฉบับย่อ
การรู้จำเสียงพูด ( ASR ) ผ่านทาง /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=stepaudio-2-asr-pro" \
-F "[email protected]" \
-F "response_format=json"
การรู้จำเสียงพูด ( ASR ) ผ่านทาง /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=step-asr" \
-F "[email protected]" \
-F "response_format=json"
การรู้จำเสียงพูด ( ASR ) ผ่านทาง /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=step-asr-1.1" \
-F "[email protected]" \
-F "response_format=json"
การรู้จำเสียงพูด ( ASR ) ผ่านทาง /v1/chat/completions
AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.5-asr",
"messages": [{
"role": "user",
"content": [{
"type": "input_audio",
"input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
}]
}]
}'
แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน /v1/chat/completions
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.5-tts",
"messages": [
{"role": "user", "content": "Natural, clear, and friendly delivery"},
{"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
],
"audio": {"format": "wav", "voice": "冰糖"}
}' > response.json
แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2.5-tts",
"voice": "cixingnansheng",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-tts",
"voice": "tongtong",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
การรู้จำเสียงพูด ( ASR ) ผ่านทาง /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=qwen3-asr-flash" \
-F "[email protected]" \
-F "response_format=json"
แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-tts-flash",
"voice": "Cherry",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "speech-2.8-hd",
"voice": "Chinese (Mandarin)_Warm_Bestie",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "speech-2.8-turbo",
"voice": "Chinese (Mandarin)_Warm_Bestie",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-2",
"voice": "cixingnansheng",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
แปลงข้อความเป็นเสียงพูด ( TTS ) ผ่าน /v1/audio/speech
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-mini",
"voice": "cixingnansheng",
"input": "(轻声)Welcome to ChinaAPI. 今天我们来测试自然语音。",
"response_format": "mp3"
}' \
--output speech.mp3
การรู้จำเสียงพูด ( ASR ) ผ่านทาง /v1/audio/transcriptions
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $CHINAAPI_API_KEY" \
-F "model=stepaudio-2.5-asr" \
-F "[email protected]" \
-F "response_format=json"
No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini ใช้ /v1/audio/speech ส่วน stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr ใช้ /v1/audio/transcriptions และ mimo-v2.5-asr, mimo-v2.5-tts ใช้ /v1/chat/completions พร้อมเพย์โหลดเสียงเฉพาะของแต่ละโมเดล
stepaudio-2-asr-pro: $0.35 ต่อชั่วโมงเสียง; step-asr: $0.15 ต่อชั่วโมงเสียง; step-asr-1.1: $0.35 ต่อชั่วโมงเสียง; mimo-v2.5-asr: $0.074 ต่อชั่วโมงเสียง; mimo-v2.5-tts: $0 ต่อ 10k อักขระ; stepaudio-2.5-tts: $0.85 ต่อ 10k อักขระ; glm-tts: $0.3077 ต่อ 10k อักขระ; qwen3-asr-flash: $0.1235 ต่อชั่วโมงเสียง; qwen3-tts-flash: $0.1231 ต่อ 10k อักขระ; speech-2.8-hd: $0.5385 ต่อ 10k อักขระ; speech-2.8-turbo: $0.3077 ต่อ 10k อักขระ; step-tts-2: $0.4 ต่อ 10k อักขระ; step-tts-mini: $0.15 ต่อ 10k อักขระ; stepaudio-2.5-asr: $0.022 ต่อชั่วโมงเสียง อัตราสื่อที่แสดงอาจรวมมาร์จิ้นบริการที่ครอบคลุมการคิดค่าอินพุต/เอาต์พุตของผู้ให้บริการ การประมวลผลการชำระเงิน ความเสี่ยงชาร์จแบ็ก และการดำเนินงาน มาร์จิ้นใด ๆ รวมอยู่ในอัตราที่แสดงแล้วและไม่ถูกบวกเพิ่มแยกต่างหาก ค่าเหล่านี้เรนเดอร์จากแคตตาล็อกโมเดล ไม่ได้คัดลอกมาไว้ในหน้านี้
ใช่แล้ว ChinaAPI ให้สิทธิ์การเข้าถึงโดยไม่ต้องมีบัญชีหรือหมายเลขโทรศัพท์ในจีนแผ่นดินใหญ่ เพียงลงทะเบียนเพื่อขอคีย์ จากนั้นใช้เส้นทางและข้อมูลที่ส่งไปตามที่แสดงสำหรับรุ่นที่คุณเลือก