Alibaba Cloud เปิดตัว qwen3.8-max เมื่อ 2026-08-03 ในฐานะโมเดลเรือธง Qwen ที่ทรงประสิทธิภาพที่สุดจนถึงปัจจุบัน โมเดลภาพและภาษาแบบเนทีฟใช้สถาปัตยกรรม Mixture-of-Experts ขนาด 2.4T พารามิเตอร์ รองรับการให้เหตุผล การสร้างข้อความ และความเข้าใจภาพ พร้อมการพัฒนาที่สำคัญเหนือซีรีส์ Qwen3.7 เอกสาร Model Studio ทางการระบุการเข้าถึงแบบ OpenAI-compatible, Anthropic-compatible และ DashScope ในปักกิ่งและหลายภูมิภาคทั่วโลก ขณะนี้เส้นทางนี้พร้อมใช้งานผ่าน ChinaAPI
อัปเดตโมเดลผนัง
กำหนดการเปิดตัวโมเดล AI ของจีน
ตารางแสดงข้อมูลการเปิดตัวโมเดล AI ของจีน โดยอ้างอิงจากแหล่งข้อมูลของผู้จำหน่ายที่เชื่อมโยงไว้ และความพร้อมใช้งานของ ChinaAPI จะแสดงเป็นสถานะรองในแต่ละรายการ มีการระบุวันที่คาดการณ์ 3 วัน และวันที่ไม่ทราบแน่ชัด 5 วัน ในข้อมูลต้นฉบับ
ใหม่ล่าสุดก่อน
กำแพงปลดล็อก
MiniMax เปิดตัว H3 (Hailuo 3.0) บันทึกประจำรุ่นอย่างเป็นทางการอธิบายว่าเป็นโมเดลวิดีโอมัลติโหมดอเนกประสงค์แบบเปิดรุ่นใหม่ ที่เข้าใจเจตนาเชิงสร้างสรรค์จากบริบทข้อความ ภาพ วิดีโอ และเสียง และให้ผลการสร้างที่เป็นธรรมชาติและต่อเนื่องยิ่งขึ้น ChinaAPI ให้บริการเส้นทางสร้างคลิปความยาว 4-15 วินาทีที่ 768P และ 2K พร้อมเสียงสเตอริโอในตัวในการประมวลผลรอบเดียว คิดค่าบริการตามวินาทีของผลลัพธ์ และเรียกใช้ได้ผ่านเอนด์พอยต์วิดีโอแบบ OpenAI-compatible
แคตตาล็อกโมเดล Ark ของ Volcano Engine แสดง Doubao-Seedance-2.5 ภายใต้ model ID doubao-seedance-2-5-260628 โมเดลวิดีโอนี้เปิดตัวเมื่อวันที่ 2026-07-31 สามารถสร้างวิดีโอได้ยาวสูงสุด 30 วินาที รับสื่ออ้างอิงได้สูงสุด 50 รายการ (ภาพ 30 ภาพ วิดีโอ 10 รายการ และคลิปเสียง 10 รายการ) รองรับการอ้างอิงแบบหลายรูปแบบ การตัดต่อและต่อความยาววิดีโอ รวมถึงการสร้างในมากกว่า 10 ภาษา 260628 ยังคงเป็นแท็กเวอร์ชันของโมเดล ChinaAPI ยังไม่ได้ยืนยันเส้นทางนี้สำหรับการเรียกใช้ของลูกค้า จึงยังไม่เผยแพร่หน้าโมเดลหรือราคา
DeepSeek อัปเกรดเส้นทาง API deepseek-v4-flash เดิมด้วย checkpoint ที่ผ่านการ post-training ใหม่ โดยคงสถาปัตยกรรมและขนาดโมเดลของรุ่น Preview แต่เพิ่มความสามารถด้านการเขียนโค้ดและ Agent DeepSeek รายงานคะแนน Terminal Bench 2.1 ที่ 82.7, DeepSWE ที่ 54.4 และ Toolathlon Verified ที่ 70.3 โดยใช้ระดับการให้เหตุผลสูงสุดและ minimal harness ที่ยังไม่เผยแพร่ ผลลัพธ์เหล่านี้เป็นข้อมูลจากผู้ให้บริการ ไม่ใช่การทดสอบของ ChinaAPI เส้นทางทางการรองรับ Responses API และการเชื่อมต่อ Codex แบบเนทีฟแล้ว ส่วนเว็บ DeepSeek แอปมือถือ และ V4-Pro API ไม่ได้รวมอยู่ในการอัปเดตนี้
Alibaba Cloud เปิดตัวโมเดล Flash ด้านภาพและภาษาแบบเนทีฟที่มีบริบท 1M และเอาต์พุตสูงสุด 131K โดยยกระดับความเข้าใจหลายรูปแบบ การรับรู้โลกจริงและเชิงพื้นที่ การทำงานของ Search Agent และ CI Agent รวมถึงการเขียนโค้ดหลายรูปแบบเมื่อเทียบกับ Qwen3.6-Flash โมเดลทางการรองรับข้อความ รูปภาพ และวิดีโอ พร้อมเครื่องมือในตัวผ่าน Responses API ปัจจุบันเส้นทางนี้ยังไม่มีในเกตเวย์ ChinaAPI
Moonshot ได้เปิดตัวผลิตภัณฑ์เรือธง 2.8T-parameter ที่มาพร้อมกับ 1M บริบท การให้เหตุผลแบบต่อเนื่อง และความเข้าใจภาพและวิดีโอแบบเนทีฟ น้ำหนักโอเพนซอร์สที่ประกาศไว้มีกำหนดส่งภายใน July 27, 2026 .
Tencent ได้เปิด Hy3 อย่างเป็นทางการ ซึ่งเป็นโมเดลไฮบริดที่ผสมผสานการคิดเร็วและการคิดช้าใน 256K-context พร้อมความเสถียรและประสิทธิภาพด้านต้นทุนที่ได้รับการปรับปรุง
Meituan ได้เปิดตัวโมเดลการให้เหตุผลแบบ MoE ที่เปิดกว้างพร้อมบริบท 1M สำหรับเอเจนต์การเขียนโค้ดและการใช้งานเครื่องมือในระยะยาว
โมเดล Doubao Seed 2.1 ที่มีความหน่วงต่ำกว่า สำหรับการให้เหตุผลแบบหลายโมดอล การเขียนโค้ด และเวิร์กโฟลว์ของเอเจนต์การผลิต
โมเดล Doubao Seed 2.1 ซึ่งเป็นโมเดลหลักสำหรับการให้เหตุผลแบบหลายรูปแบบ การเข้ารหัส การใช้เครื่องมือ และงานของเอเจนต์ในระยะยาว
HappyHorse 1.1 โมเดลเกตเวย์แปลงข้อความเป็นวิดีโอ พร้อมความเข้าใจความหมายและการควบคุมกล้องที่ดีขึ้น
โมเดลเกตเวย์อ้างอิงไปยังวิดีโอ HappyHorse 1.1 สำหรับความสอดคล้องของหัวข้อ ฉาก และรูปแบบการอ้างอิงหลายแบบ
HappyHorse 1.1 โมเดลเกตเวย์ภาพสู่วิดีโอที่มีความสอดคล้องของพื้นผิวและเอกลักษณ์ที่แข็งแกร่งยิ่งขึ้น
โซลูชันโอเพนซอร์สระดับเรือธง GLM ที่มี 1M บริบทและการเขียนโค้ดระยะยาวที่แข็งแกร่งยิ่งขึ้น รวมถึงเวิร์กโฟลว์ของเอเจนต์
โมเดลวิดีโอขนาดเล็ก Seedance 2.0 ที่รวดเร็ว สำหรับการสร้างวิดีโอสั้นต้นทุนต่ำ
เกตเวย์ Kimi K2.7 ความเร็วสูง รุ่นพิเศษสำหรับการเขียนโค้ดและการทำงานของเอเจนต์ที่ต้องการความหน่วงต่ำ
โมเดลเกตเวย์ Kimi ที่เน้นการเขียนโค้ด สำหรับงานคลังข้อมูลระยะยาว พร้อมการสนับสนุนด้านวิสัยทัศน์
ระบบรู้จำเสียงพูด MiMo สำหรับการสลับรหัสภาษาจีน-อังกฤษ ภาษาจีนกวางตุ้ง ภาษาถิ่นอู๋ ภาษาหมิ่นหนาน และภาษาเสฉวน การบันทึกที่มีเสียงรบกวนและจากระยะไกล การพูดซ้อนทับกัน และเนื้อเพลง
โมเดลเกตเวย์ Qwen แบบมัลติโมดอลสำหรับการวิเคราะห์เชิงภาพ การวางแผน ไฟล์ และการใช้เครื่องมือ
โมเดล M-series แบบมัลติโมดอลดั้งเดิม พร้อมบริบท 1M , กลไกความสนใจ MSA, การเข้ารหัส, เอเจนต์, รูปภาพ และการสนับสนุนอินพุตวิดีโอ
โมเดลเกตเวย์ Fast StepFun พร้อมบริบท 256K , การป้อนข้อมูลด้วยภาพ, การให้เหตุผล และการใช้เครื่องมือ
การเผยแพร่ทางเทคนิคของวิดีโออวตารที่ขับเคลื่อนด้วยเสียง เน้นการซิงค์ริมฝีปาก ความสอดคล้องของตัวตน และการสร้างวิดีโอความยาวเต็มเรื่อง
Qwen คือเกตเวย์รุ่นเรือธงสำหรับเวิร์กโฟลว์การวิเคราะห์ การเขียนโค้ด และเอเจนต์การผลิตที่ต้องการประสิทธิภาพสูง
Qwen 3.6 โมเดลภาพ-ภาษาความเร็วสูงสำหรับการใช้เหตุผลเชิงภาพ ไฟล์ และเวิร์กโฟลว์ของเอเจนต์
โมเดลเอเจนต์ MiMo ที่มี 1.02T-parameter บริบท 1M สำหรับการเขียนโค้ดที่ต้องการประสิทธิภาพสูงและงานระยะยาว
โมเดล MiMo แบบ Omnimodal ดั้งเดิม พร้อมบริบท 1M และความเข้าใจในข้อความ รูปภาพ วิดีโอ และเสียง
ระบบแปลงภาพเป็นวิดีโอ Wan 2.7 พร้อมการควบคุมเฟรมแรก/เฟรมสุดท้าย การเล่นต่อเนื่อง เสียงประกอบ และเอาต์พุต 720P / 1080P
DeepSeek V4 รุ่นเรือธง มีพารามิเตอร์รวม 1.6T และบริบท 1M-token เค็น
DeepSeek V4 เวอร์ชันเร็ว เหมาะสำหรับการแชทที่มีประสิทธิภาพ การให้ความช่วยเหลือด้านการเขียนโค้ด และการวนรอบของเอเจนต์
MiMo คือแอปพลิเคชันแปลงข้อความเป็นเสียงพูดที่แสดงอารมณ์ได้อย่างยอดเยี่ยม ด้วยเสียงคุณภาพสูงในตัว และสามารถควบคุมจังหวะ อารมณ์ น้ำเสียง สำเนียง และการแสดงออกของตัวละครได้อย่างเป็นธรรมชาติ
เปิดใช้งานโมเดล Kimi แบบมัลติโมดอลดั้งเดิมสำหรับการเขียนโค้ดระยะยาว การออกแบบเชิงภาพ และเวิร์กโฟลว์แบบกลุ่มเอเจนต์
แบบจำลองพื้นฐานการเข้ารหัสแบบมัลติโมดอล 200K-context สำหรับเวิร์กโฟลว์ที่ขับเคลื่อนด้วยรูปภาพ วิดีโอ ไฟล์ ตัวแทน GUI และเครื่องมือ
โมเดล Wan 2.7 สำหรับการแก้ไขวิดีโอด้วยภาษาธรรมชาติ สำหรับการแก้ไขเฉพาะจุด/โดยรวม และการแทนที่องค์ประกอบ
โมเดล Wan 2.7 แปลงข้อความเป็นวิดีโอสำหรับการสร้างวิดีโอตามคำสั่ง
โมเดล Wan 2.7 อ้างอิงถึงวิดีโอสำหรับการสร้างแบบควบคุมจากข้อมูลอ้างอิงภาพ
การปรับปรุง GLM สำหรับงานที่มีขอบเขตเวลาการทำงานที่ยาวนานขึ้น ตัวแทนการเข้ารหัส และการให้เหตุผลแบบผสมผสาน
Wan 2.7 Pro สร้างและแก้ไขภาพด้วยการควบคุมสีแบรนด์ ความสอดคล้องของภาพอ้างอิงหลายแบบ และแสดงผลได้สูงสุดถึง 4096 × 4096 พิกเซล
โมเดลภาพ Wan 2.7 สำหรับการแปลงข้อความให้เป็นภาพ การแก้ไข การสร้างการอ้างอิงหลายรายการ และการแสดงผลข้อความที่ดียิ่งขึ้น
MiniMax รุ่นความเร็วสูง เหมาะสำหรับการเขียนโค้ดที่มีความหน่วงต่ำและเวิร์กโฟลว์ของเอเจนต์
โมเดล MiniMax แบบปรับน้ำหนักได้ เหมาะสำหรับการแชท การเขียนโค้ด งานออฟฟิศ และงานที่ต้องใช้ทักษะการตัดสินใจ
การเปิดตัว Qwen เวอร์ชันดั้งเดิมที่มีเอเจนต์มัลติโมดอล ซึ่งมาก่อนรุ่นเกตเวย์ Qwen 3.6 และ 3.7 ที่ใช้งานอยู่
GLM-5 เวอร์ชันเทอร์โบที่มีประสิทธิภาพสูงขึ้น เพื่อการประมวลผล การเขียนโค้ด และการทำงานของเอเจนต์ที่รวดเร็วยิ่งขึ้น
GLM-5 เวอร์ชันใหม่สำหรับการเข้ารหัส การให้เหตุผล และเวิร์กโฟลว์ของเอเจนต์
Kling 3.0 Omni รุ่นพิเศษสำหรับใช้งานอ้างอิงวิดีโอและขั้นตอนการตัดต่อ
Kling รุ่นที่ 3.0 มาพร้อมฟังก์ชั่นแปลงข้อความเป็นวิดีโอ รูปภาพเป็นวิดีโอ เสียง และความละเอียดตั้งแต่ 720p ถึง 4K
Kling 3.0 Turbo เวอร์ชันเร็วพิเศษสำหรับการสร้างวิดีโอพร้อมเสียงที่มีความหน่วงต่ำ
เปิดโมเดล StepFun flash ที่มีบริบท 256K และรองรับการใช้งานเครื่องมือ
โมเดลภาพ Seedream 5.0-lite ที่ควบคุมการสร้าง การเรียกใช้ และความสอดคล้องของตัวแบบได้ดียิ่งขึ้น
Seedance 2.0 เป็นตัวเลือกที่รวดเร็วสำหรับการสร้างคลิปวิดีโอในราคาประหยัด
Seedance 2.0 เป็นรุ่นเรือธงสำหรับการสร้างวิดีโอ โดยคิดค่าบริการตามความละเอียดของไฟล์วิดีโอ
MiniMax ได้เปิดตัว Speech 2.8 ซึ่งมาพร้อมกับแท็กเสียงแบบเนทีฟ การโคลนเสียงที่ดีขึ้น คุณภาพเสียงระดับสตูดิโอ และการพูดข้ามภาษา ส่วน Turbo เป็นตัวเลือกที่เน้นความเร็ว
MiniMax ได้เปิดตัว Speech 2.8 ซึ่งมาพร้อมกับแท็กเสียงแบบเนทีฟ การโคลนเสียงที่ดีขึ้น คุณภาพเสียงระดับสตูดิโอ และการพูดข้ามภาษา โดย HD คือตัวเลือกคุณภาพเสียงระดับสูง
Alibaba โหมด OpenAI-compatible ลงใน Qwen3-ASR-Flash โดยยังคงรองรับการถอดเสียงหลายภาษา, ITN และการสตรีมมิ่ง
โมเดลเอเจนต์ Kimi แบบมัลติโมดอลแบบเปิด พร้อมบริบท 256K และการฝึกอบรมด้านการมองเห็นและภาษา
Z.AI ได้เปิดตัวโมเดล ASR หลายภาษาพร้อมการสนับสนุนพจนานุกรมแบบกำหนดเองที่ดีขึ้นและการจดจำคำศัพท์เฉพาะทาง
โมเดลสร้างภาพขนาดเล็กที่เน้นคุณภาพของข้อมูลมากกว่าขนาดของโมเดล
เส้นทางการแปลงภาพเป็นวิดีโอที่รวดเร็วด้วย Hailuo 2.3 เพื่อต้นทุนที่ต่ำลง
Hailuo 2.3 ปรับปรุงการเคลื่อนไหวที่ซับซ้อน การกระทำทางกายภาพ การจัดรูปแบบ และประสิทธิภาพการแสดงออกทางสีหน้าอย่างละเอียดให้ดียิ่งขึ้น
Alibaba ได้เปิดตัว Qwen3-TTS-Flash สำหรับการสังเคราะห์เสียงแบบออฟไลน์ พร้อมเสียงที่แสดงอารมณ์ได้อย่างหลากหลาย รองรับหลายภาษาและสำเนียงต่างๆ และการเข้าถึง API ที่มีความหน่วงต่ำ
รุ่น Hailuo 02 สำหรับสร้างวิดีโอจากข้อความและภาพ ตั้งแต่ความละเอียด 512p ขึ้นไป
การแปลงข้อความเป็นเสียงพูดที่คำนึงถึงบริบท พร้อมการกำหนดทิศทางภาษาธรรมชาติทั้งแบบโดยรวมและแบบเฉพาะ OpenAI-compatible การนำเสนอที่แสดงอารมณ์ และการส่งออก /v1/audio/speech
การถอดเสียงสตรีมมิ่ง 4B ที่รวดเร็วสำหรับเสียงภาษาจีน-อังกฤษ พร้อมการปรับมาตรฐาน ITN และเส้นทางการถอด OpenAI-compatible
ระบบสังเคราะห์เสียงหลายภาษาที่ประหยัดต้นทุน พร้อมเสียงต้นฉบับและเสียงจำลอง การจับคู่การออกเสียง และการควบคุมสไตล์การพูด
การสังเคราะห์เสียงพูดที่แสดงอารมณ์ได้อย่างดีเยี่ยมด้วยเสียงทางการและเสียงเลียนแบบ การแมปการออกเสียง การควบคุมสไตล์ และการส่ง OpenAI-compatible
ระบบสังเคราะห์เสียงพูดที่แสดงอารมณ์ได้อย่างแม่นยำตามบริบท พร้อมเอาต์พุตแบบสตรีมมิ่ง และการควบคุมเสียง ความเร็ว และระดับเสียง
