Alibaba Cloud merilis qwen3.8-max pada 2026-08-03 sebagai model unggulan Qwen paling mampu hingga saat ini. Model visi-bahasa native ini menggunakan arsitektur Mixture-of-Experts dengan 2.4T parameter, mendukung penalaran, pembuatan teks, dan pemahaman visual, serta meningkat signifikan dibandingkan seri Qwen3.7. Dokumentasi resmi Model Studio mencantumkan akses OpenAI-compatible, Anthropic-compatible, dan DashScope di Beijing dan beberapa wilayah global. Rute ini kini tersedia melalui ChinaAPI.
Pembaruan model dinding
Garis waktu perilisan model AI Tiongkok.
Daftar rilis model AI Tiongkok berbasis data. Tanggal berasal dari sumber vendor yang terhubung; ketersediaan ChinaAPI ditampilkan pada setiap entri sebagai status sekunder. 3 perkiraan tanggal dan 5 tanggal yang tidak diketahui ditandai dalam data sumber.
Terbaru terlebih dahulu
Lepaskan dinding.
MiniMax merilis H3 (Hailuo 3.0). Catatan rilis resminya menggambarkannya sebagai model video multimodal serbaguna terbuka generasi baru yang memahami maksud kreatif dari konteks teks, gambar, video, dan audio serta menghasilkan hasil generasi yang lebih alami dan koheren. ChinaAPI melayani rute untuk klip 4-15 detik pada 768P dan 2K dengan audio stereo native dalam sekali proses, ditagih per detik output dan dapat dipanggil melalui endpoint video OpenAI-compatible.
Katalog model Ark Volcano Engine mencantumkan Doubao-Seedance-2.5 dengan model ID doubao-seedance-2-5-260628. Dirilis pada 2026-07-31, model video ini dapat membuat video hingga 30 detik, menerima hingga 50 aset referensi (30 gambar, 10 video, dan 10 klip audio), serta mendukung referensi multimodal, penyuntingan dan perpanjangan video, dan pembuatan dalam lebih dari 10 bahasa. 260628 tetap menjadi tag versi model. ChinaAPI belum memverifikasi rute ini untuk panggilan pelanggan, sehingga halaman model dan harga belum dipublikasikan.
DeepSeek meningkatkan rute API deepseek-v4-flash yang ada dengan checkpoint yang dilatih ulang pada tahap post-training. Arsitektur dan ukuran model Preview tetap sama, sementara kemampuan coding dan Agent ditingkatkan. Dengan tingkat penalaran maksimum dan minimal harness yang belum dirilis, DeepSeek melaporkan 82.7 pada Terminal Bench 2.1, 54.4 pada DeepSWE, dan 70.3 pada Toolathlon Verified; ini adalah hasil vendor, bukan pengujian ChinaAPI. Rute resmi kini mendukung Responses API dan integrasi Codex secara native; web DeepSeek, aplikasi seluler, dan V4-Pro API tidak termasuk dalam pembaruan ini.
Alibaba Cloud merilis model Flash visi-bahasa native dengan konteks 1M dan output hingga 131K. Dibandingkan Qwen3.6-Flash, model ini meningkatkan pemahaman multimodal, persepsi dunia nyata dan spasial, eksekusi Search Agent dan CI Agent, serta coding multimodal. Model resmi menerima teks, gambar, dan video serta menyediakan alat bawaan melalui Responses API. Rute ini saat ini belum terdaftar di gateway ChinaAPI.
Moonshot merilis 2.8T-parameter andalannya dengan 1M konteks, penalaran yang selalu aktif, dan pemahaman gambar dan video asli. Bobot sumber terbuka yang diumumkan akan dirilis pada July 27, 2026 .
Tencent secara resmi merilis Hy3 , sebuah model berpikir cepat dan lambat hibrida 256K-context yang memiliki stabilitas dan efisiensi biaya yang lebih baik.
Meituan merilis model penalaran MoE terbuka dengan 1M konteks untuk agen pengkodean dan penggunaan alat jangka panjang.
Model Doubao Seed 2.1 dengan latensi rendah untuk penalaran multimodal, pengkodean, dan alur kerja agen produksi.
Model unggulan Doubao Seed 2.1 untuk penalaran multimodal, pengkodean, penggunaan alat, dan tugas agen jangka panjang.
Model gateway teks-ke-video HappyHorse 1.1 dengan pemahaman semantik dan kontrol kamera yang lebih baik.
Model gerbang referensi-ke-video HappyHorse 1.1 untuk konsistensi subjek, adegan, dan gaya multi-referensi.
Model gateway gambar-ke-video HappyHorse 1.1 dengan konsistensi tekstur dan identitas yang lebih kuat.
Unggulan sumber terbuka GLM dengan konteks 1M dan alur kerja pengkodean dan agen jangka panjang yang lebih kuat.
Model video mini Fast Seedance 2.0 untuk produksi konten pendek dengan biaya lebih rendah.
Varian gateway Kimi K2.7 berkecepatan tinggi untuk pengkodean latensi rendah dan tugas agen.
Model gerbang Kimi yang berfokus pada pengkodean untuk pekerjaan repositori jangka panjang dengan dukungan visi.
Pengenalan suara MiMo untuk peralihan kode bahasa Tionghoa-Inggris, dialek Kanton, Wu, Minnan dan Sichuan, rekaman bising dan jarak jauh, pembicara yang tumpang tindih, dan lirik.
Model gerbang Qwen multimodal untuk analisis visual, perencanaan, file, dan penggunaan alat.
Model M-series multimodal asli dengan 1M konteks, perhatian MSA, pengkodean, agen, dukungan input gambar, dan video.
Model gateway StepFun cepat dengan 256K konteks, input visual, penalaran, dan penggunaan alat.
Rilis teknis video avatar berbasis audio yang berfokus pada sinkronisasi bibir, konsistensi identitas, dan pembuatan video berdurasi panjang.
Model gateway Qwen unggulan untuk alur kerja agen analisis, pengkodean, dan produksi yang menuntut.
Qwen 3.6 model bahasa-visi cepat untuk penalaran visual, file, dan alur kerja agen.
Model agen MiMo dengan 1.02T-parameter dan 1M konteks untuk pengkodean yang kompleks dan tugas jangka panjang.
Model MiMo omnimodal asli dengan 1M konteks dan pemahaman teks, gambar, video, dan audio.
Konverter gambar ke video Wan 2.7 dengan kontrol bingkai pertama/terakhir, kelanjutan, audio penggerak, dan output 720P / 1080P .
Varian unggulan DeepSeek V4 dengan total 1.6T parameter dan konteks 1M-token .
Varian DeepSeek V4 yang cepat untuk obrolan yang efisien, bantuan pengkodean, dan perulangan agen.
MiMo adalah teknologi text-to-speech ekspresif dengan suara bawaan premium dan kontrol bahasa alami atas kecepatan, emosi, nada, dialek, dan performa karakter.
Model Kimi multimodal asli terbuka untuk pengkodean jangka panjang, desain visual, dan alur kerja kawanan agen.
Model dasar pengkodean multimodal 200K-context untuk alur kerja berbasis gambar, video, file, agen GUI, dan alat.
Wan 2.7 model pengeditan video bahasa alami untuk pengeditan lokal/global dan penggantian elemen.
Model teks-ke-video Wan 2.7 untuk pembuatan video berbasis perintah.
Model referensi-ke-video Wan 2.7 untuk pembangkitan terkontrol dari referensi visual.
Pembaruan GLM untuk tugas-tugas jangka panjang, agen pengkodean, dan penalaran hibrida.
Wan 2.7 Pro menghasilkan dan mengedit gambar dengan kontrol warna merek, konsistensi multi-referensi, dan output hingga 4096 × 4096 .
Model gambar Wan 2.7 untuk konversi teks ke gambar, pengeditan, pembuatan multi-referensi, dan rendering teks yang lebih kuat.
Varian MiniMax berkecepatan tinggi untuk pengkodean latensi rendah dan alur kerja agen.
Model MiniMax berbobot terbuka untuk obrolan, pengkodean, pekerjaan kantor, dan tugas-tugas berbasis agen.
Rilis Qwen agen multimodal asli yang mendahului model gateway Qwen 3.6 dan 3.7 yang digunakan.
Varian turbo GLM-5 yang efisien untuk penalaran, pengkodean, dan kerja agen yang lebih cepat.
Rilis GLM-5 untuk pengkodean, penalaran, dan alur kerja agen.
Varian Kling 3.0 Omni untuk alur kerja referensi ke video dan pengeditan.
Kling generasi 3.0 dengan kemampuan konversi teks ke video, gambar ke video, audio, dan output resolusi 720p hingga 4K .
Jalur Fast Kling 3.0 Turbo untuk pembuatan video dengan latensi rendah dan audio.
Buka model flash StepFun dengan konteks 256K dan dukungan penggunaan alat.
Model citra Seedream 5.0-lite dengan pembuatan, pengambilan, dan konsistensi subjek yang lebih kuat dan dapat dikontrol.
Opsi pembuatan video Fast Seedance 2.0 untuk klip yang hemat biaya.
Seedance 2.0 model unggulan generasi video yang dipasarkan berdasarkan resolusi output.
MiniMax merilis Speech 2.8 dengan tag suara asli, kloning suara yang lebih baik, audio berkualitas studio, dan ucapan lintas bahasa; Turbo adalah opsi yang berfokus pada kecepatan.
MiniMax merilis Speech 2.8 dengan tag suara asli, kloning suara yang lebih baik, audio berkualitas studio, dan ucapan lintas bahasa; HD adalah opsi fidelitas tingginya.
Alibaba menambahkan mode OpenAI-compatible ke Qwen3-ASR-Flash , mempertahankan transkripsi multibahasa, ITN, dan dukungan streaming.
Model agen Kimi multimodal asli terbuka dengan 256K konteks dan pelatihan bahasa-visi.
Z.AI merilis model ASR multibahasa dengan dukungan kamus khusus yang lebih baik dan pengenalan terminologi khusus.
Model pembangkitan gambar kecil yang berfokus pada kualitas data daripada ukuran model.
Jalur Hailuo 2.3 yang cepat untuk pembuatan gambar-ke-video dengan biaya lebih rendah.
Hailuo 2.3 meningkatkan performa gerakan kompleks, aksi fisik, penataan gaya, dan ekspresi mikro.
Alibaba merilis Qwen3-TTS-Flash untuk sintesis suara offline dengan suara ekspresif, keluaran multibahasa dan dialek, serta akses API dengan latensi rendah.
Model video Budget Hailuo 02 untuk pembuatan teks-ke-video dan gambar-ke-video mulai dari 512p .
Konversi teks ke ucapan yang peka konteks dengan arahan bahasa alami global dan langsung, penyampaian ekspresif, dan /v1/audio/speech OpenAI-compatible .
Transkripsi streaming 4B cepat untuk audio Tionghoa-Inggris dengan normalisasi ITN dan rute OpenAI-compatible .
Sintesis suara multibahasa yang hemat biaya dengan suara resmi dan suara tiruan, pemetaan pengucapan, dan kontrol gaya.
Sintesis ucapan ekspresif dengan suara resmi dan suara tiruan, pemetaan pengucapan, kontrol gaya, dan keluaran OpenAI-compatible .
Sintesis ucapan ekspresif yang peka konteks dengan output streaming dan kontrol untuk suara, kecepatan, dan volume.
