Alibaba Cloud a publié qwen3.8-max le 2026-08-03 comme le modèle phare Qwen le plus performant à ce jour. Ce modèle natif de vision et de langage repose sur une architecture Mixture-of-Experts de 2.4T paramètres, prend en charge le raisonnement, la génération de texte et la compréhension visuelle, et progresse nettement par rapport à la série Qwen3.7. La documentation officielle de Model Studio indique des accès OpenAI-compatible, Anthropic-compatible et DashScope à Pékin et dans plusieurs régions mondiales. Cette route est désormais disponible via ChinaAPI.
Journal des mises à jour
Chronologie des sorties de modèles d'IA chinois.
Une chronologie factuelle des sorties de modèles d'IA chinois. Les dates proviennent des sources de fournisseurs liées ; la disponibilité sur ChinaAPI est indiquée séparément dans chaque entrée. Les données source signalent 3 dates estimées et 5 dates inconnues.
Du plus récent au plus ancien
Historique des sorties.
MiniMax a publié H3 (Hailuo 3.0). Les notes de version officielles le décrivent comme un modèle vidéo multimodal généraliste ouvert de nouvelle génération, qui comprend l'intention créative à partir du contexte texte, image, vidéo et audio et produit des générations plus naturelles et cohérentes. ChinaAPI dessert la route pour des clips de 4 à 15 secondes en 768P et 2K avec audio stéréo natif en une seule passe, facturés à la seconde de sortie et appelables via l'endpoint vidéo OpenAI-compatible.
Le catalogue de modèles Ark de Volcano Engine répertorie Doubao-Seedance-2.5 sous le model ID doubao-seedance-2-5-260628. Sorti le 2026-07-31, ce modèle vidéo peut produire jusqu’à 30 secondes, accepter jusqu’à 50 éléments de référence (30 images, 10 vidéos et 10 extraits audio), et prendre en charge les références multimodales, le montage, la prolongation vidéo et la génération dans plus de 10 langues. 260628 reste l’étiquette de version du modèle. ChinaAPI n’a pas encore vérifié cette route pour les appels clients ; aucune page modèle ni tarification n’est donc publiée pour le moment.
DeepSeek a mis à niveau la route API deepseek-v4-flash existante avec un checkpoint réentraîné en post-entraînement, sans changer l’architecture ni la taille du modèle preview, tout en renforçant ses capacités de code et d’agent. Avec l’effort de raisonnement maximal et un harness minimal encore inédit, DeepSeek annonce 82,7 sur Terminal Bench 2.1, 54,4 sur DeepSWE et 70,3 sur Toolathlon Verified ; il s’agit de résultats du fournisseur, pas de tests ChinaAPI. La route officielle prend désormais en charge nativement la Responses API et l’intégration Codex ; le web, l’application mobile et l’API V4-Pro ne sont pas concernés par cette mise à jour.
Alibaba Cloud a publié son modèle Flash natif de vision et de langage, avec 1 M de contexte et jusqu’à 131 K en sortie. Par rapport à Qwen3.6-Flash, il améliore la compréhension multimodale, la perception du monde réel et de l’espace, l’exécution par Search Agent et CI Agent, ainsi que le code multimodal. Le modèle officiel accepte le texte, les images et la vidéo, et propose des outils intégrés via la Responses API. Cette route n’est pas encore répertoriée dans la passerelle ChinaAPI.
Moonshot a présenté son modèle phare de 2,8 billions de paramètres, avec 1 M de contexte, raisonnement continu et compréhension native des images et des vidéos. Les poids open source sont annoncés pour le 27 juillet 2026.
Tencent a officiellement publié Hy3, un modèle hybride de pensée rapide et lente avec 256K de contexte, une stabilité et une efficacité de coût améliorées.
Meituan a publié son modèle ouvert de raisonnement MoE avec 1 M de contexte pour les agents de code et l'utilisation d'outils sur de longues séquences.
Modèle Doubao Seed 2.1 à plus faible latence pour le raisonnement multimodal, le code et les workflows d'agents en production.
Modèle phare Doubao Seed 2.1 pour le raisonnement multimodal, le code, l'utilisation d'outils et les tâches d'agents de longue durée.
Modèle de passerelle HappyHorse 1.1 de texte-vers-vidéo avec meilleure compréhension sémantique et contrôle de la caméra.
Modèle de passerelle HappyHorse 1.1 de référence-vers-vidéo pour préserver la cohérence du sujet, de la scène et du style avec plusieurs références.
Modèle de passerelle HappyHorse 1.1 d'image-vers-vidéo avec texture et cohérence d'identité renforcées.
Un modèle phare GLM ouvert avec 1 M de contexte et des capacités renforcées pour le code et les workflows d'agents de longue durée.
Modèle vidéo Seedance 2.0 mini rapide pour générer des formats courts à moindre coût.
Variante de passerelle Kimi K2.7 haute vitesse pour le code et les tâches d'agents à faible latence.
Modèle de passerelle Kimi centré sur le code et le travail de longue durée sur des dépôts, avec prise en charge visuelle.
Reconnaissance vocale MiMo pour l'alternance chinois-anglais, le cantonais, les dialectes wu, minnan et sichuanais, les enregistrements bruités ou distants, les locuteurs qui se chevauchent et les paroles.
Modèle de passerelle Qwen multimodal pour l'analyse visuelle, la planification, les fichiers et l'utilisation d'outils.
Modèle natif multimodal de la série M avec 1 M de contexte, attention MSA et prise en charge du code, des agents, des images et de la vidéo en entrée.
Modèle de passerelle StepFun rapide avec 256K de contexte, entrée visuelle, raisonnement et utilisation d'outils.
Publication technique sur la vidéo d'avatar pilotée par l'audio, centrée sur la synchronisation labiale, la cohérence d'identité et la génération de longues vidéos.
Modèle de passerelle Qwen phare pour l'analyse exigeante, le code et les workflows d'agents en production.
Modèle vision-langage Qwen 3.6 rapide pour le raisonnement visuel, les fichiers et les workflows d'agents.
Modèle d'agent MiMo de 1,02 billion de paramètres, avec 1 M de contexte, pour le code exigeant et les tâches de longue durée.
Modèle MiMo nativement omnimodal avec 1 M de contexte et compréhension du texte, des images, de la vidéo et de l'audio.
Wan 2.7 image-vers-vidéo avec contrôle de la première et de la dernière image, continuation, audio moteur et sortie 720P/1080P.
Variante phare de DeepSeek V4 avec 1,6 billion de paramètres au total et 1 M de contexte.
Variante rapide de DeepSeek V4 pour le chat efficace, l'assistance au code et les boucles d'agents.
Synthèse vocale expressive MiMo avec voix premium intégrées et contrôle en langage naturel du débit, de l'émotion, du ton, du dialecte et de l'interprétation du personnage.
Modèle Kimi natif multimodal et ouvert pour le code de longue durée, le design visuel et les workflows d'essaims d'agents.
Modèle de fondation multimodal pour le code avec 200K de contexte, destiné aux images, vidéos, fichiers, agents GUI et workflows pilotés par outils.
Modèle Wan 2.7 d'édition vidéo en langage naturel pour les retouches locales et globales et le remplacement d'éléments.
Modèle Wan 2.7 de texte-vers-vidéo pour la génération pilotée par prompt.
Modèle Wan 2.7 de référence-vers-vidéo pour une génération contrôlée à partir de références visuelles.
Mise à jour GLM pour les tâches de longue durée, les agents de code et le raisonnement hybride.
Wan 2.7 Pro pour la génération et l'édition d'images, avec contrôle des couleurs de marque, cohérence multi-références et sortie jusqu'à 4096×4096.
Modèle d'image Wan 2.7 pour le texte-vers-image, l'édition, la génération multi-références et un meilleur rendu de texte.
Variante MiniMax haute vitesse pour le code et les workflows d'agents à faible latence.
Modèle MiniMax à poids ouverts pour le chat, le code, le travail bureautique et les tâches agentiques.
Sortie Qwen native multimodale orientée agents, antérieure aux modèles Qwen 3.6 et 3.7 servis par la passerelle.
Variante GLM-5 Turbo efficace pour un raisonnement, du code et un travail d'agents plus rapides.
Sortie de GLM-5 pour le code, le raisonnement et les workflows d'agents.
Variante Kling 3.0 Omni pour la transformation de références en vidéo et les workflows d'édition.
Kling 3.0 avec texte-vers-vidéo, image-vers-vidéo, audio et paliers de sortie de 720p à 4K.
Voie rapide Kling 3.0 Turbo pour générer de la vidéo avec audio à plus faible latence.
Modèle flash StepFun ouvert avec 256K de contexte et prise en charge de l'utilisation d'outils.
Modèle d'image Seedream 5.0-lite avec création contrôlable, récupération et meilleure cohérence du sujet.
Option rapide Seedance 2.0 pour des clips générés de manière économique.
Modèle phare de génération vidéo Seedance 2.0 facturé selon la résolution de sortie.
MiniMax a publié Speech 2.8 avec des balises sonores natives, un clonage de voix amélioré, un audio de qualité studio et une parole interlingue ; Turbo privilégie la vitesse.
MiniMax a publié Speech 2.8 avec des balises sonores natives, un clonage de voix amélioré, un audio de qualité studio et une parole interlingue ; HD est l'option haute fidélité.
Alibaba a ajouté un mode compatible OpenAI à Qwen3-ASR-Flash, en conservant la transcription multilingue, l'ITN et le streaming.
Modèle d'agent Kimi ouvert, natif multimodal, avec 256K de contexte et entraînement vision-langage.
Z.AI a publié son modèle ASR multilingue avec une meilleure prise en charge des dictionnaires personnalisés et de la terminologie spécialisée.
Petit modèle de génération d'images qui privilégie la qualité des données plutôt que la taille du modèle.
Voie Hailuo 2.3 rapide pour la génération image-vers-vidéo à moindre coût.
Hailuo 2.3 améliore les mouvements complexes, les actions physiques, la stylisation et les micro-expressions.
Alibaba a publié Qwen3-TTS-Flash pour la synthèse vocale hors ligne, avec voix expressives, sortie multilingue et dialectale, et accès API à faible latence.
Modèle vidéo Hailuo 02 économique pour le texte-vers-vidéo et l'image-vers-vidéo à partir de 512p.
Synthèse vocale contextuelle avec directives globales et en ligne en langage naturel, rendu expressif et sortie directe /v1/audio/speech compatible OpenAI.
Transcription streaming rapide 4B MTP pour l'audio chinois-anglais, avec normalisation ITN et route de transcription compatible OpenAI.
Synthèse vocale multilingue économique avec voix officielles et clonées, mappage de prononciation et contrôles de style.
Synthèse vocale expressive avec voix officielles et clonées, mappage de prononciation, contrôles de style et sortie compatible OpenAI.
Synthèse vocale expressive et contextuelle avec sortie en streaming et contrôles de la voix, de la vitesse et du volume.
