Journal des mises à jour

Les nouveautés de l’IA chinoise.

Un fil concis des sorties de modèles d’IA chinois, avec leurs sources et leur disponibilité sur ChinaAPI en un coup d’œil. Les données source signalent 3 dates estimées et 5 dates inconnues.

Du plus récent au plus ancien

Historique des sorties.

Xiaomi MiMo-V2.6-Pro-UltraSpeed
LLM MiMo V2.6 Source · mimo.mi.com
Xiaomi a lancé un service à faible latence qui conserve les entrées omnimodales, les capacités de raisonnement phares, le contexte de 1M tokens et la limite de sortie de 128K de MiMo-V2.6-Pro. Xiaomi annonce une vitesse de sortie jusqu’à 20 fois supérieure au service Pro standard ; les limites RPM et TPM relèvent d’un service sur mesure. Son API model ID officiel est mimo-v2.6-pro-ultraspeed. ChinaAPI propose désormais la route mimo-v2.6-pro-ultraspeed aux clients ; consultez le catalogue pour le tarif actuel.
2026-09-22
✓ Disponible sur ChinaAPI confirmé
Xiaomi MiMo-V2.6-Pro
LLM MiMo V2.6 Source · mimo.mi.com
Xiaomi a lancé son modèle phare de raisonnement nativement omnimodal pour les projets complexes, les tâches de longue durée, la cybersécurité et la recherche. MiMo-V2.6-Pro accepte le texte, les images, la vidéo et l’audio, produit du texte, offre un contexte de 1M tokens et jusqu’à 128K en sortie, avec deep thinking, tool calling, streaming, web search, structured output et context caching. Son API model ID officiel est mimo-v2.6-pro. ChinaAPI propose désormais cette route aux clients ; consultez le catalogue en direct pour le tarif actuel.
2026-09-22
✓ Disponible sur ChinaAPI confirmé
Xiaomi MiMo-V2.6-Flash
LLM MiMo V2.6 Source · mimo.mi.com
Xiaomi a lancé un modèle de raisonnement nativement omnimodal, optimisé pour les appels fréquents dans le travail professionnel et les tâches à grande échelle à moindre coût. MiMo-V2.6-Flash accepte le texte, les images, la vidéo et l’audio, produit du texte, offre un contexte de 1M tokens et jusqu’à 128K en sortie, avec deep thinking, tool calling, streaming, web search, structured output et context caching. Son API model ID officiel est mimo-v2.6-flash. ChinaAPI propose désormais cette route aux clients ; consultez le catalogue en direct pour le tarif actuel.
2026-09-22
✓ Disponible sur ChinaAPI confirmé
Xiaomi Batch API for MiMo-V2.6
LLM MiMo Batch API Source · mimo.mi.com
Xiaomi a lancé une Batch API asynchrone pour mimo-v2.6-pro et mimo-v2.6-flash, facturée à 50 % du prix de son API en temps réel. Destiné aux traitements non temps réel comme l’évaluation, l’annotation et la génération en masse, le service accepte des requêtes JSONL et prend en charge, sans streaming, les formats OpenAI Chat Completions, OpenAI Responses et Anthropic Messages. ChinaAPI propose les deux routes en temps réel, sans que cela implique la prise en charge de la Batch API distincte de Xiaomi.
2026-09-22
Absent de ChinaAPI confirmé
StepFun a publié Step 5 Preview le 2026-09-20 comme modèle phare pour l’ingénierie logicielle, les tâches Agent de longue durée, le travail professionnel spécialisé et la finance. Ce sparse Mixture-of-Experts compte 600B paramètres au total, dont 27B activés par token, et accepte un contexte de 1M tokens. Son model ID API officiel est step-5-preview ; il reçoit du texte, des images et des vidéos, produit du texte et prend en charge jusqu’à 64K tokens en sortie. L’API propose aussi le streaming, le tool calling, JSON Mode, JSON Schema, les niveaux de reasoning effort low/medium/high et le prompt caching. StepFun annonce un score de 44 dans l’Artificial Analysis Intelligence Index ainsi que des résultats de benchmark en code, Agent, finance et multimodal ; il s’agit de résultats du fournisseur, pas de tests ChinaAPI. StepFun prévoit de publier les open weights le 2026-10-15. Le live catalog de ChinaAPI expose désormais la route step-5-preview aux clients au tarif catalogue du fournisseur : 1,00 $/M en entrée, 2,70 $/M en sortie et 0,05 $/M pour la lecture du prompt cache ; le Gateway en direct fait foi.
2026-09-20
✓ Disponible sur ChinaAPI confirmé
Alibaba Qwen Qwen-Image-2.1 open weights
Image Qwen-Image Source · github.com
Qwen a publié les poids de Qwen-Image-2.1 le 2026-09-20. Son composant de génération visuelle de 7 milliards de paramètres réunit la création d’images à partir de texte et la retouche, avec transparence RGBA native, jusqu’à 10 images de référence, modifications locales et sortie 2K. Ces capacités sont annoncées par Qwen et n’ont pas été testées par ChinaAPI. Les poids sont soumis à la Qwen Research License, limitée à la recherche et à l’évaluation non commerciales sans licence commerciale distincte. Alibaba Model Studio n’a publié ni identifiant API ni tarif pour Qwen-Image-2.1, et ChinaAPI ne propose pas cette route ; aucune page modèle ni aucun tarif ChinaAPI n’est publié.
2026-09-20
Absent de ChinaAPI confirmé
DeepSeek a publié DeepSeek-V4.1-Flash et ouvert ses poids le 2026-09-10. Ce modèle natif image-texte est un Mixture-of-Experts de 552B paramètres fondé sur une nouvelle architecture Causal Encoder-Decoder : 8B paramètres sont activés pendant le prefill d’entrée et 16B pendant le decode de sortie, avec un contexte de 1M et jusqu’à 384K en sortie. Selon DeepSeek, les évaluations du fournisseur dépassent V4 Pro et le nouveau KV Cache n’utilise que 1/4 de la HBM et 1/8 du stockage SSD requis par la précédente V4 Flash. Il s’agit d’affirmations du fournisseur, pas de tests ChinaAPI. L’ID de l’API DeepSeek directe est deepseek-flash. Les checkpoints autonomes V4 Flash et Vision-Exp ont été retirés, mais leurs anciens model IDs sont temporairement redirigés vers V4.1 Flash. Le live catalog de ChinaAPI expose désormais l’ID canonique deepseek-flash à la place des deux anciens ID Flash ; les deux URL marketing Flash retirées redirigent vers sa page modèle canonique. Hors pointe, l’entrée coûte $0.15/M, la sortie $0.60/M et le cache read $0.003/M ; pendant les pointes des jours ouvrés à Pékin, les tarifs sont exactement doublés à $0.30/M, $1.20/M et $0.006/M. Le live ChinaAPI Gateway fait foi. DeepSeek avait également annoncé qu’après le 2026-09-14, les appels directs à deepseek-v4-pro seraient redirigés vers V4.1 Flash, avant de renoncer à ce projet : DeepSeek V4 Pro reste disponible après cette date avec une facturation inchangée, et deepseek-v4-pro demeure une route ChinaAPI distincte.
2026-09-10
✓ Disponible sur ChinaAPI confirmé
Tencent Hunyuan AuK and AuK-Flash open source
Tencent Hunyuan a publié en open source AuK et AuK-Flash le 2026-09-09. AuK est un modèle de fondation de 1.5B paramètres pour la génération et l’édition de la parole, entraîné avec 1.95 million d’heures de supervision effective couvrant cinq familles : génération vocale, édition de contenu, amélioration et séparation, édition paralinguistique et édition acoustique. Une interface commune d’instructions en langage naturel prend en charge le TTS zero-shot et instruction-based, l’édition de parole et de paroles chantées, les changements de pitch, speed et volume, l’édition de l’emotion et du timbre, la suppression d’accent, les sons non verbaux, l’amélioration vocale et la séparation de sources. AuK-Flash est une variante distillée en 4 steps ; l’article annonce une accélération wall-clock de 4.5x face à AuK dans des conditions identiques, mais il s’agit d’un résultat fournisseur et non d’un test ChinaAPI. Les deux dépôts officiels proposent des poids téléchargeables sous licence MIT et utilisent Qwen2.5-Omni-3B comme encoder externe. Le code officiel et SGLang-Omni documentent l’inférence self-hosted, mais ChinaAPI n’expose actuellement aucun Route AuK appelable par les clients ; aucun prix API ni Model Page n’est donc publié.
2026-09-09
Absent de ChinaAPI confirmé

Tencent Hy Team a publié les poids ouverts de Hy4 preview le 2026-08-28. Son backbone Mixture-of-Experts compte 770B paramètres, dont 49B sont activés par token, avec une couche MTP native supplémentaire de 10B pour le décodage spéculatif. Ce modèle texte prend en charge un contexte de 1M et dispose de deux dépôts officiels de poids : le checkpoint original et une variante FP8. Tencent documente un service OpenAI-compatible avec vLLM et SGLang ; la matrice SGLang officielle comprend FP8 sur 8x B200 ou 4x B300/GB300 et BF16 sur 16x H200. Distribué sous Apache-2.0, le modèle vise le Software Engineering de longue durée, l’analyse bureautique, le Game Development et la Scientific Research. Les évaluations publiées sont celles du fournisseur, pas des tests ChinaAPI. ChinaAPI propose désormais la Route hy4-preview, une Model Page dédiée et une analyse du Deployment et des coûts ; le catalogue en temps réel fait foi pour le prix actuel.
2026-08-28
✓ Disponible sur ChinaAPI confirmé
Z.ai a publié et ouvert les poids de GLM-5.3-Flash (320B-A18B) le 2026-08-27, premier modèle multimodal natif de la famille GLM-5. Il accepte le texte, les images, la vidéo et les fichiers, avec un contexte de 1 M et une sortie maximale de 128 K. Son API officielle Chat Completion conserve le raisonnement activé et prend en charge Function Calling, Context Caching et Structured Output. Son architecture à faible coût combine Sparse Attention et Linear Attention avec Manifold-Constrained Hyper-Connections. Selon Z.ai, le modèle a été préentraîné sur 30T tokens multimodaux et réduit, par rapport à GLM-5.3, le calcul d'Attention d'un facteur 3,01 et le KV Cache moyen par couche d'un facteur 4,44. Z.ai annonce aussi un score de 57 à l'Artificial Analysis Intelligence Index et des performances Coding comparables à Claude Opus 4.8 ; ce sont des déclarations du fournisseur, pas des tests ChinaAPI. La Route glm-5.3-flash est désormais accessible sur ChinaAPI via des Endpoint OpenAI-compatible et Anthropic-compatible avec des entrées texte, image et vidéo.
2026-08-27
✓ Disponible sur ChinaAPI confirmé
Qwen a publié Qwen3.8-Flash-Next le 2026-08-26 comme preview MoE multimodale de l’architecture Qwen4. Le modèle principal compte 125B paramètres, les N-gram Embedding 51B et le MTP 4B, avec 6B activés par token. Le contexte natif de 262K s’étend à 1M avec YaRN. vLLM mesure les checkpoints officiels BF16/FP8 à 335.28GiB/172.78GiB, valide 2x GB300 comme minimum FP8 et annonce environ 1,430 tokens/s en sortie à une concurrency de 64 sur 4x H100 avec déport N-gram en mémoire hôte, sur une charge aléatoire de 1,024 tokens d’entrée et 256 de sortie. Le lancement sur un seul DGX Spark 128GB utilise un NVFP4 tiers et des adaptations spécifiques : ce n’est pas le minimum officiel. Qwen Community License 1.0 exige une licence distincte pour un MaaS commercial ou un AI Work Assistant défini par la licence. La route ChinaAPI qwen3.8-flash est fondée sur Flash-Next sans être présentée comme identique aux poids preview.
2026-08-26
✓ Disponible sur ChinaAPI confirmé
DeepSeek DeepSeek-V4-Flash-Vision-Exp
LLM DeepSeek V4 Flash Vision Source · api-docs.deepseek.com
DeepSeek a lancé DeepSeek-V4-Flash-Vision-Exp sur sa plateforme API le 2026-08-21 en tant que modèle autonome et expérimental de compréhension visuelle. Il s'appelle avec model='deepseek-v4-flash-vision-exp' et accepte des entrées mixtes texte-image via les API OpenAI-compatible Chat Completions et Responses, ainsi que l'API Messages compatible Anthropic. Les images JPEG, PNG, GIF et WebP peuvent être transmises en base64, par URL publique ou via Files API. Le contexte atteint 1 M et la sortie maximale 384 K ; les modes avec et sans raisonnement, JSON Output et Tool Calls sont pris en charge, mais pas FIM. Selon DeepSeek, ses capacités Agent, de raisonnement et de connaissances en texte seul égalent celles de la version officielle DeepSeek-V4-Flash, tandis que les résultats Agent visuels progressent nettement ; il s'agit d'affirmations du fournisseur, pas de tests ChinaAPI. Chaque image est convertie en 384 tokens au maximum et suit les tarifs officiels de V4-Flash. La route deepseek-v4-flash-vision-exp était accessible sur ChinaAPI lors de sa sortie ; elle a depuis été retirée du live catalog au profit de deepseek-flash, et son ancienne URL marketing redirige vers la page canonique.
2026-08-21
Absent de ChinaAPI confirmé
Alibaba Qwen Qwen3.8 open weights: 27B and 2.4T-A95B
Qwen a publié deux spécifications Qwen3.8 déployables et quatre dépôts officiels de poids. Qwen3.8-27B et Qwen3.8-27B-FP8 sont deux variantes de précision d’un même modèle dense natif de vision et de langage. Qwen3.8-2.4T-A95B et son dépôt FP8 sont deux variantes d’un même modèle Mixture-of-Experts texte avec 95B paramètres actifs. Les deux spécifications prennent en charge un contexte natif de 262K et disposent de procédures documentées d’auto-hébergement. La version 27B est sous Apache-2.0 ; la version 2.4T utilise la licence personnalisée Qwen3.8-Max License, avec des obligations d’affichage et des conditions pour les activités MaaS ou AI Work Assistant à chiffre d’affaires élevé. Le catalogue ChinaAPI propose désormais les routes qwen3.8-27b et qwen3.8-2.4t-a95b aux clients ; cela ne garantit pas qu’elles soient identiques octet pour octet aux poids téléchargeables. Consultez le catalogue pour les tarifs actuels.
2026-08-14
✓ Disponible sur ChinaAPI confirmé
Z.ai a publié GLM-5.3 le 2026-08-14 et l’a déployé pour tous les utilisateurs de GLM Coding Plan. Il reprend le même modèle de base que GLM-5.2, tous les progrès provenant du post-entraînement. Ce modèle texte prend en charge un contexte de 1 M et une sortie maximale de 128 K ; le raisonnement est toujours activé, avec les niveaux reasoning_effort low, high et max. Z.ai annonce un gain de 50 % par rapport à GLM-5.2 sur son test interne Z.ai Code Bench ainsi que de meilleurs résultats sur des benchmarks publics de code et de cybersécurité ; il s’agit d’affirmations du fournisseur, pas de tests ChinaAPI. L’API officielle du modèle est désormais disponible et la route glm-5.3 est accessible sur ChinaAPI via une interface compatible OpenAI. Pour migrer depuis une configuration où le raisonnement était désactivé, le guide officiel recommande de l’activer et de régler reasoning_effort sur low avant de changer le model ID ; sinon la requête échoue.
2026-08-14
✓ Disponible sur ChinaAPI confirmé
DeepSeek a mis à jour l’alias API deepseek-v4-pro existant pour servir DeepSeek-V4-Pro-0813. Lors de la sortie, la méthode d’appel et le model ID restaient inchangés : les requêtes deepseek-v4-pro recevaient cette version. La page officielle de démarrage rapide confirmait aussi qu’à l’époque deepseek-v4-flash correspondait à DeepSeek-V4-Flash-0731. Il s’agissait d’un changement de version servie, pas d’une nouvelle route API. DeepSeek a ensuite renoncé au basculement prévu de deepseek-v4-pro vers V4.1 Flash ; V4 Pro reste disponible après le 2026-09-14 avec une facturation inchangée, de sorte que les intégrations ChinaAPI existantes peuvent conserver le même model ID.
2026-08-13
✓ Disponible sur ChinaAPI confirmé
Alibaba Cloud a publié qwen3.8-max le 2026-08-03 comme le modèle phare Qwen le plus performant à ce jour. Ce modèle natif de vision et de langage repose sur une architecture Mixture-of-Experts de 2.4T paramètres, prend en charge le raisonnement, la génération de texte et la compréhension visuelle, et progresse nettement par rapport à la série Qwen3.7. La documentation officielle de Model Studio indique des accès OpenAI-compatible, Anthropic-compatible et DashScope à Pékin et dans plusieurs régions mondiales. Cette route est désormais disponible via ChinaAPI.
2026-08-03
✓ Disponible sur ChinaAPI confirmé

MiniMax a publié H3 (Hailuo 3.0). Les notes de version officielles le décrivent comme un modèle vidéo multimodal généraliste ouvert de nouvelle génération, qui comprend l'intention créative à partir du contexte texte, image, vidéo et audio et produit des générations plus naturelles et cohérentes. ChinaAPI dessert la route pour des clips de 4 à 15 secondes en 768P et 2K avec audio stéréo natif en une seule passe, facturés à la seconde de sortie et appelables via l'endpoint vidéo OpenAI-compatible.
2026-07-31
✓ Disponible sur ChinaAPI confirmé
ByteDance Doubao-Seedance-2.5
Vidéo Seedance 2.5 Source · console.volcengine.com
Le catalogue de modèles Ark de Volcano Engine répertorie Doubao-Seedance-2.5 sous le model ID doubao-seedance-2-5-260628. Sorti le 2026-07-31, ce modèle vidéo peut produire jusqu’à 30 secondes, accepter jusqu’à 50 éléments de référence (30 images, 10 vidéos et 10 extraits audio), et prendre en charge les références multimodales, le montage, la prolongation vidéo et la génération dans plus de 10 langues. 260628 reste l’étiquette de version du modèle. ChinaAPI propose désormais cette route aux clients ; consultez le catalogue pour les tarifs actuels.
2026-07-31
✓ Disponible sur ChinaAPI confirmé
DeepSeek DeepSeek-V4-Flash-0731
LLM DeepSeek V4 Flash Source · api-docs.deepseek.com
DeepSeek a mis à niveau la route API deepseek-v4-flash existante avec un checkpoint réentraîné en post-entraînement, sans changer l’architecture ni la taille du modèle preview, tout en renforçant ses capacités de code et d’agent. Avec l’effort de raisonnement maximal et un harness minimal encore inédit, DeepSeek annonce 82,7 sur Terminal Bench 2.1, 54,4 sur DeepSWE et 70,3 sur Toolathlon Verified ; il s’agit de résultats du fournisseur, pas de tests ChinaAPI. La route officielle prend désormais en charge nativement la Responses API et l’intégration Codex ; le web, l’application mobile et l’API V4-Pro ne sont pas concernés par cette mise à jour.
2026-07-31
Absent de ChinaAPI confirmé
Alibaba Cloud Qwen3.7-Flash
Alibaba Cloud a publié son modèle Flash natif de vision et de langage, avec 1 M de contexte et jusqu’à 131 K en sortie. Par rapport à Qwen3.6-Flash, il améliore la compréhension multimodale, la perception du monde réel et de l’espace, l’exécution par Search Agent et CI Agent, ainsi que le code multimodal. Le modèle officiel accepte le texte, les images et la vidéo, et propose des outils intégrés via la Responses API. ChinaAPI propose désormais qwen3.7-flash aux clients ; consultez le catalogue pour les tarifs actuels.
2026-07-25
✓ Disponible sur ChinaAPI confirmé
Moonshot a présenté son modèle phare de 2,8 billions de paramètres, avec 1 M de contexte, raisonnement continu et compréhension native des images et des vidéos. Les poids open source sont annoncés pour le 27 juillet 2026.
2026-07-16
✓ Disponible sur ChinaAPI confirmé
Tencent a officiellement publié Hy3, un modèle hybride de pensée rapide et lente avec 256K de contexte, une stabilité et une efficacité de coût améliorées.
2026-07-06
✓ Disponible sur ChinaAPI confirmé

Meituan a publié son modèle ouvert de raisonnement MoE avec 1 M de contexte pour les agents de code et l'utilisation d'outils sur de longues séquences.
2026-06-30
✓ Disponible sur ChinaAPI confirmé
Vidéo HappyHorse
Modèle de passerelle HappyHorse 1.1 de texte-vers-vidéo avec meilleure compréhension sémantique et contrôle de la caméra.
2026-06-22
✓ Disponible sur ChinaAPI confirmé
Vidéo HappyHorse
Modèle de passerelle HappyHorse 1.1 de référence-vers-vidéo pour préserver la cohérence du sujet, de la scène et du style avec plusieurs références.
2026-06-22
✓ Disponible sur ChinaAPI confirmé
Vidéo HappyHorse
Modèle de passerelle HappyHorse 1.1 d'image-vers-vidéo avec texture et cohérence d'identité renforcées.
2026-06-22
✓ Disponible sur ChinaAPI confirmé
Un modèle phare GLM ouvert avec 1 M de contexte et des capacités renforcées pour le code et les workflows d'agents de longue durée.
2026-06-16
✓ Disponible sur ChinaAPI confirmé
Variante de passerelle Kimi K2.7 haute vitesse pour le code et les tâches d'agents à faible latence.
2026-06-12
✓ Disponible sur ChinaAPI confirmé
Modèle de passerelle Kimi centré sur le code et le travail de longue durée sur des dépôts, avec prise en charge visuelle.
2026-06-12
✓ Disponible sur ChinaAPI confirmé
Reconnaissance vocale MiMo pour l'alternance chinois-anglais, le cantonais, les dialectes wu, minnan et sichuanais, les enregistrements bruités ou distants, les locuteurs qui se chevauchent et les paroles.
2026-06-02
✓ Disponible sur ChinaAPI confirmé
Modèle de passerelle Qwen multimodal pour l'analyse visuelle, la planification, les fichiers et l'utilisation d'outils.
2026-06-01
✓ Disponible sur ChinaAPI confirmé
Modèle natif multimodal de la série M avec 1 M de contexte, attention MSA et prise en charge du code, des agents, des images et de la vidéo en entrée.
2026-06-01
✓ Disponible sur ChinaAPI confirmé

Modèle de passerelle StepFun rapide avec 256K de contexte, entrée visuelle, raisonnement et utilisation d'outils.
2026-05-28
✓ Disponible sur ChinaAPI confirmé
Meituan LongCat-Video-Avatar 1.5
Vidéo LongCat Video Source · arxiv.org
Publication technique sur la vidéo d'avatar pilotée par l'audio, centrée sur la synchronisation labiale, la cohérence d'identité et la génération de longues vidéos.
2026-05-26
Absent de ChinaAPI confirmé
Modèle de passerelle Qwen phare pour l'analyse exigeante, le code et les workflows d'agents en production.
2026-05-21
✓ Disponible sur ChinaAPI confirmé

Modèle d'agent MiMo de 1,02 billion de paramètres, avec 1 M de contexte, pour le code exigeant et les tâches de longue durée.
2026-04-27
✓ Disponible sur ChinaAPI confirmé
Modèle MiMo nativement omnimodal avec 1 M de contexte et compréhension du texte, des images, de la vidéo et de l'audio.
2026-04-27
✓ Disponible sur ChinaAPI confirmé
Wan 2.7 image-vers-vidéo avec contrôle de la première et de la dernière image, continuation, audio moteur et sortie 720P/1080P.
2026-04-25
✓ Disponible sur ChinaAPI confirmé
DeepSeek deepseek-v4-flash
Variante rapide de DeepSeek V4 pour le chat efficace, l'assistance au code et les boucles d'agents.
2026-04-24
Absent de ChinaAPI confirmé
Synthèse vocale expressive MiMo avec voix premium intégrées et contrôle en langage naturel du débit, de l'émotion, du ton, du dialecte et de l'interprétation du personnage.
2026-04-23
✓ Disponible sur ChinaAPI confirmé
Modèle Kimi natif multimodal et ouvert pour le code de longue durée, le design visuel et les workflows d'essaims d'agents.
2026-04-14
✓ Disponible sur ChinaAPI confirmé
Zhipu AI GLM-5V-Turbo
Modèle de fondation multimodal pour le code avec 200K de contexte, destiné aux images, vidéos, fichiers, agents GUI et workflows pilotés par outils.
2026-04-07
Absent de ChinaAPI confirmé
Modèle Wan 2.7 d'édition vidéo en langage naturel pour les retouches locales et globales et le remplacement d'éléments.
2026-04-03
✓ Disponible sur ChinaAPI confirmé
Vidéo Wan
Modèle Wan 2.7 de texte-vers-vidéo pour la génération pilotée par prompt.
2026-04-03
✓ Disponible sur ChinaAPI confirmé
Vidéo Wan
Modèle Wan 2.7 de référence-vers-vidéo pour une génération contrôlée à partir de références visuelles.
2026-04-03
✓ Disponible sur ChinaAPI confirmé
Wan 2.7 Pro pour la génération et l'édition d'images, avec contrôle des couleurs de marque, cohérence multi-références et sortie jusqu'à 4096×4096.
2026-04-01
✓ Disponible sur ChinaAPI confirmé
Modèle d'image Wan 2.7 pour le texte-vers-image, l'édition, la génération multi-références et un meilleur rendu de texte.
2026-04-01
✓ Disponible sur ChinaAPI confirmé

Modèle MiniMax à poids ouverts pour le chat, le code, le travail bureautique et les tâches agentiques.
2026-03
✓ Disponible sur ChinaAPI estimé

Alibaba Qwen3.5
Sortie Qwen native multimodale orientée agents, antérieure aux modèles Qwen 3.6 et 3.7 servis par la passerelle.
2026-02-16
Absent de ChinaAPI confirmé
StepFun Step-3.5-Flash
Modèle flash StepFun ouvert avec 256K de contexte et prise en charge de l'utilisation d'outils. ChinaAPI propose step-3.5-flash aux clients ; consultez le catalogue pour les tarifs actuels.
2026-02-01
✓ Disponible sur ChinaAPI confirmé

Modèle d'image Seedream 5.0-lite avec création contrôlable, récupération et meilleure cohérence du sujet.
2026-01-28
✓ Disponible sur ChinaAPI confirmé
Modèle phare de génération vidéo Seedance 2.0 facturé selon la résolution de sortie.
2026-01-28
✓ Disponible sur ChinaAPI confirmé
MiniMax a publié Speech 2.8 avec des balises sonores natives, un clonage de voix amélioré, un audio de qualité studio et une parole interlingue ; Turbo privilégie la vitesse.
2026-01-23
✓ Disponible sur ChinaAPI confirmé
MiniMax a publié Speech 2.8 avec des balises sonores natives, un clonage de voix amélioré, un audio de qualité studio et une parole interlingue ; HD est l'option haute fidélité.
2026-01-23
✓ Disponible sur ChinaAPI confirmé
Moonshot kimi-k2.5
Modèle d'agent Kimi ouvert, natif multimodal, avec 256K de contexte et entraînement vision-langage.
2026-01-01
Absent de ChinaAPI confirmé

Zhipu AI GLM-ASR-2512
Audio GLM Audio Source · docs.z.ai
Z.AI a publié son modèle ASR multilingue avec une meilleure prise en charge des dictionnaires personnalisés et de la terminologie spécialisée.
2025-12-10
Absent de ChinaAPI confirmé
Meituan LongCat-Image
Petit modèle de génération d'images qui privilégie la qualité des données plutôt que la taille du modèle.
2025-12
Absent de ChinaAPI confirmé

Alibaba a publié Qwen3-TTS-Flash pour la synthèse vocale hors ligne, avec voix expressives, sortie multilingue et dialectale, et accès API à faible latence.
2025-09-22
✓ Disponible sur ChinaAPI confirmé

Synthèse vocale contextuelle avec directives globales et en ligne en langage naturel, rendu expressif et sortie directe /v1/audio/speech compatible OpenAI.
Date de sortie publique non confirmée
✓ Disponible sur ChinaAPI inconnu
Transcription streaming rapide 4B MTP pour l'audio chinois-anglais, avec normalisation ITN et route de transcription compatible OpenAI.
Date de sortie publique non confirmée
✓ Disponible sur ChinaAPI inconnu
StepFun Step TTS Mini
Synthèse vocale multilingue économique avec voix officielles et clonées, mappage de prononciation et contrôles de style.
Date de sortie publique non confirmée
Absent de ChinaAPI inconnu
Synthèse vocale expressive avec voix officielles et clonées, mappage de prononciation, contrôles de style et sortie compatible OpenAI.
Date de sortie publique non confirmée
✓ Disponible sur ChinaAPI inconnu
Synthèse vocale expressive et contextuelle avec sortie en streaming et contrôles de la voix, de la vitesse et du volume.
Date de sortie publique non confirmée
✓ Disponible sur ChinaAPI inconnu