Alibaba Cloud lanzó qwen3.8-max el 2026-08-03 como el modelo insignia Qwen más capaz hasta la fecha. El modelo nativo de visión y lenguaje usa una arquitectura Mixture-of-Experts de 2.4T parámetros, admite razonamiento, generación de texto y comprensión visual y mejora significativamente frente a la serie Qwen3.7. La documentación oficial de Model Studio enumera acceso OpenAI-compatible, Anthropic-compatible y DashScope en Pekín y varias regiones globales. Esta ruta ya está disponible mediante ChinaAPI.
Muro de actualización del modelo
Cronograma de lanzamiento del modelo de IA de China.
Un análisis detallado de los lanzamientos de modelos de IA chinos. Las fechas provienen de las fuentes de los proveedores vinculados; la disponibilidad de ChinaAPI se muestra en cada entrada como un estado secundario. En los datos de origen se indican 3 fechas estimadas y 5 fechas desconocidas.
Más recientes primero
Muro de liberación.
MiniMax lanzó H3 (Hailuo 3.0). Las notas de lanzamiento oficiales lo describen como un modelo de vídeo multimodal de propósito general, abierto y de nueva generación, que entiende la intención creativa a partir del contexto de texto, imagen, vídeo y audio y ofrece generaciones más naturales y coherentes. ChinaAPI sirve la ruta para clips de 4 a 15 segundos en 768P y 2K con audio estéreo nativo en una sola pasada, facturados por segundo de salida y llamables a través del endpoint de vídeo OpenAI-compatible.
El catálogo de modelos Ark de Volcano Engine incluye Doubao-Seedance-2.5 con el model ID doubao-seedance-2-5-260628. Lanzado el 2026-07-31, el modelo puede generar vídeos de hasta 30 segundos, aceptar hasta 50 recursos de referencia (30 imágenes, 10 vídeos y 10 clips de audio) y admitir referencias multimodales, edición y extensión de vídeo, así como generación en más de 10 idiomas. 260628 sigue siendo la etiqueta de versión del modelo. ChinaAPI aún no ha verificado esta ruta para llamadas de clientes, por lo que todavía no publica una página del modelo ni precios.
DeepSeek actualizó la ruta API deepseek-v4-flash existente con un checkpoint sometido a un nuevo posentrenamiento. Mantiene la arquitectura y el tamaño del modelo Preview, pero refuerza las capacidades de programación y Agent. Con el máximo esfuerzo de razonamiento y un minimal harness aún no publicado, DeepSeek informa 82.7 en Terminal Bench 2.1, 54.4 en DeepSWE y 70.3 en Toolathlon Verified; son resultados del proveedor, no pruebas de ChinaAPI. La ruta oficial ahora admite de forma nativa Responses API y la integración con Codex; la web de DeepSeek, la aplicación móvil y V4-Pro API no formaron parte de esta actualización.
Alibaba Cloud lanzó su modelo Flash nativo de visión y lenguaje, con contexto de 1M y salida de hasta 131K. Frente a Qwen3.6-Flash, mejora la comprensión multimodal, la percepción del mundo real y espacial, la ejecución de Search Agent y CI Agent y la programación multimodal. El modelo oficial admite texto, imágenes y vídeo y ofrece herramientas integradas mediante Responses API. Esta ruta todavía no figura en el gateway de ChinaAPI.
Moonshot lanzó su 2.8T-parameter producto estrella con 1M contexto, razonamiento siempre activo y comprensión nativa de imágenes y videos. Los pesos de código abierto anunciados deben estar disponibles para July 27, 2026 .
Tencent lanzó oficialmente Hy3 , un modelo híbrido de pensamiento rápido y lento con 256K-context que ofrece mayor estabilidad y eficiencia en costes.
Meituan lanzó su modelo de razonamiento abierto MoE con un contexto 1M para agentes de codificación y uso de herramientas a largo plazo.
Modelo Doubao Seed 2.1 de baja latencia para flujos de trabajo de agentes de razonamiento, codificación y producción multimodales.
Doubao Seed 2.1 el modelo insignia para el razonamiento multimodal, la codificación, el uso de herramientas y las tareas de agentes a largo plazo.
HappyHorse 1.1 es un modelo de puerta de enlace de texto a vídeo con comprensión semántica y control de cámara mejorados.
HappyHorse 1.1 es un modelo de puerta de enlace de referencia a vídeo para lograr coherencia en temas, escenas y estilos con múltiples referencias.
Modelo de puerta de enlace de imagen a vídeo HappyHorse 1.1 con mayor consistencia de textura e identidad.
Producto estrella de código abierto GLM con 1M contexto y flujos de trabajo de agentes y codificación de largo plazo más robustos.
Modelo de minivídeo Fast Seedance 2.0 para la generación de vídeos cortos a menor coste.
Variante de puerta de enlace Kimi K2.7 de alta velocidad para tareas de codificación y agentes con menor latencia.
Modelo de puerta de enlace Kimi centrado en la codificación para el trabajo con repositorios a largo plazo con soporte de visión artificial.
Reconocimiento de voz MiMo para alternancia de códigos chino-inglés, cantonés, dialectos wu, minnan y sichuan, grabaciones ruidosas y de campo lejano, hablantes superpuestos y letras de canciones.
Modelo de puerta de enlace Qwen multimodal para análisis visual, planificación, archivos y uso de herramientas.
Modelo multimodal nativo de la serie M con contexto 1M , atención MSA, codificación, agente, soporte para entrada de imágenes y vídeo.
Modelo de puerta de enlace Fast StepFun con 256K de contexto, entrada visual, razonamiento y uso de herramientas.
Lanzamiento técnico de vídeo con avatares controlados por audio, centrado en la sincronización labial, la coherencia de la identidad y la generación de vídeos de larga duración.
Modelo insignia de Qwen para flujos de trabajo exigentes de agentes de análisis, codificación y producción.
Qwen 3.6 es un modelo rápido de visión y lenguaje para el razonamiento visual, archivos y flujos de trabajo de agentes.
Modelo de agente MiMo 1.02T-parameter con 1M de contexto para tareas de codificación exigentes y de largo plazo.
Modelo MiMo omnimodal nativo con 1M de contexto y comprensión de texto, imagen, vídeo y audio.
Convertidor de imagen a vídeo Wan 2.7 con control de primer/último fotograma, continuación, control de audio y salida 720P / 1080P .
Variante insignia de DeepSeek V4 con un total 1.6T de parámetros y un contexto 1M-token .
Variante rápida de DeepSeek V4 para chat eficiente, asistencia en codificación y bucles de agentes.
MiMo ofrece una función expresiva de conversión de texto a voz con voces integradas de alta calidad y control del lenguaje natural sobre el ritmo, la emoción, el tono, el dialecto y la interpretación de los personajes.
Modelo Kimi multimodal nativo abierto para codificación a largo plazo, diseño visual y flujos de trabajo basados en enjambres de agentes.
200K-context modelo de base de codificación multimodal para flujos de trabajo basados en imágenes, vídeo, archivos, GUI y herramientas.
Wan 2.7 es un modelo de edición de vídeo en lenguaje natural para ediciones locales/globales y sustitución de elementos.
Modelo Wan 2.7 de conversión de texto a vídeo para la generación de vídeos a partir de indicaciones.
Modelo Wan 2.7 de referencia a vídeo para la generación controlada a partir de referencias visuales.
Actualización de GLM para tareas de mayor alcance, agentes de codificación y razonamiento híbrido.
Generación y edición de imágenes Wan 2.7 Pro con control de color de marca, consistencia multirreferencia y salida de hasta 4096 × 4096 .
Modelo de imagen Wan 2.7 para conversión de texto a imagen, edición, generación de múltiples referencias y una representación de texto más robusta.
Variante MiniMax de alta velocidad para flujos de trabajo de codificación y agentes con baja latencia.
Modelo MiniMax de peso abierto para chat, programación, trabajo de oficina y tareas de agente.
Versión nativa de Qwen con agente multimodal que precedió a los modelos de puerta de enlace Qwen 3.6 y 3.7 .
Variante turbo eficiente GLM-5 para un razonamiento, codificación y trabajo de agentes más rápidos.
Versión GLM-5 para flujos de trabajo de codificación, razonamiento y agentes.
Variante Kling 3.0 Omni para flujos de trabajo de edición y referencia de vídeo.
Kling 3.0 ofrece conversión de texto a vídeo, imagen a vídeo, audio y niveles de salida de 720p a 4K .
Ruta Turbo de Kling 3.0 rápida para la generación de vídeo con audio de menor latencia.
Modelo flash StepFun abierto con soporte para contexto de 256K y uso de herramientas.
Modelo de imagen Seedream 5.0-lite con creación y recuperación controlables, y mayor coherencia del sujeto.
Opción de generación de vídeo Fast Seedance 2.0 para obtener clips rentables.
Seedance 2.0 el modelo insignia de generación de vídeo, factura según la resolución de salida.
MiniMax lanzó Speech 2.8 con etiquetas de sonido nativas, clonación de voz mejorada, audio de calidad de estudio y reconocimiento de voz multilingüe; Turbo es su opción centrada en la velocidad.
MiniMax lanzó Speech 2.8 con etiquetas de sonido nativas, clonación de voz mejorada, audio con calidad de estudio y reconocimiento de voz multilingüe; HD es su opción de alta fidelidad.
Alibaba agregó el modo OpenAI-compatible a Qwen3-ASR-Flash , conservando la transcripción multilingüe, ITN y la compatibilidad con transmisión.
Modelo de agente Kimi multimodal nativo abierto con 256K contextos y entrenamiento en visión y lenguaje.
Z.AI ha lanzado su modelo ASR multilingüe con soporte mejorado para diccionarios personalizados y reconocimiento de terminología especializada.
Modelo pequeño de generación de imágenes que prioriza la calidad de los datos sobre el tamaño del modelo.
Ruta rápida de Hailuo 2.3 para la generación de imágenes a vídeo a menor coste.
Hailuo 2.3 mejora el movimiento complejo, las acciones físicas, la estilización y el rendimiento en microexpresiones.
Alibaba lanzó Qwen3-TTS-Flash para la síntesis de voz sin conexión con voces expresivas, salida multilingüe y en diferentes dialectos, y acceso a la API de baja latencia.
Modelo de vídeo Budget Hailuo 02 para la generación de vídeo a partir de texto e imagen desde 512p .
Texto a voz sensible al contexto con dirección global y en línea en lenguaje natural, entrega expresiva y salida directa OpenAI-compatible /v1/audio/speech .
Transcripción rápida en streaming 4B para audio chino-inglés con normalización ITN y OpenAI-compatible ruta de transcripción.
Síntesis de voz multilingüe rentable con voces oficiales y clonadas, mapeo de pronunciación y controles de estilo.
Síntesis de voz expresiva con voces oficiales y clonadas, mapeo de pronunciación, controles de estilo y salida OpenAI-compatible .
Síntesis de voz expresiva sensible al contexto con salida en tiempo real y controles de voz, velocidad y volumen.
