A Alibaba Cloud lançou qwen3.8-max em 2026-08-03 como o modelo principal Qwen mais capaz até hoje. O modelo nativo de visão e linguagem usa uma arquitetura Mixture-of-Experts com 2.4T parâmetros, oferece raciocínio, geração de texto e compreensão visual e traz melhorias significativas sobre a série Qwen3.7. A documentação oficial do Model Studio lista acesso OpenAI-compatible, Anthropic-compatible e DashScope em Pequim e em várias regiões globais. Esta rota agora está disponível pela ChinaAPI.
Painel de atualização do modelo
Cronograma de lançamento do modelo de IA da China.
Uma lista de lançamentos de modelos de IA chineses baseada em dados. As datas provêm das fontes dos fornecedores; a disponibilidade na ChinaAPI é exibida em cada entrada como um status secundário. 3 datas estimadas e 5 datas desconhecidas estão sinalizadas nos dados de origem.
Mais recentes primeiro
Solte a parede.
A MiniMax lançou o H3 (Hailuo 3.0). As notas de lançamento oficiais o descrevem como um modelo de vídeo multimodal de uso geral, aberto e de nova geração, que entende a intenção criativa a partir de contexto de texto, imagem, vídeo e áudio e entrega gerações mais naturais e coerentes. A ChinaAPI atende a rota para clipes de 4 a 15 segundos em 768P e 2K com áudio estéreo nativo em uma única passada, cobrados por segundo de saída e chamáveis pelo endpoint de vídeo OpenAI-compatible.
O catálogo de modelos Ark da Volcano Engine lista Doubao-Seedance-2.5 com o model ID doubao-seedance-2-5-260628. Lançado em 2026-07-31, o modelo pode gerar vídeos de até 30 segundos, aceitar até 50 materiais de referência (30 imagens, 10 vídeos e 10 clipes de áudio) e oferecer referência multimodal, edição e extensão de vídeo, além de geração em mais de 10 idiomas. 260628 continua sendo a etiqueta de versão do modelo. A ChinaAPI ainda não verificou esta rota para chamadas de clientes; por isso, a página do modelo e o preço ainda não foram publicados.
A DeepSeek atualizou a rota de API deepseek-v4-flash existente com um checkpoint submetido a novo pós-treinamento. A arquitetura e o tamanho do modelo Preview foram mantidos, com reforço nas capacidades de programação e Agent. Com esforço máximo de raciocínio e um minimal harness ainda não publicado, a DeepSeek informa 82.7 no Terminal Bench 2.1, 54.4 no DeepSWE e 70.3 no Toolathlon Verified; são resultados do fornecedor, não testes da ChinaAPI. A rota oficial agora oferece suporte nativo à Responses API e à integração com o Codex; web da DeepSeek, aplicativo móvel e V4-Pro API não fizeram parte desta atualização.
A Alibaba Cloud lançou seu modelo Flash nativo de visão e linguagem, com contexto de 1M e saída de até 131K. Em relação ao Qwen3.6-Flash, ele aprimora a compreensão multimodal, a percepção do mundo real e espacial, a execução de Search Agent e CI Agent e a programação multimodal. O modelo oficial aceita texto, imagem e vídeo e oferece ferramentas integradas pela Responses API. Esta rota ainda não está listada no gateway da ChinaAPI.
Moonshot lançou seu 2.8T-parameter carro-chefe com 1M contexto, raciocínio sempre ativo e compreensão nativa de imagens e vídeos. Os pesos de código aberto anunciados devem ser disponibilizados até July 27, 2026 .
A Tencent lançou oficialmente Hy3 , um modelo híbrido de pensamento rápido e lento com 256K-context que oferece maior estabilidade e custo-benefício.
A Meituan lançou seu modelo de raciocínio MoE aberto com 1M contextos para agentes de codificação e uso de ferramentas de longo prazo.
Modelo Doubao Seed 2.1 de baixa latência para fluxos de trabalho de agentes de raciocínio multimodal, codificação e produção.
Modelo principal Doubao Seed 2.1 para raciocínio multimodal, codificação, uso de ferramentas e tarefas de agentes de longo prazo.
HappyHorse 1.1 é um modelo de gateway de texto para vídeo com compreensão semântica aprimorada e controle de câmera.
HappyHorse 1.1 é um modelo de gateway de referência para vídeo que garante consistência em relação a assunto, cena e estilo em múltiplas referências.
Modelo de gateway de imagem para vídeo HappyHorse 1.1 com maior consistência de textura e identidade.
Plataforma de código aberto de referência GLM com 1M contexto e fluxos de trabalho de codificação e agentes de longo prazo mais robustos.
Fast Seedance 2.0 é um modelo de minivídeo para geração de conteúdo de curta duração a baixo custo.
Variante de gateway Kimi K2.7 de alta velocidade para codificação de baixa latência e tarefas de agentes.
Modelo de gateway Kimi focado em codificação para trabalho de repositório de longo prazo com suporte visual.
Reconhecimento de fala para alternância de códigos MiMo -inglês, dialetos cantonês, wu, minnan e sichuan, gravações ruidosas e de campo distante, falantes sobrepostos e letras de músicas.
Modelo de gateway multimodal Qwen para análise visual, planejamento, arquivos e uso de ferramentas.
Modelo nativo multimodal da série M com suporte para 1M de contextos, atenção MSA, codificação, agentes, entrada de imagem e vídeo.
Modelo de gateway Fast StepFun com 256K de contexto, entrada visual, raciocínio e uso de ferramentas.
Lançamento técnico de vídeo com avatar baseado em áudio, com foco em sincronização labial, consistência de identidade e geração de vídeos longos.
O principal modelo de gateway Qwen é voltado para fluxos de trabalho exigentes de análise, codificação e agentes de produção.
Qwen 3.6 é um modelo rápido de visão e linguagem para raciocínio visual, arquivos e fluxos de trabalho de agentes.
Modelo de agente MiMo com 1.02T-parameter e 1M de contexto para tarefas de codificação exigentes e de longo prazo.
Modelo MiMo omnimodal nativo com 1M de contextos e capacidade de compreender texto, imagem, vídeo e áudio.
Conversão de imagem para vídeo Wan 2.7 com controle de primeiro/último quadro, continuação, condução de áudio e saída 720P / 1080P .
Versão principal do DeepSeek V4 com 1.6T de parâmetros no total e contexto 1M-token .
Variante rápida do DeepSeek V4 para bate-papo eficiente, assistência de codificação e loops de agentes.
MiMo: tecnologia expressiva de conversão de texto em fala com vozes premium integradas e controle de linguagem natural sobre ritmo, emoção, tom, dialeto e interpretação de personagens.
Modelo Kimi multimodal nativo e aberto para codificação de longo prazo, design visual e fluxos de trabalho de enxame de agentes.
Um modelo fundamental de codificação multimodal 200K-context para fluxos de trabalho orientados a imagens, vídeos, arquivos, agentes de GUI e ferramentas.
Modelo de edição de vídeo em linguagem natural Wan 2.7 para edições locais/globais e substituição de elementos.
Modelo de conversão de texto em vídeo Wan 2.7 para geração de vídeos guiados por instruções.
Modelo Wan 2.7 de referência a vídeo para geração controlada a partir de referências visuais.
Atualização do GLM para tarefas de longo prazo, agentes de codificação e raciocínio híbrido.
Wan 2.7 Pro oferece geração e edição de imagens com controle de cores da marca, consistência de múltiplas referências e saída de até 4096 × 4096 .
Modelo de imagem Wan 2.7 para conversão de texto em imagem, edição, geração de múltiplas referências e renderização de texto mais robusta.
Variante MiniMax de alta velocidade para codificação de baixa latência e fluxos de trabalho de agentes.
Modelo MiniMax de peso aberto para bate-papo, programação, trabalho de escritório e tarefas de agentes.
Versão do Qwen com agente multimodal nativo que precedeu os modelos de gateway Qwen 3.6 e 3.7 .
Variante turbo eficiente GLM-5 para raciocínio, codificação e trabalho do agente mais rápidos.
Versão GLM-5 para fluxos de trabalho de codificação, raciocínio e agentes.
Variante Kling 3.0 Omni para fluxos de trabalho de referência a vídeo e edição.
3.0 geração do Kling oferece opções de conversão de texto em vídeo, imagem em vídeo, áudio e resoluções de 720p a 4K .
Fast Kling 3.0 Turbo: caminho para geração de vídeo com áudio e baixa latência.
Abra o modelo flash StepFun com suporte para contexto 256K e uso de ferramentas.
Modelo de imagem Seedream 5.0-lite com criação e recuperação controláveis, além de maior consistência de assunto.
Opção de geração de vídeo Fast Seedance 2.0 para clipes com ótimo custo-benefício.
O modelo de geração de vídeo carro-chefe da Seedance, 2.0 é cobrado pela resolução de saída.
A MiniMax lançou o Speech 2.8 com tags de som nativas, clonagem de voz aprimorada, áudio com qualidade de estúdio e fala multilíngue; o Turbo é a opção focada em velocidade.
A MiniMax lançou o Speech 2.8 com tags de som nativas, clonagem de voz aprimorada, áudio com qualidade de estúdio e fala multilíngue; HD é a opção de alta fidelidade.
Alibaba adicionado o modo OpenAI-compatible ao Qwen3-ASR-Flash , mantendo a transcrição multilíngue, ITN e suporte a streaming.
Modelo de agente Kimi multimodal nativo aberto com 256K contextos e treinamento de visão e linguagem.
A Z.AI lançou seu modelo ASR multilíngue com suporte aprimorado para dicionários personalizados e reconhecimento de terminologia especializada.
Modelo de geração de imagens de pequeno porte focado na qualidade dos dados em detrimento do tamanho do modelo.
Caminho rápido Hailuo 2.3 para geração de vídeo a partir de imagens a um custo menor.
Hailuo 2.3 aprimora movimentos complexos, ações físicas, estilização e desempenho em microexpressões.
A Alibaba lançou Qwen3-TTS-Flash para síntese de voz offline com vozes expressivas, saída multilíngue e em diferentes dialetos, além de acesso à API de baixa latência.
Modelo de vídeo Hailuo 02 econômico para geração de vídeo a partir de texto e vídeo a partir de 512p .
Conversão de texto em fala sensível ao contexto, com direcionamento global e em linha para linguagem natural, expressão expressiva e /v1/audio/speech OpenAI-compatible .
Transcrição rápida de streaming 4B para áudio chinês-inglês com normalização ITN e OpenAI-compatible rota de transcrição.
Síntese de fala multilíngue com excelente custo-benefício, utilizando vozes oficiais e clonadas, mapeamento de pronúncia e controles de estilo.
Síntese de fala expressiva com vozes oficiais e clonadas, mapeamento de pronúncia, controles de estilo e saída OpenAI-compatible .
Síntese de fala expressiva e sensível ao contexto, com saída em fluxo contínuo e controles para voz, velocidade e volume.
