ChinaAPI · Chinês LLM Roteamento
Escolha um chinês LLM : Guia de roteamento atual ChinaAPI
Classificar os modelos de raciocínio atuais da ChinaAPI por formato da tarefa, janela de contexto, modalidade e custo de resposta utilizável — não por uma tabela de classificação de qualidade genérica.
A configuração padrão incorreta é um modelo principal para cada solicitação. A maioria das falhas em produção ocorre no início: um modelo somente de texto recebe uma imagem, um modelo 256K recebe um repositório ilimitado, uma primeira tentativa barata se transforma silenciosamente em cinco novas tentativas ou um loop de ferramenta não tem limite de orçamento e aprovação.
O snapshot reconciliado pelo 2026-07-20 contém 25 modelos atuais por token marcados RaciocínioIsso oferece opções suficientes para tornar uma tabela de classificação genérica menos útil do que uma regra de roteamento. Este guia restringe a primeira decisão à restrição que pode levar uma tarefa à falha: modalidade, janela de contexto, uso de ferramentas, latência ou o custo de uma resposta aceita.
Este é um guia de seleção do catálogo atual, não um parâmetro de qualidade público. Os model IDs abaixo estão ativos no ChinaAPI hoje; grupo de contas, saldo, limites de taxa, integridade do servidor upstream e a própria tarefa ainda afetam o sucesso de uma solicitação.
Resposta curta
- Comece com texto em primeiro lugar RAG , extração, classificação e candidatos a código de baixo custo com
deepseek-v4-flash. Possui 1M janela de contexto e suporte a ferramentas no catálogo atual, com $0.14 entradas / $0.28 saídas por milhão de tokens. Não envie entradas de imagem ou vídeo para uma rota somente de texto. - Usar
qwen3.7-pluscomo o agente prático de uso geral padrão quando o trabalho precisa de arquivos ou imagens, bem como uma janela 1M . É o teste inicial correto quando o uso da ferramenta e o contexto visual importam mais do que minimizar cada token. - Para trabalhos de longa duração, escolha a opção que melhor atenda às suas necessidades.
LongCat-2.0é uma rota de ferramenta somente de 1M ;kimi-k2.7-codeé o candidato a especialista em código em 256K ;MiniMax-M3é a rota 1M neste instantâneo com arquivos e visão. Eles resolvem diferentes restrições. - Reserva
qwen3.7-max,glm-5.2, oukimi-k3para passes selecionados de alto valor e revisão independente. Um passe premium é mais útil depois que um candidato já existe, e não como a primeira chamada em um fluxo de trabalho em massa. - Usar
glm-5v-turboquando a entrada inclui vídeo. No catálogo atual, trata-se da rota de raciocínio explicitamente marcada para imagem, vídeo, arquivos e ferramentas; uma rota somente de texto ou somente de imagem não pode recuperar informações que nunca recebeu.
A posição é deliberada: Não direcione o atendimento com base no selo principal do fornecedor. Direcione com base no modo de falha que você não pode aceitar e, em seguida, obtenha uma escalação premium com dados de saída aceitáveis.
O que o catálogo atual possibilita
| Restrição de produção | Comece com | Escalar ou mudar para | Por que essa é a primeira decisão? |
|---|---|---|---|
| Texto de alto volume RAG, extração, classificação ou um candidato a código | deepseek-v4-flash | deepseek-v4-pro ou um modelo específico da tarefa após uma verificação de aceitação falha | O catálogo atual lista 1M de contextos e ferramentas com uma taxa de entrada/saída econômica; não lista a entrada de visão. |
| Arquivos ou imagens, além de planejamento e ferramentas. | qwen3.7-plus | MiniMax-M3 para uma alternativa 1M selecionada | A tarefa exige entrada multimodal e uma longa janela de contexto, portanto, rotas econômicas baseadas apenas em texto representam uma falsa economia. |
| Documentos longos somente com texto e longos loops de ferramentas | LongCat-2.0 | deepseek-v4-pro quando uma análise de raciocínio textual de custo mais elevado se justifica | Tanto a janela 1M quanto a ausência de visão fazem parte da escolha; não anexe imagens a esta rota. |
| Repositório ou codificação de vários arquivos em até 256K | kimi-k2.7-code | kimi-k3 ou glm-5.2 para revisões de contexto longo ou finais selecionadas | Use o candidato a especialista em codificação para a versão de trabalho e, em seguida, separe a geração da revisão crítica. |
| Vídeos, imagens ou arquivos devem ser compreendidos antes de uma chamada de ferramenta. | glm-5v-turbo | MiniMax-M3 ou qwen3.7-plus quando a entrada de vídeo não for necessária | O catálogo atual distingue explicitamente o suporte à entrada de vídeo da visão comum. |
| Uma resposta de alto impacto, fusão, decisão política ou revisão final de código. | Um candidato testado e aprovado em uma segunda tentativa. | qwen3.7-max, glm-5.2, ou kimi-k3 | A avaliação independente é uma função, não uma prova de que um modelo premium seja universalmente o melhor. |
A tabela é intencionalmente um mapa de rotas, e não uma ordem de classificação. deepseek-v4-flash Pode ser uma opção melhor como primeira escolha do que uma solução completa quando a entrada é texto e o objetivo é gerar candidatos a baixo custo. É uma má primeira escolha quando o trabalho depende de uma imagem, um vídeo ou um arquivo que o modelo não consegue inspecionar.
O preço é um fator que influencia o roteamento, não a decisão em si.
Os preços atuais em exibição mostram por que a direção do token é importante. deepseek-v4-flash é $0.14 entrada / $0.28 saída por milhão de tokens. qwen3.7-plus é $0.3077 / $1.2308 ; LongCat-2.0 é $0.3 / $1.2 ; e qwen3.7-max é $2.5 / $7.5 ;
Esses números representam as taxas de exibição atuais reconciliadas pelo gateway, e não uma previsão do custo total do projeto ou uma pontuação de qualidade. Tokens de processamento, falhas de cache, chamadas de ferramentas, novas tentativas, correções humanas e a probabilidade de aceitação da resposta influenciam o resultado. A unidade útil é:
usable-answer cost =
(input tokens + output/thinking tokens + tool costs + retries + review time)
/ accepted answers
Um modelo com baixo custo de entrada é ineficiente se não conseguir processar a modalidade de origem ou se seu primeiro resultado falhar repetidamente em verificações de esquema, citação, ferramenta ou revisão de código. Por outro lado, um modelo com alto custo de saída pode ser adequado para uma revisão final específica, mas ineficiente para todos os candidatos em um lote. preços em tempo real antes de colocar uma rota em produção.
Execute esses modelos você mesmo. Um único ponto de extremidade API key , OpenAI-compatible e preços transparentes em USD. Consulte a página de preços em tempo real para ver a taxa de câmbio atual.
Obtenha uma chave — crédito grátis de $2Um método de roteamento repetível em dois estágios
Crie o cartão de tarefa antes de escolher o modelo. O objetivo é evitar que uma solicitação se transforme acidentalmente em um loop de agente dispendioso e ilimitado.
{
"task_id": "contract-qa-01",
"task_type": "document_question_answering",
"source_modalities": ["pdf", "image"],
"context_band": "1m",
"needs_tools": true,
"needs_video_input": false,
"max_tool_rounds": 6,
"max_attempts": 2,
"acceptance_checks": ["answer cites supplied pages", "JSON validates", "no unsupported claim"],
"candidate_model": "qwen3.7-plus",
"escalation_model": "glm-5.2",
"human_approval_required": true
}
Em seguida, utilize duas etapas:
- Selecione a rota de menor custo que consiga efetivamente ler as entradas e que atenda às restrições de contexto/ferramenta.
- Execute uma seleção limitada de candidatos com verificações explícitas de aceitação, custos e limites de novas tentativas.
- Encaminhe para um canal premium ou especializado apenas os casos que não obtiveram sucesso ou que sejam de alto valor.
- Para resultados relevantes, realize uma revisão independente e exija aprovação humana antes de ações externas, pagamentos, implementações ou exclusão de dados.
- Armazene o resultado aceito/rejeitado, os tokens faturados, as rodadas da ferramenta, as novas tentativas e os minutos de reparo. Promova uma rota para o padrão somente depois que ela for bem-sucedida nos dados de saída aceitos.
O resumo de roteamento interno define um Conjunto de 60-task Abrangendo texto RAG , extração estruturada, codificação, uso de ferramentas, documentos longos, compreensão de imagens ou vídeos e revisão final. Este é um plano de teste, não um benchmark público. Ainda não publicamos taxas de conclusão repetidas ChinaAPI , distribuições de latência, taxas de sucesso das ferramentas ou resultados de codificação em nível de repositório em todos os 25 modelos.
Erros comuns de roteamento
| Erro | Regra melhor |
|---|---|
| Envie todas as tarefas para o modelo mais caro. | Gere candidatos com uma rota econômica ou padrão viável; reserve verba premium para casos selecionados. |
| Utilize um modelo 1M somente com texto para evidências de imagem ou vídeo. | Escolha um modelo com a modalidade de entrada necessária antes de comparar os preços dos tokens. |
| Considere uma janela de contexto longa como garantia de recuperação correta. | Corrigir a segmentação, a seleção de fontes, as citações e os testes de aceitação; a capacidade contextual não é qualidade de evidência. |
| Deixe o agente chamar as ferramentas até que a operação seja bem-sucedida. | Defina os limites de rodadas de ferramentas, tentativas, custos e aprovação no cartão de tarefa. |
| Compare modelos por meio de uma resposta memorável. | Execute tarefas fixas repetidas e meça a taxa de aceitação, além do custo da resposta utilizável. |
O que este guia não afirma
Este artigo não publica um ranking universal de qualidade, tabela de classificação de latência, garantia de disponibilidade do fornecedor ou resultado de política de segurança. As configurações do modelo e os preços dos gateways podem mudar; a página de preços em tempo real é a fonte oficial. Também não temos ainda um benchmark público que comprove que um modelo é melhor em código, raciocínio, uso de ferramentas ou compreensão multimodal para todas as tarefas.
Use os dados atuais do catálogo para escolher uma primeira rota defensável. Em seguida, meça seus próprios resultados aceitáveis, tipos de falha, novas tentativas e custo total. A próxima atualização útil é um relatório de benchmark com um conjunto fixo de tarefas, execuções repetidas, metodologia detalhada e conclusões claramente definidas — e não um ranking mais chamativo.
Experimente em ChinaAPI . Todos os modelos deste artigo estão disponíveis em um único ponto de acesso — não é necessário ter uma conta ou número de telefone da China continental, $2 você pode começar com um teste gratuito.
Comece grátis — crédito $2 Veja os preços em tempo real.