Integração LiteLLM

Utilize o LiteLLM com modelos de IA chineses através da ChinaAPI.

Adicione ChinaAPI como um OpenAI-compatible backend no LiteLLM proxy ou no Python SDK , então direcione os aplicativos para modelos chineses de preço oficial com uma única chave.

Pré-requisitos

Antes de editar a configuração.

LiteLLM instalado

Utilize o servidor proxy LiteLLM ou o SDK Python.

Endpoint ChinaAPI

Base URL é https://api.chinaapi.ai/v1Os tokens . API keys são criados em Painel -> Console -> Tokens.

Configuração de proxy

Usar openai /<modelo> entradas em config.yaml.

model_list:
  - model_name: deepseek-fast
    litellm_params:
      model: openai/deepseek-v4-flash
      api_base: https://api.chinaapi.ai/v1
      api_key: os.environ/CHINAAPI_API_KEY

  - model_name: kimi-code
    litellm_params:
      model: openai/kimi-k2.7-code
      api_base: https://api.chinaapi.ai/v1
      api_key: os.environ/CHINAAPI_API_KEY

  - model_name: qwen-max
    litellm_params:
      model: openai/qwen3.7-max
      api_base: https://api.chinaapi.ai/v1
      api_key: os.environ/CHINAAPI_API_KEY
export CHINAAPI_API_KEY="sk-..."
litellm --config config.yaml --port 4000

SDK Python

Acesse a ChinaAPI diretamente do LiteLLM.

import os
from litellm import completion

response = completion(
    model="openai/deepseek-v4-flash",
    api_base="https://api.chinaapi.ai/v1",
    api_key=os.environ["CHINAAPI_API_KEY"],
    messages=[{"role": "user", "content": "Say LiteLLM is connected to ChinaAPI."}],
    stream=True,
)

for chunk in response:
    print(chunk, end="")

Modelos recomendados

Boas rotas LiteLLM.

Para obter detalhes sobre o modelo atual e evidências de taxas, consulte a revisão. DeepSeek-V4 e Kimi K2.7 antes de definir uma rota de produção.

deepseek-v4-flash

Rota alternativa rápida para bate-papo, ajuda com programação e loops de agentes.

kimi-k2.7-code

Boa rota de codificação para tarefas em nível de repositório e sessões mais longas.

qwen3.7-max

Rota que exige muito raciocínio quando a qualidade importa mais do que a latência.

glm-5.2

Rota de contexto longo para documentos e bases de código maiores.

MiniMax-M3

Codificação multimodal e modelo de contexto longo para roteamento alternativo.

Solução de problemas

Problemas comuns do LiteLLM.

Modelos de pensamento como qwen3.7-max Pode gerar tokens de raciocínio antes da saída final. Use streaming em clientes atrás de LiteLLM ou aumente os tempos limite de upstream/cliente.

Modelo não encontrado: verifique o model ID exato em preços em tempo reale então atualize litellm_params .modelMantenha o openai / prefixo para roteamento OpenAI-compatible .

401 : confirmar CHINAAPI_API_KEY resolve-se em um sk-... chave e LiteLLM está passando-a como o provedor API key .

Preços e inscrição

Utilize a precificação de tokens sincronizada com o gateway por trás do seu gateway LiteLLM.

As tarifas podem seguir os preços oficiais de tabela da China dos provedores, conforme configurado. Cadastre-se para obter um crédito gratuito de $2 e, em seguida, verifique os preços em tempo real antes de rotear o tráfego de produção.