Integración de LiteLLM

Utilice LiteLLM con modelos de IA chinos a través de ChinaAPI.

Agregue ChinaAPI como un OpenAI-compatible backend en LiteLLM proxy o Python SDK , luego dirija las aplicaciones a modelos chinos de precio oficial con una clave.

Requisitos previos

Antes de editar la configuración.

LiteLLM instalado

Utilice el servidor proxy LiteLLM o el SDK de Python.

Punto final de ChinaAPI

Base URL es https://api.chinaapi.ai/v1. API keys se crean en Dashboard -> Console -> Tokens.

Configuración del proxy

Usar openai /<modelo> entradas en config.yaml.

model_list:
  - model_name: deepseek-fast
    litellm_params:
      model: openai/deepseek-v4-flash
      api_base: https://api.chinaapi.ai/v1
      api_key: os.environ/CHINAAPI_API_KEY

  - model_name: kimi-code
    litellm_params:
      model: openai/kimi-k2.7-code
      api_base: https://api.chinaapi.ai/v1
      api_key: os.environ/CHINAAPI_API_KEY

  - model_name: qwen-max
    litellm_params:
      model: openai/qwen3.7-max
      api_base: https://api.chinaapi.ai/v1
      api_key: os.environ/CHINAAPI_API_KEY
export CHINAAPI_API_KEY="sk-..."
litellm --config config.yaml --port 4000

SDK de Python

Llama a ChinaAPI directamente desde LiteLLM.

import os
from litellm import completion

response = completion(
    model="openai/deepseek-v4-flash",
    api_base="https://api.chinaapi.ai/v1",
    api_key=os.environ["CHINAAPI_API_KEY"],
    messages=[{"role": "user", "content": "Say LiteLLM is connected to ChinaAPI."}],
    stream=True,
)

for chunk in response:
    print(chunk, end="")

Modelos recomendados

Buenas rutas de LiteLLM.

Para obtener detalles del modelo actual y evidencia de tasas, revise DeepSeek-V4 y Kimi K2.7 antes de establecer una ruta de producción.

deepseek-v4-flash

Ruta de respaldo rápida para el chat, la ayuda con la codificación y los bucles de agentes.

kimi-k2.7-code

Buena ruta de codificación para tareas a nivel de repositorio y sesiones más largas.

qwen3.7-max

Ruta que requiere un razonamiento intensivo cuando la calidad importa más que la latencia.

glm-5.2

Ruta de contexto largo para documentos y bases de código de mayor tamaño.

MiniMax-M3

Codificación multimodal y modelo de contexto extenso para enrutamiento alternativo.

Solución de problemas

Problemas comunes de LiteLLM.

Modelos de pensamiento como qwen3.7-max puede generar tokens de razonamiento antes de la salida final. Use transmisión en clientes detrás de LiteLLM o aumente los tiempos de espera de upstream/cliente.

Modelo no encontrado: comprobar el model ID exacto en precios en tiempo real, luego actualiza litellm_params .modelo. Mantén el openai / prefijo para enrutamiento OpenAI-compatible .

401 : confirmar CHINAAPI_API_KEY se resuelve a un sk-... clave y LiteLLM lo está pasando como el proveedor API key .

Precios e inscripción

Utilice precios de tokens sincronizados con la pasarela detrás de su pasarela LiteLLM.

Las tarifas pueden ajustarse a los precios oficiales de China de los proveedores, si están configuradas. Regístrese para obtener un crédito gratuito $2 y consulte los precios en tiempo real antes de enrutar el tráfico de producción.