ChinaAPI Insights · 中国 LLM 路由

选择中国 LLM:ChinaAPI 当前路由指南

按任务形态、上下文窗口、模态和可用答案成本,为当前的 ChinaAPI 推理模型分配路由——而不是看通用的质量排行榜。

ChinaAPI Research · 2026-07-20 · 最后更新于 2026-09-28

错误的默认做法,是把每个提示词都交给旗舰模型。大多数生产故障发生得更早:纯文本模型收到了一张图片,256K 模型被塞进一个不设上限的代码仓库,一次廉价的首轮调用悄悄变成了五次重试,或者工具循环既没有预算、也没有审批上限。

2026-07-20 经网关对账的快照包含 25 个当前按 token 计费的模型,均标记为 Reasoning。选择多到这种程度,通用排行榜就不如一条路由规则有用了。本指南把第一个决策收窄到可能导致任务失败的那个约束上:模态、上下文窗口、工具使用、延迟,或获得一个通过验收的答案所需的成本。

这是一份基于当前目录的选型指南,而不是公开的质量基准测试。下列 model IDs 目前已在 ChinaAPI 目录中上线;账号分组、余额、速率限制、上游健康状况以及任务本身,仍会影响请求能否成功。

简短结论

这个立场是刻意的: 不要按厂商的旗舰标签来路由。要按你不能接受的失败模式来路由,然后用通过验收的输出数据,证明升级到高端模型是值得的。

当前目录能做到什么

生产约束起步选择升级或切换到为什么这是第一个决策
大批量文本 RAG、信息抽取、分类或代码候选deepseek-v4-flashdeepseek-v4-pro 或在验收检查失败后换用任务专用模型当前目录列出了 1M 上下文和工具支持,输入/输出价格属经济档;未列出视觉输入
文件或图像,外加规划与工具qwen3.7-plusMiniMax-M3 作为选定的 1M 多模态备选任务需要多模态输入和长上下文窗口,因此纯文本经济档路由省下的钱只是假象
纯文本长文档与长工具循环LongCat-2.0deepseek-v4-pro 在值得付出更高成本做一轮文本推理时使用1M 窗口和不支持视觉,都是这一选择的一部分;不要向这条路由附带图片
256K 以内的代码仓库或多文件编码kimi-k2.7-codekimi-k3 或 glm-5.2 用于选定的长上下文或最终审查环节主工作轮次使用编码专精候选,再把生成与严格审查分开
工具调用前必须先理解视频、图像或文件glm-5v-turboMiniMax-M3 或 qwen3.7-plus 在不需要视频输入时使用当前目录明确区分了视频输入支持与普通视觉能力
高影响的回答、合并、策略决策或最终代码审查经过测试的候选结果,再加第二轮处理qwen3.7-max、 glm-5.2 或 kimi-k3独立审查是一种角色分工,并不能证明高端模型在所有场景下都最好

这张表刻意做成路由图,而不是排名。 deepseek-v4-flash 在输入为文本、目标是低成本产出候选时,可能是比旗舰模型更好的首次调用。当任务依赖模型无法查看的图像、视频或文件时,它就是糟糕的首次调用。

价格是路由的输入之一,而不是决定本身

当前的展示价格说明了为什么 token 的方向很重要。 deepseek-v4-flash 的价格为每百万 tokens 输入 $0.3 / 输出 $1.2。 qwen3.7-plus 为 $1.2 / $4.8; LongCat-2.0 为 $0.3 / $1.2;而 qwen3.7-max 为 $2.5 / $7.5。

这些数字是当前经网关对账的展示价格,既不是对项目总成本的预测,也不是质量评分。思考 tokens、缓存未命中、工具调用、重试、人工修复以及答案通过验收的概率,都会改变最终结果。真正有用的衡量单位是:

usable-answer cost =
  (input tokens + output/thinking tokens + tool costs + retries + review time)
  / accepted answers

如果模型处理不了源输入的模态,或者它的首个结果屡屡通不过 schema、引用、工具或代码审查检查,低输入价就占不到便宜。反过来,输出价高的模型也许适合用于一次选定的最终审查,但若用于批量中的每个候选,就是浪费。请查看 实时价格 之后,再将路由投入生产。

亲自运行这些模型。 一个 API key、OpenAI-compatible 端点,外加透明的美元定价。当前展示价格请查看实时价格页。

获取 API key — 赠送 $2 免费额度

一套可复用的两阶段路由方法

先写任务卡,再选模型。这样做是为了防止一个提示词意外变成昂贵且没有边界的 Agent 循环。

{
  "task_id": "contract-qa-01",
  "task_type": "document_question_answering",
  "source_modalities": ["pdf", "image"],
  "context_band": "1m",
  "needs_tools": true,
  "needs_video_input": false,
  "max_tool_rounds": 6,
  "max_attempts": 2,
  "acceptance_checks": ["answer cites supplied pages", "JSON validates", "no unsupported claim"],
  "candidate_model": "qwen3.7-plus",
  "escalation_model": "glm-5.2",
  "human_approval_required": true
}

然后按以下五个步骤为每项任务选择路由:

  1. 选择成本最低、且确实能读取输入并满足上下文/工具约束的路由。
  2. 运行一轮有限的候选生成,并设置明确的验收检查、成本上限和重试上限。
  3. 只把失败的或高价值的案例升级到高端或专精路由。
  4. 对于影响重大的输出,执行一轮独立审查;在执行外部操作、付款、部署或删除数据之前,必须经过人工批准。
  5. 保存通过/未通过验收的结果、计费 tokens、工具轮次、重试次数和修复分钟数。只有当某条路由在通过验收的输出数据上胜出后,才将它提升为默认路由。

内部路由简报定义了一个 60 项任务的候选集 涵盖文本 RAG、结构化抽取、编码、工具使用、长文档、图像或视频理解以及最终审查。这是一份测试计划,而不是公开的基准测试。我们尚未发布全部 25 个模型在 ChinaAPI 上经重复测试的完成率、延迟分布、工具调用成功率或仓库级编码结果。

常见路由错误

错误做法更好的规则
把每个任务都发给最贵的模型用能力足够的经济档或标准档路由生成候选;把高端支出留给选定的案例
用纯文本 1M 模型处理图像或视频证据先选出支持所需输入模态的模型,再比较 token 价格
把长上下文窗口当作检索正确的保证修正分块、来源选择、引用和验收测试;上下文容量不等于证据质量
让 Agent 一直调用工具,直到成功为止在任务卡中设定工具轮次、重试、成本和审批上限
凭一个令人印象深刻的回答来比较模型重复运行固定任务,衡量验收通过率和可用答案成本

本指南不做哪些声明

本文不发布通用质量排名、延迟排行榜、厂商可用性保证或安全策略结果。模型配置和网关价格可能变化;价格以实时价格页为准。我们目前也没有公开的基准测试,能够证明某个模型在所有任务上都更擅长代码、推理、工具使用或多模态理解。

请依据当前目录中的事实,选出一条站得住脚的首选路由。然后衡量你自己通过验收的输出、失败类型、重试次数和总成本。下一次有价值的更新,将是一份基准测试报告:固定任务集、多次重复运行、公开原始方法,并给出范围清晰的结论——而不是一个更喧嚣的排行榜。

在 ChinaAPI 上试试。 本文中的每个模型都已上线,统一通过一个端点调用——无需中国大陆账号或手机号,起步即享 $2 免费试用。

免费开始 — 赠送 $2 额度 查看实时价格
Method & data. Written by: ChinaAPI Research. Published 2026-07-20, last updated 2026-09-28. Data source: ChinaAPI gateway-reconciled catalog snapshot and ChinaAPI Research current-catalog routing brief v2.0, both dated 2026-07-20. Standard token-model rates follow providers' international list prices at 100%; some models have a separate Paid rate after the first top-up. Media rates use the displayed billing unit and may include a service margin covering provider input/output billing, payment processing, chargeback exposure, and operations; any margin is included in the displayed rate and is not added separately. The 实时价格页 is authoritative.