ChinaAPI Insights · 中国 LLM 路由
选择中国 LLM:ChinaAPI 当前路由指南
按任务形态、上下文窗口、模态和可用答案成本,为当前的 ChinaAPI 推理模型分配路由——而不是看通用的质量排行榜。
错误的默认做法,是把每个提示词都交给旗舰模型。大多数生产故障发生得更早:纯文本模型收到了一张图片,256K 模型被塞进一个不设上限的代码仓库,一次廉价的首轮调用悄悄变成了五次重试,或者工具循环既没有预算、也没有审批上限。
2026-07-20 经网关对账的快照包含 25 个当前按 token 计费的模型,均标记为 Reasoning。选择多到这种程度,通用排行榜就不如一条路由规则有用了。本指南把第一个决策收窄到可能导致任务失败的那个约束上:模态、上下文窗口、工具使用、延迟,或获得一个通过验收的答案所需的成本。
这是一份基于当前目录的选型指南,而不是公开的质量基准测试。下列 model IDs 目前已在 ChinaAPI 目录中上线;账号分组、余额、速率限制、上游健康状况以及任务本身,仍会影响请求能否成功。
简短结论
- 文本优先的 RAG、信息抽取、分类和低成本代码候选,先用
deepseek-v4-flash。 在当前目录中,它具备 1M 上下文窗口并支持工具调用,价格为每百万 tokens 输入 $0.3 / 输出 $1.2。不要把图像或视频输入发给纯文本路由。 - 使用
qwen3.7-plus作为实用的通用 Agent 默认选择,适用于既要处理文件或图像、又需要 1M 窗口的任务。 当工具使用和视觉上下文比省下每一个 token 更重要时,它是合适的首轮测试对象。 - 长任务要先选操作类型,再选品牌。
LongCat-2.0是一条支持工具的 1M 纯文本路由;kimi-k2.7-code是 256K 的代码专精候选;MiniMax-M3是本快照中支持文件和视觉的 1M 路由。它们解决的是不同的约束。 - 只把
qwen3.7-max、glm-5.2或kimi-k3留给选定的高价值环节和独立审查。 高端模型的一轮处理,要在已有候选结果之后才最有价值,而不是作为批量工作流中的第一次调用。 - 使用
glm-5v-turbo处理包含视频的输入。 在当前目录中,它是明确标注支持图像、视频、文件和工具的推理路由;纯文本或仅支持图像的路由,无法找回它从未收到的信息。
这个立场是刻意的: 不要按厂商的旗舰标签来路由。要按你不能接受的失败模式来路由,然后用通过验收的输出数据,证明升级到高端模型是值得的。
当前目录能做到什么
| 生产约束 | 起步选择 | 升级或切换到 | 为什么这是第一个决策 |
|---|---|---|---|
| 大批量文本 RAG、信息抽取、分类或代码候选 | deepseek-v4-flash | deepseek-v4-pro 或在验收检查失败后换用任务专用模型 | 当前目录列出了 1M 上下文和工具支持,输入/输出价格属经济档;未列出视觉输入 |
| 文件或图像,外加规划与工具 | qwen3.7-plus | MiniMax-M3 作为选定的 1M 多模态备选 | 任务需要多模态输入和长上下文窗口,因此纯文本经济档路由省下的钱只是假象 |
| 纯文本长文档与长工具循环 | LongCat-2.0 | deepseek-v4-pro 在值得付出更高成本做一轮文本推理时使用 | 1M 窗口和不支持视觉,都是这一选择的一部分;不要向这条路由附带图片 |
| 256K 以内的代码仓库或多文件编码 | kimi-k2.7-code | kimi-k3 或 glm-5.2 用于选定的长上下文或最终审查环节 | 主工作轮次使用编码专精候选,再把生成与严格审查分开 |
| 工具调用前必须先理解视频、图像或文件 | glm-5v-turbo | MiniMax-M3 或 qwen3.7-plus 在不需要视频输入时使用 | 当前目录明确区分了视频输入支持与普通视觉能力 |
| 高影响的回答、合并、策略决策或最终代码审查 | 经过测试的候选结果,再加第二轮处理 | qwen3.7-max、 glm-5.2 或 kimi-k3 | 独立审查是一种角色分工,并不能证明高端模型在所有场景下都最好 |
这张表刻意做成路由图,而不是排名。 deepseek-v4-flash 在输入为文本、目标是低成本产出候选时,可能是比旗舰模型更好的首次调用。当任务依赖模型无法查看的图像、视频或文件时,它就是糟糕的首次调用。
价格是路由的输入之一,而不是决定本身
当前的展示价格说明了为什么 token 的方向很重要。 deepseek-v4-flash 的价格为每百万 tokens 输入 $0.3 / 输出 $1.2。 qwen3.7-plus 为 $1.2 / $4.8; LongCat-2.0 为 $0.3 / $1.2;而 qwen3.7-max 为 $2.5 / $7.5。
这些数字是当前经网关对账的展示价格,既不是对项目总成本的预测,也不是质量评分。思考 tokens、缓存未命中、工具调用、重试、人工修复以及答案通过验收的概率,都会改变最终结果。真正有用的衡量单位是:
usable-answer cost =
(input tokens + output/thinking tokens + tool costs + retries + review time)
/ accepted answers
如果模型处理不了源输入的模态,或者它的首个结果屡屡通不过 schema、引用、工具或代码审查检查,低输入价就占不到便宜。反过来,输出价高的模型也许适合用于一次选定的最终审查,但若用于批量中的每个候选,就是浪费。请查看 实时价格 之后,再将路由投入生产。
亲自运行这些模型。 一个 API key、OpenAI-compatible 端点,外加透明的美元定价。当前展示价格请查看实时价格页。
获取 API key — 赠送 $2 免费额度一套可复用的两阶段路由方法
先写任务卡,再选模型。这样做是为了防止一个提示词意外变成昂贵且没有边界的 Agent 循环。
{
"task_id": "contract-qa-01",
"task_type": "document_question_answering",
"source_modalities": ["pdf", "image"],
"context_band": "1m",
"needs_tools": true,
"needs_video_input": false,
"max_tool_rounds": 6,
"max_attempts": 2,
"acceptance_checks": ["answer cites supplied pages", "JSON validates", "no unsupported claim"],
"candidate_model": "qwen3.7-plus",
"escalation_model": "glm-5.2",
"human_approval_required": true
}
然后按以下五个步骤为每项任务选择路由:
- 选择成本最低、且确实能读取输入并满足上下文/工具约束的路由。
- 运行一轮有限的候选生成,并设置明确的验收检查、成本上限和重试上限。
- 只把失败的或高价值的案例升级到高端或专精路由。
- 对于影响重大的输出,执行一轮独立审查;在执行外部操作、付款、部署或删除数据之前,必须经过人工批准。
- 保存通过/未通过验收的结果、计费 tokens、工具轮次、重试次数和修复分钟数。只有当某条路由在通过验收的输出数据上胜出后,才将它提升为默认路由。
内部路由简报定义了一个 60 项任务的候选集 涵盖文本 RAG、结构化抽取、编码、工具使用、长文档、图像或视频理解以及最终审查。这是一份测试计划,而不是公开的基准测试。我们尚未发布全部 25 个模型在 ChinaAPI 上经重复测试的完成率、延迟分布、工具调用成功率或仓库级编码结果。
常见路由错误
| 错误做法 | 更好的规则 |
|---|---|
| 把每个任务都发给最贵的模型 | 用能力足够的经济档或标准档路由生成候选;把高端支出留给选定的案例 |
| 用纯文本 1M 模型处理图像或视频证据 | 先选出支持所需输入模态的模型,再比较 token 价格 |
| 把长上下文窗口当作检索正确的保证 | 修正分块、来源选择、引用和验收测试;上下文容量不等于证据质量 |
| 让 Agent 一直调用工具,直到成功为止 | 在任务卡中设定工具轮次、重试、成本和审批上限 |
| 凭一个令人印象深刻的回答来比较模型 | 重复运行固定任务,衡量验收通过率和可用答案成本 |
本指南不做哪些声明
本文不发布通用质量排名、延迟排行榜、厂商可用性保证或安全策略结果。模型配置和网关价格可能变化;价格以实时价格页为准。我们目前也没有公开的基准测试,能够证明某个模型在所有任务上都更擅长代码、推理、工具使用或多模态理解。
请依据当前目录中的事实,选出一条站得住脚的首选路由。然后衡量你自己通过验收的输出、失败类型、重试次数和总成本。下一次有价值的更新,将是一份基准测试报告:固定任务集、多次重复运行、公开原始方法,并给出范围清晰的结论——而不是一个更喧嚣的排行榜。
