ChinaAPI Insights · LLM 采购与路由

中国 LLMs 对比 GPT、Gemini 与 Claude:按契约选路由,而不是看品牌

一套实用的决策框架:根据产品依赖、任务约束和合格输出成本,在中国 LLM 与直连前沿厂商的路由之间做选择——而不是看通用排行榜。

ChinaAPI Research · 2026-07-24

这个问题的无效问法是:“中国 LLMs 和 GPT、Gemini、Claude 相比,哪个更好?”它让“更好”这一个词,去代替产品功能、服务商合同、模型能力、延迟、预算、数据处理,以及纠正错误答案的成本。

真正有用的问题是: 这个任务要成功,哪些条件必须成立,以及哪条路由能满足这份契约? 模型品牌不是验收标准。

先说清一条边界:ChinaAPI 通过自己的 OpenAI-compatible 端点,提供其模型目录中列出的中国模型。它 不 提供访问 GPT、Gemini 或 Claude API 的途径。如果你的任务依赖某个上游服务商特定的产品、账号、条款、部署或工具,请让这部分工作负载继续直接使用该服务商。本指南要讨论的是:什么情况下值得把中国模型路由与这条直连路由放在一起认真评估——而不是假装所有 API 都可以互换。

简短结论

我们的立场很简单: 当服务商依赖本身就是任务的一部分时,使用直连国际服务商的路由;否则,就测试成本最低、且能读取输入、遵守管控要求并产出通过验收结果的路由。升级要凭证据,而不是凭品牌。

决策看的是契约,而不是国别标签

下表把不可妥协的依赖与模型选型问题区分开来。它刻意不对不同服务商的模型智能水平排名:ChinaAPI 尚未发布能够支撑这种结论的、多次重复的跨服务商基准测试。

任务的实际要求决策为何起决定作用
指定的 OpenAI、Google 或 Anthropic API/产品功能;现有的服务商专属集成;或对该服务商的合同要求保留直连服务商路由产品与合同依赖无法从输出质量对比中推断出来。ChinaAPI 并不提供这些服务商的 API。
尚未针对替代供应商获批的企业、数据、地区、审计或支持条款先解决采购与安全问题这是治理层面的决策。模型测试无法替代法务、安全或供应商审查。
大规模文本抽取、分类、RAG 候选或代码草稿;不需要视觉/视频输入测试 deepseek-v4-flash、 deepseek-v4-pro、 LongCat-2.0或其他适合该任务的中国文本模型路由1M 上下文和工具需求可以由多条目录路由满足;有效的比较对象,是在你自己的文档上的合格输出成本。
必须查看文件或图像并调用工具的长上下文工作测试 qwen3.7-plus、 MiniMax-M3 或 mimo-v2.5-pro 之后再比较价格这几条快照中的路由同时具备相应的 1M、多模态和工具元数据。纯文本候选甚至在评估质量之前就已出局。
在规划或调用工具之前,证据中就包含视频使用明确标注支持视频输入的目录路由,例如 glm-5v-turbo 或 kimi-k3,也可以保留你的产品所要求的直连服务商视频支持是输入契约层面的要求,而不是在纯文本调用之后再追加的高级功能。
影响重大的最终决策、合并或对外操作进行独立审核,并要求相应的人工审批第二个模型可以作为审核角色发挥作用,但它不能证明结果正确。真正的管控手段是验收测试和审批关卡。

前沿模型服务商的格局变化很快。在决定采用某个服务商特有的依赖之前,请先阅读最新的 OpenAI 模型指南、 Gemini 模型文档和 Anthropic 模型文档。它们的能力、生命周期标签和商业条款,应以各服务商自己的信息为准——而不是 ChinaAPI 的目录。

当前的中国模型选型清单与价格适用范围

以下是 ChinaAPI 目录中可作为起点的候选,并不表示它们胜过任何外部模型。所列价格由当前经网关对账的数据源生成;价格可能变动,而且只在候选满足任务的输入和管控要求之后才适用。

任务形态候选路由当前展示的输入 / 输出价格(每 1M tokens)这并不能证明
大批量文本、结构化抽取或低成本的候选生成deepseek-v4-flash$0.3 / $1.2它能查看图像或视频,或能在你的验收测试中追平直连前沿模型的路由
文件或图像,加上 1M 上下文和工具qwen3.7-plus$1.2 / $4.8多模态元数据就等同于质量排名
第二个 1M 多模态/工具候选MiniMax-M3$0.9 / $3.6两家厂商在你的数据上会以同样的方式失败或成功
纯文本 1M 工作,并可选用成本更高的推理环节glm-5.2$1.4 / $4.4token 价格更高,就普遍有理由把它升为默认

价格比较刻意止步于此。我们不会把 GPT、Gemini 或 Claude 的价格手工抄进 ChinaAPI 的营销页面,也不会把各服务商在缓存、批处理、模型版本、速率限制或合同上的差异抹平,做成一张虚假的单位成本表。对于一条实际运行的路由,真正重要的数字是:

accepted-output cost =
  (model tokens + tool/runtime charges + retries + review time + repair time)
  / accepted outputs

如果低 token 价格的路由产出不合规的 JSON、漏掉引用的证据、无法读取输入,或者带来的返工多到抵消了节省,那它就是亏的。同样,如果高成本直连路由的服务商专属优势与任务无关,它也是亏的。用同一张任务卡片来衡量这两种情况。

亲自运行这些模型。 一个 API key、OpenAI-compatible 端点,外加透明的美元定价。当前展示价格请查看实时价格页。

获取 API key — 赠送 $2 免费额度

把比较当作受控的路由测试来做

不要因为一个演示提示词就迁移生产工作流。先冻结任务契约,包括正确答案是“这必须继续留在直连服务商”的情况。下面的模板让这一决策可以被审查。

{
  "task_id": "claims-extraction-01",
  "must_use_provider": null,
  "provider_owned_dependencies": [],
  "source_modalities": ["pdf", "image"],
  "context_band": "1m",
  "needs_tools": true,
  "needs_video_input": false,
  "data_and_procurement_approved": true,
  "max_attempts": 2,
  "max_tool_rounds": 6,
  "acceptance_checks": [
    "every claim points to a supplied page",
    "JSON validates against the schema",
    "no unsupported claim",
    "human reviewer accepts the result"
  ],
  "candidate_routes": [
    "direct-provider-route",
    "qwen3.7-plus",
    "MiniMax-M3"
  ],
  "human_approval_required": true
}

然后按以下步骤执行:

  1. 在发送提示词之前先排除无效路由。 如果 must_use_provider 已设置,或需要某项服务商自有的依赖,就不要把中国替代方案当作替代品来打分。如果输入包含图像、视频、文件或工具,就移除无法支持它们的路由。
  2. 保持任务和验收检查不变。 对每条有效路由使用相同的源材料集、允许的工具、输出 schema、脱敏策略、重试上限和人工审核规则。
  3. 记录结果,而不只是你最喜欢的那个答案。 保存通过/驳回状态、驳回原因、tokens、工具调用轮数、耗时、重试次数和人工修复分钟数。原始源材料要保留在已批准的边界之内。
  4. 拆分默认、升级和审核角色。 成本较低的中国模型路由可以作为默认的候选生成器;直连服务商可以保留给依赖特定产品的步骤;另一条独立路由可以审核高影响的输出。一条路由不必在所有角色上都胜出。
  5. 有了可重复的证据之后才升为默认。 当模型版本、上游行为、服务商条款或你的任务 schema 发生变化后,重新测试。

ChinaAPI 的内部路由简报目前定义了 60 项任务的候选集 涵盖文本 RAG、结构化抽取、编码、工具使用、长文档、图像/视频理解和最终审核。它是一份测试计划产物,而不是公开的评分表。对于所有这些路由,我们尚未发布经重复测试的跨服务商完成率、延迟分布、工具调用成功率或质量排名。

三种不应被合并成一个答案的结果

1. “保持直连。” 你的应用使用了某个服务商特有的托管功能,或者你的组织已经批准了某一家供应商的合同与管控措施。保留直连路由。中国 LLM 仍可以在另一个不涉及该依赖的独立工作流中接受评估,但不能作为未经披露的替代品。

2. “以中国模型为默认,并保留直连升级通道。” 你的工作负载是大批量文本、抽取、分类或起草,而且没有指定任何产品依赖。从一个能力足够的 ChinaAPI 候选开始,强制执行验收检查,并为那些界定清楚、确有必要的情况保留升级到直连服务商的通道。这通常比让每一项都走同一条旗舰路由更稳健。

3. “输入不同,就使用多条路由。” 纯文本候选、1M 多模态路由和视频输入路由并不重复。根据任务需要读取什么、必须遵守哪些管控要求来选择它们。路由层应当让选择足够明确,使运维人员日后能够解释清楚。

本指南不做哪些声明

本文并不声称中国 LLMs 普遍比 GPT、Gemini 或 Claude 更便宜、更好、更安全或更容易获得。本文不发布跨服务商基准测试、延迟排行榜、企业合规结论,也不对上游行为作任何保证。本文也不意味着可以通过 ChinaAPI 使用 GPT、Gemini 或 Claude。

不过,本文确实给出一条实用建议: 当服务商确实是任务契约的一部分时,就把它当作契约的一部分;否则,就用可重复的验收数据和合格输出成本来比较有效的模型路由。 先查看当前的 ChinaAPI 模型目录 和 实时价格,然后留下在你自己的工作流中真正证明了价值的那条路由。

在 ChinaAPI 上试试。 本文中的每个模型都已上线,统一通过一个端点调用——无需中国大陆账号或手机号,起步即享 $2 免费试用。

免费开始 — 赠送 $2 额度 查看实时价格
Method & data. Written by: ChinaAPI Research. Published 2026-07-24, last updated 2026-07-24. Data source: ChinaAPI gateway-reconciled model catalog snapshot captured 2026-07-24; ChinaAPI Research routing brief v1.0 dated 2026-07-24; current official OpenAI, Google, and Anthropic documentation cited in the article. Standard token-model rates follow providers' international list prices at 100%; some models have a separate Paid rate after the first top-up. Media rates use the displayed billing unit and may include a service margin covering provider input/output billing, payment processing, chargeback exposure, and operations; any margin is included in the displayed rate and is not added separately. The 实时价格页 is authoritative.