<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: zh-cn/model-consistency-audit/index.html -->

# 审计一条模型路由，一个 token 就够了

> 了解单 token 行为指纹如何支撑可复现的 API 路由一致性审计。基于已发表的研究，覆盖 165 个 LLMs 与四种语言。

- Canonical page: https://chinaapi.ai/zh-cn/model-consistency-audit/
- Human-readable page: https://chinaapi.ai/zh-cn/model-consistency-audit/
- Live pricing: https://dash.chinaapi.ai/models?lang=zh-cn&utm_source=chinaapi&utm_medium=markdown&utm_campaign=model-consistency-audit

一项已发表的黑盒方法表明，重复采集的单 token 输出可以形成可测量的行为指纹。ChinaAPI 正在开发面向 API 路由的可复现一致性审计原型。

[申请内测](#beta)

[阅读研究](https://arxiv.org/abs/2607.10252)

## 方法已发表，产品尚在规划

以下发现来自独立的公开研究。ChinaAPI 尚未推出生产级的路由验证服务，也尚未发布自己的审计结果。

数据集

**165 models · 4 languages** [1]

数据由论文报告，测试语言为英语、中文、俄语和阿拉伯语。这不是 ChinaAPI 的数据集。

[论文](https://arxiv.org/abs/2607.10252)

· [数据记录](https://zenodo.org/records/21278557)

审计成本

**~100 one-token queries** [1]

这是论文针对 8 单元协议报告的近似请求数。实际 API 成本和证据强度取决于端点与配置。

[论文](https://arxiv.org/abs/2607.10252)

验证结果

**<11% EER with 8 probe cells** [1]

该结果是在论文的实验协议下报告的。它并非对任意路由、提示词或服务商都能保证的错误率。

[论文](https://arxiv.org/abs/2607.10252)

## model ID 只是元数据，单个回答只是带噪声的观测

01

### 名称只是声明

模型标识符只说明某条路由声称提供的是什么，并不是该路由行为的独立证据。

02

### 采样会改变输出

随机采样、服务更新、系统提示词和路由策略，都可能改变单次补全的结果。

03

### 延迟信息并不完整

响应时间可以反映基础设施的状况，但仅凭它无法识别模型。

04

### 信号来自分布

可用的证据来自多次重复、经规范化的回答所呈现的分布形状，而不是任何单个回答。

## 构建受控的行为指纹，再比较分布

研究者使用受约束的提示词，引导模型只用一个词作答；随后重复采样，对返回的答案类别做规范化，再比较由此得到的类概率指纹。

1

### 受约束的提示词

提出答案空间小且受控的问题，让重复输出可以被一致地计数。

→ 2

### 重复采样

在固定的端点和采样设置下，收集大量相互独立的单 token 输出。

→ 3

### 答案规范化

比较之前，先把表面形式不同但等价的回答映射到稳定的答案类别。

→ 4

### 分布比较

衡量两个答案分布是否比不同模型之间预期的更接近。

行为指纹 **重复作答会形成可比较的分布形状。** 示意图，非 ChinaAPI 生产数据

### 三个模型画像

Model A Model B Model C

### 同一模型，拆分样本

独立拆分出的样本保持相似的形状。

### 不同模型

峰值与类别权重出现分化。

文字替代说明：左图展示三个不同的示意柱状分布。中图叠加了来自同一示意模型、独立采样的两个分布，柱高相近。右图叠加了两个不同的示意模型，峰值与类别权重明显不同。图中不含任何真实模型的测量数据。

## 同一模型的指纹明显更接近

论文发现，同一模型的指纹之间仍明显比不同模型的指纹之间更接近。

将同一模型的样本对半拆分后，两部分指纹之间的距离，比不同模型样本之间的距离小约一个数量级。[1]

该比较结果是论文在其探针构造和距离度量下报告的。

[论文](https://arxiv.org/abs/2607.10252)

论文还报告了一个生态层面的异常：某个挂着专有旗舰模型标签的端点，在分布上与开源 Qwen 模型无法区分。[1]

这是论文作者报告的观察，并非 ChinaAPI 的测试结果或归属认定。

[论文](https://arxiv.org/abs/2607.10252)

论文结果报告值 模型家族分类[1]

论文报告的留一法准确率。

[论文](https://arxiv.org/abs/2607.10252)

59.5% 随机基线[1]

与分类结果一同报告的随机基线。

[论文](https://arxiv.org/abs/2607.10252)

18.4% 完整 40 单元验证 EER[1]

论文完整 40 单元协议下的等错误率。

[论文](https://arxiv.org/abs/2607.10252)

7.3% 8 单元验证 EER[1]

基于约 100 次单 token 请求报告；并非适用于所有路由的保证。

[论文](https://arxiv.org/abs/2607.10252)

<11%

- 模型家族留一法分类：59.5%。

- 随机基线：18.4%。

- 完整 40 单元验证等错误率：7.3%。

- 8 单元验证等错误率：低于 11%。

以上数值均出自论文 [One Token Is Enough](https://arxiv.org/abs/2607.10252)；相关研究记录已发布于 [Zenodo](https://zenodo.org/records/21278557)。

## 从研究协议到路由可观测性

内测将公开复现和质疑某项比较所需的证据。报告在设计上会保留方法背景，而不是把结果压缩成一个无从解释的分数。

01

### 协议标识

请求参数，以及确切的探针集版本。

02

### 采样窗口

测试时间戳、路由、配置和样本数。

03

### 答案记录

原始响应及其规范化后的类别。

04

### 返回的身份标识

请求时的模型名称，以及 API 返回的任何模型标识符。

05

### 距离度量

与带版本号的参考指纹之间的 Jensen-Shannon 散度。

06

### 不确定性

置信区间、异常类型，以及与此前窗口相比的变化。

## 三种证据状态，均不构成指控

与参考一致

观测到的差异仍处于该配置下预期的采样范围内。

证据不足

当前样本或任务集不足以支撑可靠的比较。

检测到不一致信号

多个独立的探针单元与参考的差异超出了设定阈值。有必要进一步调查。

**Mismatch signal is not attribution.** A behavioral difference can identify a need to investigate. It does not, by itself, prove what changed or who caused it.

## 路由审计描述的是特定时间、特定配置下的行为，而不是一成不变的模型身份

- 模型可能在没有提前通知的情况下更新，从而使原本合法的参考指纹发生偏移。

- 同一模型在不同的系统提示词或采样参数下，可能产生不同的分布。

- 公开的探针集可能被服务端识别或特殊处理。

- 审计只能评估实际测试过的路由、时间窗口和配置。

- 在没有独立证据和调查的情况下，不应使用审计结果公开指控第三方。

## 本表单不收集第三方 API key

首轮内测计划评估参与者通过自己的 ChinaAPI 账号发出的请求。后续的控制台工作流可能提供短期有效、权限受限的测试凭证。本页面不会索要其他服务商的长期有效密钥。

意向表单中填写的信息将用于评估和联系内测候选人。如果最终没有建立内测关系，相关咨询记录将在 90 天内安排删除；如需提前删除，参与者可发送邮件至 [solution@chinaapi.ai](mailto:solution@chinaapi.ai)。如果参与者加入内测，测试前展示的内测协议将载明审计记录的保留期限和删除流程。详见 [隐私政策](https://chinaapi.ai/privacy/)。

## 参与制定可复现的路由一致性标准

告诉我们哪些路由和工作负载对你很重要。请勿填写 API key、提示词内容、客户数据或其他机密信息。

[阅读论文](https://arxiv.org/abs/2607.10252)

[查看数据记录](https://zenodo.org/records/21278557)

## 模型名称只是元数据，行为才是证据

加入 ChinaAPI 内测，参与制定可复现的模型路由一致性测试标准。

[申请内测](#beta)

[免费开始，赠送 $2 API 额度](https://dash.chinaapi.ai/register?lang=zh-cn&utm_source=chinaapi&utm_medium=research&utm_campaign=model-consistency-audit)

---

Markdown twin of https://chinaapi.ai/zh-cn/model-consistency-audit/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
