数据集
165 models · 4 languages审计成本
~100 one-token queries[1]
这是论文针对 8 单元协议报告的近似请求数。实际 API 成本和证据强度取决于端点与配置。
论文验证结果
<11% EER with 8 probe cells[1]
该结果是在论文的实验协议下报告的。它并非对任意路由、提示词或服务商都能保证的错误率。
论文为什么单次响应证明不了什么
model ID 只是元数据,单个回答只是带噪声的观测
名称只是声明
模型标识符只说明某条路由声称提供的是什么,并不是该路由行为的独立证据。
采样会改变输出
随机采样、服务更新、系统提示词和路由策略,都可能改变单次补全的结果。
延迟信息并不完整
响应时间可以反映基础设施的状况,但仅凭它无法识别模型。
信号来自分布
可用的证据来自多次重复、经规范化的回答所呈现的分布形状,而不是任何单个回答。
论文实际做了什么
构建受控的行为指纹,再比较分布
研究者使用受约束的提示词,引导模型只用一个词作答;随后重复采样,对返回的答案类别做规范化,再比较由此得到的类概率指纹。
受约束的提示词
提出答案空间小且受控的问题,让重复输出可以被一致地计数。
重复采样
在固定的端点和采样设置下,收集大量相互独立的单 token 输出。
答案规范化
比较之前,先把表面形式不同但等价的回答映射到稳定的答案类别。
分布比较
衡量两个答案分布是否比不同模型之间预期的更接近。
三个模型画像
同一模型,拆分样本
独立拆分出的样本保持相似的形状。
不同模型
峰值与类别权重出现分化。
文字替代说明:左图展示三个不同的示意柱状分布。中图叠加了来自同一示意模型、独立采样的两个分布,柱高相近。右图叠加了两个不同的示意模型,峰值与类别权重明显不同。图中不含任何真实模型的测量数据。
拟推出的内测
从研究协议到路由可观测性
内测将公开复现和质疑某项比较所需的证据。报告在设计上会保留方法背景,而不是把结果压缩成一个无从解释的分数。
协议标识
请求参数,以及确切的探针集版本。
采样窗口
测试时间戳、路由、配置和样本数。
答案记录
原始响应及其规范化后的类别。
返回的身份标识
请求时的模型名称,以及 API 返回的任何模型标识符。
距离度量
与带版本号的参考指纹之间的 Jensen-Shannon 散度。
不确定性
置信区间、异常类型,以及与此前窗口相比的变化。
如何解读报告
三种证据状态,均不构成指控
与参考一致
观测到的差异仍处于该配置下预期的采样范围内。
证据不足
当前样本或任务集不足以支撑可靠的比较。
检测到不一致信号
多个独立的探针单元与参考的差异超出了设定阈值。有必要进一步调查。
方法边界
路由审计描述的是特定时间、特定配置下的行为,而不是一成不变的模型身份
- 模型可能在没有提前通知的情况下更新,从而使原本合法的参考指纹发生偏移。
- 同一模型在不同的系统提示词或采样参数下,可能产生不同的分布。
- 公开的探针集可能被服务端识别或特殊处理。
- 审计只能评估实际测试过的路由、时间窗口和配置。
- 在没有独立证据和调查的情况下,不应使用审计结果公开指控第三方。
内测数据边界
本表单不收集第三方 API key
首轮内测计划评估参与者通过自己的 ChinaAPI 账号发出的请求。后续的控制台工作流可能提供短期有效、权限受限的测试凭证。本页面不会索要其他服务商的长期有效密钥。
意向表单中填写的信息将用于评估和联系内测候选人。如果最终没有建立内测关系,相关咨询记录将在 90 天内安排删除;如需提前删除,参与者可发送邮件至 [email protected]。如果参与者加入内测,测试前展示的内测协议将载明审计记录的保留期限和删除流程。详见 隐私政策。
研究预览
模型名称只是元数据,行为才是证据
加入 ChinaAPI 内测,参与制定可复现的模型路由一致性测试标准。
