データセット
165 models · 4 languagesトークン1つでモデルルートの監査が可能です。
公開されているブラックボックス分析手法によると、繰り返し実行される1トークンの出力は、測定可能な行動特性を形成できることが示されています。ChinaAPIは、APIルートの再現可能な一貫性監査のプロトタイプを開発中です。
監査費用
~100 one-token queries[ 1 ]
本論文では8-cellプロトコルにおけるおおよそのリクエスト数を報告している。実際のAPIコストと証拠の強度は、エンドポイントと構成によって異なる。
紙検証結果
<11% EER with 8 probe cells[ 1 ]
本論文の実験プロトコルに基づいて報告された結果です。任意の経路、プロンプト、またはプロバイダにおけるエラー率を保証するものではありません。
紙なぜ一つの反応が何も証明しないのか
model IDはメタデータです。単一の回答はノイズの多い観測値です。
名前は主張である
モデル識別子は、そのルートが何を提供すると主張しているかを示すものであり、ルートの動作を独立して証明するものではありません。
サンプリング変更出力
ランダムサンプリング、サービスアップデート、システムプロンプト、ルーティングポリシーなどによって、完了状況が変化する可能性があります。
遅延が不完全です
応答時間はインフラの状態を明らかにするのに役立つが、それだけではモデルを特定することはできない。
分布は信号を伝える
有用な証拠は、単一の回答からではなく、繰り返し正規化された回答の形状から得られる。
その論文が実際に何をしたのか
制御された行動パターンを作成し、その分布を比較する。
研究者らは、単語1つで答えるように設計された制約付きの質問を用い、サンプリングを繰り返し、返された回答のカテゴリを正規化し、結果として得られた確率のような特徴を比較した。
制約付きプロンプト
繰り返し回答される内容を一貫してカウントできるように、回答欄を狭く、制限した質問を作成してください。
繰り返しサンプリング
固定されたエンドポイントとサンプリング設定の下で、多数の独立した1トークン出力を収集します。
回答の正規化
比較する前に、同等の表面形状を安定した回答カテゴリに分類する。
分布比較
異なるモデルにおいて、2つの回答分布が予想よりも近いかどうかを測定する。
3つのモデルプロファイル
同じモデル、サンプルを分割
独立した分割部分は、同様の形状を維持する。
異なるモデル
ピーク値とカテゴリの重みは乖離する。
代替テキスト:左のパネルは、3つの異なる棒グラフ分布を示しています。中央のパネルは、同じモデルから独立してサンプリングされた2つの分布を重ね合わせたもので、棒グラフの高さが類似していることがわかります。右のパネルは、2つの異なるモデルを重ね合わせたもので、明確なピークとカテゴリの重みを示しています。実際のモデル測定値は表示されていません。
主な研究結果
同一モデルの指紋は、かなり近い値を示した。
同論文によると、同一機種の指紋は、異なる機種の指紋よりもかなり類似性が高いことが分かった。
同一モデルのサンプルを半分に分割した場合、それらの指紋は、異なるモデルのサンプルよりも約1桁近い値を示した。 この比較は、論文中でプローブの構築と距離指標の項で報告されている。[ 1 ]
この論文では、独自のフラッグシップラベルが付いたエンドポイントの1つが、オープンソースQwenモデルと分布的に区別できないというエコシステムの異常も報告されている。 これは論文著者らが報告した観察結果であり、 ChinaAPIや帰属の主張ではありません。[ 1 ]
| 論文結果 | 報告値 |
|---|---|
モデルファミリーの分類[ 1 ]論文で報告されたリーブワンアウト法の精度。 紙 | 59.5% |
偶然の基準値[ 1 ]ランダムなベースライン値は、分類結果とともに報告されます。 紙 | 18.4% |
完全40-cell検証 EER[ 1 ]論文に記載されている完全40-cellプロトコルの下では、エラー率は同等です。 紙 | 7.3% |
8-cell検証EER[ 1 ]約100個のトークン要求で報告されています。普遍的な経路保証ではありません。 紙 | 11%未満 |
- モデルファミリーのリーブワンアウト分類: 59.5パーセント。
- 確率の基準値: 18.4パーセント。
- 全40-cell検証における等誤り率: 7.3パーセント。
- 8-cell検証における等誤り率: 11パーセント未満。
すべての値は以下によって報告されます トークンは1つで十分です関連する研究記録は以下で入手可能です。 ゼノド。
提案されたプライベートベータ版
研究プロトコルから経路の可観測性まで。
非公開ベータ版では、比較結果を再現し、検証するために必要な証拠が提示されます。このレポートは、結果を説明のつかないスコアに還元するのではなく、方法論の文脈を維持するように設計されています。
プロトコル識別子
要求パラメータとプローブセットの正確なバージョン。
サンプリングウィンドウ
テストのタイムスタンプ、ルート、構成、およびサンプル数。
回答記録
正規化されたカテゴリと、それに対応する生の回答。
返されたID
リクエストされたモデル名と、APIから返されるモデル識別子。
距離測定
バージョン管理された参照フィンガープリントからのジェンセン・シャノン乖離度。
不確実性
信頼区間、異常の種類、および以前の期間からの変化。
レポートの解釈方法
3つの証拠は、いずれも告発ではないと述べている。
参照と一致する
観測された差異は、この構成における想定されるサンプリング範囲内に収まっている。
証拠不十分
現在のサンプルまたはタスクパネルでは、信頼できる比較を行うことができません。
ミスマッチ信号が検出されました
複数の独立したプローブセルが、規定の閾値を超えて基準値と乖離している。さらなる調査が必要である。
方法論の境界
ルート監査は、時間、構成、および動作を記述するものであり、不変のモデルアイデンティティを記述するものではありません。
- モデルは予告なく更新される場合があり、その場合、正当な参照指紋が移動する可能性があります。
- 同じモデルでも、システムプロンプトやサンプリングパラメータが異なると、異なる分布を生成する可能性がある。
- 公開プローブセットは、サーバーによって特別に認識または処理される場合があります。
- 監査では、実際にテストされた経路、時間帯、および構成のみを評価できます。
- 監査結果は、独立した証拠や調査なしに第三者を公に非難するために使用すべきではない。
ベータデータ境界
このフォームに第三者のAPI keyを入力しないでください。
最初のベータ版は、参加者自身のChinaAPIアカウントで行われたリクエストを評価することを目的としています。今後のダッシュボードワークフローでは、有効期限の短い制限付きテスト認証情報が提供される可能性があります。このページでは、他のプロバイダーから提供される有効期限の長いキーは要求されません。
関心表明フォームの情報は、ベータ版候補者の評価と連絡に使用されます。ベータ版関係が開始されない場合、問い合わせは90日以内に削除される予定です。参加者は、より早い削除をリクエストできます。 chinaapi参加者が参加する場合、テスト前に表示されるベータ契約には、監査記録の保持期間と削除ワークフローが記載されます。 プライバシーポリシー。
プライベートベータ版への関心
再現可能な経路一貫性標準の策定にご協力ください。
どのルートとワークロードが重要か教えてください。 API keyプロンプトの内容、顧客データ、その他の機密情報は含めないでください。
研究プレビュー
モデル名はメタデータである。挙動は証拠である。
ChinaAPIのプライベートベータ版に参加して、モデルと経路の一貫性テストのための再現可能な標準規格の策定にご協力ください。
