Kumpulan data
165 models · 4 languages[ 1 ]
Dilaporkan oleh makalah untuk pengujian dalam bahasa Inggris, Mandarin, Rusia, dan Arab. Ini bukan dataset ChinaAPI.
Kertas · catatan dataMetode black-box yang telah dipublikasikan menunjukkan bahwa keluaran satu token yang berulang dapat membentuk sidik jari perilaku yang terukur. ChinaAPI sedang membuat prototipe audit konsistensi yang dapat direproduksi untuk rute API.
Kumpulan data
165 models · 4 languagesDilaporkan oleh makalah untuk pengujian dalam bahasa Inggris, Mandarin, Rusia, dan Arab. Ini bukan dataset ChinaAPI.
Kertas · catatan dataBiaya audit
~100 one-token queriesMakalah ini melaporkan perkiraan jumlah permintaan untuk protokol 8-cell . Biaya API aktual dan kekuatan bukti bergantung pada titik akhir dan konfigurasi.
KertasHasil verifikasi
<11% EER with 8 probe cellsHasil yang dilaporkan berdasarkan protokol eksperimental makalah ini. Ini bukan jaminan tingkat kesalahan untuk rute, perintah, atau penyedia yang sembarangan.
KertasMengapa satu jawaban tidak membuktikan apa pun
Pengidentifikasi model memberi tahu Anda apa yang diklaim dilayani oleh suatu rute. Ini bukanlah bukti independen tentang perilaku rute tersebut.
Pengambilan sampel acak, pembaruan layanan, perintah sistem, dan kebijakan perutean semuanya dapat mengubah satu penyelesaian.
Waktu respons dapat mengungkap kondisi infrastruktur, tetapi hal itu sendiri tidak dapat mengidentifikasi suatu model.
Bukti yang dapat digunakan berasal dari bentuk jawaban yang dinormalisasi dan diulang, bukan dari satu jawaban tunggal.
Apa yang sebenarnya dilakukan oleh makalah tersebut?
Para peneliti menggunakan petunjuk terbatas yang dirancang untuk menghasilkan jawaban satu kata, mengulangi pengambilan sampel, menormalkan kategori jawaban yang dikembalikan, dan membandingkan sidik jari seperti probabilitas yang dihasilkan.
Ajukan pertanyaan dengan ruang lingkup jawaban yang kecil dan terkontrol sehingga keluaran yang berulang dapat dihitung secara konsisten.
Kumpulkan banyak keluaran satu token independen di bawah pengaturan titik akhir dan pengambilan sampel yang tetap.
Petakan bentuk permukaan yang setara ke dalam kategori jawaban yang stabil sebelum perbandingan.
Mengukur apakah dua distribusi jawaban lebih dekat dari yang diharapkan untuk model yang berbeda.
Split independen mempertahankan bentuk yang serupa.
Puncak dan bobot kategori berbeda.
Alternatif teks: panel kiri menunjukkan tiga distribusi batang ilustratif yang berbeda. Panel tengah menampilkan dua distribusi yang diambil sampelnya secara independen dari model ilustratif yang sama dan menunjukkan tinggi batang yang serupa. Panel kanan menampilkan dua model ilustratif yang berbeda dan menunjukkan puncak serta bobot kategori yang berbeda. Tidak ada pengukuran model sebenarnya yang ditampilkan.
Hasil penelitian utama
Makalah tersebut menemukan bahwa sidik jari dari model yang sama tetap jauh lebih mirip daripada sidik jari dari model yang berbeda.
Ketika sampel dari model yang sama dibagi menjadi dua, sidik jarinya sekitar satu tingkat lebih dekat daripada sampel dari model yang berbeda. Perbandingan ini dilaporkan dalam makalah tersebut berdasarkan konstruksi penyelidikan dan metrik jaraknya.[ 1 ]
Makalah ini juga melaporkan anomali ekosistem di mana satu titik akhir yang membawa label unggulan eksklusif secara distribusi tidak dapat dibedakan dari model Qwen terbuka. Ini adalah pengamatan yang dilaporkan oleh penulis makalah, bukan uji ChinaAPI atau klaim atribusi.[ 1 ]
| Hasil makalah | Nilai yang dilaporkan |
|---|---|
Klasifikasi keluarga model[ 1 ]Akurasi leave-one-out yang dilaporkan oleh makalah tersebut. Kertas | 59.5% |
Garis dasar peluang[ 1 ]Data dasar acak dilaporkan bersamaan dengan hasil klasifikasi. Kertas | 18.4% |
Verifikasi 40-cell lengkap[ 1 ]Tingkat kesalahan yang sama di bawah protokol 40-cell makalah ini. Kertas | 7.3% |
8-cell EER[ 1 ]Dilaporkan dengan sekitar 100 permintaan satu token; bukan jaminan rute universal. Kertas | < 11% |
Semua nilai dilaporkan oleh Satu Token Saja Sudah Cukup; catatan penelitian terkait tersedia di Zenodo.
Usulan versi beta privat
Versi beta tertutup ini akan mengungkap bukti yang dibutuhkan untuk mereproduksi dan menantang perbandingan tersebut. Laporan ini dirancang untuk mempertahankan konteks metode, bukan untuk mereduksi hasilnya menjadi skor yang tidak dapat dijelaskan.
Parameter permintaan dan versi probe-set yang tepat.
Stempel waktu pengujian, rute, konfigurasi, dan jumlah sampel.
Respons mentah beserta kategori yang dinormalisasi.
Nama model yang diminta dan pengidentifikasi model apa pun yang dikembalikan oleh API.
Penyimpangan Jensen-Shannon dari sidik jari referensi yang diberi versi.
Interval kepercayaan, jenis anomali, dan perubahan dari jendela sebelumnya.
Cara menafsirkan laporan
Sesuai dengan referensi
Perbedaan yang diamati tetap berada dalam rentang pengambilan sampel yang diharapkan untuk konfigurasi ini.
Bukti tidak cukup
Sampel atau panel tugas saat ini tidak dapat mendukung perbandingan yang andal.
Sinyal ketidaksesuaian terdeteksi
Beberapa sel uji independen berbeda dari sel referensi di luar ambang batas yang ditentukan. Investigasi lebih lanjut diperlukan.
Batasan metode
Batas data beta
Versi beta pertama ini bertujuan untuk mengevaluasi permintaan yang dibuat melalui akun ChinaAPI milik peserta sendiri. Alur kerja Dasbor selanjutnya mungkin akan menawarkan kredensial uji coba yang berumur pendek dan terbatas. Halaman ini tidak akan meminta kunci jangka panjang dari penyedia lain.
Rincian formulir minat digunakan untuk mengevaluasi dan menghubungi kandidat beta. Jika tidak ada hubungan beta yang dimulai, permintaan tersebut dijadwalkan untuk dihapus dalam waktu 90 hari; peserta dapat meminta penghapusan lebih awal di solusi@ chinaapi .aiJika peserta bergabung, perjanjian beta yang ditampilkan sebelum pengujian akan menyatakan periode penyimpanan catatan audit dan alur kerja penghapusan. Lihat Kebijakan Privasi.
Minat beta pribadi
Sebutkan rute dan beban kerja mana yang penting. Jangan menyertakan tanda API key , isi prompt, data pelanggan, atau rahasia lainnya.
Pratinjau penelitian
Bergabunglah dengan program beta privat ChinaAPI untuk membantu membentuk standar yang dapat direproduksi untuk pengujian konsistensi model-rute.