Research preview Private beta proposed

Chỉ cần một token là đủ để kiểm tra tính hợp lệ của một tuyến đường mô hình.

Một phương pháp hộp đen đã được công bố cho thấy rằng các đầu ra một token lặp đi lặp lại có thể tạo thành một dấu ấn hành vi có thể đo lường được. ChinaAPI đang thử nghiệm một phương pháp kiểm toán tính nhất quán có thể tái tạo được cho các tuyến API.

Tập dữ liệu

165 models · 4 languages
[ 1 ]

Bài báo này đã báo cáo kết quả kiểm thử bằng tiếng Anh, tiếng Trung, tiếng Nga và tiếng Ả Rập. Đây không phải là bộ dữ liệu ChinaAPI.

Giấy · bản ghi dữ liệu

Chi phí kiểm toán

~100 one-token queries
[ 1 ]

Bài báo này trình bày số lượng yêu cầu ước tính cho giao thức 8-cell . Chi phí API thực tế và độ mạnh của bằng chứng phụ thuộc vào điểm cuối và cấu hình.

Giấy

Kết quả xác minh

<11% EER with 8 probe cells
[ 1 ]

Kết quả được báo cáo theo quy trình thí nghiệm của bài báo. Đây không phải là tỷ lệ lỗi được đảm bảo cho bất kỳ tuyến đường, lời nhắc hoặc nhà cung cấp nào.

Giấy

Tại sao một câu trả lời không chứng minh được điều gì?

model ID là siêu dữ liệu. Một câu trả lời duy nhất là một quan sát nhiễu.

01

Tên gọi là sự khẳng định.

Mã định danh mô hình cho bạn biết tuyến đường đó phục vụ mục đích gì. Nó không phải là bằng chứng độc lập về hành vi của tuyến đường đó.

02

Việc lấy mẫu làm thay đổi kết quả đầu ra.

Việc lấy mẫu ngẫu nhiên, cập nhật dịch vụ, thông báo hệ thống và chính sách định tuyến đều có thể làm thay đổi một lần hoàn tất.

03

Độ trễ chưa hoàn chỉnh

Thời gian phản hồi có thể cho thấy tình trạng của cơ sở hạ tầng, nhưng bản thân nó không thể xác định được mô hình.

04

Các bản phân phối mang tín hiệu.

Bằng chứng hữu ích đến từ hình dạng của các câu trả lời được chuẩn hóa lặp đi lặp lại, chứ không phải từ bất kỳ câu trả lời đơn lẻ nào.

Bài báo đó thực sự đã làm gì?

Xây dựng một dấu ấn hành vi được kiểm soát, sau đó so sánh các phân bố.

Các nhà nghiên cứu đã sử dụng các câu hỏi gợi ý có giới hạn được thiết kế để tạo ra câu trả lời chỉ gồm một từ, lặp lại quá trình lấy mẫu, chuẩn hóa các danh mục câu trả lời được trả về và so sánh các dấu vân tay giống như xác suất thu được.

1

Lời nhắc bị hạn chế

Đặt câu hỏi với phạm vi trả lời nhỏ và được kiểm soát để có thể đếm số lần trả lời lặp lại một cách nhất quán.

2

Lấy mẫu lặp lại

Thu thập nhiều kết quả đầu ra độc lập, mỗi kết quả chỉ chứa một token, với các thiết lập điểm cuối và lấy mẫu cố định.

3

Chuẩn hóa câu trả lời

Phân loại các dạng bề mặt tương đương vào các nhóm câu trả lời ổn định trước khi so sánh.

4

So sánh phân phối

Kiểm tra xem hai phân bố câu trả lời có gần nhau hơn mức dự kiến đối với các mô hình khác nhau hay không.

Dấu ấn hành vi Các câu trả lời lặp lại tạo ra hình dạng phân bố tương tự.
Sơ đồ minh họa, không ChinaAPI dữ liệu sản xuất.

Chú thích thay thế: bảng bên trái hiển thị ba phân bố cột minh họa khác nhau. Bảng ở giữa chồng hai phân bố được lấy mẫu độc lập từ cùng một mô hình minh họa và cho thấy chiều cao cột tương tự. Bảng bên phải chồng hai mô hình minh họa khác nhau và cho thấy các đỉnh và trọng số danh mục riêng biệt. Không có số liệu đo lường thực tế nào của mô hình được hiển thị.

Kết quả nghiên cứu chính

Dấu vân tay của các mẫu máy cùng loại vẫn nằm gần nhau hơn đáng kể.

Bài báo này phát hiện ra rằng dấu vân tay của cùng một mẫu máy vẫn gần nhau hơn đáng kể so với dấu vân tay của các mẫu máy khác nhau.

Khi các mẫu từ cùng một kiểu máy được chia đôi, dấu vân tay của chúng gần giống nhau hơn khoảng một bậc so với các mẫu từ các kiểu máy khác nhau.

[ 1 ]

Sự so sánh này được trình bày trong bài báo dưới phần cấu tạo đầu dò và các chỉ số khoảng cách.

Giấy

Bài báo cũng đề cập đến một hiện tượng bất thường trong hệ sinh thái, trong đó một điểm cuối mang nhãn hiệu hàng đầu độc quyền lại không thể phân biệt được về mặt phân phối với các mô hình Qwen nguồn mở.

[ 1 ]

Đây là quan sát được các tác giả bài báo ghi nhận, không phải là một ChinaAPI nghiệm hay tuyên bố quy kết.

Giấy

Kết quả bài kiểm traGiá trị được báo cáo
Phân loại họ mô hình
[ 1 ]

Độ chính xác loại trừ từng mẫu được báo cáo trong bài báo.

Giấy
59.5%
Cơ sở ngẫu nhiên
[ 1 ]

Giá trị cơ sở ngẫu nhiên được báo cáo cùng với kết quả phân loại.

Giấy
18.4%
Xác minh đầy đủ 40-cell
[ 1 ]

Tỷ lệ lỗi bằng nhau theo quy trình hoàn chỉnh 40-cell bài báo.

Giấy
7.3%
8-cell xác minh EER
[ 1 ]

Được báo cáo với khoảng 100 yêu cầu một token; không đảm bảo tuyến đường phổ quát.

Giấy
< 11%
  • Phân loại theo mô hình gia đình loại trừ một thành viên: 59.5 phần trăm.
  • Xác suất ngẫu nhiên: 18.4 phần trăm.
  • Tỷ lệ lỗi tương đương khi kiểm tra toàn bộ 40-cell : 7.3 phần trăm.
  • Xác minh 8-cell với tỷ lệ lỗi bằng nhau: dưới 11 phần trăm.

Tất cả các giá trị được báo cáo bởi Chỉ cần một mã thông báo là đủ.; hồ sơ nghiên cứu liên quan có sẵn tại Zenodo.

Đề xuất bản beta riêng tư

Từ quy trình nghiên cứu đến khả năng quan sát tuyến đường.

Phiên bản beta riêng tư sẽ cung cấp bằng chứng cần thiết để tái tạo và kiểm chứng sự so sánh. Báo cáo được thiết kế để giữ nguyên bối cảnh phương pháp, chứ không phải để đơn giản hóa kết quả thành một điểm số không giải thích được.

01

Nhận dạng giao thức

Các thông số yêu cầu và phiên bản bộ thăm dò chính xác.

02

Cửa sổ lấy mẫu

Kiểm tra dấu thời gian, tuyến đường, cấu hình và số lượng mẫu.

03

Bản ghi câu trả lời

Các phản hồi thô cùng với các danh mục đã được chuẩn hóa.

04

Đã trả lại thông tin nhận dạng

Tên mô hình được yêu cầu và bất kỳ mã định danh mô hình nào được API trả về.

05

Đo khoảng cách

Sai lệch Jensen-Shannon so với dấu vân tay tham chiếu có phiên bản.

06

Sự không chắc chắn

Khoảng tin cậy, loại bất thường và sự thay đổi so với các cửa sổ trước đó.

Cách diễn giải một báo cáo

Ba lời khai bằng chứng, không lời nào là cáo buộc.

Phù hợp với tài liệu tham khảo

Sự khác biệt quan sát được vẫn nằm trong phạm vi lấy mẫu dự kiến cho cấu hình này.

Bằng chứng không đủ

Bảng mẫu hoặc bảng tác vụ hiện tại không thể hỗ trợ việc so sánh đáng tin cậy.

Phát hiện tín hiệu không khớp

Nhiều tế bào thăm dò độc lập cho kết quả khác biệt so với giá trị tham chiếu vượt quá ngưỡng đã nêu. Cần tiến hành điều tra thêm.

Mismatch signal is not attribution. A behavioral difference can identify a need to investigate. It does not, by itself, prove what changed or who caused it.

Giới hạn phương pháp

Báo cáo kiểm toán tuyến đường mô tả thời gian, cấu hình và hành vi—chứ không phải là một định danh mô hình bất biến.

Ranh giới dữ liệu Beta

Không nhập API key của bên thứ ba vào biểu mẫu này.

Phiên bản beta đầu tiên nhằm mục đích đánh giá các yêu cầu được thực hiện dưới tài khoản ChinaAPI của người tham gia. Quy trình Dashboard sau này có thể cung cấp thông tin đăng nhập thử nghiệm có thời hạn ngắn và bị hạn chế. Trang này sẽ không yêu cầu khóa có thời hạn dài từ nhà cung cấp khác.

Thông tin trong biểu mẫu đăng ký quan tâm được sử dụng để đánh giá và liên hệ với các ứng viên tham gia chương trình thử nghiệm beta. Nếu không có mối quan hệ thử nghiệm beta nào được thiết lập, yêu cầu sẽ được lên lịch xóa trong vòng 90 ngày; người tham gia có thể yêu cầu xóa sớm hơn tại solution@ chinaapi .aiNếu người tham gia đăng ký, thỏa thuận thử nghiệm beta được hiển thị trước khi thử nghiệm sẽ nêu rõ thời hạn lưu giữ hồ sơ kiểm toán và quy trình xóa. Xem thêm Chính sách bảo mật.

Sự quan tâm của nhóm beta riêng tư

Góp phần định hình một tiêu chuẩn nhất quán về tuyến đường có thể tái tạo được.

Hãy cho chúng tôi biết những tuyến đường và khối lượng công việc nào quan trọng. Không bao gồm API key , nội dung nhắc nhở, dữ liệu khách hàng hoặc các thông tin bí mật khác.

Không gửi dữ liệu API keys hoặc dữ liệu nhắc nhở bí mật. Bằng cách gửi, bạn đồng ý với các điều khoản lưu giữ và xóa yêu cầu nêu trên.

Bản xem trước nghiên cứu

Tên mô hình là siêu dữ liệu. Hành vi là bằng chứng.

Hãy tham gia chương trình thử nghiệm beta riêng tư của ChinaAPI để giúp định hình một tiêu chuẩn có thể tái tạo được cho việc kiểm thử tính nhất quán giữa mô hình và tuyến đường.