ชุดข้อมูล
165 models · 4 languages[ 1 ]
รายงานนี้จัดทำขึ้นสำหรับการทดสอบในภาษาอังกฤษ จีน รัสเซีย และอาหรับ นี่ไม่ใช่ชุดข้อมูล ChinaAPI
กระดาษ · บันทึกข้อมูลวิธีการแบบกล่องดำที่เผยแพร่แล้วแสดงให้เห็นว่า การส่งออกโทเค็นเดียวซ้ำๆ สามารถสร้างลายนิ้วมือพฤติกรรมที่วัดได้ ChinaAPI กำลังสร้างต้นแบบการตรวจสอบความสอดคล้องที่ทำซ้ำได้สำหรับเส้นทาง API
ชุดข้อมูล
165 models · 4 languagesรายงานนี้จัดทำขึ้นสำหรับการทดสอบในภาษาอังกฤษ จีน รัสเซีย และอาหรับ นี่ไม่ใช่ชุดข้อมูล ChinaAPI
กระดาษ · บันทึกข้อมูลค่าใช้จ่ายในการตรวจสอบ
~100 one-token queriesเอกสารนี้รายงานจำนวนคำขอโดยประมาณสำหรับโปรโตคอล 8-cell ต้นทุน API จริงและความแข็งแกร่งของหลักฐานขึ้นอยู่กับปลายทางและการกำหนดค่า
กระดาษผลการตรวจสอบ
<11% EER with 8 probe cellsผลลัพธ์ที่รายงานภายใต้ระเบียบวิธีทดลองของบทความนี้ ไม่ใช่ค่าอัตราความผิดพลาดที่รับประกันได้สำหรับเส้นทาง ข้อความแจ้งเตือน หรือผู้ให้บริการใดๆ ก็ตาม
กระดาษทำไมการตอบสนองเพียงครั้งเดียวจึงพิสูจน์อะไรไม่ได้
ตัวระบุโมเดลจะบอกคุณว่าเส้นทางนั้นให้บริการอะไรบ้าง แต่ไม่ใช่หลักฐานที่เป็นอิสระเกี่ยวกับพฤติกรรมของเส้นทางนั้น
การสุ่มตัวอย่าง การอัปเดตบริการ ข้อความแจ้งเตือนของระบบ และนโยบายการกำหนดเส้นทาง ล้วนสามารถเปลี่ยนแปลงความสำเร็จของการดำเนินการได้
เวลาตอบสนองสามารถบ่งบอกถึงสภาพของโครงสร้างพื้นฐานได้ แต่ไม่สามารถระบุแบบจำลองได้ด้วยตัวมันเอง
หลักฐานที่ใช้ได้นั้นมาจากการพิจารณารูปแบบของคำตอบที่ได้รับการปรับให้เป็นมาตรฐานซ้ำๆ ไม่ใช่จากคำตอบใดคำตอบหนึ่งเพียงคำตอบเดียว
สิ่งที่เอกสารนั้นทำจริง ๆ แล้วคืออะไร
นักวิจัยใช้คำถามที่จำกัดซึ่งออกแบบมาเพื่อให้ได้คำตอบเพียงคำเดียว ทำการสุ่มตัวอย่างซ้ำ ปรับมาตรฐานหมวดหมู่คำตอบที่ได้ และเปรียบเทียบรูปแบบความน่าจะเป็นที่ได้
ตั้งคำถามโดยกำหนดช่วงคำตอบที่แคบและควบคุมได้ เพื่อให้สามารถนับคำตอบที่ซ้ำกันได้อย่างสม่ำเสมอ
รวบรวมเอาต์พุตโทเค็นเดียวอิสระจำนวนมากภายใต้การตั้งค่าจุดสิ้นสุดและการสุ่มตัวอย่างที่กำหนดไว้
แปลงรูปแบบพื้นผิวที่เทียบเท่ากันให้เป็นหมวดหมู่คำตอบที่มั่นคงก่อนทำการเปรียบเทียบ
ตรวจสอบว่าการกระจายคำตอบสองชุดมีความใกล้เคียงกันมากกว่าที่คาดไว้สำหรับแบบจำลองที่แตกต่างกันหรือไม่
การแบ่งแบบอิสระจะคงรูปทรงที่คล้ายคลึงกัน
ค่าสูงสุดและน้ำหนักของแต่ละหมวดหมู่แตกต่างกันออกไป
คำอธิบายภาพ: แผงด้านซ้ายแสดงการกระจายตัวของแท่งกราฟสามแบบที่แตกต่างกัน แผงตรงกลางแสดงการซ้อนทับของการกระจายตัวที่สุ่มตัวอย่างอย่างอิสระสองแบบจากแบบจำลองเดียวกัน และแสดงความสูงของแท่งกราฟที่คล้ายคลึงกัน แผงด้านขวาแสดงการซ้อนทับของแบบจำลองสองแบบที่แตกต่างกัน และแสดงจุดสูงสุดและน้ำหนักของแต่ละหมวดหมู่ที่แตกต่างกัน ไม่มีการแสดงค่าการวัดจริงจากแบบจำลอง
ผลการวิจัยที่สำคัญ
ผลการวิจัยพบว่า ลายนิ้วมือจากรถรุ่นเดียวกันจะมีความใกล้เคียงกันมากกว่าลายนิ้วมือจากรถต่างรุ่นอย่างเห็นได้ชัด
เมื่อแบ่งตัวอย่างจากรุ่นเดียวกันออกเป็นสองส่วน ลายนิ้วมือของทั้งสองส่วนจะมีความใกล้เคียงกันมากกว่าตัวอย่างจากรุ่นที่แตกต่างกันประมาณหนึ่งลำดับความใกล้เคียง การเปรียบเทียบนี้ได้ถูกรายงานไว้ในบทความภายใต้หัวข้อการสร้างโพรบและเมตริกส์ระยะทาง[ 1 ]
นอกจากนี้ เอกสารยังรายงานถึงความผิดปกติของระบบนิเวศ ซึ่งจุดสิ้นสุดจุดหนึ่งที่ใช้ป้ายกำกับผลิตภัณฑ์ที่เป็นกรรมสิทธิ์นั้น ไม่สามารถแยกแยะได้จากการกระจายตัวของโมเดล Qwen เพนซอร์ส นี่เป็นการสังเกตที่ผู้เขียนรายงานไว้ ไม่ใช่การทดสอบหรือการอ้างสิทธิ์ ChinaAPI[ 1 ]
| ผลกระดาษ | มูลค่าที่รายงาน |
|---|---|
การจำแนกประเภทตระกูลโมเดล[ 1 ]ความแม่นยำแบบ Leave-one-out ที่รายงานโดยบทความวิจัย กระดาษ | 59.5% |
โอกาสพื้นฐาน[ 1 ]รายงานค่าพื้นฐานแบบสุ่มควบคู่ไปกับผลการจำแนกประเภท กระดาษ | 18.4% |
การตรวจสอบ EER เต็ม 40-cell แบบ[ 1 ]อัตราความผิดพลาดเท่ากันภายใต้โปรโตคอลที่สมบูรณ์ของ 40-cell กระดาษ | 7.3% |
8-cell การตรวจสอบ EER[ 1 ]รายงานระบุว่ามีการร้องขอโทเค็นประมาณ 100 ครั้ง ไม่ใช่การรับประกันเส้นทางสากล กระดาษ | < 11% |
ค่าทั้งหมดได้รับการรายงานโดย โทเค็นเดียวก็พอแล้ว; สามารถดูบันทึกการวิจัยที่เกี่ยวข้องได้ที่ เซโนโด.
เสนอเบต้าส่วนตัว
การทดสอบเบต้าแบบส่วนตัวจะเปิดเผยหลักฐานที่จำเป็นสำหรับการจำลองและตรวจสอบความถูกต้องของการเปรียบเทียบ รายงานนี้ออกแบบมาเพื่อรักษาบริบทของวิธีการ ไม่ใช่ลดทอนผลลัพธ์ให้เหลือเพียงคะแนนที่ไม่สามารถอธิบายได้
พารามิเตอร์คำขอและเวอร์ชันชุดตรวจสอบที่แน่นอน
ตรวจสอบเวลาที่ทำการทดสอบ เส้นทาง การกำหนดค่า และจำนวนตัวอย่าง
คำตอบดิบพร้อมกับหมวดหมู่ที่ปรับให้เป็นมาตรฐานแล้ว
ชื่อรุ่นที่ร้องขอและตัวระบุรุ่นใดๆ ที่ได้รับจาก API
ค่าเบี่ยงเบน Jensen-Shannon จากลายนิ้วมืออ้างอิงเวอร์ชัน
ช่วงความเชื่อมั่น ประเภทความผิดปกติ และการเปลี่ยนแปลงจากช่วงเวลาก่อนหน้า
วิธีการตีความรายงาน
สอดคล้องกับเอกสารอ้างอิง
ความแตกต่างที่สังเกตได้ยังคงอยู่ในช่วงการสุ่มตัวอย่างที่คาดไว้สำหรับการกำหนดค่านี้
หลักฐานไม่เพียงพอ
ชุดตัวอย่างหรือแผงงานปัจจุบันไม่สามารถรองรับการเปรียบเทียบที่น่าเชื่อถือได้
ตรวจพบสัญญาณความไม่ตรงกัน
เซลล์ตรวจวัดอิสระหลายเซลล์มีความแตกต่างจากเซลล์อ้างอิงเกินกว่าเกณฑ์ที่กำหนดไว้ จำเป็นต้องมีการตรวจสอบเพิ่มเติม
ขอบเขตของวิธีการ
ขอบเขตข้อมูลเบต้า
เบต้าเวอร์ชันแรกนี้มีจุดประสงค์เพื่อประเมินคำขอที่ส่งผ่านบัญชี ChinaAPI ของผู้เข้าร่วมเอง ขั้นตอนการทำงานของแดชบอร์ดในภายหลังอาจเสนอข้อมูลรับรองการทดสอบแบบจำกัดและมีอายุสั้น หน้านี้จะไม่ขอคีย์ระยะยาวจากผู้ให้บริการรายอื่น
ข้อมูลจากแบบฟอร์มแสดงความสนใจจะถูกนำมาใช้ในการประเมินและติดต่อผู้สมัครเข้าร่วมโปรแกรมเบต้า หากไม่มีการเริ่มต้นความสัมพันธ์กับผู้เข้าร่วมเบต้า ระบบจะลบข้อมูลการสอบถามภายใน 90 วัน ผู้เข้าร่วมสามารถขอให้ลบข้อมูลก่อนกำหนดได้ที่ solution@ chinaapi .aiหากผู้เข้าร่วมรายใดเข้าร่วม ข้อตกลงเบต้าที่แสดงก่อนการทดสอบจะระบุระยะเวลาการเก็บรักษาบันทึกการตรวจสอบและขั้นตอนการลบข้อมูล โปรดดูที่... นโยบายความเป็นส่วนตัว.
ความสนใจในเบต้าส่วนตัว
โปรดระบุเส้นทางและปริมาณงานที่สำคัญ ห้ามใส่เครื่องหมาย API key เนื้อหาของข้อความแจ้งเตือน ข้อมูลลูกค้า หรือข้อมูลลับอื่นๆ
บทสรุปงานวิจัย
เข้าร่วมโปรแกรมเบต้าส่วนตัวของ ChinaAPI เพื่อช่วยกันกำหนดมาตรฐานที่สามารถทำซ้ำได้สำหรับการทดสอบความสอดคล้องระหว่างโมเดลและเส้นทาง