Conjunto de datos
165 models · 4 languages[ 1 ]
El artículo publicó datos para pruebas en inglés, chino, ruso y árabe. Este no es un conjunto de datos de ChinaAPI.
Papel · registro de datosUn método de caja negra publicado demuestra que las salidas repetidas de un solo token pueden formar una huella digital de comportamiento medible. ChinaAPI está desarrollando un prototipo de auditoría de consistencia reproducible para las rutas de la API.
Conjunto de datos
165 models · 4 languagesEl artículo publicó datos para pruebas en inglés, chino, ruso y árabe. Este no es un conjunto de datos de ChinaAPI.
Papel · registro de datosCosto de auditoría
~100 one-token queriesEl documento informa sobre este número aproximado de solicitudes para un protocolo 8-cell . El costo real de la API y la solidez de la evidencia dependen del punto final y la configuración.
PapelResultado de la verificación
<11% EER with 8 probe cellsResultado reportado según el protocolo experimental del artículo. No se trata de una tasa de error garantizada para rutas, indicaciones o proveedores arbitrarios.
PapelPor qué una respuesta no prueba nada
Un identificador de modelo indica qué servicio pretende ofrecer una ruta. No constituye una prueba independiente del comportamiento de la ruta.
El muestreo aleatorio, las actualizaciones del servicio, las indicaciones del sistema y la política de enrutamiento pueden modificar el resultado de una prueba.
El tiempo de respuesta puede revelar las condiciones de la infraestructura, pero por sí solo no puede identificar un modelo.
La evidencia útil proviene de la forma de las respuestas normalizadas repetidas, no de una sola respuesta.
Lo que realmente hizo el periódico
Los investigadores utilizaron preguntas con restricciones diseñadas para obtener respuestas de una sola palabra, repitieron el muestreo, normalizaron las categorías de respuesta obtenidas y compararon las huellas digitales resultantes, similares a las de probabilidad.
Formula preguntas con un espacio de respuesta pequeño y controlado para que las respuestas repetidas puedan contabilizarse de forma consistente.
Recopile múltiples resultados independientes de un token bajo configuraciones fijas de punto final y muestreo.
Antes de compararlas, clasifique las formas de superficie equivalentes en categorías de respuesta estables.
Mide si dos distribuciones de respuestas están más cerca de lo esperado para diferentes modelos.
Las divisiones independientes mantienen una forma similar.
Los picos y las ponderaciones de las categorías divergen.
Texto alternativo: el panel izquierdo muestra tres distribuciones de barras ilustrativas diferentes. El panel central superpone dos distribuciones muestreadas independientemente del mismo modelo ilustrativo y muestra alturas de barra similares. El panel derecho superpone dos modelos ilustrativos diferentes y muestra picos y ponderaciones de categoría distintos. No se muestran mediciones reales del modelo.
Resultados clave de la investigación
El estudio reveló que las huellas dactilares de un mismo modelo permanecen sustancialmente más cercanas que las huellas dactilares de diferentes modelos.
Cuando se dividieron por la mitad muestras del mismo modelo, sus huellas dactilares resultaron ser aproximadamente un orden de magnitud más similares que las de muestras de diferentes modelos. Esta comparación se presenta en el artículo en el apartado de su construcción de sonda y métricas de distancia.[ 1 ]
El artículo también informa de una anomalía en el ecosistema en la que un punto final que llevaba una etiqueta insignia propietaria era indistinguible en términos de distribución de los modelos Qwen abierto. Esta es la observación reportada por los autores del artículo, no una ChinaAPI ni una afirmación de atribución.[ 1 ]
| Resultado del artículo | Valor reportado |
|---|---|
Clasificación de la familia de modelos[ 1 ]Precisión de validación cruzada dejando uno fuera, según lo informado en el artículo. Papel | 59.5% |
Línea de base aleatoria[ 1 ]Se informa una línea de base aleatoria junto con el resultado de la clasificación. Papel | 18.4% |
Verificación completa 40-cell[ 1 ]Tasa de error igual según el protocolo 40-cell del artículo. Papel | 7.3% |
8-cell verificación EER[ 1 ]Se reporta con aproximadamente 100 solicitudes de un token; no es una garantía de ruta universal. Papel | < 11% |
Todos los valores son informados por Un token es suficiente; el registro de investigación asociado está disponible en Zenodo.
Beta privada propuesta
La versión beta privada revelará las pruebas necesarias para reproducir y cuestionar una comparación. El informe está diseñado para preservar el contexto metodológico, no para simplificar el resultado a una puntuación sin explicación.
Solicite los parámetros y la versión exacta del conjunto de sondas.
Marcas de tiempo de prueba, ruta, configuración y recuento de muestras.
Respuestas sin procesar junto con sus categorías normalizadas.
El nombre del modelo solicitado y cualquier identificador de modelo devuelto por la API.
Divergencia de Jensen-Shannon respecto de una huella digital de referencia versionada.
Intervalo de confianza, tipo de anomalía y cambio con respecto a ventanas anteriores.
Cómo interpretar un informe
De acuerdo con la referencia
Las diferencias observadas se mantienen dentro del rango de muestreo esperado para esta configuración.
Pruebas insuficientes
La muestra o el panel de tareas actual no permiten realizar una comparación fiable.
Se detectó una señal de discrepancia.
Varias células de prueba independientes difieren de la referencia más allá del umbral establecido. Se justifica una investigación más exhaustiva.
Límites del método
Límite de datos beta
La primera versión beta tiene como objetivo evaluar las solicitudes realizadas con la cuenta ChinaAPI del participante. Un flujo de trabajo posterior en el panel de control podría ofrecer credenciales de prueba restringidas y de corta duración. Esta página no solicitará una clave permanente de otro proveedor.
Los detalles del formulario de interés se utilizan para evaluar y contactar a los candidatos beta. Si no se inicia una relación beta, la consulta se programará para su eliminación en un plazo de 90 días; los participantes pueden solicitar una eliminación anticipada en solución@ chinaapi .aiSi un participante se une, el acuerdo beta que se muestra antes de las pruebas indicará el período de retención de registros de auditoría y el flujo de trabajo de eliminación. Consulte el política de privacidad.
Interés en la versión beta privada
Indíquenos qué rutas y cargas de trabajo son importantes. No incluya API key , contenido de las indicaciones, datos de clientes ni otros secretos.
Vista previa de la investigación
Únete a la versión beta privada de ChinaAPI para ayudar a definir un estándar reproducible para las pruebas de coherencia entre modelos y rutas.