Research preview Private beta proposed

Un solo token es suficiente para auditar una ruta modelo.

Un método de caja negra publicado demuestra que las salidas repetidas de un solo token pueden formar una huella digital de comportamiento medible. ChinaAPI está desarrollando un prototipo de auditoría de consistencia reproducible para las rutas de la API.

Conjunto de datos

165 models · 4 languages
[ 1 ]

El artículo publicó datos para pruebas en inglés, chino, ruso y árabe. Este no es un conjunto de datos de ChinaAPI.

Papel · registro de datos

Costo de auditoría

~100 one-token queries
[ 1 ]

El documento informa sobre este número aproximado de solicitudes para un protocolo 8-cell . El costo real de la API y la solidez de la evidencia dependen del punto final y la configuración.

Papel

Resultado de la verificación

<11% EER with 8 probe cells
[ 1 ]

Resultado reportado según el protocolo experimental del artículo. No se trata de una tasa de error garantizada para rutas, indicaciones o proveedores arbitrarios.

Papel

Por qué una respuesta no prueba nada

Un model ID es metadatos. Una sola respuesta es una observación ruidosa.

01

Los nombres son afirmaciones

Un identificador de modelo indica qué servicio pretende ofrecer una ruta. No constituye una prueba independiente del comportamiento de la ruta.

02

El muestreo modifica los resultados.

El muestreo aleatorio, las actualizaciones del servicio, las indicaciones del sistema y la política de enrutamiento pueden modificar el resultado de una prueba.

03

La latencia es incompleta

El tiempo de respuesta puede revelar las condiciones de la infraestructura, pero por sí solo no puede identificar un modelo.

04

Las distribuciones llevan la señal

La evidencia útil proviene de la forma de las respuestas normalizadas repetidas, no de una sola respuesta.

Lo que realmente hizo el periódico

Cree una huella digital de comportamiento controlada y luego compare las distribuciones.

Los investigadores utilizaron preguntas con restricciones diseñadas para obtener respuestas de una sola palabra, repitieron el muestreo, normalizaron las categorías de respuesta obtenidas y compararon las huellas digitales resultantes, similares a las de probabilidad.

1

Indicaciones restringidas

Formula preguntas con un espacio de respuesta pequeño y controlado para que las respuestas repetidas puedan contabilizarse de forma consistente.

2

Muestreo repetido

Recopile múltiples resultados independientes de un token bajo configuraciones fijas de punto final y muestreo.

3

Normalización de la respuesta

Antes de compararlas, clasifique las formas de superficie equivalentes en categorías de respuesta estables.

4

Comparación de distribuciones

Mide si dos distribuciones de respuestas están más cerca de lo esperado para diferentes modelos.

Huella conductual Las respuestas repetidas crean una forma de distribución comparable.
Esquema ilustrativo, ChinaAPI datos de producción.

Texto alternativo: el panel izquierdo muestra tres distribuciones de barras ilustrativas diferentes. El panel central superpone dos distribuciones muestreadas independientemente del mismo modelo ilustrativo y muestra alturas de barra similares. El panel derecho superpone dos modelos ilustrativos diferentes y muestra picos y ponderaciones de categoría distintos. No se muestran mediciones reales del modelo.

Resultados clave de la investigación

Las huellas dactilares del mismo modelo permanecieron sustancialmente más cerca.

El estudio reveló que las huellas dactilares de un mismo modelo permanecen sustancialmente más cercanas que las huellas dactilares de diferentes modelos.

Cuando se dividieron por la mitad muestras del mismo modelo, sus huellas dactilares resultaron ser aproximadamente un orden de magnitud más similares que las de muestras de diferentes modelos.

[ 1 ]

Esta comparación se presenta en el artículo en el apartado de su construcción de sonda y métricas de distancia.

Papel

El artículo también informa de una anomalía en el ecosistema en la que un punto final que llevaba una etiqueta insignia propietaria era indistinguible en términos de distribución de los modelos Qwen abierto.

[ 1 ]

Esta es la observación reportada por los autores del artículo, no una ChinaAPI ni una afirmación de atribución.

Papel

Resultado del artículoValor reportado
Clasificación de la familia de modelos
[ 1 ]

Precisión de validación cruzada dejando uno fuera, según lo informado en el artículo.

Papel
59.5%
Línea de base aleatoria
[ 1 ]

Se informa una línea de base aleatoria junto con el resultado de la clasificación.

Papel
18.4%
Verificación completa 40-cell
[ 1 ]

Tasa de error igual según el protocolo 40-cell del artículo.

Papel
7.3%
8-cell verificación EER
[ 1 ]

Se reporta con aproximadamente 100 solicitudes de un token; no es una garantía de ruta universal.

Papel
< 11%
  • Clasificación modelo de exclusión de un elemento en familias: 59.5 por ciento.
  • Probabilidad de referencia: 18.4 por ciento.
  • La verificación completa 40-cell arroja una tasa de error 7.3 por ciento.
  • Tasa de error igual en la verificación de 8-cell : inferior al 11 por ciento.

Todos los valores son informados por Un token es suficiente; el registro de investigación asociado está disponible en Zenodo.

Beta privada propuesta

Desde un protocolo de investigación hasta la observabilidad de la ruta.

La versión beta privada revelará las pruebas necesarias para reproducir y cuestionar una comparación. El informe está diseñado para preservar el contexto metodológico, no para simplificar el resultado a una puntuación sin explicación.

01

Identidad del protocolo

Solicite los parámetros y la versión exacta del conjunto de sondas.

02

Ventana de muestreo

Marcas de tiempo de prueba, ruta, configuración y recuento de muestras.

03

Registro de respuestas

Respuestas sin procesar junto con sus categorías normalizadas.

04

Identidad devuelta

El nombre del modelo solicitado y cualquier identificador de modelo devuelto por la API.

05

Medida de distancia

Divergencia de Jensen-Shannon respecto de una huella digital de referencia versionada.

06

Incertidumbre

Intervalo de confianza, tipo de anomalía y cambio con respecto a ventanas anteriores.

Cómo interpretar un informe

Tres pruebas afirman que ninguna de ellas constituye una acusación.

De acuerdo con la referencia

Las diferencias observadas se mantienen dentro del rango de muestreo esperado para esta configuración.

Pruebas insuficientes

La muestra o el panel de tareas actual no permiten realizar una comparación fiable.

Se detectó una señal de discrepancia.

Varias células de prueba independientes difieren de la referencia más allá del umbral establecido. Se justifica una investigación más exhaustiva.

Mismatch signal is not attribution. A behavioral difference can identify a need to investigate. It does not, by itself, prove what changed or who caused it.

Límites del método

Una auditoría de ruta describe un tiempo, una configuración y un comportamiento, no una identidad de modelo inmutable.

Límite de datos beta

No introduzca una API key de terceros en este formulario.

La primera versión beta tiene como objetivo evaluar las solicitudes realizadas con la cuenta ChinaAPI del participante. Un flujo de trabajo posterior en el panel de control podría ofrecer credenciales de prueba restringidas y de corta duración. Esta página no solicitará una clave permanente de otro proveedor.

Los detalles del formulario de interés se utilizan para evaluar y contactar a los candidatos beta. Si no se inicia una relación beta, la consulta se programará para su eliminación en un plazo de 90 días; los participantes pueden solicitar una eliminación anticipada en solución@ chinaapi .aiSi un participante se une, el acuerdo beta que se muestra antes de las pruebas indicará el período de retención de registros de auditoría y el flujo de trabajo de eliminación. Consulte el política de privacidad.

Interés en la versión beta privada

Ayuda a definir un estándar reproducible para la consistencia de las rutas de enrutamiento.

Indíquenos qué rutas y cargas de trabajo son importantes. No incluya API key , contenido de las indicaciones, datos de clientes ni otros secretos.

No envíe API keys confidencial ni datos personales. Al enviar la información, acepta los términos de retención y eliminación de consultas mencionados anteriormente.

Vista previa de la investigación

Los nombres de los modelos son metadatos. El comportamiento es evidencia.

Únete a la versión beta privada de ChinaAPI para ayudar a definir un estándar reproducible para las pruebas de coherencia entre modelos y rutas.