Conjunto de dados
165 models · 4 languages[ 1 ]
Os dados apresentados no artigo referem-se aos testes em inglês, chinês, russo e árabe. Este não é um conjunto de dados ChinaAPI .
Papel · registro de dadosUm método de caixa preta publicado demonstra que a repetição de saídas de um único token pode formar uma impressão digital comportamental mensurável. A ChinaAPI está prototipando uma auditoria de consistência reproduzível para rotas de API.
Conjunto de dados
165 models · 4 languagesOs dados apresentados no artigo referem-se aos testes em inglês, chinês, russo e árabe. Este não é um conjunto de dados ChinaAPI .
Papel · registro de dadosCusto da auditoria
~100 one-token queriesO artigo apresenta essa contagem aproximada de requisições para um protocolo 8-cell . O custo real da API e a robustez das evidências dependem do endpoint e da configuração.
PapelResultado da verificação
<11% EER with 8 probe cellsResultado relatado de acordo com o protocolo experimental do artigo. Não se trata de uma taxa de erro garantida para rotas, solicitações ou provedores arbitrários.
PapelPor que uma única resposta não prova nada?
Um identificador de modelo informa o que uma rota afirma servir. Não é uma evidência independente do comportamento da rota.
Amostragem aleatória, atualizações de serviço, avisos do sistema e políticas de roteamento podem alterar a conclusão de uma tarefa.
O tempo de resposta pode expor as condições da infraestrutura, mas não pode, por si só, identificar um modelo.
As evidências úteis provêm do padrão das respostas normalizadas repetidas, e não de uma única resposta.
O que o artigo realmente fez
Os pesquisadores usaram instruções restritas, projetadas para gerar respostas de uma palavra, repetiram a amostragem, normalizaram as categorias de respostas retornadas e compararam as impressões digitais resultantes, semelhantes a probabilidades.
Faça perguntas com um espaço de resposta pequeno e controlado para que as respostas repetidas possam ser contabilizadas de forma consistente.
Coletar várias saídas independentes de um único token sob configurações fixas de ponto final e amostragem.
Mapeie formas de superfície equivalentes em categorias de resposta estáveis antes da comparação.
Meça se duas distribuições de respostas estão mais próximas do que o esperado para modelos diferentes.
As divisões independentes mantêm uma forma semelhante.
Os picos e os pesos das categorias divergem.
Texto alternativo: o painel da esquerda mostra três distribuições de barras ilustrativas diferentes. O painel do meio sobrepõe duas distribuições amostradas independentemente do mesmo modelo ilustrativo e mostra alturas de barras semelhantes. O painel da direita sobrepõe dois modelos ilustrativos diferentes e mostra picos distintos e pesos de categoria. Nenhuma medição real do modelo é mostrada.
Principais resultados da pesquisa
O estudo constatou que as impressões digitais do mesmo modelo permanecem substancialmente mais semelhantes do que as impressões digitais de modelos diferentes.
Quando amostras do mesmo modelo foram divididas ao meio, suas impressões digitais ficaram cerca de uma ordem de magnitude mais próximas do que amostras de modelos diferentes. Essa comparação é relatada no artigo na seção sobre a construção da sonda e as métricas de distância.[ 1 ]
O artigo também relata uma anomalia no ecossistema em que um endpoint que carregava um rótulo proprietário de referência era indistinguível, em termos de distribuição, dos modelos de Qwen aberto. Esta é uma observação relatada pelos autores do artigo, não um teste ChinaAPI ou uma alegação de atribuição.[ 1 ]
| Resultado do artigo | Valor relatado |
|---|---|
Classificação de famílias de modelos[ 1 ]A precisão do teste leave-one-out relatada no artigo. Papel | 59.5% |
linha de base aleatória[ 1 ]A linha de base aleatória foi relatada juntamente com o resultado da classificação. Papel | 18.4% |
Verificação completa 40-cell EER[ 1 ]Taxa de erro igual sob o protocolo 40-cell do artigo. Papel | 7.3% |
Verificação 8-cell[ 1 ]Relatado com aproximadamente 100 solicitações de um token; não é uma garantia de rota universal. Papel | < 11% |
Todos os valores são relatados por Um token é suficiente.O registro de pesquisa associado está disponível em Zenodo.
Proposta de beta privado
A versão beta privada revelará as evidências necessárias para reproduzir e contestar uma comparação. O relatório foi concebido para preservar o contexto metodológico, e não para reduzir o resultado a uma pontuação inexplicável.
Solicite os parâmetros e a versão exata do conjunto de sondas.
Teste os carimbos de data/hora, a rota, a configuração e a contagem de amostras.
Respostas brutas juntamente com suas categorias normalizadas.
O nome do modelo solicitado e qualquer identificador de modelo retornado pela API.
Divergência de Jensen-Shannon em relação a uma impressão digital de referência versionada.
Intervalo de confiança, tipo de anomalia e alteração em relação às janelas anteriores.
Como interpretar um relatório
De acordo com a referência
As diferenças observadas permanecem dentro da faixa de amostragem esperada para esta configuração.
Evidências insuficientes
O painel de amostras ou tarefas atual não permite uma comparação confiável.
Sinal de incompatibilidade detectado
Múltiplas células de teste independentes diferem da referência além do limite estabelecido. Investigações adicionais são necessárias.
Limites do método
Limite de dados beta
A primeira versão beta destina-se a avaliar solicitações feitas na conta ChinaAPI do próprio participante. Um fluxo de trabalho posterior no Painel de Controle poderá oferecer credenciais de teste restritas e de curta duração. Esta página não solicitará uma chave de longa duração de outro provedor.
Os dados do formulário de interesse são usados para avaliar e contatar os candidatos beta. Caso não se estabeleça uma relação beta, a consulta será agendada para exclusão em até 90 dias; os participantes podem solicitar a exclusão antecipada em solução@ chinaapi .aiSe um participante aderir, o contrato beta exibido antes do teste especificará o período de retenção dos registros de auditoria e o fluxo de trabalho de exclusão. Consulte o política de Privacidade.
Interesse em beta privado
Informe quais rotas e cargas de trabalho são importantes. Não inclua um API key , conteúdo de prompts, dados do cliente ou outras informações confidenciais.
Prévia da pesquisa
Participe do beta privado da ChinaAPI para ajudar a moldar um padrão reproduzível para testes de consistência de modelo-rota.