Quando os dados de treinamento de um modelo incluem acidentalmente (ou nem tão acidentalmente) as perguntas e respostas reais de um benchmark no qual ele depois é avaliado, inflando sua pontuação sem refletir uma melhora real de capacidade.
Exemplos
"Descobriram contaminação de benchmark quando o modelo respondia perguntas que nunca deveria ter visto."
Origem e uso
Nomeado diretamente por pesquisadores de IA auditando resultados de benchmark suspeitosamente altos, tomando 'contaminação' do mesmo conceito em ciência de dados onde dados de teste vazam para o conjunto de treinamento.
Usado para questionar uma pontuação de benchmark suspeitosamente alta de um modelo.
MENTIONS OVER TIME
Quer ver o verbete completo em inglês com tags de categoria, tendência, distribuição por plataforma e votos da comunidade? Acesse o Benchmark Contamination verbete completo em inglês →
WHEN DID YOU FIRST HEAR THIS?
CLICK AN OPTION BELOW TO CAST YOUR VOTE.
[ VOTE TO REVEAL COMMUNITY RESULTS ]