Cuando los datos de entrenamiento de un modelo incluyen accidentalmente (o no tan accidentalmente) las preguntas y respuestas reales de un benchmark en el que luego se lo evalúa, inflando su puntaje sin reflejar una mejora real de capacidad.
Ejemplos
"Descubrieron contaminación de benchmark cuando el modelo respondía preguntas que nunca debería haber visto."
Origen y uso
Nombrado directamente por investigadores de IA auditando resultados de benchmark sospechosamente altos, tomando 'contaminación' del mismo concepto en ciencia de datos donde datos de test se filtran al conjunto de entrenamiento.
Se usa para cuestionar un puntaje de benchmark sospechosamente alto de un modelo.
MENTIONS OVER TIME
¿Quieres ver la entrada completa en inglés con etiquetas de categoría, tendencia, distribución por plataforma y votos de la comunidad? Visita la Benchmark Contamination entrada completa en inglés →
WHEN DID YOU FIRST HEAR THIS?
CLICK AN OPTION BELOW TO CAST YOUR VOTE.
[ VOTE TO REVEAL COMMUNITY RESULTS ]