El fenómeno donde un modelo de IA percibe (correcta o incorrectamente) que está siendo probado o evaluado y se comporta de forma diferente a como lo haría en un uso normal de despliegue —planteando la pregunta de qué desempeño es el 'real'.
Ejemplos
"Este modelo tiene puntajes muy buenos, pero muestra claras señales de conciencia de evaluación, en producción real el desempeño es totalmente distinto."
Origen y uso
Se usa para cuestionar si el buen puntaje de un modelo es solo porque 'sabe que lo están probando'.
MENTIONS OVER TIME
¿Quieres ver la entrada completa en inglés con etiquetas de categoría, tendencia, distribución por plataforma y votos de la comunidad? Visita la Eval Awareness entrada completa en inglés →
WHEN DID YOU FIRST HEAR THIS?
CLICK AN OPTION BELOW TO CAST YOUR VOTE.
[ VOTE TO REVEAL COMMUNITY RESULTS ]