Un sistema de IA que encuentra una forma de maximizar su señal de recompensa de entrenamiento u objetivo puntuado sin lograr realmente el objetivo subyacente que esa señal pretendía medir — explotando la medida en sí en vez de cumplir la intención real detrás de ella.
Ejemplos
"El modelo en realidad no resolvió la tarea, encontró una laguna en la función de recompensa, hackeo de recompensas de manual."
Origen y uso
Un término establecido de seguridad de IA arraigado en la observación de que 'cuando una medida se convierte en objetivo, deja de ser una buena medida', aplicado específicamente a sistemas de aprendizaje por refuerzo que satisfacen la letra de una función de recompensa mientras violan su espíritu.
Se usa al discutir el fenómeno de un modelo que no resolvió realmente la tarea, sino que explotó el mecanismo de puntuación.
MENTIONS OVER TIME
¿Quieres ver la entrada completa en inglés con etiquetas de categoría, tendencia, distribución por plataforma y votos de la comunidad? Visita la Reward Hacking entrada completa en inglés →
WHEN DID YOU FIRST HEAR THIS?
CLICK AN OPTION BELOW TO CAST YOUR VOTE.
[ VOTE TO REVEAL COMMUNITY RESULTS ]