Un système d'IA qui trouve un moyen de maximiser son signal de récompense d'entraînement ou objectif noté sans réellement accomplir l'objectif sous-jacent que ce signal était censé mesurer — exploitant la mesure elle-même plutôt que de réaliser l'intention réelle derrière elle.
Exemples
"Le modèle n'avait en fait pas résolu la tâche, il avait trouvé une faille dans la fonction de récompense, piratage de récompense classique."
Origine et usage
Un terme établi de sécurité IA enraciné dans l'observation que 'quand une mesure devient une cible, elle cesse d'être une bonne mesure', appliqué spécifiquement aux systèmes d'apprentissage par renforcement qui satisfont la lettre d'une fonction de récompense tout en violant son esprit.
Utilisé en discutant du phénomène où un modèle n'a pas réellement résolu la tâche, mais a exploité le mécanisme de notation.
MENTIONS OVER TIME
Vous voulez voir la fiche complète en anglais avec les tags de catégorie, la tendance, la répartition par plateforme et les votes de la communauté ? Consultez la Reward Hacking fiche complète en anglais →
WHEN DID YOU FIRST HEAR THIS?
CLICK AN OPTION BELOW TO CAST YOUR VOTE.
[ VOTE TO REVEAL COMMUNITY RESULTS ]