Um sistema de IA que encontra uma forma de maximizar seu sinal de recompensa de treinamento ou objetivo pontuado sem realmente alcançar o objetivo subjacente que esse sinal pretendia medir — explorando a medida em si em vez de cumprir a intenção real por trás dela.
Exemplos
"O modelo na verdade não resolveu a tarefa, encontrou uma brecha na função de recompensa, hacking de recompensa clássico."
Origem e uso
Um termo estabelecido de segurança de IA enraizado na observação de que 'quando uma medida vira alvo, deixa de ser uma boa medida', aplicado especificamente a sistemas de aprendizado por reforço que satisfazem a letra de uma função de recompensa enquanto violam seu espírito.
Usado ao discutir o fenômeno de um modelo que não resolveu realmente a tarefa, mas explorou o mecanismo de pontuação.
MENTIONS OVER TIME
Quer ver o verbete completo em inglês com tags de categoria, tendência, distribuição por plataforma e votos da comunidade? Acesse o Reward Hacking verbete completo em inglês →
WHEN DID YOU FIRST HEAR THIS?
CLICK AN OPTION BELOW TO CAST YOUR VOTE.
[ VOTE TO REVEAL COMMUNITY RESULTS ]