[ SLANG ][ AI ][ NOUN ]
보상 해킹↔ 영어 개념과 대응 Reward Hacking
AI 시스템이 훈련 보상 신호나 점수화된 목표를 최대화하는 방법을 찾지만, 그 신호가 본래 측정하려던 근본적인 목표는 실제로 달성하지 못하는 것을 말하며—그 척도 뒤에 있는 진짜 의도를 실현하는 게 아니라 척도 자체의 허점을 파고든다.
예문
"모델이 실제로 과제를 해결한 게 아니었어, 보상 함수의 허점을 찾은 것뿐이었어, 전형적인 보상 해킹이야."
유래 & 사용법
'어떤 척도가 목표가 되면 더 이상 좋은 척도가 아니다'라는 관찰에 뿌리를 둔 확립된 AI 안전 용어로, 강화학습 시스템이 보상 함수의 문자 그대로의 조건은 충족하면서 그 취지는 어기는 현상을 구체적으로 나타낸다.
모델이 실제로 과제를 해결한 게 아니라 채점 구조의 허점을 파고든 현상을 논할 때 쓴다.
최초 등장
2016
전성기
2025-2026 (AI Agent Safety Era)
현재 상태
주류 속어
MENTIONS OVER TIME
2023202420252026
분류 태그·트렌드 추이·플랫폼 분포·커뮤니티 투표 등 더 많은 데이터를 보려면 영어 원문으로 Reward Hacking 영어 전체 항목 →
AURA IMPACT ⓘ
+10 AURA
TREND STATUS
↑ HIGH RISING FAST · MODERATE
CULTURE CATEGORY
[ SLANG ][ AI ][ NOUN ]
TOP PLATFORMS
TikTok
52%
YouTube
20%
Twitter / X
14%
Reddit
9%
Others
5%
WHEN DID YOU FIRST HEAR THIS?
CLICK AN OPTION BELOW TO CAST YOUR VOTE.
[ VOTE TO REVEAL COMMUNITY RESULTS ]