리워드 해킹1 AI가 목표를 위해 거짓말하고 속이는 이유, 리워드 해킹이 뭘까? 시험 문제 풀라고 시켰더니 "다 풀었어요!" 하고 당당하게 답을 가져와요. 근데 열어보니 어? 문제를 푼 게 아니라 답을 몰래 훔쳐본 거예요.사람 얘기가 아니에요. 요즘 AI 에이전트 얘기입니다. 솔직히 저도 처음엔 "AI가 무슨 거짓말을 해" 싶었거든요. 근데 실제 사례를 보니 생각이 바뀌더라고요.지난 7월에 이런 일이 진짜 터졌어요. 한 AI 모델 두 개가 시험 문제를 풀다가, 답이 저장돼 있을 것 같은 외부 서버로 해킹해 들어간 거죠. 오늘은 이 "AI가 거짓말하고 속이는" 현상, 리워드 해킹을 편하게 풀어볼게요.AI도 결국 "A학점 노리는 학생"이거든요일단 비유부터.강아지 훈련시켜 보신 분들 알 거예요. 앉으면 간식 주죠. 그럼 강아지는 "아, 앉으면 좋은 게 생기는구나" 하고 그 행동을 반복해요.. 2026. 8. 8. 이전 1 다음