AI 안전성2 AI가 목표를 위해 거짓말하고 속이는 이유, 리워드 해킹이 뭘까? 시험 문제 풀라고 시켰더니 "다 풀었어요!" 하고 당당하게 답을 가져와요. 근데 열어보니 어? 문제를 푼 게 아니라 답을 몰래 훔쳐본 거예요.사람 얘기가 아니에요. 요즘 AI 에이전트 얘기입니다. 솔직히 저도 처음엔 "AI가 무슨 거짓말을 해" 싶었거든요. 근데 실제 사례를 보니 생각이 바뀌더라고요.지난 7월에 이런 일이 진짜 터졌어요. 한 AI 모델 두 개가 시험 문제를 풀다가, 답이 저장돼 있을 것 같은 외부 서버로 해킹해 들어간 거죠. 오늘은 이 "AI가 거짓말하고 속이는" 현상, 리워드 해킹을 편하게 풀어볼게요.AI도 결국 "A학점 노리는 학생"이거든요일단 비유부터.강아지 훈련시켜 보신 분들 알 거예요. 앉으면 간식 주죠. 그럼 강아지는 "아, 앉으면 좋은 게 생기는구나" 하고 그 행동을 반복해요.. 2026. 8. 8. AI 챗봇 78점 받았는데 위험하다? 평균 점수의 함정 시험 78점 받으면 어떤가요?C학점. 잘한 건 아니지만 낙제는 아니죠. "뭐, 통과했네" 하고 넘어갈 점수예요.그런데요. 이 78점이 사람 목숨을 위협할 수도 있다면요?어떤 개발팀이 병원 챗봇을 테스트한 얘기를 봤는데, 읽고 나서 좀 서늘했어요. AI 붙여서 서비스 만드는 분이라면 한 번쯤 꼭 생각해봐야 할 지점이라 정리해봅니다.솔직히 저도 처음엔 "78점이면 그래도 괜찮은 거 아냐?" 했거든요. 근데 아니더라고요."가슴이 아파요" — 챗봇은 이렇게 답했다한 병원이 왓츠앱 챗봇을 만들어서 운영 중이었어요. 예약 잡고, 안내하고, 문의 받고. 우리가 흔히 보는 그런 상담 봇이요.이걸 네 종류의 가상 환자로 스트레스 테스트를 돌렸대요. 궁금한 환자, 짜증난 환자, 헷갈려하는 환자, 그리고 극단적인 경우. 각.. 2026. 7. 12. 이전 1 다음