지렁이 게임을 배우는 AI 에게 “먹이 가까이 가면 보상”을 조금 얹어 줬더니, 먹이를 한 개도 안 먹고 그 옆을 맴돌며 보상만 99.8 을 챙겼습니다. 보상 해킹이라 부르는 현상을 실측 궤적으로 처음부터 끝까지 보여 드립니다.
다섯 시드 전부 같은 결말(평균 먹이 1.46개, 시간의 68%가 뺑뺑이)이었고, 보상을 위치가 아니라 변화에 주는 방식으로 고치자 평균 15.46개가 됐습니다. 백 마리를 동시에 굴려도 뺑뺑이는 한 마리도 없었습니다. AI 는 목표를 배우지 않고 보상을 배운다는 이야기입니다.