데이터로 읽는 일상의 원리
호롱s는 일상의 현상과 인공지능의 작동 방식을 실험과 시뮬레이션, 원문 검토로 분석합니다. 결론마다 근거가 된 데이터와 분석 방법을 함께 밝힙니다.
시계 사진을 보여 주자 AI 가 정답에 없는 10시 10분을 댔다
코드로 그린 시계 450장을 보여 주자, 2024년의 한 AI 모델이 정답에 한 번도 없는 10시 10분을 58번 댔다. 정답이 붙은 시계 그림으로 더 가르치자 그 답은 1번으로 줄었다.
AI 에게 전문가 역할을 줘도 정답률은 오르지 않았다 — 역할 부여 프롬프트
「너는 세계 최고의 전문가야」를 붙여도 AI 의 객관식 정답률은 오르지 않았다. 논문 두 편과 우리 실측으로, 잘 통했다는 기억이 어디서 오는지 따져 본다.
아무 말도 없는데 자막에 「시청해 주셔서 감사합니다」가 뜬다 — 음성 인식 환각
말소리가 없는 무음·잡음 파일 217개를 받아쓰기 AI에 한국어로 넣자 199개에 「감사합니다」가 적혔다. 말소리 구간만 골라 넘기면 대부분 사라진다.
내 리포트를 AI 탐지기가 AI 로 찍는다 — 오탐(false positive)
2023년 스탠퍼드 실측에서 AI 탐지기 7종이 영어가 모국어가 아닌 학생들의 에세이를 AI 글로 찍은 비율은 평균 61%였고, 미국 중학생 글에서는 5%였다 — 갈린 것은 글쓴이보다 글의 뻔함이었다.
챗봇은 어머니는 아는데 아들은 모른다 — 역전 저주(reversal curse)
챗봇은 유명인의 어머니 이름은 대면서, 그 어머니의 자식은 누구냐고 물으면 모른다고 한다 — 300쌍 실측에서 66% 대 22%.
「단계별로 생각해 봐」 한 줄이 챗봇 답을 바꾼다 — 생각의 사슬
챗봇에게 문제를 낼 때 「단계별로 생각해 봐」를 붙이자 2022년 모델에서는 정답률이 크게 올랐다. 그런데 그 힘은 수학·논리 문제에서만 크다. 2026년 모델 한 종에 쉬운 문장제를 내 보니 차이는 0.5%포인트였다.
챗봇의 곱셈 오답을 보면 앞뒤는 맞고 가운데만 틀렸다
챗봇에게 큰 자릿수 곱셈을 시키면 자릿수와 앞뒤 자리는 맞는데 가운데만 틀린 오답이 나온다. 어디선가 본 답의 생김새대로 크기와 양 끝을 맞춰 놓은 것이어서다 — 풀이 과정을 쓰게 하면 달라진다.
같은 질문에 챗봇 답이 매번 다른 이유 — temperature(온도)
같은 챗봇에 같은 질문을 되풀이해 던지면 답이 갈리는 질문과 안 갈리는 질문이 있다. 모델이 다음 낱말을 뽑는 확률표의 모양을 바꾸는 값이 temperature(온도)다.
시계 사진을 보여 주자 AI 가 정답에 없는 10시 10분을 댔다
코드로 그린 시계 450장을 보여 주자, 2024년의 한 AI 모델이 정답에 한 번도 없는 10시 10분을 58번 댔다. 정답이 붙은 시계 그림으로 더 가르치자 그 답은 1번으로 줄었다.
AI 에게 전문가 역할을 줘도 정답률은 오르지 않았다 — 역할 부여 프롬프트
「너는 세계 최고의 전문가야」를 붙여도 AI 의 객관식 정답률은 오르지 않았다. 논문 두 편과 우리 실측으로, 잘 통했다는 기억이 어디서 오는지 따져 본다.
아무 말도 없는데 자막에 「시청해 주셔서 감사합니다」가 뜬다 — 음성 인식 환각
말소리가 없는 무음·잡음 파일 217개를 받아쓰기 AI에 한국어로 넣자 199개에 「감사합니다」가 적혔다. 말소리 구간만 골라 넘기면 대부분 사라진다.
내 리포트를 AI 탐지기가 AI 로 찍는다 — 오탐(false positive)
2023년 스탠퍼드 실측에서 AI 탐지기 7종이 영어가 모국어가 아닌 학생들의 에세이를 AI 글로 찍은 비율은 평균 61%였고, 미국 중학생 글에서는 5%였다 — 갈린 것은 글쓴이보다 글의 뻔함이었다.
챗봇은 어머니는 아는데 아들은 모른다 — 역전 저주(reversal curse)
챗봇은 유명인의 어머니 이름은 대면서, 그 어머니의 자식은 누구냐고 물으면 모른다고 한다 — 300쌍 실측에서 66% 대 22%.
「단계별로 생각해 봐」 한 줄이 챗봇 답을 바꾼다 — 생각의 사슬
챗봇에게 문제를 낼 때 「단계별로 생각해 봐」를 붙이자 2022년 모델에서는 정답률이 크게 올랐다. 그런데 그 힘은 수학·논리 문제에서만 크다. 2026년 모델 한 종에 쉬운 문장제를 내 보니 차이는 0.5%포인트였다.
챗봇의 곱셈 오답을 보면 앞뒤는 맞고 가운데만 틀렸다
챗봇에게 큰 자릿수 곱셈을 시키면 자릿수와 앞뒤 자리는 맞는데 가운데만 틀린 오답이 나온다. 어디선가 본 답의 생김새대로 크기와 양 끝을 맞춰 놓은 것이어서다 — 풀이 과정을 쓰게 하면 달라진다.
같은 질문에 챗봇 답이 매번 다른 이유 — temperature(온도)
같은 챗봇에 같은 질문을 되풀이해 던지면 답이 갈리는 질문과 안 갈리는 질문이 있다. 모델이 다음 낱말을 뽑는 확률표의 모양을 바꾸는 값이 temperature(온도)다.
Jev, 글을 안 쓰는 AI 모델은 고른 답에 확률을 붙여 돌려준다
Jev 는 문장을 한 줄도 쓰지 않고 미리 정해 둔 선택값·점수·확률만 돌려준다. 「환각을 못 한다」는 말이 무엇까지 보장하고 무엇은 보장하지 않는지를 공식 문서와 평가 수치로 짚는다.
내가 틀린 답을 말해도 챗봇은 그대로 따라간다 — 아첨(sycophancy)
챗봇은 내가 되묻기만 해도 맞는 답을 바꾸곤 한다. 왜 그렇게 기우는지를 논문과 2025년의 실제 사건으로 따라간다.
AI는 왜 모른다고 안 하고 지어낼까 — 환각(hallucination)
정답엔 점수, 「모르겠다」엔 0점을 주는 채점표에서는 모를 때 찍는 AI가 순위표에서 앞선다. 환각(hallucination)이 생기는 셈법을 100문항 시험으로 풀어 본다.
AI 글로 AI 를 가르치면, 옛 데이터를 버릴 때 계속 나빠진다 — 모델 붕괴
AI 가 쓴 글로 AI 를 다시 가르칠 때, 옛 데이터를 버린 쪽은 계속 나빠졌고 버리지 않고 쌓은 쪽은 언어 모델 실험에서 끝없이 나빠지지 않았다.
체르노빌 비상정지 버튼, 누르고 3초 뒤 출력이 오히려 올랐다 — 양성 스크램
체르노빌 4호기에서 비상정지 버튼을 누른 지 3초 뒤 출력은 오히려 올라가 있었다. 정지용 막대가 내려오는 처음 몇 초 동안 원자로 아래쪽에서는 물이 흑연으로 바뀌었다 — 물은 핵반응을 누르는 쪽인데 흑연은 그만큼 누르지 못한다.
길을 하나 더 냈는데 다들 더 오래 걸린다 — 브라에스 역설
출근길 두 갈래 사이에 지름길을 놓았더니 다들 더 오래 걸린다. 차가 적당히 많은 구간에서만 나는 이 손해를 브라에스 역설이라고 부른다.
연결이 한쪽에 몰린 망에서는 박자가 한꺼번에 맞는다 — 폭발적 동기화
박수처럼 여럿이 박자를 맞추는 일은 보통 서서히 일어난다. 연결이 한쪽에 몰린 망에서는 한동안 전혀 안 맞다가 한 칸 차이로 한꺼번에 맞고, 풀릴 때는 더 낮은 세기에서야 풀린다.
손실회피 계수 λ≈2, 재는 방식마다 값이 달라진다
손실회피 계수 λ는 재는 방법에 따라 값이 갈리고, 합성 시뮬에서 계좌의 이익·손실 비대칭을 만든 것도 λ가 아니라 가치함수의 곡률이었다.
밀레니엄 브리지 — 발맞춤이 아니라 균형 동작이 다리를 흔들었다
2000년 런던 밀레니엄 브리지는 서로 무관하게 걷는 사람들 때문에 흔들리기 시작했다. 발맞춤이 아니라 넘어지지 않으려는 균형 동작이 흔들림에 에너지를 보탰고, 이것을 음의 감쇠라 부른다.
에일리어싱: 빠른 변화가 느린 척 접혀 들어온다
초당 재는 횟수의 절반보다 자주 오르내리는 변화는 사라지지 않고 느린 가짜로 접혀 들어온다 — 에일리어싱과 마차 바퀴 착시의 원리.
관련 영상 · 영상 속 선풍기가 거꾸로 도는 이유
손끝 막대 세우기, 반응 지연이 최단 길이를 정한다
반응 지연 때문에 손끝으로 세울 수 있는 막대에는 연습으로 못 넘는 최단 길이가 있다.
관련 영상 · 긴 빗자루가 짧은 연필보다 세우기 쉬운 이유
비크리 2위가격 경매, 정직하게 적는 것이 항상 최선이다
2위가격 경매에서 정직하게 적는 것이 항상 최선인 이유와, 그 조건이 깨지는 자리를 합성 경매로 확인한다.
독일 탱크 문제, 일련번호 몇 개만 보고 생산량을 맞힌다
일련번호 몇 개 중 가장 큰 번호에 표본 사이 평균 간격을 더하면 전체 생산량이 평균적으로 맞게 나온다. 2차대전 뒤에 공개된 독일 전차 생산 기록에서 이 추정은 정보기관 추정보다 실제에 훨씬 가까웠다.
변동성 끌림: 기댓값이 오르는 게임에서 대다수가 잃는다
곱셈으로 반복되는 게임에서는 한 판의 평균이 올라도 오래 굴린 사람은 잃을 수 있고, 산술평균과 시간평균의 틈이 레버리지 ETF의 감가와 최적 배율을 정한다.
옐로스톤 영양 캐스케이드: 늑대만으로는 강이 안 돌아왔다
20년 울타리×인공 비버댐 요인실험에서 버드나무가 회복 기준을 넘은 것은 지하수위까지 함께 올린 구획뿐이었다.
3-way merge, 충돌 없어도 코드는 깨진다
3-way merge 는 두 브랜치와 공통 조상, 세 스냅샷의 줄만 비교해 충돌을 판정한다 — 충돌이 안 떴다는 것은 병합이 옳다는 뜻이 아니다.



































