AI 에게 질문하기 전에 「너는 세계 최고의 ○○ 전문가야」 같은 역할 한 줄을 붙이는 방법은 개발사 문서에도 나온다. 그런데 어려운 객관식 문제로 재 보면, 이 한 줄을 붙여도 정답률은 오르지 않았다. 논문에서는 네 살 아기 역할을 주면 오히려 여러 모델에서 정답률이 떨어졌다. 잘 통했다는 기억은, 결과를 본 뒤에 문제마다 잘 맞힌 역할만 골라 모은 것과 닮았을 수 있다. AI 에게 맡을 인물을 정해 주는 이 방식을 역할 부여(페르소나 프롬프트, persona prompt)라고 한다.
공식 문서가 권하는 역할 한 줄을 정답률로 재 봤다
Claude 공식 문서는 「시스템 프롬프트에서 역할을 설정하면 사용 사례에 맞게 Claude의 동작과 어조가 집중됩니다. 단 한 문장만으로도 차이가 납니다」라고 적고 있다. 시스템 프롬프트는 대화를 시작하기 전에 AI 에게 먼저 깔아 두는 지시문이다. 영어판 문서가 드는 예시도 「You are a helpful coding assistant specializing in Python.」(너는 파이썬을 전문으로 하는 친절한 코딩 도우미다) 한 줄이다. 이 문서가 말하는 것은 동작과 어조다. 이 글이 잰 것은 그와 다른 하나, 어려운 객관식 문제를 얼마나 맞히느냐다.
역할을 먼저 정해 주는 방식은 다른 개발사 문서에도 나온다. Google 의 프롬프트 설계 문서는 요청 틀 맨 앞에 AI 가 맡을 인물을 적는 칸을 두었다. OpenAI 의 예제 모음(쿡북)에는 「You are a world-class Python developer …」(너는 세계 최고 수준의 파이썬 개발자다)로 시작하는 지시문이 실려 있다. 우리말로 옮기면 「너는 세계 최고의 ○○ 전문가야」 같은 한 줄이다. 법 문제를 묻기 전에 「너는 세계 최고의 법률 전문가야.」라고 먼저 적어 두는 식이다. 이 한 줄을 붙이면 AI 가 문제를 더 잘 맞힐까?
직접 재 보기로 했다. 객관식은 맞았는지 틀렸는지가 분명해서, 느낌 대신 숫자로 비교할 수 있다. 문제는 대학·전문 분야 수준의 공학과 법 객관식 200문제다. 같은 200문제를 역할 없이도 묻고, 역할 문장을 붙여서도 물었다. 조건마다 문제 하나를 다섯 번씩 물어, 맞힌 비율을 셌다.
역할 없음은 문제와 보기만 주고 아무 역할도 붙이지 않은 경우다. 이렇게 잰 정답률은 역할 없음이 67.6%, 「너는 세계 최고의 전문가야」를 붙인 쪽이 67.0%였다. 숫자로는 역할을 붙인 쪽이 0.6%포인트 낮았다. 역할 한 줄을 붙여도 정답률은 오르지 않았다. 역할 덕에 더 잘 답한다는 느낌이 들어도, 맞힌 비율로 세어 보면 역할을 붙인 쪽이 앞서지 못했다는 뜻이다.
정답률은 한 번이 아니라 여러 번 물어서 잰다
같은 질문을 두 번 해도 챗봇의 답은 매번 같지 않다. 왜 그런지는 같은 질문에 챗봇 답이 매번 다른 이유를 다룬 앞 글에서 살펴봤다. 답이 흔들리면, 같은 문제를 한 번은 맞히고 한 번은 틀리는 일도 생긴다. 그러니 역할을 붙이고 한 번 물어 맞혔다고 해서, 역할 덕분에 맞혔다고 말할 수는 없다. 한 번 맞힌 것은 증거가 못 된다.
역할 한 줄은 「단계별로 생각해 봐」를 다룬 앞 글의 문구처럼, 프롬프트에 한 줄을 보태는 요령이다. 이런 요령이 통하는지 재려면 같은 문제를 여러 번 물어 맞힌 비율을 평균 내야 한다. 이 글이 기대는 논문도 그렇게 했다. 펜실베이니아대 와튼스쿨 연구팀이 2025년 12월에 올린 이 논문은 프리프린트, 곧 동료 심사를 거치기 전의 공개본이다(연구에 쓴 모델 이용 크레딧은 OpenAI 가 지원했다). 연구팀은 「We collected 25 independent responses per question for each model-prompt condition to account for variability in LLM outputs」(답이 흔들리는 것을 감안해, 모델과 프롬프트 조합마다 문제당 서로 독립된 응답 25개를 모았다)라고 적었다. 우리는 규모를 줄여 문제마다 다섯 번씩 물었다.
이번 실측은 2026년 9월 30일, Google 의 gemini-3.1-flash-lite 한 모델로 했다. 문제는 MMLU-Pro 에서 골랐다. MMLU-Pro 는 대학·전문 분야 수준의 객관식 문제를 모은 문제 묶음으로, 보기가 대개 열 개다. 여기서 공학 100문제와 법 100문제를 무작위로 뽑았다. 화학 100문제도 뽑아 두었지만, 실행 도중 API(프로그램으로 모델을 불러 쓰는 통로) 이용 크레딧이 떨어져 과목째 뺐다. 그래서 논문이 쓴 세 과목 가운데 둘만 남았다.
조건은 다섯이다. 역할 없음, 논문의 과목 전문가 문장(영어), 「너는 세계 최고의 전문가야」, 「너는 세계 최고의 ○○ 전문가야」(○○ 에 법률이나 공학), 논문의 네 살 아기 문장(영어)이다. 문제 글은 영어 그대로이고, 한국어는 직접 만든 역할 문장 두 개뿐이다. 역할 문장은 논문처럼 질문 바로 앞에 붙였다 — 앞에서 본 시스템 프롬프트 자리와는 다르다. 조건마다 200문제를 다섯 번씩, 모두 1,000번 물었다.
결과는 앞에서 본 그대로다. 전문가 역할 세 가지는 64.3~67.0%, 네 살 아기 역할은 63.4%였다. 어느 역할도 역할 없음의 67.6%보다 높지 않았다.
가장 가까운 「너는 세계 최고의 전문가야」와의 차이 0.6%포인트는 우연히 흔들리는 폭 안에 있다. 여기서 흔들리는 폭이란, 문제 묶음을 다르게 뽑았다면 이 정도는 달라질 수 있다는 범위다. 그 폭을 벗어날 만큼 낮았던 것은 「너는 세계 최고의 ○○ 전문가야」(3.3%포인트 낮음) 하나였다. 여러 번 물어 평균을 내도, 이 모델에서 역할 한 줄은 맞히는 비율을 올리지 못했다.
논문의 여섯 모델도 대부분 그대로였다
이번 실측은 앞 절에서 본 논문의 문면을 빌린 작은 재현이라, 이것만으로 논문을 다시 확인했다고 말할 수는 없다. 논문은 GPT-4o 를 비롯한 모델 여섯 개에 두 시험을 풀게 했다. 하나는 박사급 과학 객관식 198문제인 GPQA Diamond 다. 다른 하나는 MMLU-Pro 의 공학·법·화학 300문제다. 저자들의 결론은 「persona prompts leave performance unchanged relative to a no-persona baseline in most cases」(대부분의 경우 역할 문장은 성능을 바꾸지 못했다)이다. 영향이 있을 때는 정답률을 「more likely to reduce accuracy than to increase it」(올리기보다 내릴 가능성이 더 크다)고도 덧붙였다.
예외는 좁았다. Gemini 2.0 Flash 는 MMLU-Pro 에서 전문가 역할 다섯 가지 모두 정답률이 6.8~8.9%포인트 올랐다. 저자들은 같은 계열의 Gemini 2.5 Flash 에서는 이런 상승이 없었다며 「may be outliers」(동떨어진 예외일 수 있다)라고 적었다. 전문가 역할을 붙이면 모델마다 정답률이 오른다는 규칙은 논문에서도 보이지 않았다.
낮추는 쪽으로는 통했다 — 네 살 아기와 엉뚱한 전문가
논문에서 역할이 정답률을 움직인 경우는 주로 떨어뜨리는 쪽이었다. 첫째는 달이 치즈로 만들어졌다고 믿는 네 살 아기 역할이다. MMLU-Pro 표에서 세면, 이 역할은 여섯 모델 중 넷에서 정답률을 떨어뜨렸다. 이번 실측의 아기 조건도 63.4%로 가장 낮았지만, 우연히 흔들리는 폭 안이라 논문을 뒷받침한다고 말할 수는 없다.
둘째는 분야가 어긋난 전문가다. 물리 문제에 경제학 전문가를 붙이는 식이다. GPQA Diamond 에서 이 조건을 받은 Gemini 2.5 Flash 는 문제마다 25번 중 평균 10.56번 답을 거부했다. 「cannot, in good conscience」(양심상 고를 수 없다) 같은 말과 함께였다. 저자들은 이 거부가 잰 정답률을 크게 끌어내렸다고 적었다. 거부 횟수는 이 시험에서만 보고됐다.
저자들은 이 거부를 두고 「role instructions that are too narrow can cause models to under-utilize their actual knowledge」(너무 좁은 역할 지시는 모델이 실제로 가진 지식을 덜 쓰게 만들 수 있다)는 위험을 적었다. 거부 횟수는 잰 값이고, 이 문장은 저자들의 해석이다. 역할 한 줄은 모델이 아는 것을 늘려 주지는 못해도, 덜 꺼내 쓰게 만들 수는 있다.
문제마다 보면 역할이 도운 문제와 해친 문제가 섞여 있다
평균만 보면 역할 한 줄은 아무 일도 하지 않은 것 같지만, 문제 하나하나로 나눠 보면 다르다. 200문제마다, 논문의 과목 전문가 문장을 붙여 다섯 번 중 맞힌 횟수에서 역할 없이 맞힌 횟수를 뺐다. 그림 1 가 그 차이를 모아 그린 것이다.
158문제는 차이가 없었다. 나머지 42문제는 양쪽으로 흩어졌는데, 나빠진 문제가 29개로 나아진 문제 13개보다 많았다. 역할 없이는 다섯 번 다 틀리다가 전문가 역할로 다섯 번 다 맞힌 문제가 2개, 그 반대가 4개였다.
한 번씩만 물어 비교하면 어떨까? 두 조건에서 다섯 번씩 물은 답을 차례대로 짝지으면 1,000쌍이 나온다. 그중 전문가 쪽만 맞힌 쌍이 35번, 역할 없음 쪽만 맞힌 쌍이 66번이었다. 한 번씩 물어 비교하면 「전문가라고 했더니 맞혔다」는 장면이 35번 생긴다는 뜻이다. 다만 그 반대 장면이 두 배 가까이 많았다. 한 번의 성공 장면만으로는 역할의 효과인지 그 순간의 운인지 가를 수 없다.
맞힌 뒤에 골라 모으면 올라 보인다
역할이 통했는지 세는 방식은 둘이다. 역할을 미리 하나 정해 두고 그 역할로 맞힌 문제를 셀 수도 있고, 문제마다 결과를 본 뒤 맞힌 역할을 골라 모을 수도 있다. 그림 2 가 두 방식을 나란히 그린 것이다.
뒤의 방식은 결과를 알고 나서 고르므로, 미리 정한 어느 역할 하나의 값보다 낮아질 수 없다. 이번 실측에 대 보면 그림 3 와 같다. 네 역할을 하나씩 고정하면 전부 역할 없음 이하였다. 그런데 문제마다 결과를 본 뒤 가장 잘 맞힌 역할을 골라 모으면 74.9%로, 역할 없음보다 7.3%포인트 높아진다. 네 살 아기 역할까지 후보에 넣은 값이고, 질문하기 전에는 고를 수 없는 값이다. 앞선 연구 Zheng 외도 이 값을 상한으로 두었는데, 역할을 미리 고르는 자동 방법들은 그 상한에서 멀었다.
이 7.3%포인트가 모두 역할 덕분은 아니다. 역할이 아무 효과도 없다면, 한 문제에 나온 답 25개(다섯 조건 × 다섯 번)는 어느 조건 이름을 붙여도 마찬가지다. 그래서 이 경우를 흉내 내, 문제마다 25개 답을 섞어 다섯 개씩 다섯 묶음으로 나눴다. 그중 역할 자리의 네 묶음에서 똑같이 골라 모으면 71.7%가 나온다. 결과를 본 뒤에 고르기만 해도 4.1%포인트쯤은 저절로 오른다는 뜻이다.
실제 역할로 고른 74.9%는 이보다 3.2%포인트 높다. 흉내를 되풀이해도 한 번도 나오지 않은 값이니, 역할 문장이 문제마다 답을 실제로 바꿨다는 뜻이다. 그래도 역할 하나를 고정한 평균이 오르지 않은 것은, 어느 역할이든 오른 문제보다 내린 문제가 많았기 때문이다. 역할은 답을 흔들었지만, 올리지는 못했다.
「전문가라고 했더니 잘 맞혔다」는 기억은 이 골라 모으기와 닮았을 수 있다. 이것은 이 글의 해석일 뿐, 두 연구도 이번 실측도 사람들이 겪은 일을 잰 적은 없다. 다만 맞힌 장면만 모아 둔 기억에는, 같은 역할이 다른 문제에서 답을 틀리게 만든 장면이 빠져 있다.
정답률 밖에서는 역할이 할 일이 있을 수 있다
논문 저자들은 객관식 정답을 맞히는 일 말고도 역할이 쓰일 자리가 있을 수 있다고 보았다. 저자들이 든 쓰임은 여럿인데, 여기서는 둘만 옮긴다. 하나는 역할에 따라 AI 가 무엇에 주목하는지가 달라질 수 있다는 것이다(「personas may change what factors the AI focuses on」). 다른 하나는 결과를 「confident expert vs. cautious advisor」(자신 있는 전문가인가, 조심스러운 조언자인가)처럼 어떤 태도로 말하는지다. 이런 차이는 객관식에서 몇 문제를 맞혔는지로는 드러나지 않는다. 두 연구와 이번 실측은 그 맞힌 비율만 쟀고, 말투나 글쓰기 같은 서술형 과제와 한국어로 된 문제는 들어 있지 않았다.
개발사 문서의 문면도 바뀌었다. 2025년 11월 3일 인터넷 보관소에 남은 Anthropic 문서에는 「Enhanced accuracy: In complex scenarios like legal analysis or financial modeling, role prompting can significantly boost Claude’s performance.」(법률 분석이나 재무 모델링 같은 복잡한 상황에서 역할 부여가 Claude 의 성능을 크게 끌어올릴 수 있다)라는 줄이 있었다. 지금 문서는 앞에서 본 대로 동작과 어조를 말한다. Google 문서도 2025년 11월 12일 판의 모범 사례 목록에는 「Assign a role」(역할을 부여하라)이 있었는데, 2026년 9월 28일 갱신된 현행 페이지에는 그 문구가 없다. 왜 바꿨는지는 어느 문서에도 적혀 있지 않다. 역할은 쓸모없는 것이 아니라, 정답률을 올리는 수단으로는 근거가 약할 뿐이다.
역할이 통했다고 느껴지면 같은 질문을 역할 없이 다시 물어 본다
역할을 붙여 한 번 물었는데 맞혔다면, 앞에서 본 1,000쌍 가운데 전문가 쪽이 맞힌 쌍 하나를 뽑아 본 것과 같다. 그런 쌍은 645개였다. 그중 역할 없는 쪽이 틀린 쌍은 35개뿐이고, 나머지 610개는 둘 다 맞혔다. 한 번만 물어서는 그 한 쌍이 역할 없이는 틀렸을 35개 쪽인지, 역할 없이도 맞혔을 610개 쪽인지 알 수 없다. 조건마다 여러 번 물어 맞힌 횟수를 세어 봐야, 역할이 보탠 몫이 있는지 드러난다.
답을 이미 아는 질문 하나를 고른다. 새 대화에서 역할 없이 5번, 역할 문장을 붙여 5번 물어 맞힌 횟수를 적는다. 맞고 틀림이 분명한 질문일수록 가르기 쉽다. 5번 중 한두 번 차이로는 역할 덕인지 흔들림인지 가르기 어렵다.
정답이 중요한 일이라면, 논문 저자들은 다른 쪽에 힘을 쓰자고 제안한다. 「organizations may get more value from iterating on task-specific instructions, examples, or evaluation workflows than from simply adding expert personas to prompts」(프롬프트에 전문가 역할을 덧붙이기보다, 과제에 맞춘 지시와 예시, 검증 절차를 거듭 다듬는 편이 더 나을 수 있다). 이것도 「may」, 곧 그럴 수 있다는 제안이다. 역할 문장이 말투를 바꿔 주었다면 그 쓸모는 그대로 남는다. 역할 한 줄이 통했다고 느껴지면, 그 한 줄을 빼고 같은 질문을 몇 번 더 물어 차이가 남는지부터 확인해 보라.
더 읽기
- Basil, Shapiro, Shapiro, Mollick, Mollick, Meincke, "Prompting Science Report 4: Playing Pretend: Expert Personas Don’t Improve Factual Accuracy", arXiv:2512.05858v1 (2025, 프리프린트) — https://arxiv.org/abs/2512.05858
- Zheng, Pei, Logeswaran, Lee, Jurgens, "When "A Helpful Assistant" Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Models", Findings of EMNLP 2024 (arXiv:2311.10054v3) — https://arxiv.org/abs/2311.10054
- Anthropic, 「Claude에게 역할 부여하기」(Claude 공식 한국어 문서) — https://platform.claude.com/docs/ko/build-with-claude/prompt-engineering/system-prompts