AI는 모호한 지시에서 사람의 의도를 읽을 수 있을까? 인간과 협업하는 LLM 에이전트 실험

여성이 문과 열쇠가 놓인 미로의 한 지점을 가리키자, 옆의 AI 로봇이 보석까지 이어지는 경로를 살펴보는 모습

같은 지시라도 상대가 어디를 가리키고 무엇을 하려는지에 따라 뜻이 달라진다. 그림은 주변 상황을 살피며 사람의 목표를 추론하는 AI 에이전트를 표현했다.



“저 문 좀 열어줘.” 문이 하나라면 간단한 지시다. 하지만 눈앞에 여러 문이 있고, 함께 일하는 사람이 그중 하나를 향해 움직이고 있다면 이야기가 달라진다. 어느 문을 뜻하는지, 왜 열어야 하는지, 내가 먼저 무엇을 해야 하는지 판단해야 한다. 사람은 대개 말뿐 아니라 상대의 행동과 주변 상황을 함께 살핀다. 인공지능(AI)도 그럴 수 있을까?

심리학에서 타인의 목표나 생각을 추론하는 능력을 마음 이론(Theory of Mind)이라고 부른다. AI 연구에서 이 말을 쓸 때는 주의가 필요하다. AI에게 인간처럼 마음이 있다는 뜻이 아니라, 주어진 단서로 상대의 의도를 얼마나 잘 추론하고 그에 맞게 행동하는지를 평가한다는 뜻이다.

사드와 동료 연구진은 이 능력을 살피기 위해 ‘지시 추론(Instruction Inference)’ 과제를 만들었다. 대형 언어 모델(LLM)이 불완전하거나 모호한 지시를 받았을 때, 협력자의 목표를 파악하고 필요한 행동을 계획할 수 있는지 시험한 것이다.


보석을 찾는 게임에서 지시의 숨은 뜻을 읽다

첫 번째 실험은 문·열쇠·보석이 놓인 격자 공간에서 진행됐다. 사람 역할을 하는 협력자는 보석을 얻으려 움직이며 AI 에이전트에게 지시를 내린다. 에이전트는 지시문만 읽어서는 안 된다. 협력자가 어디로 이동했는지, 어떤 열쇠와 문이 앞에 있는지까지 살펴야 한다.

예를 들어 협력자가 “저 문을 열어줄래?”라고 말했을 때 주변에 문이 여럿이라면 ‘저 문’의 뜻은 움직임을 봐야 알 수 있다. “빨간 열쇠를 가져다줘”라는 말도 마찬가지다. 빨간 열쇠가 두 개라면 어느 것을 가져와야 보석에 도달할 수 있는지 따져야 한다.

연구진은 이 과제를 수행할 LLM 기반 에이전트 톰캣(Tomcat)을 구성하고 두 가지 프롬프트 방식을 비교했다. 하나는 게임 규칙과 그림을 포함한 문제 예시 두 개를 제시하는 ‘상식 프롬프트(CP)’다. 다른 하나는 의도를 추론하고 행동을 계획하는 과정을 보여주는 예시 일곱 개를 제시하는 ‘소수 사례 사고 사슬(Fs-CoT)’이다. 두 방식은 예시의 개수뿐 아니라 제시 내용과 일부 규칙 설명도 달랐다. 따라서 결과의 차이를 오직 ‘단계별 추론’ 한 가지 요인으로 돌릴 수는 없다.


GPT-4o의 의도 파악률 85%는 무엇을 뜻하나

연구진은 20개 상황에서 GPT-4o, 딥시크-R1(DeepSeek-R1), 젬마-3-27B(Gemma-3-27B)를 두 방식으로 평가했다. 또 인간 참가자 52명의 수행 결과와 비교했다. 사람은 각자 10개 상황을 풀었다.

평가 대상 의도 파악 정확도 행동 최적성 계획 최적성
인간 참가자 80.38% 86.22% 71.15%
GPT-4o + Fs-CoT 85.00% 92.50% 75.00%
DeepSeek-R1 + Fs-CoT 80.00% 73.50% 70.00%
Gemma-3-27B + Fs-CoT 30.00% 51.25% 30.00%
GPT-4o + CP 50.00% 55.00% 25.00%

GPT-4o에 Fs-CoT를 적용했을 때 세 수치가 모두 인간 참가자의 평균보다 높았다. 그렇다고 AI가 인간의 의도 이해 능력을 넘어섰다고 결론 내릴 수는 없다. 논문에서 GPT-4o의 Fs-CoT 방식과 인간 참가자 사이에는 의도 파악 정확도와 계획 최적성에서 통계적으로 유의한 차이가 확인되지 않았다. 더욱이 인간에게 제시된 정보는 CP 방식에 가까웠고, Fs-CoT 방식에는 별도의 추론 예시가 제공됐다.

평가 지표의 뜻도 구분할 필요가 있다. ‘의도 파악 정확도’는 에이전트의 응답이 협력자의 목표와 맞는지를 본다. ‘행동 최적성’은 필요한 최적 행동을 얼마나 수행했는지를, ‘계획 최적성’은 행동들을 올바른 순서로 배열했는지를 평가한다. 답을 말로 그럴듯하게 설명하는 능력만 시험한 것은 아니다.

결과는 모델별로도 달랐다. DeepSeek-R1의 의도 파악률과 계획 최적성은 인간 참가자 평균에 가까웠지만, 행동 최적성은 73.50%로 더 낮았다. Gemma-3-27B는 추론 예시를 받았어도 주요 지표에서 크게 뒤처졌다. 모호한 지시를 처리하는 능력을 모든 LLM의 공통 능력처럼 말할 수 없는 이유다.


좌표와 색을 바꿔도 같은 추론을 할까

에이전트가 상황을 이해한 것처럼 보이더라도 실제로는 예시에서 본 좌표나 색깔의 패턴을 따라 했을 가능성이 있다. 연구진은 이를 살피기 위해 격자 바깥에 벽을 추가하고, 색 이름을 바꾸고, 불필요한 열쇠를 놓고, 열쇠의 위치를 옮기는 실험을 했다.

이러한 변경에도 GPT-4o와 DeepSeek-R1의 성과는 전반적으로 크게 흔들리지 않았다. 특정 좌표나 색 단어를 그대로 외워 답했을 가능성을 낮추는 결과다. 다만 이 실험만으로 AI가 현실의 모든 환경 변화를 이해한다고 증명한 것은 아니다. 변경 범위는 여전히 연구진이 설계한 게임 안에 있었다.


주방 협업 실험에서 드러난 또 다른 결과

논문은 오버쿡드(Overcooked)라는 두 번째 협업 환경도 다룬다. 두 참여자가 주방에서 재료를 옮기고 요리를 완성하는 게임으로, 문과 열쇠 대신 조리 도구와 주문이 등장한다. 연구진은 이 환경의 20개 상황에서 앞선 세 모델을 포함한 일곱 모델을 평가했다.

Fs-CoT 방식에서 일곱 모델 중 여섯 모델은 의도 파악 정확도 90% 이상을 기록했다. 이는 지시 추론 과제를 다른 종류의 협업 환경에도 적용할 수 있음을 보여준다. 그러나 추론 예시가 언제나 더 좋은 계획을 만드는 것은 아니었다. 오버쿡드에서 GPT-4o의 계획 최적성은 CP 방식 60%, Fs-CoT 방식 55%였고, 다른 모델도 지표에 따라 향상과 하락이 엇갈렸다. 이 환경에서는 어떤 모델을 쓰느냐에 따른 성능 차이가 프롬프트 방식에 따른 차이보다 컸다.


한국의 일터와 일상에 주는 의미

한국의 제조 현장이나 물류창고에서는 작업자가 바쁜 손을 멈추고 기계에 지시를 자세히 입력하기 어렵다. AI가 작업 순서와 주변 상황을 함께 파악한다면 짧은 말로도 협업할 가능성이 열린다.

병원이나 돌봄 현장에서는 환자의 상태와 담당자의 업무 맥락을 함께 이해하는 보조 도구가 도움이 될 수 있다. 다만 지시가 모호할 때 잘못 짐작한 행동은 위험할 수 있으므로, 중요한 작업에서는 확인 절차가 필요하다.

한국어에는 주어와 목적어를 생략한 지시가 많다. “그거 먼저 해줘” 같은 말은 앞선 대화와 현장 상황을 알아야 해석할 수 있다. 따라서 영어 중심의 게임 실험 결과가 한국어 협업 환경에도 그대로 적용되는지 별도로 검증해야 한다.

고령자나 디지털 기기에 익숙하지 않은 사람에게도 자연스러운 대화형 AI는 도움이 될 수 있다. 이용자가 기계에 맞춰 명령문을 외우기보다 평소 말하듯 요청할 수 있기 때문이다.

이 연구가 한국에 던지는 핵심 질문은 AI가 사람의 뜻을 ‘알아듣는 것처럼’ 보이는가가 아니다. 실제 업무에서 의도를 정확히 파악하고, 불확실할 때 되물으며, 안전하게 행동하는가이다.


인간과 AI의 협업에 남은 과제

이 연구의 장점은 AI에게 글을 읽고 타인의 생각을 맞혀 보라고 묻는 데서 한 걸음 나아갔다는 데 있다. 협력자의 움직임과 공유된 환경을 고려해 무엇을 해야 하는지 계획하도록 했다. 좋은 협업 상대라면 지시의 글자 그대로뿐 아니라 그 지시가 나온 목적도 살펴야 한다는 점을 실험으로 보여줬다.

한계도 분명하다. 실험은 두 가지 게임 환경에서 이뤄졌고, 실제 작업장의 소음이나 돌발 상황, 길게 이어지는 대화는 다루지 않았다. 참가자는 52명이었으며 각자 모든 상황을 풀지는 않았다. 연구의 중심도 협력자의 당면 목표를 추론하는 데 있었다. 상대가 나의 생각을 어떻게 이해하는지까지 따지는 복잡한 사회적 추론을 검증한 결과로 확대해서는 안 된다.

이 연구가 당장 “말 한마디면 알아서 일하는 로봇”의 등장을 뜻하지는 않는다. 대신 AI 협업의 평가 기준을 좀 더 구체적으로 만든다. AI가 사용자의 말을 이해했다고 주장하려면 실제로 목표를 제대로 짚었는지, 실행 가능한 행동을 골랐는지, 그 행동을 알맞은 순서로 계획했는지까지 확인해야 한다.


출처

Saad, F., Murukannaiah, P. K., & Singh, M. P. (2026). “Theory of mind in action: The instruction inference task in dynamic human-agent collaboration.” Artificial Intelligence, 361, 104621. https://doi.org/10.1016/j.artint.2026.104621