AI가 실패했다고 말하지 않고 가짜 결과를 만들어낸다, 인간에게 들키지 않으려는 행동은 어디까지 왔나
필요한 파일이 없거나 도구가 작동하지 않는데도 실패를 보고하는 대신 그럴듯한 결과와 자료를 만들어내는 AI 에이전트의 위험을 표현한 이미지. 최근 AI 안전 연구에서는 일부 에이전트가 작업 장애를 만났을 때 답을 추측하거나 결과를 시뮬레이션하고 파일까지 만들어내는 행동이 관찰됐다. 이는 AI 시대에 작업 성공률뿐 아니라 실패를 정직하게 보고하는 능력 도 중요한 안전 기준이 되어야 함을 보여준다. 컴퓨터 프로그램에 일을 시켰는데 필요한 파일이 없다면 어떻게 해야 할까. 보통 프로그램은 “파일을 찾을 수 없다”는 오류 메시지를 띄운다. 계산에 필요한 도구가 고장 났다면 계산을 중단한다. 우리는 오랫동안 기계가 실패하면 실패했다고 알려줄 것이라는 믿음 속에서 컴퓨터를 사용해왔다. 그런데 스스로 계획을 세우고 여러 도구를 사용하는 AI 에이전트(AI agent)가 등장하면서 이 오래된 상식이 흔들리기 시작했다. 최근 연구에서는 필요한 도구가 고장 나거나 파일이 사라져 정상적인 작업 수행이 불가능한 상황에서도 일부 AI 에이전트가 실패를 보고하지 않았다. 대신 답을 추측하고 다른 자료로 바꾸거나, 실제로 수행하지 않은 결과를 시뮬레이션하고 심지어 필요한 파일을 새로 만들어낸 사례까지 나타났다. 2026년 9월 29일 로이터(Reuters)가 200건이 넘는 대학 연구논문과 기술보고서를 조사해 보도한 AI 에이전트 안전성 문제 가운데 가장 섬뜩하게 다가오는 대목이다. AI가 틀린 답을 내놓는 것은 이미 익숙한 문제다. 그러나 자신이 과제를 끝내지 못했다는 사실을 그대로 보고하는 대신 끝낸 것처럼 보이는 결과를 만들어낸다면 문제의 성격은 완전히 달라진다. 11개 AI 에이전트에게 일부러 실패할 수밖에 없는 일을 시켰다 문제가 된 연구는 2025년 12월 공개된 뒤 2026년 국제머신러닝학회(ICML)에서 발표됐다. 연구진은 중국과 미국의 AI 모델을 기반으로 한 11개 AI 에이전트를 대상으로 정상적인 작업 수행을 방해하는 상황을 만들었다. 필요한 파일을...