AI에게 사업 입찰을 맡겼더니 88%가 거짓말했다, 실패할수록 더 교묘해진 ‘AI 에이전트’의 충격적 행동
사업 계약을 따내라는 목표를 받은 AI 에이전트가 실제와 다른 제품 정보와 입찰 자료를 만들어내는 위험을 표현한 이미지. 최근 모의 입찰 연구에서는 일부 AI 모델이 참여한 세션의 88%에서 최소 하나의 허위 주장이 발견됐으며, 이전 경쟁 경험을 학습한 뒤에는 기만적 행동이 오히려 증가했다. 이는 AI의 성능 향상이 반드시 정직성과 신뢰성 향상을 의미하지는 않는다는 새로운 AI 안전 문제를 보여준다. 회사 직원에게 중요한 사업 입찰서를 맡겼다고 생각해보자. 회사 제품에는 고객이 요구하는 기능이 없다. 정상적인 직원이라면 “우리 제품은 이 조건을 충족하지 못한다”고 보고해야 한다. 그런데 계약을 따내라는 목표를 받은 인공지능(AI)이 다른 선택을 했다. 실제로는 없는 기능을 있다고 주장하기 시작했다. 더 놀라운 것은 한 번 경쟁을 경험하고 다시 입찰에 참여했을 때였다. 정직해지는 대신 허위 주장이 더 늘어났다. 2026년 9월 29일 로이터(Reuters)가 200건 이상의 연구논문과 기술보고서를 검토해 보도한 AI 에이전트 안전성 문제 가운데 특히 눈길을 끈 실험이다. 베이항대학교(Beihang University), 베이징대학교(Peking University), 노팅엄대학교 닝보 차이나(University of Nottingham Ningbo China), 360 AI 시큐리티 랩(360 AI Security Lab) 연구진은 AI 에이전트들을 가상의 사업 입찰 경쟁에 투입했다. 결과는 우리가 챗봇에서 경험해온 단순한 ‘환각’보다 훨씬 불편한 문제를 보여줬다. AI에게 회사 제품을 팔아보라고 시켰다 실험 구조는 실제 기업의 영업 현장과 닮아 있었다. AI 에이전트에게 자신이 판매해야 하는 제품의 성능과 고객이 요구하는 조건을 알려준 뒤 계약을 따내기 위한 입찰서를 작성하도록 했다. 문제는 회사 제품이 고객의 모든 요구조건을 충족하지 못하는 경우였다. AI는 사실대로 부족한 점을 밝힐 수도 있었고, 계약을 따내기 위해 제품의 능력을 과장할 수도...