데이터베이스를 붙인 AI는 헛소리를 얼마나 덜 하나…환각률 최대 90% 이상 줄인 방법의 효과


생성형 AI가 추천한 정보를 어디까지 믿어도 될까. 대화형 AI는 그럴듯한 답을 만들어내는 데 뛰어나지만, 실제로 존재하지 않는 제품이나 서비스를 추천하는 이른바 '환각(hallucination)' 문제가 꾸준히 지적돼 왔다. 특히 기업이나 연구기관처럼 정해진 목록 안에서만 답해야 하는 환경에서는 이런 오류가 치명적이다.

불가리아 소피아공과대학교 연구진은 이러한 문제를 줄일 수 있는 시스템 구조를 시험했다. 핵심은 AI 자체를 새로 학습시키는 것이 아니라, 검증된 데이터베이스를 기반으로 답하도록 설계했을 때 환각이 얼마나 줄어드는지를 확인하는 것이었다. 연구 결과는 국제학술지 AI에 발표됐다.


AI가 틀린 이유는 '없는 도구를 추천했기 때문'

이번 연구는 일반적인 사실 오류를 측정하지 않았다. 연구진은 전자설계(EDA) 분야의 공학 소프트웨어 82개를 검증된 목록으로 구축한 뒤, AI가 이 목록에 없는 도구를 추천하는 경우를 '환각'으로 정의했다.

여기에는 두 가지 경우가 포함된다. 실제로 존재하지 않는 가상의 소프트웨어를 만들어내는 경우와, 실제 상용 프로그램이지만 연구진이 구축한 데이터베이스에는 등록되지 않은 프로그램을 추천하는 경우다. 즉, 이 연구에서 측정한 환각은 '사실이 틀렸다'기보다 '허용된 목록을 벗어났다'는 의미에 가깝다. 따라서 연구 결과는 폐쇄형 추천 시스템에서의 신뢰성을 평가한 것으로 이해해야 한다.

세 가지 장치를 함께 적용하자 환각률이 크게 감소했다

연구진은 모두 6912회의 API 호출을 수행하며 세 가지 방법을 조합해 비교했다.

첫 번째는 데이터베이스에서 관련 정보를 미리 불러와 AI에게 제공하는 방식이다. 두 번째는 추천 가능한 도구 이름을 검증된 목록으로 제한하는 것이다. 세 번째는 답변을 자유로운 문장이 아니라 일정한 JSON 형식으로 출력하도록 강제했다.

아무런 제약이 없는 상태에서는 데이터베이스 밖의 도구를 추천하는 비율이 약 69~80%에 달했다. 그러나 세 가지 방법을 모두 적용하자 이 비율은 약 4~13%까지 감소했다. 모델과 서비스 제공업체가 달라도 전반적인 감소 효과는 일관되게 나타났다.

특히 데이터베이스 정보를 제공하고 허용된 도구 목록을 함께 제시하는 방식이 가장 큰 개선 효과를 보였다.


'생각하는 AI'가 더 정확하지는 않았다

최근에는 답을 내기 전에 여러 단계를 거쳐 추론하는 'Reasoning' 모델이 등장하고 있다. 직관적으로는 더 오래 생각하는 모델이 더 정확할 것으로 예상하기 쉽다.

하지만 이번 연구에서는 그런 결과가 나오지 않았다.

연구진은 OpenAI, Anthropic, Google의 일반 모델과 추론 모델을 각각 비교했지만, 추론 모드가 환각을 통계적으로 유의하게 줄인다는 증거는 발견하지 못했다. 일부 모델에서는 오히려 일반 모델보다 환각률이 조금 더 높게 나타나기도 했다. 이는 단순히 추론 과정을 늘리는 것보다 신뢰할 수 있는 외부 정보로 답변을 제한하는 설계가 더 중요할 수 있음을 시사한다.

다만 이것은 연구에서 사용한 특정 추천 환경에서 얻어진 결과이며, 모든 작업에서 추론 모델의 성능이 떨어진다는 의미는 아니다.

환각을 크게 줄였지만 문제는 남아 있다

흥미로운 점은 환각률이 크게 감소했음에도 사용자가 체감하는 오류는 완전히 사라지지 않았다는 것이다.

연구진은 전체 구조를 적용한 뒤에도 약 절반(약 49.5%)의 응답에는 데이터베이스 밖의 도구가 최소 한 번 이상 포함됐다고 보고했다. 이들 가운데 상당수는 존재하지 않는 프로그램이 아니라 실제 상용 소프트웨어였다. 즉, AI는 엉뚱한 이름을 지어내기보다 검증 목록에는 없지만 실제 시장에는 존재하는 다른 제품을 추천하는 경우가 많았다.

연구진은 따라서 폐쇄형 추천 시스템에서는 단순히 환각을 줄이는 것뿐 아니라, 데이터베이스에 없는 새로운 제품을 어떻게 처리할 것인지가 앞으로 해결해야 할 과제라고 해석했다.


이번 연구가 의미하는 점

이번 연구는 최신 AI 모델 자체를 비교한 연구라기보다 AI를 어떻게 설계해야 더 신뢰할 수 있는 추천 시스템을 만들 수 있는지를 보여준 연구다.

많은 기업이 생성형 AI를 고객 상담, 의료 정보, 법률 검색, 사내 업무 등에 도입하고 있다. 이런 환경에서는 모델 성능을 계속 높이는 것만큼이나 검증된 데이터와 연결해 답변 범위를 통제하는 시스템 설계가 중요하다는 점을 이번 연구는 보여준다.

다만 연구는 전자설계 분야의 82개 공학 소프트웨어를 대상으로 수행됐다. 따라서 의료, 금융, 교육 등 다른 분야에서도 동일한 수준의 효과가 나타난다고 단정할 수는 없다.


기억해야 할 핵심

• 검증된 데이터베이스와 연결한 구조는 AI의 환각을 약 69~80%에서 4~13% 수준으로 크게 줄였다.
• 추론(Reasoning) 모델은 일반 모델보다 환각을 유의하게 줄이지 못했다.
• 환각이 감소해도 응답 절반 정도에는 데이터베이스 밖의 실제 도구가 여전히 포함돼 폐쇄형 추천 시스템의 과제로 남았다.

논문 서지정보

Lavdim Menxhiqi, Galia Marinova. Hallucination Mitigation in Large Language Model-Based Tool Recommendation: A Cross-Provider Architectural Ablation Study Across Two Model Generations. AI, 2026, 7, 273. DOI: 10.3390/ai7070273