글

트랜스포머 강화학습으로 산업용 로봇 제어 정확도와 안전성을 높이는 TRL-Net

이미지
TRL-Net은 로봇의 과거 동작과 현재 상태를 시계열로 분석하고 안전 제약을 적용해 다양한 산업 작업을 하나의 강화학습 정책으로 제어하는 새로운 산업용 로봇 기술의 가능성을 보여준다. 자동차 공장에서 로봇 팔 하나가 움직이는 모습을 보면 동작이 단순해 보인다. 부품을 집고, 옮기고, 정확한 위치에 내려놓는다. 그러나 사람이 보기에는 몇 초에 불과한 이 동작 뒤에는 관절 위치와 속도, 힘, 이동 경로, 충돌 가능성 등을 순간순간 계산해야 하는 복잡한 제어 기술이 숨어 있다. 스마트 공장이 확산되면서 산업용 로봇에게 요구되는 능력도 달라지고 있다. 이제 로봇은 정해진 동작을 수천 번 반복하는 것만으로 충분하지 않다. 생산 제품과 작업 환경이 바뀌면 새로운 작업에 빠르게 적응해야 하고, 높은 정밀도를 유지하면서도 사람이나 설비와 충돌하지 않아야 한다. 카자흐스탄 연구진이 발표한 TRL-Net(Transformer-Based Reinforcement Learning Network)은 이러한 문제를 트랜스포머와 강화학습을 결합해 해결하려는 시도이다. 연구진은 로봇이 현재 상태만 보는 대신 과거의 움직임까지 하나의 연속된 흐름으로 이해하도록 만들었다. 산업용 로봇 프로그래밍의 오래된 한계 산업용 로봇은 제조업의 핵심 설비가 됐다. 물품 이송부터 조립, 용접, 연마, 팔레타이징까지 사람이 담당하던 수많은 작업을 수행한다. 하지만 기존 산업용 로봇은 상당 부분 미리 작성한 궤적이나 교시 장치(Teach Pendant)를 이용한 프로그래밍에 의존한다. 생산 공정이나 작업 공간이 달라지면 엔지니어가 동작을 다시 설정해야 한다. 전통적인 선형 보간법, 스플라인 궤적 생성, RRT*, CHOMP, STOMP 같은 경로 계획 기술은 구조화된 환경에서 안정적인 성능을 낼 수 있다. 그러나 정확한 환경 모델과 사람이 설계한 목적함수, 세밀한 매개변수 조정이 필요하다는 한계가 있다. 깊은 강화학습(Deep Reinforcement Learning)은 다른 접...

AI는 모호한 지시에서 사람의 의도를 읽을 수 있을까? 인간과 협업하는 LLM 에이전트 실험

이미지
같은 지시라도 상대가 어디를 가리키고 무엇을 하려는지에 따라 뜻이 달라진다. 그림은 주변 상황을 살피며 사람의 목표를 추론하는 AI 에이전트를 표현했다. “저 문 좀 열어줘.” 문이 하나라면 간단한 지시다. 하지만 눈앞에 여러 문이 있고, 함께 일하는 사람이 그중 하나를 향해 움직이고 있다면 이야기가 달라진다. 어느 문을 뜻하는지, 왜 열어야 하는지, 내가 먼저 무엇을 해야 하는지 판단해야 한다. 사람은 대개 말뿐 아니라 상대의 행동과 주변 상황을 함께 살핀다. 인공지능(AI)도 그럴 수 있을까? 심리학에서 타인의 목표나 생각을 추론하는 능력을 마음 이론(Theory of Mind) 이라고 부른다. AI 연구에서 이 말을 쓸 때는 주의가 필요하다. AI에게 인간처럼 마음이 있다는 뜻이 아니라, 주어진 단서로 상대의 의도를 얼마나 잘 추론하고 그에 맞게 행동하는지를 평가한다는 뜻이다. 사드와 동료 연구진은 이 능력을 살피기 위해 ‘지시 추론(Instruction Inference)’ 과제를 만들었다. 대형 언어 모델(LLM)이 불완전하거나 모호한 지시를 받았을 때, 협력자의 목표를 파악하고 필요한 행동을 계획할 수 있는지 시험한 것이다. 보석을 찾는 게임에서 지시의 숨은 뜻을 읽다 첫 번째 실험은 문·열쇠·보석이 놓인 격자 공간에서 진행됐다. 사람 역할을 하는 협력자는 보석을 얻으려 움직이며 AI 에이전트에게 지시를 내린다. 에이전트는 지시문만 읽어서는 안 된다. 협력자가 어디로 이동했는지, 어떤 열쇠와 문이 앞에 있는지까지 살펴야 한다. 예를 들어 협력자가 “저 문을 열어줄래?”라고 말했을 때 주변에 문이 여럿이라면 ‘저 문’의 뜻은 움직임을 봐야 알 수 있다. “빨간 열쇠를 가져다줘”라는 말도 마찬가지다. 빨간 열쇠가 두 개라면 어느 것을 가져와야 보석에 도달할 수 있는지 따져야 한다. 연구진은 이 과제를 수행할 LLM 기반 에이전트 톰캣(Tomcat) 을 구성하고 두 가지 프롬프트 방식을 비교했다. 하나는 게임 규칙과 그림을 포함한...

AI가 모든 것을 해낸다는 말을 들을 때

이미지
놀라운 AI 소식 앞에서 잠시 멈춘다. 번역할 때 원문을 다시 살피듯, 큰 발표 뒤에 무엇이 확인됐는지 묻기 위해서다. 나는 오랫동안 남이 쓴 문장을 읽고 옮기는 일을 해 왔다. 문장이 그럴듯하다고 해서 곧바로 믿지는 않는다. 숫자 하나가 잘못 들어갔을 수도 있고, 앞뒤를 떼어 놓으면 뜻이 달라지는 말도 있다. 번역을 하다 보면 매끄러운 문장일수록 한 번 더 원문을 들여다보게 된다. 요즘 AI 뉴스를 읽을 때도 그렇다. 전문가보다 뛰어나다, 어려운 수학 문제를 풀었다, 머지않아 사람을 넘어설 것이라는 제목이 잇따른다. 처음에는 나도 놀란다. 하지만 조금 읽다 보면 알고 싶은 것이 생긴다. 정확히 어떤 일을 해냈다는 것일까. 다른 사람도 같은 결과를 확인했을까. AI가 놀라운 일을 하는 것은 사실이다. 나도 낯선 내용을 이해하거나 글의 실마리를 찾을 때 도움을 받는다. 그렇지만 한번 제대로 답했다고 해서 다음에도 반드시 옳은 것은 아니다. 내가 아는 주제에서는 선뜻 믿기 어려운 답을 태연하게 내놓기도 한다. 그럴 때면 참 묘하다. 말투는 그렇게 자신 있는데, 내용은 다시 확인해야 한다니. 큰 발표가 지나간 뒤 팀닛 게브루와 에밀리 벤더는 《MIT 테크놀로지 리뷰》에 쓴 글에서 최근의 AI 발표를 다시 살펴본다. 기업이 대단한 성과를 알리면 언론도 크게 보도한다. 그런데 관련 분야의 전문가들이 시간을 들여 검토한 뒤에는 처음 발표와 다른 설명이 나오기도 한다는 것이다. 나는 그 시간 차이가 마음에 걸린다. 놀라운 소식은 아침에 들었는데, 자세한 검토는 며칠 뒤에 나온다. 그사이 첫 소식은 이미 여러 사람에게 전해졌다. 정작 뒤늦게 나온 설명은 처음만큼 널리 읽히지 않는다. 나 역시 제목만 보고 기억해 둔 일을 나중에야 바로잡은 적이 있다. AI가 수학이나 컴퓨터 작업에서 좋은 성과를 거두면 반갑다. 다만 그 성과가 무엇을 뜻하는지는 수학자와 컴퓨터 전문가의 설명까지 듣고 판단하고 싶다. 바둑을 잘 두는 사람이 내 병까지 진단해 줄 수는 없...

AI 디지털 트윈이 땅콩 농사의 미래 수확량을 예측하는 방법

이미지
인공지능과 디지털 트윈 기술은 땅콩밭의 토양, 기상, 생육 정보를 가상 공간에서 분석해 수확량 예측과 지속가능한 농업 전략 수립을 돕는다. 기후변화 시대의 농업은 더 이상 하늘만 바라보는 일이 아니다. 비가 언제 오는지, 토양이 얼마나 버티는지, 어떤 농법이 수확량을 높이는지, 어떤 정책 변화가 농가의 선택을 바꾸는지까지 함께 읽어야 한다. 이번 연구는 인도 412개 지역의 땅콩 재배 데이터를 바탕으로 인공지능과 디지털 트윈을 결합해 수확량을 예측하고, 지속가능한 농업 전략을 가상으로 실험한 사례이다. 연구진은 1997년부터 2023년까지 인도 농무부가 축적한 지역별 땅콩 재배면적, 생산량, 수확량 자료를 분석했다. 농업 데이터는 현실처럼 고르지 않다. 어떤 해에는 기록이 빠지고, 어떤 지역은 값이 불완전하며, 기후·정책·가격 변화가 한꺼번에 얽힌다. 연구진은 이런 빈틈을 시계열 보간과 공간 인접 보정 방식으로 메우고, 미래 정보가 과거 예측에 섞이는 데이터 누출을 막아 안정적인 패널 데이터를 만들었다. 디지털 농장의 핵심은 수확량만 보지 않는 데 있다 이 연구의 흥미로운 지점은 단순히 “내년 땅콩 수확량이 얼마인가”를 묻는 데서 멈추지 않았다는 점이다. 연구진은 농업 환경의 지속가능성을 수치화하기 위해 확장형 재생농업 지수(eRAI)를 제안했다. eRAI는 작물 다각화 지수, 토양 건강 대리 지수, 토지 이용 효율성, 수확량 추세 모멘텀을 결합한 종합 지표이다. 즉 한 지역의 농업이 많이 생산하는지를 넘어, 오래 버틸 수 있는 구조인지까지 함께 보려 한 것이다. 분석 결과 eRAI는 개별 구성 지표보다 다음 해 수확량과 더 강한 관련성을 보였다. 특히 다음 해 수확량과의 상관계수는 r=0.74로 나타났다. 마르코프 전이 모델에서도 지속가능성 상태의 관성이 확인됐다. eRAI가 높은 지역은 다음 해에도 높은 상태를 유지할 확률이 0.79였고, 낮은 지역은 낮은 상태에 머무를 확률이 0.81이었다. 이는 농업의 격차가 한 해의 우연으로 끝나지 ...

AI 에이전트는 이제 기억할 수 있다 — 해커는 그 기억을 ‘오염’시킬 수 있다

이미지
AI 에이전트의 지속적인 기억에 악성 정보가 삽입되면 당장은 정상적으로 작동하더라도 이후의 상호작용에서 오염된 기억을 불러와 잘못된 판단이나 행동으로 이어질 수 있다. 인공지능(AI) 시스템은 이제 단순히 질문에 답하는 수준을 넘어서는 단계로 나아가고 있다. 새로운 AI ‘에이전트(agent)’는 이전 상호작용에서 얻은 정보를 기억하고, 여러 단계에 걸친 계획을 세우며, 디지털 도구를 활용해 작업을 수행할 수 있다. 기억은 이러한 시스템을 유용하게 만드는 핵심 기능 가운데 하나이다. 그러나 캘거리 대학교(University of Calgary)의 동료 연구자 하디스 카리미푸르(Hadis Karimipour)와 함께 수행한 필자의 최근 연구에 따르면, 기억은 쉽게 간과할 수 있는 보안 취약점을 만들어내기도 한다. AI 에이전트를 자신이 배운 내용을 노트에 기록하는 비서라고 생각해 보자. 에이전트가 작업을 하나씩 완료할 때마다 유용한 정보가 노트에 기록되고, 이후 필요할 때 다시 참조된다. 그런데 누군가 그 노트에 오해를 불러일으키는 지시를 몰래 끼워 넣었다고 가정해 보자. 공격자는 AI 자체를 직접 장악할 필요조차 없을 수 있다. 에이전트는 한동안 아무 문제 없이 정상적으로 작동할 수 있다. 그러나 며칠 뒤, 혹은 여러 차례의 상호작용이 지난 뒤 노트를 다시 펼쳐 오염된 정보를 불러오고, 그것을 자신이 이전에 학습한 신뢰할 만한 정보로 받아들일 수 있다. 이를 ‘기억 오염(memory poisoning)’이라고 한다. 여기서 핵심은 시간 지연 이다. 기억이 오염된 AI 에이전트가 즉시 침해된 시스템처럼 행동하는 것은 아닐 수 있다. 기다리는 공격 우리가 익숙하게 접하는 많은 사이버 공격은 비교적 빠르게 효과가 나타난다. 악성 링크를 클릭하면 악성코드가 실행되고, 탈취된 비밀번호가 사용되면 계정에 접근할 수 있게 되는 식이다. 그러나 기억 오염은 다르게 작동할 수 있다. 필자 연구진은 기억 기능이 활성화된 대형 언어 모델(...

뇌파 속 졸음 신호를 찾아내는 AI, 운전자 피로 감지 정확도 98.86%

이미지
AI가 운전자의 뇌파에서 피로와 졸음의 초기 신호를 포착해 졸음운전 사고를 예방하는 미래형 운전자 안전 시스템을 시각화했다. 심야의 고속도로를 시속 100km로 달리는 운전자가 단 2초 동안 눈을 감으면 자동차는 약 56m를 나아간다. 졸음이 짧은 순간에 그치더라도 차량은 운전자의 통제를 벗어나 치명적인 사고로 이어질 수 있다. 문제는 운전자가 졸음이 시작됐다는 사실을 깨달았을 때는 이미 주의력과 반응 속도가 떨어진 뒤일 가능성이 크다는 점이다. 중국 베이징정보과학기술대학교와 난징항공항천대학교 연구진은 운전자의 뇌파에서 피로 신호를 찾아내는 새로운 인공지능 모델을 개발했다. 이 모델은 뇌파를 2차원 이미지로 변환한 뒤, 졸음과 관련된 특징은 강화하고 불필요한 잡음은 걸러낸다. 두 개의 공개 데이터셋을 이용한 실험에서 각각 98.86%와 97.38%의 정확도를 기록했다. 운전자 졸음 감지가 어려운 이유 현재 운전자 피로 감지 기술은 주로 카메라로 눈꺼풀의 움직임, 하품, 머리 자세와 표정 변화를 분석한다. 차량이 차선 안에서 흔들리는 정도나 운전대 조작 패턴을 측정하는 방식도 사용한다. 그러나 카메라는 어두운 조명과 선글라스, 얼굴 가림, 고개 방향에 영향을 받는다. 차량 움직임을 이용한 방법 역시 도로 상태와 운전 습관에 따라 결과가 달라질 수 있다. 뇌파검사(EEG)는 뇌의 전기적 활동을 직접 측정하기 때문에 운전자의 생리적 각성 수준을 파악하는 중요한 수단이다. 눈이 완전히 감기거나 운전 자세가 무너지기 전에 나타나는 뇌 활동의 변화를 포착할 가능성이 있다는 점도 장점이다. 하지만 실제 운전 상황에서 얻은 뇌파에는 눈동자 움직임, 눈 깜박임, 얼굴과 목 근육의 활동, 차량 진동, 주변 전기 장치의 간섭이 뒤섞인다. 신호 자체도 시간에 따라 계속 변한다. 따라서 졸음과 관련된 미세한 뇌파 변화와 우연히 섞인 잡음을 정확히 구분하기가 쉽지 않다. 1차원 뇌파를 재귀도표 이미지로 변환한 방법 연구진은 시간에 따라 이어지는 1...

자간전증 예측 AI의 성능과 한계: 높은 AUC만으로 임상 적용을 판단할 수 없는 이유

이미지
전자건강기록과 임상 데이터를 분석하는 인공지능은 자간전증 위험을 조기에 발견할 가능성을 보여주지만, 실제 의료 현장에 적용하려면 외부 검증과 교정, 설명 가능성 평가가 필요하다. 전자건강기록과 혈압, 혈액검사 결과를 분석해 자간전증 위험을 조기에 가려내는 인공지능 연구가 빠르게 늘고 있다. 일부 머신러닝 모델은 0.9에 가까운 높은 AUC를 보고하며 산부인과 진료를 바꿀 기술로 주목받는다. 그러나 높은 예측 성능이 곧바로 실제 병원에서 사용할 수 있다는 뜻은 아니다. 에콰도르 국립폴리테크닉대학교 연구진은 자간전증과 임신고혈압질환을 예측한 머신러닝 연구 29편을 분석했다. 그 결과 트리 기반 모델과 선형 모델이 가장 널리 사용됐고, 논문 초록에서 확인할 수 있는 AUC도 전반적으로 높았다. 반면 외부 검증과 확률 교정, 설명 가능성, 데이터 공개 여부처럼 임상 적용에 필요한 정보는 초록에 충분히 드러나지 않았다. 이번 연구가 보여준 핵심은 “자간전증 예측 AI의 성능이 형편없다”는 것이 아니다. 높은 성능 수치만으로 모델의 신뢰성과 임상 준비도를 판단해서는 안 되며, 논문 초록만으로는 중요한 검증 절차의 수행 여부조차 제대로 파악하기 어렵다는 점이다. 한눈에 보는 자간전증 예측 머신러닝 연구 결과 연구진은 자간전증과 임신고혈압질환을 다룬 머신러닝·인공지능 연구 29편을 최종 분석했다. 트리 기반 모델은 17편, 선형·일반화선형 모델은 15편, 서포트벡터머신은 9편, 신경망은 8편의 초록에서 확인됐다. 전자건강기록과 일반 임상 변수를 이용한 연구가 21편으로 가장 많았다. 논문 초록에서 수치가 확인된 14편의 AUC는 0.790~0.976 범위였으며, 평균은 0.873이었다. 외부 검증은 8편, 설명 가능성 관련 방법은 5편의 초록에서 확인됐다. 교정 관련 정보는 4편, 저장소 또는 데이터 출처 정보는 1편의 초록에서만 확인됐다. 이 수치는 연구 전문이 아니라 제목·초록·서지정보에서 확인된 정보만 집계한 결과이다. 자간...