트랜스포머 강화학습으로 산업용 로봇 제어 정확도와 안전성을 높이는 TRL-Net
TRL-Net은 로봇의 과거 동작과 현재 상태를 시계열로 분석하고 안전 제약을 적용해 다양한 산업 작업을 하나의 강화학습 정책으로 제어하는 새로운 산업용 로봇 기술의 가능성을 보여준다. 자동차 공장에서 로봇 팔 하나가 움직이는 모습을 보면 동작이 단순해 보인다. 부품을 집고, 옮기고, 정확한 위치에 내려놓는다. 그러나 사람이 보기에는 몇 초에 불과한 이 동작 뒤에는 관절 위치와 속도, 힘, 이동 경로, 충돌 가능성 등을 순간순간 계산해야 하는 복잡한 제어 기술이 숨어 있다. 스마트 공장이 확산되면서 산업용 로봇에게 요구되는 능력도 달라지고 있다. 이제 로봇은 정해진 동작을 수천 번 반복하는 것만으로 충분하지 않다. 생산 제품과 작업 환경이 바뀌면 새로운 작업에 빠르게 적응해야 하고, 높은 정밀도를 유지하면서도 사람이나 설비와 충돌하지 않아야 한다. 카자흐스탄 연구진이 발표한 TRL-Net(Transformer-Based Reinforcement Learning Network)은 이러한 문제를 트랜스포머와 강화학습을 결합해 해결하려는 시도이다. 연구진은 로봇이 현재 상태만 보는 대신 과거의 움직임까지 하나의 연속된 흐름으로 이해하도록 만들었다. 산업용 로봇 프로그래밍의 오래된 한계 산업용 로봇은 제조업의 핵심 설비가 됐다. 물품 이송부터 조립, 용접, 연마, 팔레타이징까지 사람이 담당하던 수많은 작업을 수행한다. 하지만 기존 산업용 로봇은 상당 부분 미리 작성한 궤적이나 교시 장치(Teach Pendant)를 이용한 프로그래밍에 의존한다. 생산 공정이나 작업 공간이 달라지면 엔지니어가 동작을 다시 설정해야 한다. 전통적인 선형 보간법, 스플라인 궤적 생성, RRT*, CHOMP, STOMP 같은 경로 계획 기술은 구조화된 환경에서 안정적인 성능을 낼 수 있다. 그러나 정확한 환경 모델과 사람이 설계한 목적함수, 세밀한 매개변수 조정이 필요하다는 한계가 있다. 깊은 강화학습(Deep Reinforcement Learning)은 다른 접...