AI 용어집 · 심화 · 피지컬 AI·로봇 · 강화학습
Sim-to-Real 시뮬레이션에서 현실로
Sim-to-Real은 컴퓨터 속 가상 환경(시뮬레이션)에서 로봇이나 AI를 훈련시킨 뒤, 그 실력을 실제 현실 세계로 옮겨 쓰는 기법이다.
어떻게 작동하나
먼저 물리 법칙을 흉내 내는 시뮬레이터 안에 로봇과 주변 환경을 만든다. 로봇은 그 안에서 강화학습 등으로 걷기·집기 같은 동작을 수백만 번 시도하며 익힌다. 이때 바닥 마찰, 물체 무게, 조명, 센서 잡음 등을 일부러 계속 바꿔 가며 훈련하는데, 이를 '도메인 랜덤화'라고 한다. 다양한 조건에 익숙해진 로봇은 현실이 시뮬레이션과 조금 달라도 잘 버틴다. 이렇게 얻은 제어 모델(정책)을 실제 로봇에 옮긴 뒤, 현실에서 모은 소량의 데이터로 다시 다듬기도 한다.
왜 중요한가
실제 로봇으로 시행착오를 반복하면 시간이 오래 걸리고, 기계가 부서지거나 사람이 다칠 위험도 있다. 시뮬레이션에서는 수많은 로봇을 동시에, 실제보다 훨씬 빠른 속도로 훈련시킬 수 있다. 넘어지고 떨어뜨려도 비용이 들지 않는다. 그래서 휴머노이드나 로봇 팔처럼 데이터 모으기가 어려운 분야에서 핵심 훈련 방법으로 쓰인다.
알아 둘 점
가상과 현실의 차이를 흔히 '리얼리티 갭(Reality Gap)'이라고 부르며, 이것이 가장 큰 과제다. 천이나 액체처럼 시뮬레이션하기 어려운 물체, 미세한 접촉과 마찰은 특히 현실과 어긋나기 쉽다. 랜덤화를 너무 넓게 하면 학습이 어려워지고, 너무 좁게 하면 현실에서 실패한다. 그래서 시뮬레이션만으로 끝내기보다 실제 데이터와 섞어 쓰는 경우가 많다.
예시
로봇 기업들은 걷기나 균형 잡기 같은 기본 동작을 대규모 시뮬레이션에서 먼저 학습시키고, 그 결과를 실제 휴머노이드나 사족 보행 로봇에 옮겨 싣는 방식을 널리 쓴다. 시뮬레이터 속 가상 로봇 수천 대가 동시에 넘어지고 일어나며 배운 걸음걸이가 실제 로봇 한 대의 걸음으로 이어지는 셈이다.