← AI 용어집

AI 용어집 · 심화 · 피지컬 AI·로봇 · 강화학습

Sim-to-Real 시뮬레이션에서 현실로

Sim-to-Real은 컴퓨터 속 가상 환경(시뮬레이션)에서 로봇이나 AI를 훈련시킨 뒤, 그 실력을 실제 현실 세계로 옮겨 쓰는 기법이다.

쉽게 말하면 비행기 조종사가 실제 비행 전에 비행 시뮬레이터에서 수없이 연습하는 것과 같다. 다만 시뮬레이터가 현실과 조금이라도 다르면 실전에서 당황하듯, 로봇도 가상과 현실의 차이 때문에 실수할 수 있다.

어떻게 작동하나

먼저 물리 법칙을 흉내 내는 시뮬레이터 안에 로봇과 주변 환경을 만든다. 로봇은 그 안에서 강화학습 등으로 걷기·집기 같은 동작을 수백만 번 시도하며 익힌다. 이때 바닥 마찰, 물체 무게, 조명, 센서 잡음 등을 일부러 계속 바꿔 가며 훈련하는데, 이를 '도메인 랜덤화'라고 한다. 다양한 조건에 익숙해진 로봇은 현실이 시뮬레이션과 조금 달라도 잘 버틴다. 이렇게 얻은 제어 모델(정책)을 실제 로봇에 옮긴 뒤, 현실에서 모은 소량의 데이터로 다시 다듬기도 한다.

Sim-to-Real 훈련 흐름시뮬레이터 → 도메인 랜덤화; 도메인 랜덤화 → 강화학습 훈련; 강화학습 훈련 → 정책 모델; 정책 모델 → 실제 로봇 적용(옮기기); 실제 로봇 적용 → 현실 데이터로 보정(소량 데이터); 현실 데이터로 보정 → 강화학습 훈련시뮬레이터가상 로봇·환경도메인 랜덤화마찰·무게·조명 변경강화학습 훈련수많은 시행착오정책 모델동작 제어실제 로봇 적용현실 데이터로 보정옮기기소량 데이터
Sim-to-Real 훈련 흐름 가상 환경에서 조건을 바꿔 가며 훈련한 정책을 실제 로봇에 옮기고, 현실 데이터로 다시 다듬는 흐름이다.

왜 중요한가

실제 로봇으로 시행착오를 반복하면 시간이 오래 걸리고, 기계가 부서지거나 사람이 다칠 위험도 있다. 시뮬레이션에서는 수많은 로봇을 동시에, 실제보다 훨씬 빠른 속도로 훈련시킬 수 있다. 넘어지고 떨어뜨려도 비용이 들지 않는다. 그래서 휴머노이드나 로봇 팔처럼 데이터 모으기가 어려운 분야에서 핵심 훈련 방법으로 쓰인다.

알아 둘 점

가상과 현실의 차이를 흔히 '리얼리티 갭(Reality Gap)'이라고 부르며, 이것이 가장 큰 과제다. 천이나 액체처럼 시뮬레이션하기 어려운 물체, 미세한 접촉과 마찰은 특히 현실과 어긋나기 쉽다. 랜덤화를 너무 넓게 하면 학습이 어려워지고, 너무 좁게 하면 현실에서 실패한다. 그래서 시뮬레이션만으로 끝내기보다 실제 데이터와 섞어 쓰는 경우가 많다.

예시

로봇 기업들은 걷기나 균형 잡기 같은 기본 동작을 대규모 시뮬레이션에서 먼저 학습시키고, 그 결과를 실제 휴머노이드나 사족 보행 로봇에 옮겨 싣는 방식을 널리 쓴다. 시뮬레이터 속 가상 로봇 수천 대가 동시에 넘어지고 일어나며 배운 걸음걸이가 실제 로봇 한 대의 걸음으로 이어지는 셈이다.

함께 보면 좋은 용어