AI 용어집 · 심화 · 피지컬 AI·로봇 · 생성형 미디어
월드 모델 World model
월드 모델은 AI가 세상이 어떻게 돌아가는지를 머릿속 시뮬레이터처럼 익혀, '이렇게 하면 다음에 어떻게 될까'를 미리 예측하게 해 주는 모델이다.
어떻게 작동하나
월드 모델은 먼저 영상이나 센서로 들어온 현재 관찰을 받아, 중요한 정보만 남긴 압축된 상태(Representation)로 요약한다. 여기에 '앞으로 간다', '팔을 든다' 같은 후보 행동을 함께 넣으면, 그 행동 뒤에 세상이 어떻게 바뀔지 다음 상태를 예측한다. 예측된 미래를 보고 결과가 좋지 않으면 다른 행동을 넣어 다시 시험해 볼 수 있다. 이렇게 실제로 움직이기 전에 머릿속에서 여러 경우를 돌려 본 뒤 가장 나은 행동을 고르는 것이 핵심이다.
왜 중요한가
현실에서 로봇이나 자율주행차를 직접 시행착오로 가르치면 시간과 비용이 많이 들고 위험하다. 월드 모델이 있으면 상상 속 연습으로 많은 시도를 대신할 수 있어 강화학습 같은 학습을 훨씬 효율적으로 할 수 있다. 또 글만 다루는 LLM이 물리 세계의 인과관계를 잘 모른다는 한계를 보완할 방법으로 주목받는다. 그래서 로봇, 자율주행, 게임·영상 생성 분야에서 함께 연구되고 있다.
알아 둘 점
'월드 모델'은 쓰는 곳마다 뜻의 폭이 조금씩 다르다. 픽셀 단위로 그럴듯한 다음 영상을 만들어 내는 생성형 방식도 있고, JEPA처럼 픽셀 대신 추상적인 Representation 수준에서만 미래를 예측하는 방식도 있다. 그럴듯한 영상을 만든다고 해서 물리 법칙을 정확히 이해했다는 뜻은 아니며, 작은 예측 오차가 여러 단계에 걸쳐 쌓이면 먼 미래 예측은 크게 틀어질 수 있다.
예시
자율주행 회사는 월드 모델로 '앞차가 갑자기 멈추면', '보행자가 뛰어들면' 같은 드문 상황의 주행 영상을 만들어 시스템을 시험하고 훈련한다. 게임·영상 생성 쪽에서는 사용자가 키보드로 방향을 바꾸면 그에 맞춰 다음 화면을 실시간으로 만들어 내는 상호작용형 세계를 보여 주는 데 쓰인다. 로봇 분야에서는 물건을 밀거나 잡았을 때의 결과를 미리 예측해 동작 계획을 세우는 데 활용된다.