← AI 용어집

AI 용어집 · 심화 · 피지컬 AI·로봇

VLA 비전-언어-행동 모델

VLA(Vision-Language-Action, 비전-언어-행동 모델)는 카메라로 본 장면과 사람이 말로 한 지시를 함께 이해해 로봇이 할 동작까지 바로 만들어 내는 AI 모델이다. 보고, 알아듣고, 몸을 움직이는 일을 모델 하나가 맡는다.

쉽게 말하면 요리 레시피를 읽으면서 도마 위 재료를 보고 바로 손을 움직이는 요리사와 비슷하다. 다만 실제 로봇은 사람보다 훨씬 서툴러서, 처음 보는 주방이나 낯선 도구 앞에서는 쉽게 실수한다.

어떻게 작동하나

VLA는 먼저 로봇 카메라 영상과 "컵을 집어" 같은 언어 지시를 함께 입력받는다. 이 둘은 이미지와 글을 같이 이해하는 VLM(비전-언어 모델) 같은 뼈대 모델이 처리해, 지금 무엇을 해야 하는지 파악한다. 그다음 행동 출력부가 이 이해를 로봇 팔의 관절 각도나 그리퍼(집게)를 열고 닫는 명령 같은 구체적인 동작으로 바꾼다. 로봇이 조금 움직이면 장면이 바뀌므로, 새로 찍힌 영상을 다시 보고 다음 동작을 정하는 과정을 짧은 간격으로 되풀이한다.

VLA가 동작을 정하는 고리카메라 영상 → VLM 뼈대; 언어 지시 → VLM 뼈대; VLM 뼈대 → 행동 출력부; 행동 출력부 → 로봇 동작; 로봇 동작 → 카메라 영상(새 장면)카메라 영상지금 보이는 장면언어 지시예: 컵을 집어VLM 뼈대장면·지시 이해행동 출력부관절·그리퍼 명령로봇 동작새 장면
VLA가 동작을 정하는 고리 영상과 언어 지시가 뼈대 모델을 거쳐 로봇 동작이 되고, 움직인 뒤 바뀐 장면을 다시 보며 같은 과정을 되풀이한다.

왜 중요한가

예전 로봇은 작업마다 사람이 동작을 일일이 짜 넣어야 해서, 물건 위치가 조금만 달라져도 실패하기 쉬웠다. VLA는 인터넷 규모의 글과 이미지로 미리 학습한 모델의 지식을 빌려 오기 때문에, 처음 보는 물건이나 새로운 말 지시에도 어느 정도 대응할 수 있다. 그래서 공장·물류 창고·가정용 로봇과 휴머노이드를 하나의 범용 '두뇌'로 움직이려는 시도의 중심에 있다. 로봇 분야의 파운데이션 모델이라는 말도 이런 흐름에서 자주 쓰인다.

알아 둘 점

글이나 이미지와 달리 로봇이 실제로 움직인 기록 데이터는 모으기가 어렵고 비싸서, 학습 데이터가 부족한 것이 가장 큰 숙제다. 이를 메우려고 시뮬레이션에서 연습시킨 뒤 현실로 옮기는 Sim-to-Real이나 합성 데이터를 함께 쓰기도 한다. 또 모델이 커질수록 동작을 정하는 속도가 느려질 수 있어, 빠르게 반응해야 하는 작업에서는 별도의 빠른 제어 장치와 나눠 맡기는 구조가 흔하다. 시연 영상에서 잘 되는 작업이 실제 현장에서도 안정적으로 되는지는 따로 따져 봐야 한다.

예시

로봇 기업들은 VLA를 자사 로봇의 공통 두뇌로 내세운다. 이 사이트에서 다룬 소식 중에는 투모로로보틱스가 로봇 파운데이션 모델 '하빌리스 브레인 0'을 공개했다는 보도가 있는데, 이런 모델은 카메라 영상과 작업 지시를 받아 로봇 팔이나 휴머노이드가 물건을 집고 옮기는 동작을 만들어 내는 데 쓰인다. 같은 모델을 여러 작업과 여러 로봇에 두루 쓰는 것이 목표다.

이 사이트에서 나온 사례

함께 보면 좋은 용어