AI 용어집 · 심화 · 피지컬 AI·로봇
VLA 비전-언어-행동 모델
VLA(Vision-Language-Action, 비전-언어-행동 모델)는 카메라로 본 장면과 사람이 말로 한 지시를 함께 이해해 로봇이 할 동작까지 바로 만들어 내는 AI 모델이다. 보고, 알아듣고, 몸을 움직이는 일을 모델 하나가 맡는다.
어떻게 작동하나
VLA는 먼저 로봇 카메라 영상과 "컵을 집어" 같은 언어 지시를 함께 입력받는다. 이 둘은 이미지와 글을 같이 이해하는 VLM(비전-언어 모델) 같은 뼈대 모델이 처리해, 지금 무엇을 해야 하는지 파악한다. 그다음 행동 출력부가 이 이해를 로봇 팔의 관절 각도나 그리퍼(집게)를 열고 닫는 명령 같은 구체적인 동작으로 바꾼다. 로봇이 조금 움직이면 장면이 바뀌므로, 새로 찍힌 영상을 다시 보고 다음 동작을 정하는 과정을 짧은 간격으로 되풀이한다.
왜 중요한가
예전 로봇은 작업마다 사람이 동작을 일일이 짜 넣어야 해서, 물건 위치가 조금만 달라져도 실패하기 쉬웠다. VLA는 인터넷 규모의 글과 이미지로 미리 학습한 모델의 지식을 빌려 오기 때문에, 처음 보는 물건이나 새로운 말 지시에도 어느 정도 대응할 수 있다. 그래서 공장·물류 창고·가정용 로봇과 휴머노이드를 하나의 범용 '두뇌'로 움직이려는 시도의 중심에 있다. 로봇 분야의 파운데이션 모델이라는 말도 이런 흐름에서 자주 쓰인다.
알아 둘 점
글이나 이미지와 달리 로봇이 실제로 움직인 기록 데이터는 모으기가 어렵고 비싸서, 학습 데이터가 부족한 것이 가장 큰 숙제다. 이를 메우려고 시뮬레이션에서 연습시킨 뒤 현실로 옮기는 Sim-to-Real이나 합성 데이터를 함께 쓰기도 한다. 또 모델이 커질수록 동작을 정하는 속도가 느려질 수 있어, 빠르게 반응해야 하는 작업에서는 별도의 빠른 제어 장치와 나눠 맡기는 구조가 흔하다. 시연 영상에서 잘 되는 작업이 실제 현장에서도 안정적으로 되는지는 따로 따져 봐야 한다.
예시
로봇 기업들은 VLA를 자사 로봇의 공통 두뇌로 내세운다. 이 사이트에서 다룬 소식 중에는 투모로로보틱스가 로봇 파운데이션 모델 '하빌리스 브레인 0'을 공개했다는 보도가 있는데, 이런 모델은 카메라 영상과 작업 지시를 받아 로봇 팔이나 휴머노이드가 물건을 집고 옮기는 동작을 만들어 내는 데 쓰인다. 같은 모델을 여러 작업과 여러 로봇에 두루 쓰는 것이 목표다.
이 사이트에서 나온 사례
- 브리핑 투모로로보틱스, 로봇 파운데이션 모델 '하빌리스 브레인 0' 공개(보도) 2026-10-07