VLM 비전-언어 모델
VLM(Vision-Language Model, 비전-언어 모델)은 이미지나 영상을 보고 그 내용을 글로 설명하거나 관련 질문에 답할 수 있는 AI 모델이다. 언어 모델에 '눈'을 달아 준 형태의 멀티모달 모델이라고 볼 수 있다.
어떻게 작동하나
먼저 이미지를 작은 조각으로 나누고, 비전 인코더가 각 조각을 숫자 벡터(임베딩)로 바꾼다. 연결층(프로젝터)이 이 벡터를 언어 모델이 쓰는 토큰과 같은 형식으로 맞춘다. 언어 모델은 이렇게 만든 이미지 토큰과 사용자의 질문 텍스트를 함께 읽고, 답을 한 토큰씩 생성한다. 영상은 여러 장면(프레임)을 이미지처럼 차례로 처리하는 방식이 흔하다.
왜 중요한가
사람이 다루는 정보 중 상당 부분이 사진, 스캔한 문서, 화면, 영상이다. VLM은 영수증·표·그래프 읽기, 사진 설명, 화면을 보고 버튼을 찾아 누르는 컴퓨터 사용 에이전트 등에 쓰인다. 로봇 분야에서는 VLM에 행동 출력을 더한 VLA로 발전하고 있다. 글만 다루던 AI가 눈으로 보는 세상까지 다루게 해 준다는 점에서 중요하다.
알아 둘 점
이미지 속 작은 글자 읽기, 물건 개수 세기, 위치 관계 판단에서 실수하기 쉽다. 이미지에 없는 것을 있다고 말하는 환각도 생긴다. 이미지 안에 숨긴 글자로 몰래 지시를 심는 프롬프트 인젝션에 속을 수도 있다. 중요한 판단에 쓸 때는 결과를 사람이 확인하는 것이 안전하다.
예시
스마트폰으로 찍은 사진을 챗봇에 올리고 "이 표를 정리해 줘"라고 묻는 기능이 대표적인 VLM 활용이다. 이 사이트의 소식 중에는 트웰브랩스가 1인칭 영상을 로봇 학습 데이터로 바꾸는 VLM '페가수스 1.6'을 내놓았다는 보도가 있는데, 영상 내용을 이해하는 VLM의 능력을 로봇 학습에 활용하려는 사례다.
이 사이트에서 나온 사례
- 브리핑 트웰브랩스, 1인칭 영상을 로봇 학습 데이터로 바꾸는 VLM '페가수스 1.6' 출시(보도) 2026-10-07