← AI 용어집

AI 용어집 · 기초 · 멀티모달 · 컴퓨터 비전

VLM 비전-언어 모델

VLM(Vision-Language Model, 비전-언어 모델)은 이미지나 영상을 보고 그 내용을 글로 설명하거나 관련 질문에 답할 수 있는 AI 모델이다. 언어 모델에 '눈'을 달아 준 형태의 멀티모달 모델이라고 볼 수 있다.

쉽게 말하면 말을 잘하는 사람(언어 모델)에게 그림을 읽어 주는 통역사(비전 인코더)를 붙여 준 팀과 비슷하다. 통역사가 그림을 언어 모델이 알아듣는 말로 바꿔 주면, 언어 모델은 그걸 바탕으로 답을 쓴다. 실제로는 둘이 함께 학습되어 사람 팀보다 훨씬 긴밀하게 맞물린다.

어떻게 작동하나

먼저 이미지를 작은 조각으로 나누고, 비전 인코더가 각 조각을 숫자 벡터(임베딩)로 바꾼다. 연결층(프로젝터)이 이 벡터를 언어 모델이 쓰는 토큰과 같은 형식으로 맞춘다. 언어 모델은 이렇게 만든 이미지 토큰과 사용자의 질문 텍스트를 함께 읽고, 답을 한 토큰씩 생성한다. 영상은 여러 장면(프레임)을 이미지처럼 차례로 처리하는 방식이 흔하다.

VLM의 기본 구조이미지·영상 → 비전 인코더; 비전 인코더 → 프로젝터; 프로젝터 → 언어 모델(이미지 토큰); 질문 텍스트 → 언어 모델; 언어 모델 → 답변이미지·영상비전 인코더조각을 벡터로프로젝터토큰 형식으로 맞춤질문 텍스트언어 모델이미지·텍스트 함께 읽기답변이미지 토큰
VLM의 기본 구조 이미지는 위 줄을 따라 토큰으로 바뀌어 언어 모델에 들어가고, 질문 텍스트와 함께 읽혀 답변이 나온다.

왜 중요한가

사람이 다루는 정보 중 상당 부분이 사진, 스캔한 문서, 화면, 영상이다. VLM은 영수증·표·그래프 읽기, 사진 설명, 화면을 보고 버튼을 찾아 누르는 컴퓨터 사용 에이전트 등에 쓰인다. 로봇 분야에서는 VLM에 행동 출력을 더한 VLA로 발전하고 있다. 글만 다루던 AI가 눈으로 보는 세상까지 다루게 해 준다는 점에서 중요하다.

알아 둘 점

이미지 속 작은 글자 읽기, 물건 개수 세기, 위치 관계 판단에서 실수하기 쉽다. 이미지에 없는 것을 있다고 말하는 환각도 생긴다. 이미지 안에 숨긴 글자로 몰래 지시를 심는 프롬프트 인젝션에 속을 수도 있다. 중요한 판단에 쓸 때는 결과를 사람이 확인하는 것이 안전하다.

예시

스마트폰으로 찍은 사진을 챗봇에 올리고 "이 표를 정리해 줘"라고 묻는 기능이 대표적인 VLM 활용이다. 이 사이트의 소식 중에는 트웰브랩스가 1인칭 영상을 로봇 학습 데이터로 바꾸는 VLM '페가수스 1.6'을 내놓았다는 보도가 있는데, 영상 내용을 이해하는 VLM의 능력을 로봇 학습에 활용하려는 사례다.

이 사이트에서 나온 사례

함께 보면 좋은 용어