AI 용어집 · 입문 · 멀티모달
멀티모달 Multimodal
멀티모달은 AI가 글뿐 아니라 이미지, 소리, 영상 등 여러 종류의 정보를 함께 이해하거나 만들어 낼 수 있는 성질을 말합니다.
쉽게 말하면 눈으로 보고, 귀로 듣고, 글을 읽으며 상황을 종합적으로 파악하는 사람과 비슷합니다. 글만 읽는 AI가 전화 통화만 하는 사람이라면, 멀티모달 AI는 영상 통화를 하는 사람에 가깝습니다.
어떻게 작동하나
멀티모달 모델은 이미지나 소리 같은 정보를 글과 함께 다룰 수 있는 형태로 바꿔서 처리합니다. 예를 들어 사진을 작은 조각으로 나눠 숫자로 표현하고, 이를 글의 토큰과 함께 모델에 넣는 방식이 있습니다. 이렇게 하면 '이 사진에 뭐가 있어?' 같은 질문에 답할 수 있습니다.
왜 중요한가
현실의 정보는 글만으로 이루어져 있지 않습니다. 사진 속 문서 읽기, 그래프 해석, 음성 대화, 영상 요약처럼 멀티모달 능력이 있어야 할 수 있는 일이 많습니다. 로봇이나 자율주행처럼 주변을 보고 판단해야 하는 분야에서도 핵심 기술입니다.
알아 둘 점
멀티모달 모델도 이미지나 소리를 잘못 해석해 환각을 일으킬 수 있습니다. 또 모델마다 지원하는 입력·출력 종류가 다릅니다. 이미지를 읽을 수는 있지만 만들지는 못하는 모델도 있으니, '멀티모달'이라는 말이 정확히 무엇을 뜻하는지 확인하는 것이 좋습니다.
예시
이 사이트에 소개된 Google의 'EmbeddingGemma 2'는 텍스트, 이미지, 오디오, 비디오를 하나의 공간에 함께 담는 임베딩 모델입니다. 이런 모델을 쓰면 글로 검색해서 관련된 사진이나 영상을 찾는 것처럼, 서로 다른 종류의 정보를 넘나드는 검색이 가능해집니다.