← AI 용어집

AI 용어집 · 입문 · 언어 모델

사전 학습 Pre-training

사전 학습은 AI 모델이 인터넷 글, 책, 코드 같은 아주 많은 데이터를 먼저 읽으며 언어와 세상에 대한 기본 지식을 익히는 첫 번째 학습 단계예요. 이 단계를 마친 모델을 바탕으로 이후 여러 용도에 맞게 다듬어요.

쉽게 말하면 아이가 어떤 직업을 정하기 전에 수많은 책을 읽으며 말과 상식을 익히는 시기와 비슷해요. 다만 모델은 내용을 '이해'한다기보다 데이터에 나타난 패턴을 통계적으로 익히는 것이라서, 사람의 독서와 똑같지는 않아요.

어떻게 작동하나

LLM의 사전 학습에서는 보통 문장의 앞부분을 보고 다음에 올 토큰(글자 조각)을 맞히는 연습을 엄청나게 많이 반복해요. 정답은 원래 글에 이미 들어 있어서 사람이 하나하나 정답을 달아 줄 필요가 없어요. 모델은 틀릴 때마다 내부 파라미터(모델이 배운 내용을 담는 숫자)를 조금씩 고치고, 이 과정에서 문법, 사실 지식, 추론의 흔적 같은 것을 함께 익혀요. 이미지나 영상 모델도 비슷한 방식으로 대량의 데이터에서 기본 패턴을 먼저 배워요.

왜 중요한가

모델이 가진 기본 능력과 지식은 대부분 사전 학습에서 만들어져요. 한 번 잘 사전 학습된 모델은 번역, 요약, 코딩처럼 서로 다른 일에 쉽게 맞춰 쓸 수 있어서 '파운데이션 모델'이라고 불러요. 그래서 데이터의 양과 품질, 모델 크기, 투입한 연산량이 성능을 크게 좌우하고, 이 관계를 다루는 연구가 스케일링 법칙이에요.

알아 둘 점

사전 학습에는 GPU 같은 연산 자원이 아주 많이 들어서 큰 회사나 연구소만 처음부터 해낼 수 있는 경우가 많아요. 사전 학습만 마친 모델은 질문에 친절하게 답하기보다 글을 이어 쓰는 데 익숙하기 때문에, 대화형 서비스로 쓰려면 사후 학습이 더 필요해요. 학습 데이터에 들어 있는 오류나 편향도 모델에 그대로 남을 수 있어요. 또 모델은 학습 데이터를 모은 시점 이후의 일은 알지 못해요.

예시

우리가 쓰는 대화형 AI 서비스 뒤에 있는 LLM은 모두 먼저 대량의 텍스트로 사전 학습을 거치고, 그다음 대화에 맞게 다듬어진 모델이에요. 이 사이트에서 소개한 'Kandinsky 6.0 Video'처럼 영상과 오디오를 함께 만드는 파운데이션 모델도, 큰 틀에서는 많은 데이터로 기본 능력을 먼저 익힌 뒤 원하는 용도에 맞춰 조정하는 흐름을 따라요.

이 사이트에서 나온 사례

함께 보면 좋은 용어