AI 용어집 · 입문 · 언어 모델
사전 학습 Pre-training
사전 학습은 AI 모델이 인터넷 글, 책, 코드 같은 아주 많은 데이터를 먼저 읽으며 언어와 세상에 대한 기본 지식을 익히는 첫 번째 학습 단계예요. 이 단계를 마친 모델을 바탕으로 이후 여러 용도에 맞게 다듬어요.
어떻게 작동하나
LLM의 사전 학습에서는 보통 문장의 앞부분을 보고 다음에 올 토큰(글자 조각)을 맞히는 연습을 엄청나게 많이 반복해요. 정답은 원래 글에 이미 들어 있어서 사람이 하나하나 정답을 달아 줄 필요가 없어요. 모델은 틀릴 때마다 내부 파라미터(모델이 배운 내용을 담는 숫자)를 조금씩 고치고, 이 과정에서 문법, 사실 지식, 추론의 흔적 같은 것을 함께 익혀요. 이미지나 영상 모델도 비슷한 방식으로 대량의 데이터에서 기본 패턴을 먼저 배워요.
왜 중요한가
모델이 가진 기본 능력과 지식은 대부분 사전 학습에서 만들어져요. 한 번 잘 사전 학습된 모델은 번역, 요약, 코딩처럼 서로 다른 일에 쉽게 맞춰 쓸 수 있어서 '파운데이션 모델'이라고 불러요. 그래서 데이터의 양과 품질, 모델 크기, 투입한 연산량이 성능을 크게 좌우하고, 이 관계를 다루는 연구가 스케일링 법칙이에요.
알아 둘 점
사전 학습에는 GPU 같은 연산 자원이 아주 많이 들어서 큰 회사나 연구소만 처음부터 해낼 수 있는 경우가 많아요. 사전 학습만 마친 모델은 질문에 친절하게 답하기보다 글을 이어 쓰는 데 익숙하기 때문에, 대화형 서비스로 쓰려면 사후 학습이 더 필요해요. 학습 데이터에 들어 있는 오류나 편향도 모델에 그대로 남을 수 있어요. 또 모델은 학습 데이터를 모은 시점 이후의 일은 알지 못해요.
예시
우리가 쓰는 대화형 AI 서비스 뒤에 있는 LLM은 모두 먼저 대량의 텍스트로 사전 학습을 거치고, 그다음 대화에 맞게 다듬어진 모델이에요. 이 사이트에서 소개한 'Kandinsky 6.0 Video'처럼 영상과 오디오를 함께 만드는 파운데이션 모델도, 큰 틀에서는 많은 데이터로 기본 능력을 먼저 익힌 뒤 원하는 용도에 맞춰 조정하는 흐름을 따라요.
이 사이트에서 나온 사례
- 논문 DuoMatching: 소수 스텝 영상 생성을 위한 결합·주변 분포 동시 매칭 2026-10-08
- 논문 Kandinsky 6.0 Video: 영상과 오디오를 동기화해 생성하는 파운데이션 모델 2026-10-07