AI 용어집 · 기초 · 효율·인프라
추론(인퍼런스) Inference
추론(인퍼런스)은 이미 학습을 마친 AI 모델에 새로운 입력을 넣어 실제 결과(답변, 이미지, 분류 등)를 얻어 내는 과정, 즉 모델을 '사용하는' 단계입니다.
어떻게 작동하나
AI 모델의 일생은 크게 학습과 인퍼런스로 나뉩니다. 학습 단계에서는 많은 데이터를 보며 모델 안의 숫자(파라미터)를 조정하고, 인퍼런스 단계에서는 그 숫자를 고정한 채 새 입력에 대한 계산만 합니다. LLM의 경우 프롬프트를 토큰으로 나눠 모델에 넣으면, 모델은 다음에 올 토큰 하나를 예측합니다. 그 토큰을 입력 뒤에 붙이고 다시 다음 토큰을 예측하는 일을 반복해 답변 전체를 완성합니다.
왜 중요한가
학습은 한 번 크게 하지만, 인퍼런스는 사용자가 질문할 때마다 매번 일어납니다. 그래서 서비스 규모가 커질수록 전체 비용과 전력의 상당 부분이 인퍼런스에서 나옵니다. 답변 속도, 요금, 스마트폰에서 바로 돌릴 수 있는지(온디바이스 AI) 같은 사용자 경험도 인퍼런스 효율에 달려 있습니다. 이 때문에 양자화, KV 캐시, 추측 디코딩, 전용 칩(NPU 등)처럼 인퍼런스를 빠르고 싸게 만드는 기술이 활발히 연구됩니다.
알아 둘 점
한국어에서 '추론'은 두 가지 뜻으로 쓰여 헷갈리기 쉽습니다. 모델을 실행해 결과를 얻는 inference와, 단계별로 따져 생각하는 reasoning입니다. '추론 비용'이나 '추론 서버'는 보통 inference를, '추론 모델'이나 '추론 능력'은 reasoning을 가리킵니다. 또 인퍼런스 중에는 모델이 새로 배우지 않으므로, 대화에서 알려 준 내용은 그 대화의 컨텍스트 안에서만 쓰일 뿐 모델 자체에 저장되지는 않습니다.
예시
챗봇에 질문을 입력하고 답이 한 글자씩 나타나는 순간이 바로 인퍼런스가 일어나는 장면입니다. AI 서비스 회사들은 이 과정을 GPU 서버에서 돌리고, API 요금을 입력·출력 토큰 수에 따라 매기는데, 이는 인퍼런스에 드는 계산량이 토큰 수에 비례해 늘어나기 때문입니다. 스마트폰 사진 앱이 인터넷 연결 없이 사진 속 사물을 알아보는 것도 기기 안에서 인퍼런스를 수행하는 예입니다.