← AI 용어집

AI 용어집 · 기초 · 효율·인프라

추론(인퍼런스) Inference

추론(인퍼런스)은 이미 학습을 마친 AI 모델에 새로운 입력을 넣어 실제 결과(답변, 이미지, 분류 등)를 얻어 내는 과정, 즉 모델을 '사용하는' 단계입니다.

쉽게 말하면 요리사가 오랜 수련(학습)으로 실력을 쌓은 뒤, 손님 주문(입력)을 받아 요리(출력)를 내는 일이 인퍼런스입니다. 주문을 받는 동안 요리사의 실력 자체가 바뀌지는 않는다는 점도 닮았습니다.

어떻게 작동하나

AI 모델의 일생은 크게 학습과 인퍼런스로 나뉩니다. 학습 단계에서는 많은 데이터를 보며 모델 안의 숫자(파라미터)를 조정하고, 인퍼런스 단계에서는 그 숫자를 고정한 채 새 입력에 대한 계산만 합니다. LLM의 경우 프롬프트를 토큰으로 나눠 모델에 넣으면, 모델은 다음에 올 토큰 하나를 예측합니다. 그 토큰을 입력 뒤에 붙이고 다시 다음 토큰을 예측하는 일을 반복해 답변 전체를 완성합니다.

LLM 인퍼런스의 흐름프롬프트 → 토큰으로 나누기; 토큰으로 나누기 → 학습된 모델; 학습된 모델 → 다음 토큰 예측; 다음 토큰 예측 → 학습된 모델(붙여서 반복); 파라미터 → 학습된 모델; 다음 토큰 예측 → 완성된 답변(끝나면)프롬프트토큰으로 나누기학습된 모델다음 토큰 예측파라미터학습 때 정해짐·고정완성된 답변붙여서 반복끝나면
LLM 인퍼런스의 흐름 학습 때 정해진 파라미터는 고정된 채로, 모델이 다음 토큰을 하나씩 예측해 입력 뒤에 붙이는 일을 반복하고 끝나면 답변이 완성됩니다.

왜 중요한가

학습은 한 번 크게 하지만, 인퍼런스는 사용자가 질문할 때마다 매번 일어납니다. 그래서 서비스 규모가 커질수록 전체 비용과 전력의 상당 부분이 인퍼런스에서 나옵니다. 답변 속도, 요금, 스마트폰에서 바로 돌릴 수 있는지(온디바이스 AI) 같은 사용자 경험도 인퍼런스 효율에 달려 있습니다. 이 때문에 양자화, KV 캐시, 추측 디코딩, 전용 칩(NPU 등)처럼 인퍼런스를 빠르고 싸게 만드는 기술이 활발히 연구됩니다.

알아 둘 점

한국어에서 '추론'은 두 가지 뜻으로 쓰여 헷갈리기 쉽습니다. 모델을 실행해 결과를 얻는 inference와, 단계별로 따져 생각하는 reasoning입니다. '추론 비용'이나 '추론 서버'는 보통 inference를, '추론 모델'이나 '추론 능력'은 reasoning을 가리킵니다. 또 인퍼런스 중에는 모델이 새로 배우지 않으므로, 대화에서 알려 준 내용은 그 대화의 컨텍스트 안에서만 쓰일 뿐 모델 자체에 저장되지는 않습니다.

예시

챗봇에 질문을 입력하고 답이 한 글자씩 나타나는 순간이 바로 인퍼런스가 일어나는 장면입니다. AI 서비스 회사들은 이 과정을 GPU 서버에서 돌리고, API 요금을 입력·출력 토큰 수에 따라 매기는데, 이는 인퍼런스에 드는 계산량이 토큰 수에 비례해 늘어나기 때문입니다. 스마트폰 사진 앱이 인터넷 연결 없이 사진 속 사물을 알아보는 것도 기기 안에서 인퍼런스를 수행하는 예입니다.

함께 보면 좋은 용어