← AI 용어집

AI 용어집 · 기초 · 언어 모델

추론 모델 Reasoning model

추론 모델은 질문을 받자마자 답하지 않고, 먼저 문제를 단계별로 따져 보는 '생각 과정'을 길게 거친 뒤 최종 답을 내도록 훈련된 대규모 언어 모델(LLM)입니다.

쉽게 말하면 암산으로 바로 답을 말하는 학생과, 연습장에 풀이를 적어 가며 검산까지 한 뒤 답을 내는 학생의 차이와 비슷합니다. 다만 모델의 '생각'은 사람의 사고와 같은 것이 아니라, 답을 내기 전에 글자(토큰)를 더 많이 만들어 내는 과정입니다.

어떻게 작동하나

일반 LLM은 질문을 받으면 곧바로 답을 이어서 써 내려갑니다. 추론 모델은 답을 쓰기 전에 문제를 쪼개고, 가설을 세우고, 중간 결과를 확인하고, 틀린 부분을 고치는 과정을 글로 먼저 만들어 냅니다. 이런 능력은 주로 강화학습으로 길러집니다. 수학 문제나 코드처럼 정답 여부를 확인할 수 있는 과제를 풀게 하고, 맞힌 풀이 방식에 보상을 주어 '길고 꼼꼼하게 생각하는 습관'을 익히게 하는 방식입니다. 그래서 답변 시간에 계산을 더 쓰는 '테스트 타임 컴퓨트'와 밀접하게 연결됩니다.

일반 LLM과 추론 모델의 차이질문 → 일반 LLM; 일반 LLM → 바로 답하기; 질문 → 추론 모델; 추론 모델 → 생각 과정; 생각 과정 → 최종 답일반 LLM추론 모델질문일반 LLM바로 답하기질문추론 모델생각 과정쪼개기·확인·수정최종 답
일반 LLM과 추론 모델의 차이 위 줄은 질문에 바로 답하는 일반 LLM, 아래 줄은 답하기 전에 단계별 생각 과정을 거치는 추론 모델입니다.

왜 중요한가

모델을 더 크게 만들거나 데이터를 더 넣는 것 말고도, 답할 때 더 오래 생각하게 하는 것으로 성능을 끌어올릴 수 있다는 점을 보여 줬습니다. 특히 수학, 과학, 프로그래밍, 여러 단계를 거쳐야 하는 계획 문제에서 효과가 큽니다. 코딩 에이전트나 AI 에이전트처럼 스스로 여러 단계를 진행해야 하는 서비스의 바탕이 되기도 합니다. 많은 서비스가 이제 '빠른 모드'와 '깊이 생각하는 모드'를 나눠 제공하는 것도 이 흐름 때문입니다.

알아 둘 점

생각 과정이 길어지는 만큼 답이 늦게 나오고, 처리하는 토큰이 많아져 비용도 커집니다. 간단한 질문에는 오히려 과하게 생각해 비효율적일 수 있습니다. 화면에 보이는 생각 과정이 모델 내부에서 실제로 일어난 계산을 그대로 보여 준다고 단정할 수는 없습니다. 또 오래 생각한다고 환각이 사라지는 것은 아니어서, 그럴듯한 풀이 끝에 틀린 답을 내기도 합니다. 참고로 '추론 모델'의 추론은 reasoning(따져 생각하기)이며, 모델을 실행한다는 뜻의 '추론(인퍼런스)'과는 다른 말입니다.

예시

OpenAI의 o 시리즈, DeepSeek-R1, Anthropic Claude의 확장 사고(extended thinking) 기능처럼 여러 회사가 추론 모델이나 추론 모드를 내놓고 있습니다. 사용자는 채팅 서비스에서 '생각하기' 옵션을 켜면 모델이 잠시 고민하는 과정을 거친 뒤 답하는 모습을 볼 수 있고, 개발자는 API에서 생각에 쓸 분량을 조절해 속도·비용과 정확도 사이에서 균형을 맞춥니다.

함께 보면 좋은 용어