AI 용어집 · 기초 · 전통 ML·추천·검색
결정 트리 Decision Tree, 랜덤 포레스트
결정 트리는 예/아니오로 답할 수 있는 질문을 차례로 던져 데이터를 나누고, 마지막 갈래에서 답을 내는 예측 모델입니다. 결정 트리 여러 그루를 모아 투표로 답을 정하는 방식을 랜덤 포레스트라고 합니다.
어떻게 작동하나
학습할 때 모델은 데이터를 가장 깔끔하게 나누는 질문을 고릅니다. 나뉜 각 그룹 안에 같은 답을 가진 데이터가 많이 모일수록 좋은 질문입니다. 나뉜 그룹마다 다시 가장 좋은 질문을 찾아 가지를 뻗고, 더 나눌 필요가 없거나 정해 둔 깊이에 이르면 멈춥니다. 맨 끝의 잎(리프)에는 '승인/거절' 같은 분류 결과나 '예상 금액' 같은 숫자 예측이 담깁니다. 새 데이터는 뿌리에서부터 질문에 답하며 내려가 도착한 잎의 답을 받습니다.
왜 중요한가
모델의 판단 과정이 '이 조건이면 이쪽'이라는 규칙으로 그대로 읽히기 때문에, 판단 근거를 설명해야 하는 금융·의료·공공 분야에서 특히 환영받습니다. 숫자 단위를 맞추는 등의 전처리가 적게 필요하고, 숫자와 범주가 섞인 데이터도 잘 다룹니다. 무엇보다 결정 트리는 랜덤 포레스트와 그래디언트 부스팅의 기본 부품이어서, 표 데이터 머신러닝을 이해하는 출발점이 됩니다.
랜덤 포레스트로 약점 보완하기
결정 트리 하나는 깊어질수록 학습 데이터의 우연한 특징까지 외워 과적합되기 쉽고, 데이터가 조금만 바뀌어도 나무 모양이 크게 달라집니다. 랜덤 포레스트는 데이터의 일부와 질문 후보의 일부를 무작위로 골라 서로 조금씩 다른 트리를 여러 그루 만든 뒤, 분류는 투표로, 숫자 예측은 평균으로 답을 정합니다. 각 트리의 실수가 서로 상쇄되어 훨씬 안정적인 결과가 나오고, 트리들을 동시에 만들 수 있어 학습도 빠릅니다. 반면 그래디언트 부스팅은 트리를 순서대로 쌓아 앞 트리의 오차를 메운다는 점이 다릅니다.
트리 하나 vs 숲 vs 부스팅
결정 트리트리 한 그루
- 규칙을 그대로 읽을 수 있음
- 과적합되기 쉬움
- 데이터가 조금 바뀌어도 모양이 크게 변함
랜덤 포레스트따로 만든 여러 트리의 투표
- 무작위로 다른 트리를 여러 그루
- 실수가 상쇄되어 안정적
- 동시에 만들 수 있어 빠름
그래디언트 부스팅순서대로 쌓는 트리
- 앞 트리의 오차를 메움
- 표 데이터에서 높은 정확도
- 설정값 조정이 까다로움
공통 모두 예/아니오 질문으로 데이터를 나누는 트리를 기본 부품으로 씁니다
알아 둘 점
트리 하나를 쓸 때는 깊이를 제한하거나 불필요한 가지를 쳐 내는 '가지치기'로 과적합을 막아야 합니다. 랜덤 포레스트처럼 트리가 많아지면 정확도와 안정성은 올라가지만, 트리 하나처럼 규칙을 한눈에 읽기는 어려워집니다. 이때는 어떤 항목이 판단에 많이 쓰였는지 보여 주는 피처 중요도로 설명을 보완합니다. 이미지나 문장처럼 구조가 없는 데이터에는 딥러닝이 더 잘 맞는 경우가 많습니다.
예시
은행은 대출 신청자의 소득, 기존 대출, 연체 이력 같은 정보로 결정 트리를 만들어 '연체 이력이 있는가 → 소득 대비 부채가 큰가'처럼 읽히는 심사 규칙을 얻고, 심사 결과를 고객에게 설명할 때 활용합니다. 더 높은 정확도가 필요할 때는 같은 데이터로 랜덤 포레스트를 학습해 고객 이탈 예측, 불량품 판별, 질병 위험 분류 같은 문제에 씁니다.