← AI 용어집

AI 용어집 · 입문 · 전통 ML·추천·검색

회귀 분석 Regression

회귀 분석은 여러 입력 값과 결과 값 사이의 관계를 찾아, 새 입력이 들어왔을 때 집값·매출·온도처럼 연속된 숫자를 예측하는 방법이다. 지도 학습의 가장 기본적인 형태 중 하나다.

쉽게 말하면 키와 몸무게를 적은 점들을 그래프에 찍고, 그 점들을 가장 잘 지나가는 선을 하나 긋는 것과 같다. 선을 한 번 그어 두면 새로운 키만 알아도 몸무게를 대략 짐작할 수 있다. 다만 실제 관계가 직선이 아니면 선이 엉뚱한 답을 낼 수 있다.

어떻게 작동하나

과거 데이터에서 입력(예: 면적, 방 개수, 역과의 거리)과 정답 숫자(예: 집값)를 함께 모은다. 모델은 입력마다 가중치를 붙여 더한 식을 만들고, 예측값과 실제값의 차이(오차)가 가장 작아지도록 가중치를 조정한다. 가장 단순한 선형 회귀는 이 관계를 직선(또는 평면)으로 보고, 더 복잡한 관계는 결정 트리·그래디언트 부스팅·신경망 같은 모델로 회귀 문제를 풀기도 한다. 이름에 '회귀'가 들어가지만, 결과가 '예/아니오' 확률로 나오는 로지스틱 회귀는 실제로는 분류에 쓰인다.

회귀와 분류의 차이

회귀얼마나?

  • 연속된 숫자를 예측
  • 예: 집값, 판매량, 온도
  • 오차의 크기로 평가

분류어느 쪽?

  • 정해진 범주 중 하나를 고름
  • 예: 스팸 여부, 상품 종류
  • 맞힌 비율 등으로 평가

공통 둘 다 입력과 정답을 짝지은 데이터로 학습하는 지도 학습

둘 다 정답이 있는 데이터로 배우는 지도 학습이지만, 내놓는 답의 모양이 다르다.

왜 중요한가

수요 예측, 가격 책정, 위험도 점수 매기기처럼 '얼마나'를 묻는 업무는 대부분 회귀 문제다. 선형 회귀는 각 입력이 결과에 얼마나 영향을 주는지 가중치로 바로 보여 주기 때문에 설명하기 쉽다는 장점도 있다. 그래서 복잡한 AI 모델을 만들기 전에 기준선(베이스라인)으로 먼저 회귀 모델을 세워 보는 경우가 많다. 손실 함수, 경사 하강법, 과적합 같은 머신러닝의 기본 개념을 익히기에도 가장 좋은 출발점이다.

알아 둘 점

회귀가 찾는 것은 '함께 움직이는 관계'이지 원인과 결과가 아니다. 아이스크림 판매량과 물놀이 사고가 함께 늘어도 하나가 다른 하나의 원인은 아닐 수 있다. 학습 데이터 범위를 벗어난 값을 넣으면 예측이 크게 틀릴 수 있고, 입력 변수를 너무 많이 넣으면 과적합이 생긴다. 극단적인 이상값 몇 개가 선 전체를 끌어당기는 문제도 자주 겪는다.

예시

부동산 플랫폼은 면적·층수·지역·주변 시설 같은 정보로 집의 예상 시세를 보여 주고, 유통 회사는 날씨·요일·행사 여부로 다음 주 판매량을 예측해 재고를 준비한다. 둘 다 결과가 연속된 숫자이므로 회귀 문제로 다룬다.

함께 보면 좋은 용어