← 스터디

스터디 · 2026-10-09 · 기초

정형 데이터 머신러닝: 트리 모델의 강점과 TabPFN·LLM의 도전

엑셀 표 같은 정형 데이터에서는 이미지·글과 달리 딥러닝보다 그래디언트 부스팅 같은 트리 모델이 오랫동안 기본 선택이었다. 최근에는 표를 통째로 읽고 학습 없이 바로 예측하는 TabPFN 계열 테이블 파운데이션 모델과 LLM이 이 자리에 도전하고 있다.

핵심 정리

왜 필요했나: 표 데이터는 딥러닝에게 낯선 땅

회사 데이터 대부분은 행과 열로 된 표다. 고객 한 명이 한 행이고, 나이·가입 기간·최근 결제액·지역 같은 값이 열로 붙는다. 이런 데이터를 정형 데이터(tabular data)라고 부른다. 이탈 예측, 사기 탐지, 수요 예측처럼 지도 학습(정답이 붙은 예시로 배우는 방식)이 쓰이는 업무 문제는 대부분 이런 표에서 시작한다.

딥러닝은 이미지·음성·글에서 크게 성공했고, 표에도 그대로 쓰려는 시도가 많았다. 표 데이터용 딥러닝 비교 연구논문는 그 동기를 이렇게 설명한다. 성능이 더 좋아질 가능성도 있고, 표와 이미지·글을 함께 다루는 멀티모달 파이프라인을 한 번에 학습할 수 있다는 점도 매력적이었다. 그런데 이 분야에는 이미지의 ImageNet 같은 공통 벤치마크가 없었다. 논문마다 다른 데이터셋과 실험 방식을 써서, 어떤 모델이 정말 나은지 판단하기 어려웠다.

그사이 실무에서는 결정 트리를 여러 개 묶은 그래디언트 부스팅(GBDT)이 기본 선택이었다. 같은 연구논문는 XGBoost·LightGBM·CatBoost 같은 GBDT 라이브러리가 대회에서 흔히 1순위로 쓰인다고 정리했다. 그러면 왜 트리가 강한지, 신경망은 무엇이 모자란지, 그리고 이 구도를 바꿀 새 방식이 나왔는지가 이 글에서 다룰 질문이다.

핵심 아이디어: 스무고개를 여러 번 겹쳐 하기

결정 트리는 스무고개와 비슷하다. "최근 30일 결제가 있나?", "가입 1년 이상인가?"처럼 열 하나에 대한 예/아니오 질문을 이어 가다가, 마지막 칸(잎)에 도착하면 그 칸의 값을 답으로 낸다. 질문이 열 하나씩만 보기 때문에 단위가 제각각인 열이 섞여 있어도 상관없다. 쓸모없는 열은 질문에 거의 뽑히지 않아서 자연스럽게 무시된다.

트리 하나는 거칠다. 그래디언트 부스팅은 첫 트리가 틀린 만큼, 즉 남은 오차를 두 번째 트리가 맞히도록 배우고, 세 번째 트리는 그래도 남은 오차를 맞히는 식으로 트리를 하나씩 더한다. 여러 사람이 차례로 앞사람의 실수만 고쳐 주는 협업과 비슷하다. XGBoost논문는 최종 예측을 각 트리가 내놓은 점수의 합으로 정의한다.

TabPFN과 LLM 쪽 생각은 전혀 다르다. 표마다 모델을 새로 학습하지 않는다. 미리 아주 많은 표 문제를 겪어 본 큰 모델에게 "이 표의 정답 붙은 행들을 보고 나머지 행을 맞혀 봐"라고 시킨다. 문제를 많이 풀어 본 사람이 처음 보는 문제도 예시 몇 개만 보고 감을 잡는 것과 같다. 이것을 인컨텍스트 학습(in-context learning)이라고 부른다.

어떻게 작동하나: 부스팅과 TabPFN의 두 경로

그래디언트 부스팅의 흐름은 이렇다. 먼저 표 데이터로 첫 트리를 만든다. 각 행에서 예측과 정답의 차이(남은 오차)를 계산하고, 그 오차를 줄이는 방향으로 다음 트리를 만든다. 이 과정을 정해진 횟수만큼 되풀이하고, 예측할 때는 모든 트리의 점수를 더한다. XGBoost논문는 여기에 트리 잎의 개수와 잎 점수 크기를 벌점으로 주는 정규화 항을 더해 지나치게 복잡한 트리를 막았다. 학습 데이터에만 맞고 새 데이터에서는 틀리는 과적합을 줄이려는 장치다.

TabPFN논문은 두 단계로 나뉜다. 첫째, 오프라인에서 한 번만 사전학습한다. 이때 실제 데이터가 아니라 '사전 분포(prior)'에서 뽑은 합성 데이터셋을 쓴다. 이 사전 분포는 인과 구조를 표현하는 구조적 인과 모형을 넓게 담되 단순한 구조를 더 자주 뽑도록 짜여 있다. 둘째, 새 표가 오면 학습용 행(정답 포함)과 예측할 행을 한꺼번에 트랜스포머에 넣는다. 그러면 모델이 한 번의 계산(forward pass)으로 예측할 행 전체의 답을 낸다. 파라미터를 고치는 과정이 없어서 하이퍼파라미터 튜닝도 필요 없다.

TabLLM논문은 표의 한 행을 자연어 문장으로 바꾼다(직렬화). 예를 들어 "나이는 45세, 직업은 교사…" 같은 문장을 만들고, 분류 문제 설명과 함께 LLM에 프롬프트로 넣는다. 정답 예시 없이 바로 묻는 제로샷도 가능하고, 정답 예시가 조금 있으면 그것으로 LLM을 파인튜닝하는 퓨샷 설정도 쓴다. 템플릿, 표-글 변환 모델, LLM 자체 등 여러 직렬화 방법을 비교했다.

부스팅과 TabPFN의 작동 방식표 데이터 → 트리 추가; 트리 추가 → 남은 오차(오차 계산); 남은 오차 → 트리 추가(다음 트리); 남은 오차 → 트리 점수 합; 합성 데이터셋 → TabPFN(사전학습); 새 표(문맥) → TabPFN; TabPFN → 예측 행 전체 답그래디언트 부스팅TabPFN표 데이터정답 붙은 행트리 추가남은 오차트리 점수 합최종 예측합성 데이터셋인과 구조 사전 분포TabPFN한 번만 사전학습예측 행 전체 답한 번의 계산새 표(문맥)학습 행 + 예측할 행오차 계산다음 트리사전학습
부스팅과 TabPFN의 작동 방식 위 줄은 트리를 하나씩 더해 오차를 메우는 부스팅이고, 아래 줄은 합성 데이터로 한 번 사전학습한 뒤 새 표를 문맥으로 받아 한 번에 예측하는 TabPFN이다.

발전 흐름: 트리의 전성기에서 새로운 도전까지

XGBoost2016 논문는 트리 부스팅을 대규모로 돌릴 수 있는 시스템으로 만들었다. 비어 있는 값이 많은 희소 데이터를 다루는 알고리즘, 근사 분할을 위한 가중 분위수 스케치, 캐시를 고려한 블록 구조, 메모리 밖 데이터를 다루는 계산을 묶었다. 그 결과 단일 머신에서 기존 도구보다 10배 넘게 빠르고 수십억 개 예시까지 확장된다고 보고했다. 논문에 따르면 2015년 Kaggle 블로그에 실린 우승 솔루션 29개 중 17개가 XGBoost를 썼고, 심층 신경망을 쓴 솔루션은 11개였다. KDDCup 2015에서는 상위 10개 팀이 모두 XGBoost를 썼다.

표 데이터용 딥러닝 비교 연구2021 논문는 여러 딥러닝 모델을 같은 학습·튜닝 규칙으로 다시 비교했다. 단순한 ResNet 형태 모델이 지금까지 빠져 있던 강한 기준선이라는 점을 보였다. 또 트랜스포머를 표에 맞게 바꾼 FT-Transformer가 대부분의 과제에서 가장 좋았다고 보고했다. 그래도 결론은 GBDT와 딥러닝 사이에 '언제나 이기는 쪽'은 아직 없다는 것이었다.

트리 모델 우위 연구2022 논문는 45개 데이터셋과 학습기마다 2만 계산 시간 규모의 하이퍼파라미터 탐색으로 기준을 세웠다. 1만 행 안팎의 중간 규모 데이터에서는 속도 이점을 빼고 봐도 트리 모델이 여전히 최고 성능이었다. 원인으로는 신경망의 성향(inductive bias) 차이를 꼽았다. 그리고 표 전용 신경망이 풀어야 할 과제 세 가지를 제시했다. 쓸모없는 열에 흔들리지 않을 것, 데이터의 방향(각 열이 가진 고유한 축)을 보존할 것, 들쭉날쭉한 함수를 쉽게 배울 것이다.

같은 해 다른 방향의 도전도 나왔다. TabPFN논문은 학습 데이터 1,000행 이하, 수치 열 100개 이하, 클래스 10개 이하인 OpenML-CC18 데이터셋 18개에서 부스팅 트리를 확실히 앞섰다. 복잡한 AutoML 시스템과는 비슷한 성능을 내면서 최대 230배, GPU에서는 5,700배 빨랐다. TabLLM논문은 직렬화와 LLM만으로 기존 표 딥러닝 방법들을 몇몇 벤치마크에서 앞섰다. 특히 정답 예시가 아주 적을 때는 그래디언트 부스팅과도 경쟁할 만했고, 제로샷으로도 의미 있는 성능을 냈다. LLM이 사전학습 때 익힌 지식을 쓸 수 있기 때문이다.

2015년 Kaggle 우승 솔루션 속 XGBoost

17 / 29

해당 17나머지 12

Kaggle 블로그에 실린 우승 솔루션 29개 중 XGBoost를 쓴 17개를 칠한 그림이다.

요즘 어디로 가고 있나: 테이블 파운데이션 모델의 실전 과제

TabPFN처럼 여러 표 과제로 미리 학습한 뒤 새 표에서 인컨텍스트 학습으로 예측하는 모델을 요즘은 테이블 파운데이션 모델(TFM)이라 부른다. 2026년 연구들은 "정확도가 높다"는 단계를 지나 실제로 쓸 때 부딪히는 문제를 다룬다.

첫째는 비용이다. 이 모델들은 예측할 때마다 학습용 행 전체를 문맥으로 다시 읽어야 한다. 활성화 정렬 연구논문는 문맥을 일부만 쓰는 'Student'의 중간 활성값이 전체 문맥을 쓰는 'Teacher'의 활성값을 닮도록 가벼운 선형 변환을 학습시켰다. TabArena의 분류 데이터셋 38개에서 TabPFN-3과 TabFM 두 모델 모두 개선됐다. 데이터가 적은 구간에서는 Teacher와의 성능 격차를 절반 가까이 되찾았다. 이 변환은 GPU 없이 몇 초에서 몇 분이면 학습된다.

둘째는 시간이 흐르며 계속 들어오는 데이터다. 데이터 스트림 연구논문에 따르면 TFM은 파라미터 대신 문맥을 바꿔 적응한다. 최근 예시만 남기는 단순한 방법이 기존 메모리 관리 기법만큼 효과적이었다. 데이터 드리프트(데이터 분포가 바뀌는 현상) 뒤에도 기존 스트리밍 학습기보다 빨리 회복했다. 다만 거의 같은 문맥을 예측마다 다시 인코딩하느라 서빙 비용이 크다는 한계도 함께 지적했다.

셋째는 민감 데이터다. PrivTab논문은 의료·금융처럼 개인 정보가 담긴 표를 위해, 차등 프라이버시(개인 한 명의 포함 여부가 결과에서 드러나지 않게 하는 수학적 보장) 장치를 모델 구조 안에 넣었다. 시뮬레이션 데이터로 사전학습했고, 데이터셋에 맞추는 시간을 1만 배 줄여 한 번의 계산으로 끝낸다고 보고했다.

최근 TFM 연구의 수치

38개활성화 정렬 평가 데이터셋(TabArena)
절반 가까이적은 데이터에서 되찾은 Teacher와의 격차
1만 배PrivTab의 데이터셋 맞춤 시간 단축
활성화 정렬 연구와 PrivTab이 보고한 값이다.
정형 데이터 연구 지도 왼쪽부터 트리의 전성기, 공정 비교 연구, 새 방식의 도전, 2026년 실전 과제 순서다. 화살표는 비교 기준으로 삼았거나 후속 모델을 쓴 관계다.

한계와 쟁점: 누가 이겼다고 말하기 이르다

먼저 결과가 성립한 조건을 봐야 한다. TabPFN논문의 강한 결과는 1,000행 이하, 수치 열 100개 이하, 결측값 없음, 클래스 10개 이하라는 작은 표 조건에서 나왔다. 트리 모델 우위 연구논문가 트리의 강세를 확인한 것은 1만 행 안팎의 중간 규모 데이터다. 두 결과는 서로 다른 구간을 말하므로, 한쪽 결과로 다른 구간을 판단하면 안 된다.

비용 구조도 다르다. 부스팅 트리는 한 번 학습해 두면 예측이 가볍다. 반면 TFM은 학습 단계가 없는 대신 예측할 때마다 문맥 전체를 처리한다. 데이터 스트림 연구논문가 말한 높은 서빙 비용, 활성화 정렬 연구논문가 풀려는 문맥 비용이 바로 이 지점이다. 행이 많고 예측 요청이 잦은 서비스라면 정확도와 함께 이 비용을 따져야 한다.

LLM 방식은 예시가 아주 적을 때 강점이 두드러진다. TabLLM논문이 그래디언트 부스팅과 경쟁할 만하다고 한 것도 "특히 정답 예시가 매우 적을 때"라는 조건이 붙어 있다. 행을 글로 바꾸는 직렬화 방식에 따라 결과가 달라진다는 점도 고려해야 한다. 정리하면 2021년 비교 연구논문의 결론, 곧 '언제나 이기는 하나의 방법은 없다'가 아직 실무의 출발점이다.

세 가지 접근 비교

부스팅 트리XGBoost 등

  • 중간 규모 데이터에서 여전히 강함
  • 쓸모없는 열에 잘 흔들리지 않음
  • 학습 후 예측이 가벼움

TabPFN·TFM인컨텍스트 학습

  • 학습·튜닝 없이 바로 예측
  • 작은 표에서 강한 결과
  • 예측마다 문맥 처리 비용

LLM(TabLLM)행을 글로 직렬화

  • 예시가 아주 적을 때 강점
  • 사전학습 지식 활용
  • 직렬화 방식에 영향받음

공통 언제나 이기는 하나의 방법은 아직 없다

본문에서 다룬 연구 결과를 바탕으로 세 방식의 강점과 조건을 나란히 놓았다.

더 공부하려면

처음이라면 트리 모델 우위 연구논문부터 읽기를 권한다. 왜 트리가 강한지를 쓸모없는 열, 데이터 방향, 불규칙한 함수라는 세 가지 관점으로 설명해 이 주제의 지도를 잡아 준다. 이어서 XGBoost논문의 2장을 읽으면 트리를 더해 가는 원리와 정규화 목적 함수를 이해할 수 있다.

딥러닝 쪽 흐름은 표 데이터용 딥러닝 비교 연구논문가 좋다. 공정한 비교가 왜 중요한지, FT-Transformer가 무엇인지 알 수 있다. 새 방식은 TabPFN논문과 TabLLM논문을 함께 읽으면 '합성 데이터로 배운 트랜스포머'와 '언어 지식을 쓰는 LLM'의 차이가 보인다.

최신 흐름은 실무 관심사에 따라 고르면 된다. 운영 비용이 궁금하면 활성화 정렬 연구논문와 데이터 스트림 연구논문를, 개인정보가 걸린 데이터를 다룬다면 PrivTab논문을 읽는다.

관련 용어

그래디언트 부스팅 결정 트리 파운데이션 모델 합성 데이터 과적합 데이터 드리프트 트랜스포머 지도 학습

참고 문헌

핵심 논문

최근 연구

AI가 참고 문헌을 바탕으로 작성하고 검수를 거친 해설입니다. 정확한 내용은 원문을 확인해 주세요.