AI 용어집 · 입문 · 전통 ML·추천·검색 · 데이터 엔지니어링
정형 데이터 Tabular Data, 표 데이터
정형 데이터는 행과 열이 정해진 표 형태로 정리된 데이터입니다. 엑셀 시트나 데이터베이스 테이블처럼 각 칸에 어떤 값이 들어갈지 미리 정해져 있습니다.
어떻게 작동하나
정형 데이터에서 한 행은 하나의 대상(고객 한 명, 거래 한 건)을, 한 열은 그 대상의 특징(나이, 금액, 지역)을 뜻합니다. 열마다 숫자·날짜·범주 같은 형식이 정해져 있어 컴퓨터가 바로 계산하고 검색할 수 있습니다. 관계형 데이터베이스와 SQL이 이런 데이터를 다루는 대표 도구입니다. 반대로 문서, 이미지, 음성처럼 정해진 칸이 없는 데이터는 비정형 데이터라고 부릅니다.
정형 데이터와 비정형 데이터
정형 데이터행과 열이 정해진 표
- 엑셀·데이터베이스 테이블
- SQL로 바로 계산·검색
- 그래디언트 부스팅이 강한 편
비정형 데이터정해진 칸이 없음
- 문서·이미지·음성
- 임베딩 등으로 바꿔 다룸
- 딥러닝·LLM이 주로 처리
공통 둘 다 AI가 배우고 판단하는 재료입니다.
왜 중요한가
기업의 매출, 재고, 고객, 센서 기록처럼 실제 업무 데이터의 상당 부분이 정형 데이터입니다. 대출 심사, 수요 예측, 이상 거래 탐지 같은 일은 대부분 이런 표를 보고 판단합니다. 표 데이터에서는 지금도 그래디언트 부스팅 같은 전통적인 머신러닝 기법이 딥러닝보다 강한 경우가 많다고 알려져 있습니다. 최근에는 LLM이 사람의 질문을 SQL로 바꿔 표를 조회하는 Text-to-SQL처럼, 정형 데이터와 생성형 AI를 잇는 시도도 늘고 있습니다.
알아 둘 점
LLM은 글을 토큰 단위로 읽기 때문에, 큰 표를 통째로 넣으면 숫자를 정확히 계산하거나 많은 행을 비교하는 데 약할 수 있습니다. 그래서 계산은 데이터베이스나 코드에 맡기고 LLM은 질문 해석과 설명을 맡기는 방식이 흔합니다. 또 정형 데이터라도 빈 칸, 단위 혼동, 중복 행 같은 품질 문제가 많아 정리 작업이 먼저 필요합니다.
예시
사내 데이터 분석 챗봇에 "지난 분기 지역별 매출 상위 3곳은?"이라고 물으면, LLM이 질문을 SQL로 바꿔 매출 테이블(정형 데이터)을 조회하고 결과를 문장으로 설명해 줍니다. 은행의 이상 거래 탐지 시스템은 거래 금액·시간·장소가 담긴 거래 테이블을 학습한 모델로 의심스러운 거래를 골라냅니다.