논문 리뷰 · 2026년 10월 9일
LeCuration: 데이터 큐레이션용 다목적 도구로 쓰는 작은 월드 모델
LeCuration: A Tiny World Model as a Data Curation Multi-Tool
약 1,500만 파라미터의 JEPA 기반 작은 월드 모델을 CS:GO 데이터로 몇 시간 만에 학습하고, 그 임베딩과 예측 오차를 클러스터링·이상 탐지 등 데이터 큐레이션 신호로 쓸 수 있음을 정성적으로 보였다.
문제
피지컬 AI 학습 데이터를 모두 쓰면 비정상적인 구간까지 그대로 배우게 된다. 수작업 필터링은 규모를 키우기 어렵고, 규칙 기반 필터는 보통 접근할 수 없는 물리 엔진 상태가 필요하다. 그래서 데이터셋의 전형적인 것, 드문 것, 의외인 것을 빠르게 파악할 수 있는 가벼운 도구가 필요하다.
방법
LeWorldModel(LeWM)을 바탕으로 큐레이션 전용 소형 모델을 만들었다. 프레임을 먼저 TAESD로 4×28×28 Latent로 압축하고(48배), 약 200만 파라미터의 patch-ViT 인코더가 프레임마다 196차원 세계 상태(CLS 토큰)를 만든다. 약 1,300만 파라미터의 인과 Transformer 예측기는 과거 6개 상태와 행동으로 다음 상태를 예측한다. 학습은 예측 MSE와 SIGReg 정규화를 쓰는 사전학습 뒤, 50프레임 자기회귀 사후학습을 거친다. 시각화용 DiT 디코더는 따로 학습하며 큐레이션에는 쓰이지 않는다. 임베딩 클러스터링(UMAP+HDBSCAN), 최근접 이웃 검색, 예측-관측 임베딩 거리 d_t를 큐레이션 도구로 활용한다.
결과
- 40GB A100 한 장에서 사전학습 120분, 사후학습 60분, DiT 디코더 30분으로 전체 학습이 몇 시간 안에 끝났다고 저자들은 보고했다.
- 100만 개 CLS 임베딩을 클러스터링하자 라벨 없이도 개방된 시야, 근접 실내, 연막, 스코프 화면 같은 장면별 묶음이 나왔다(정성 평가). 스코프 화면 같은 비정상 클러스터를 걸러내는 데 쓸 수 있음을 보였다.
- 자기회귀 예측 임베딩을 100만 프레임 중 최근접 실제 프레임으로 바꾸면 장면, 시점, 조명이 정답 시퀀스와 일치했다. 반면 손에 든 무기는 자주 잘못 표현돼, 무기 교체·사격 데이터를 늘려야 한다는 진단으로 이어졌다.
- 예측-관측 임베딩 거리 d_t는 드문 행동으로 장면이 맵의 다른 위치로 순간이동하는 구간에서 크게 치솟았다가 약 350프레임 뒤 복귀하며 줄어들어, 비지도 이상 신호로 쓸 가능성을 보였다.
한계
저자들이 밝혔듯 CS:GO 한 맵(de_dust2)에 대한 정성적 개념 증명이다. 큐레이션 품질에 대한 정량 지표도, 큐레이션한 데이터로 더 큰 다운스트림 모델을 학습한 결과도 없다. 클러스터는 실제 위치·방향 라벨과 비교하지 않았다. d_t 급등은 물리 이상뿐 아니라 누적 예측 오차, 분포 밖 행동, 녹화 끊김 때문에도 생길 수 있다. 버릴 프레임과 더 뽑을 프레임을 가르는 임계값도 정하지 않았다.
의미
로봇이나 게임 에이전트용 대형 월드 모델을 학습하기 전에, 몇 시간 안에 학습되는 작은 '정찰' 모델로 데이터의 편중, 결함, 희귀 구간을 파악하는 실용적 방향을 제시한다. 물리 엔진 상태나 라벨 없이 영상과 행동 기록만으로 동작한다는 점이 장점이다.
핵심 용어
- JEPA(Joint-Embedding Predictive Architecture)
- 픽셀을 직접 복원하는 대신, 다음 프레임의 임베딩을 임베딩 공간에서 예측하도록 학습하는 자기지도 방식이다.
- SIGReg
- 임베딩 분포를 등방성 가우시안 쪽으로 밀어, 모든 입력이 같은 표현으로 뭉개지는 Representation 붕괴를 막는 정규화 항이다.
- TAESD
- Stable Diffusion 오토인코더를 Distill한 240만 파라미터의 경량 오토인코더다. 이미지를 작은 Latent로 빠르게 압축하고 복원한다.
- 임베딩 발산(Embedding Divergence) d_t
- 예측기가 예상한 다음 상태 임베딩과 실제 프레임 임베딩 사이의 유클리드 거리다. 값이 급등하면 모델이 예상하지 못한 구간이라는 뜻으로, 이상 탐지 후보 신호로 쓰인다.
원문
저자: Mayank Sengupta, Nirmit Desai, Eric Song, Kunal Sawarkar · 게시 2026-10-07 · 라이선스 CC BY-SA 4.0 · 본문 기준 분석
이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.