← 연구

논문 리뷰 · 2026년 10월 9일

LeCuration: 데이터 큐레이션용 다목적 도구로 쓰는 작은 월드 모델

LeCuration: A Tiny World Model as a Data Curation Multi-Tool

피지컬 AI·로봇데이터 엔지니어링컴퓨터 비전 중급 cs.LG

약 1,500만 파라미터의 JEPA 기반 작은 월드 모델을 CS:GO 데이터로 몇 시간 만에 학습하고, 그 임베딩과 예측 오차를 클러스터링·이상 탐지 등 데이터 큐레이션 신호로 쓸 수 있음을 정성적으로 보였다.

문제

피지컬 AI 학습 데이터를 모두 쓰면 비정상적인 구간까지 그대로 배우게 된다. 수작업 필터링은 규모를 키우기 어렵고, 규칙 기반 필터는 보통 접근할 수 없는 물리 엔진 상태가 필요하다. 그래서 데이터셋의 전형적인 것, 드문 것, 의외인 것을 빠르게 파악할 수 있는 가벼운 도구가 필요하다.

방법

LeWorldModel(LeWM)을 바탕으로 큐레이션 전용 소형 모델을 만들었다. 프레임을 먼저 TAESD로 4×28×28 Latent로 압축하고(48배), 약 200만 파라미터의 patch-ViT 인코더가 프레임마다 196차원 세계 상태(CLS 토큰)를 만든다. 약 1,300만 파라미터의 인과 Transformer 예측기는 과거 6개 상태와 행동으로 다음 상태를 예측한다. 학습은 예측 MSE와 SIGReg 정규화를 쓰는 사전학습 뒤, 50프레임 자기회귀 사후학습을 거친다. 시각화용 DiT 디코더는 따로 학습하며 큐레이션에는 쓰이지 않는다. 임베딩 클러스터링(UMAP+HDBSCAN), 최근접 이웃 검색, 예측-관측 임베딩 거리 d_t를 큐레이션 도구로 활용한다.

결과

한계

저자들이 밝혔듯 CS:GO 한 맵(de_dust2)에 대한 정성적 개념 증명이다. 큐레이션 품질에 대한 정량 지표도, 큐레이션한 데이터로 더 큰 다운스트림 모델을 학습한 결과도 없다. 클러스터는 실제 위치·방향 라벨과 비교하지 않았다. d_t 급등은 물리 이상뿐 아니라 누적 예측 오차, 분포 밖 행동, 녹화 끊김 때문에도 생길 수 있다. 버릴 프레임과 더 뽑을 프레임을 가르는 임계값도 정하지 않았다.

의미

로봇이나 게임 에이전트용 대형 월드 모델을 학습하기 전에, 몇 시간 안에 학습되는 작은 '정찰' 모델로 데이터의 편중, 결함, 희귀 구간을 파악하는 실용적 방향을 제시한다. 물리 엔진 상태나 라벨 없이 영상과 행동 기록만으로 동작한다는 점이 장점이다.

핵심 용어

JEPA(Joint-Embedding Predictive Architecture)
픽셀을 직접 복원하는 대신, 다음 프레임의 임베딩을 임베딩 공간에서 예측하도록 학습하는 자기지도 방식이다.
SIGReg
임베딩 분포를 등방성 가우시안 쪽으로 밀어, 모든 입력이 같은 표현으로 뭉개지는 Representation 붕괴를 막는 정규화 항이다.
TAESD
Stable Diffusion 오토인코더를 Distill한 240만 파라미터의 경량 오토인코더다. 이미지를 작은 Latent로 빠르게 압축하고 복원한다.
임베딩 발산(Embedding Divergence) d_t
예측기가 예상한 다음 상태 임베딩과 실제 프레임 임베딩 사이의 유클리드 거리다. 값이 급등하면 모델이 예상하지 못한 구간이라는 뜻으로, 이상 탐지 후보 신호로 쓰인다.

원문

저자: Mayank Sengupta, Nirmit Desai, Eric Song, Kunal Sawarkar · 게시 2026-10-07 · 라이선스 CC BY-SA 4.0 · 본문 기준 분석

이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.