← 연구

논문 리뷰 · 2026년 10월 9일

Long-WAM: World-Action 모델의 컨텍스트 확장

Long-WAM: Scaling the Context of World-Action Models

피지컬 AI·로봇효율·인프라 고급 추천 88 cs.RO

자기회귀(AR) 방식으로 사전학습한 비디오 모델을 로봇 제어에 맞게 적응시켜 더 긴 시각 이력을 활용하게 하고, 엣지 기기에서 실시간으로 실행되도록 최적화했다.

문제

빠른 로봇 제어에는 물체의 움직임과 작업 진행 상황을 파악할 수 있을 만큼의 시각 이력이 필요하다. 하지만 이력을 많이 처리할수록 행동 출력이 늦어진다. 또 기존 WAM(World-Action Model)은 주로 양방향으로 사전학습한 비디오 생성기를 인과적 제어용으로 바꿔 쓴다. 이런 모델이 긴 이력에 '접근'할 수 있다고 해서 그 이력을 실제로 '활용'한다는 보장은 없다.

방법

(1) LongLive2.0-Robot: LongLive-2.0의 AR 체크포인트를 바탕으로, 행동 라벨이 없는 로봇·1인칭 영상 약 10,000시간(window-equivalent 기준)으로 추가 학습한다. Teacher Forcing 방식으로 과거에서 미래를 예측하는 법을 배운다. (2) Causal-to-causal 적응: 비디오 expert의 인과 구조를 그대로 유지한 채 action expert를 붙인다. 먼저 미래 비디오 latent를 부분적으로 디노이징하고(σ=0.9에서 멈춤), 그 KV 캐시를 조건으로 행동 chunk를 생성한다(IDM 방식). (3) 배포 최적화: 비동기 실행, 스트리밍 VAE 인코딩, NVFP4(W4A4) 양자화, CUDA Graph, 실행 호출 내 KV 재사용, 기기별 커널 튜닝을 적용했다. 이를 통해 RTX 5090, DGX Spark, Jetson AGX Thor에서 미래 예측 단계를 빼지 않고도 실시간으로 실행한다.

결과

한계

이력 길이마다 모델을 따로 학습하고 평가했다. 최적 이력 길이도 벤치마크마다 달랐다(GR-1은 19.2초, LIBERO-Long은 2.4초). 저자들은 이력이 길어질수록 prefill·어텐션·캐시 비용이 커진다고 밝혔다. 실제 로봇 실험은 과제당 20회 수준의 시도로 평가해 표본이 작다. 대규모 영상 사전학습과 NVIDIA 하드웨어별 튜닝이 필요해 재현 비용이 크다.

의미

로봇 정책에서 '더 긴 컨텍스트'가 효과를 내는지는 비디오 기반 모델을 어떻게 사전학습했는지에 달려 있다는 점을 실험으로 보였다. 또 미래 예측을 포함한 WAM을 엣지 기기에서 실시간으로 돌릴 수 있다는 것을 시스템 수준에서 입증했다.

핵심 용어

WAM(World-Action Model)
미래 영상을 예측하는 월드 모델과 행동 생성을 결합해, 예측한 미래를 바탕으로 로봇 행동을 만드는 모델이다.
자기회귀(AR) 비디오 사전학습
과거 프레임만 보고 다음 프레임을 예측하도록 학습하는 방식이다. 양방향 학습과 달리 이력에서 미래로 이어지는 인과 구조를 그대로 배운다.
비동기 실행(Asynchronous Execution)
로봇이 현재 행동 chunk를 실행하는 동안 다음 chunk를 미리 추론하는 방식이다. 두 chunk가 겹치는 구간에서 행동이 매끄럽게 이어지는지가 관건이다.
NVFP4
NVIDIA의 4비트 부동소수점 형식이다. 이 논문에서는 가중치와 활성값을 모두 4비트로 양자화해 비디오 expert의 연산을 가속했다.

원문

저자: Wei Huang, Bohan Zhang, Chenzhi Liu, Isabella Liu, Shuai Yang, Weian Mao, Luozhou Wang, Yicheng Xiao, 외 · 게시 2026-10-07 · 라이선스 CC BY 4.0 · 본문 기준 분석

이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.