논문 리뷰 · 2026년 10월 10일
AgentGarten: 에이전트가 계속 발전하도록 돕는 코드 기반 가상 세계
AgentGarten: Code Worlds for Evolving Agents
시뮬레이터·게임 엔진에 공용 실시간 뉴럴 렌더러를 결합해 코드로 짜는 상호작용 환경을 만들었고, 그 안에서 에이전트가 몇 라운드 만에 학습하는 모습을 보였다.
문제
에이전트가 배울 수 있는 범위는 연습하는 환경이 정한다. 시뮬레이터와 게임 엔진은 상태와 규칙이 명확하지만, 시각적으로 다양하게 만들려면 3D 에셋 제작 비용이 크다. 반대로 비디오 월드 모델은 시각이 풍부한 대신 상태와 물리 규칙이 모델 안에 암묵적으로 들어 있어 확인하거나 수정하기 어렵다.
방법
엔진이 장면 상태와 상호작용 규칙을 코드로 실행하고, 깊이나 표면 법선 같은 구조화된 조건을 내보낸다. 공용 뉴럴 렌더러는 이 조건과 외형 참조 이미지, 텍스트, 과거 화면을 받아 관측 화면을 만든다. 렌더러는 Cosmos 3-Nano를 기반으로 기하 조건을 학습시킨 뒤 블록 단위 자기회귀 생성으로 바꾸고, 저자들이 제안한 Adversarial Forcing으로 Distill한다. Adversarial Forcing은 자기 Rollout에 대한 DMD(Distribution Matching Distillation), 과거 블록 인코딩까지 gradient가 닿게 하는 비트 단위로 정확한 재계산(exact replay), 실제 영상 기반 적대적 학습과 정확한 R1/R2 정규화를 결합한다. 에이전트는 렌더링된 화면만 보고 행동하며, 라운드마다 경험을 플레이북으로 정리해 다음 에이전트에게 넘긴다.
결과
- 저자들은 에이전트가 4라운드 만에 학습해, 수백만 번이 필요한 기존 강화학습 방식보다 학습 효율이 크게 높다고 보고했다.
- 숨바꼭질 환경에서 경사로 사용과 은신처 짓기 같은 전략이 몇 판 만에 나타났다고 저자들은 보고했다.
- exact replay가 샘플링 Rollout과 비트 단위로 같은 재계산을 달성해, 전체 시퀀스를 한 번에 계산하는 SGF 방식의 수치 불일치를 없앤다고 설명한다.
- 렌더러는 GPU 1장에서 실시간 상호작용이 되도록 최적화되었다고 밝혔다.
한계
제공된 본문이 중간에 잘려 렌더러 품질 비교(Self Forcing 대비)와 여러 환경별 정량 결과는 확인하지 못했다. 강화학습과의 비교는 '4라운드 대 수백만'이라는 수준으로만 제시되어, 비교 조건(사전학습된 파운데이션 모델 에이전트와 처음부터 학습하는 RL)이 다르다는 점을 감안해야 한다.
의미
상태·규칙은 코드로, 화면은 공용 생성 모델로 나누면 새 환경을 에셋 없이 코드만으로 늘릴 수 있다. 에이전트 학습용 환경을 대량으로 만들 방법이 될 수 있다.
핵심 용어
- 코드 월드(Code World)
- 장면 프로그램이 상태와 규칙을 실행하고 뉴럴 렌더러가 화면을 생성하는 환경. 렌더링 오류가 상태에 쌓이지 않는다.
- Adversarial Forcing
- 자기 Rollout으로 학습하는 Distillation 기법. 분포 매칭, 과거 인코딩까지 gradient를 전달하는 exact replay, 실제 영상 기반 적대적 학습을 결합한다.
- DMD(Distribution Matching Distillation)
- Student 모델이 생성한 샘플 분포를 Teacher 모델의 분포에 맞추도록 학습시켜 적은 단계로 생성하게 만드는 Distillation 방법.
- 플레이북(Playbook)
- 에이전트가 라운드마다 실패 원인과 깨달은 점을 글로 정리한 문서. 다음 라운드 에이전트가 이어받아 개선한다.
원문
저자: Jiawei Chi, Shangchen Miao, Zhiyuan Shi, Kailu Wu, Hanyang Wang, Weiliang Chen, Qiyu Dai, Jinshan Ren, 외 · 게시 2026-10-08 · 라이선스 arXiv 비독점 배포 라이선스 · 본문 기준 분석
이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.