← 연구

논문 리뷰 · 2026년 10월 10일

AgentGarten: 에이전트가 계속 발전하도록 돕는 코드 기반 가상 세계

AgentGarten: Code Worlds for Evolving Agents

생성형 미디어에이전트피지컬 AI·로봇 고급 추천 131 cs.CV

시뮬레이터·게임 엔진에 공용 실시간 뉴럴 렌더러를 결합해 코드로 짜는 상호작용 환경을 만들었고, 그 안에서 에이전트가 몇 라운드 만에 학습하는 모습을 보였다.

문제

에이전트가 배울 수 있는 범위는 연습하는 환경이 정한다. 시뮬레이터와 게임 엔진은 상태와 규칙이 명확하지만, 시각적으로 다양하게 만들려면 3D 에셋 제작 비용이 크다. 반대로 비디오 월드 모델은 시각이 풍부한 대신 상태와 물리 규칙이 모델 안에 암묵적으로 들어 있어 확인하거나 수정하기 어렵다.

방법

엔진이 장면 상태와 상호작용 규칙을 코드로 실행하고, 깊이나 표면 법선 같은 구조화된 조건을 내보낸다. 공용 뉴럴 렌더러는 이 조건과 외형 참조 이미지, 텍스트, 과거 화면을 받아 관측 화면을 만든다. 렌더러는 Cosmos 3-Nano를 기반으로 기하 조건을 학습시킨 뒤 블록 단위 자기회귀 생성으로 바꾸고, 저자들이 제안한 Adversarial Forcing으로 Distill한다. Adversarial Forcing은 자기 Rollout에 대한 DMD(Distribution Matching Distillation), 과거 블록 인코딩까지 gradient가 닿게 하는 비트 단위로 정확한 재계산(exact replay), 실제 영상 기반 적대적 학습과 정확한 R1/R2 정규화를 결합한다. 에이전트는 렌더링된 화면만 보고 행동하며, 라운드마다 경험을 플레이북으로 정리해 다음 에이전트에게 넘긴다.

결과

한계

제공된 본문이 중간에 잘려 렌더러 품질 비교(Self Forcing 대비)와 여러 환경별 정량 결과는 확인하지 못했다. 강화학습과의 비교는 '4라운드 대 수백만'이라는 수준으로만 제시되어, 비교 조건(사전학습된 파운데이션 모델 에이전트와 처음부터 학습하는 RL)이 다르다는 점을 감안해야 한다.

의미

상태·규칙은 코드로, 화면은 공용 생성 모델로 나누면 새 환경을 에셋 없이 코드만으로 늘릴 수 있다. 에이전트 학습용 환경을 대량으로 만들 방법이 될 수 있다.

핵심 용어

코드 월드(Code World)
장면 프로그램이 상태와 규칙을 실행하고 뉴럴 렌더러가 화면을 생성하는 환경. 렌더링 오류가 상태에 쌓이지 않는다.
Adversarial Forcing
자기 Rollout으로 학습하는 Distillation 기법. 분포 매칭, 과거 인코딩까지 gradient를 전달하는 exact replay, 실제 영상 기반 적대적 학습을 결합한다.
DMD(Distribution Matching Distillation)
Student 모델이 생성한 샘플 분포를 Teacher 모델의 분포에 맞추도록 학습시켜 적은 단계로 생성하게 만드는 Distillation 방법.
플레이북(Playbook)
에이전트가 라운드마다 실패 원인과 깨달은 점을 글로 정리한 문서. 다음 라운드 에이전트가 이어받아 개선한다.

원문

저자: Jiawei Chi, Shangchen Miao, Zhiyuan Shi, Kailu Wu, Hanyang Wang, Weiliang Chen, Qiyu Dai, Jinshan Ren, 외 · 게시 2026-10-08 · 라이선스 arXiv 비독점 배포 라이선스 · 본문 기준 분석

이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.