논문 리뷰 · 2026년 10월 10일
기록에서 에이전트 세계로: 상호작용 환경을 시뮬레이션하는 에이전트형 언어 월드 모델
From Traces to Agentic Worlds: Agentic Language World Models for Interactive Environment Simulation
과거 상호작용 기록을 환경 '월드북'으로 재구성하고 이를 참고하는 월드 모델 에이전트로 환경을 흉내 내, 기존 프롬프트 방식보다 충실하고 일관된 시뮬레이션을 얻었다.
문제
LLM 에이전트를 학습·평가하려면 실제 환경 복제본이 유용하지만, 원래 시스템의 코드·데이터·인프라를 구할 수 없는 경우가 많다. 기존 언어 월드 모델은 환경 설명과 기록을 한 프롬프트에 넣고 다음 관측을 예측하므로, 파일 삭제처럼 나중에야 드러나는 상태 변화를 여러 턴에 걸쳐 유지하기 어렵다.
방법
학습이 필요 없는 Trace2Env를 제안한다. 오프라인 단계에서 기록을 스키마(행동·상태 정의), 근거 기록, 유도된 행동 규칙, 출처 정보로 구성된 월드북으로 만든다. 실행 단계에서는 월드 모델 에이전트가 월드북과 현재 에피소드 상태, 에피소드 메모리를 필요한 만큼 찾아보며 관측과 상태 변화를 제안한다. 검색된 기록이 지금 상황에 적용 가능한지 판정하는 게이트와, 제안된 상태 변화를 스키마·규칙에 맞춰 검증하는 게이트를 거쳐 공용 하네스가 확정한다.
결과
- 9개 환경에서 형식·사실성·일관성·현실성·종합 품질 다섯 항목 모두 기존 프롬프트 기반 언어 월드 모델보다 개선됐다고 보고했다.
- 다음 관측 예측은 AgentWorldBench의 Terminal·SWE·Android·Web과 EnvScaler의 Food·Shopping·Benefits로, 다중 턴 평가는 ALFWorld·SciWorld로 진행했다.
- 다중 턴 상호작용에서 Trace2Env 안에서 생성된 에이전트 행동을 실제 환경에 재생했을 때 유효한 경우가 더 많았다고 저자들은 보고했다.
한계
제공된 본문이 실험 설정에서 잘려 구체적 수치와 비교 대상을 확인하지 못했다. 월드북은 실행 가능한 재구성이 아니므로, 기록에 없는 동작은 추론에 의존한다. 다중 턴 평가는 텍스트 게임 두 종류에 한정된다.
의미
원 시스템 없이 상호작용 기록만으로 에이전트 학습·테스트용 환경을 만들 수 있다면, 사내 시스템처럼 복제하기 어려운 환경에서도 에이전트를 안전하게 연습시킬 수 있다.
핵심 용어
- 언어 월드 모델(LWM)
- 언어 모델로 '이 행동을 하면 환경이 어떤 관측을 돌려줄지' 예측해 환경을 흉내 내는 모델.
- 월드북(Worldbook)
- 과거 기록에서 만든 환경 지식 묶음. 스키마, 실제 관측 근거, 반복되는 규칙, 출처 정보를 담고 실행 중에는 바뀌지 않는다.
- 에피소드 상태(Episode State)
- 현재 에피소드에서 사실로 확정된 내용(예: 어떤 파일이 삭제됨)을 기록하는 변경 가능한 상태. 월드북의 일반 지식과 구분한다.
원문
저자: Quanyu Long, Xiao Chen, Jianda Chen, Haozhen Zhang, Qisheng Hu, Jianzhu Bao, Wenya Wang · 게시 2026-10-05 · 라이선스 arXiv 비독점 배포 라이선스 · 본문 기준 분석
이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.