논문 리뷰 · 2026년 10월 10일
Learn2Play Bench: LLM 에이전트는 낯선 환경에서 경험으로 얼마나 잘 배우는가
Learn2Play Bench: How Well Do LLM Agents Learn from Experience in Unfamiliar Environments?
규칙이 숨겨져 있거나 상식과 반대인 텍스트 게임 20종으로 벤치마크를 만들어, LLM 에이전트가 사전 지식이 아니라 상호작용으로 배우는 능력을 측정했다.
문제
기존 자기 발전(self-evolving) 에이전트 벤치마크는 규칙이 지시문에 나오거나 사전학습으로 이미 익숙한 과제가 많다. 그래서 성능이 올라도 상호작용으로 새로 배운 것인지, 원래 알던 지식으로 추론한 것인지 구분하기 어렵다.
방법
새로 설계한 게임 템플릿 20개로 구성하고, 각 게임은 결정론적 피드백과 자동 채점을 제공한다. 10개는 매 에피소드 같은 인스턴스를, 10개는 규칙은 유지하고 등장인물·배치를 바꾼 인스턴스를 쓴다. 어려운 게임 5개는 10에피소드, 나머지는 5에피소드를 플레이하며, 최고 점수(Max), 평균(Mean), 처음 대비 마지막 향상(LG), 학습 기울기(LS)를 잰다. OpenCode 하네스로 백본 11종을 비교하고, 백본을 고정한 채 Memory·Reflexion·EvoTest·ReasoningBank·AWM·Naive를 비교했으며, 사람 플레이어와도 비교했다.
결과
- OpenCode 하네스에서 Claude Opus 5.5가 Max 80.1, Mean 61.0으로 가장 높았고, 향상 폭은 Qwen 3.8 Max가 LG +25.2, LS +6.30으로 가장 컸다.
- Kimi K3 기준으로 과거 상호작용 기록을 그대로 넣는 Memory가 Max 63.3, LG +16.9로 Reflexion(61.6, +14.8), AWM(56.1, +4.8) 등 경험을 요약하는 방법보다 모든 지표에서 앞섰다.
- 같은 백본에서 OpenCode 하네스가 평가한 자기 발전 방법들보다 성능이 높았다(Kimi K3: OpenCode Max 68.5 대 최고 방법 Memory 63.3).
- 상위 1명 사람 플레이어의 Max는 84.3으로 최고 에이전트(80.1)보다 높았고, 사람은 더 다양한 전략을 시도하며 행동 반복이 적었다고 보고했다.
- 저자들은 에이전트가 규칙을 알아내도 미리 계획하지 못해 실패하는 사례(Haunted Inn)와 부분적으로 통하는 전략에 머무는 사례(GemForge)를 보고했다.
한계
게임 템플릿마다 시드 하나, 시행 3회로 평가해 통계적 규모가 작다. 텍스트 게임에 한정되어 실제 업무 환경으로 일반화되는지는 확인되지 않았다. 사람 비교는 상위 k명을 Max 기준으로 고른 결과다. 가중치 등 집계 방식에 따라 순위가 달라질 수 있다.
의미
에이전트를 낯선 시스템에 배포할 때 필요한 '시행착오로 배우는 능력'을 사전 지식과 분리해 재는 도구다. 경험을 요약하기보다 원본 기록을 보존하는 편이 나을 수 있고, 하네스 설계가 백본만큼 중요하다는 점을 실무적으로 보여준다.
핵심 용어
- 자기 발전 에이전트(Self-evolving Agent)
- 모델 가중치를 바꾸지 않고 메모리, 반성, 규칙 추출 등으로 이전 시도의 경험을 다음 시도에 활용하는 에이전트.
- 하네스(Harness)
- 모델을 감싸 도구 호출, 기억 관리, 실행 루프를 제공하는 에이전트 실행 틀. 이 논문에서는 OpenCode가 대표 예다.
- Learning Gain / Learning Slope
- 처음 몇 에피소드 대비 마지막 몇 에피소드의 점수 향상폭, 그리고 에피소드별 점수에 맞춘 직선의 기울기. 얼마나 배우는지를 잰다.
원문
저자: Yibo Li, Jinhang Qiu, Zhi Zheng, Qianyun Guo, Jiaying Wu, Shuo Ji, Bryan Hooi · 게시 2026-10-06 · 라이선스 CC BY 4.0 · 본문 기준 분석
이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.