← 연구

논문 리뷰 · 2026년 10월 9일

Recursive Game Creator: 플레이 경험 중심의 에이전트 기반 게임 개발 Harness

Recursive Game Creator: An Agentic Product-Level Experience-Oriented Game Harness

에이전트생성형 미디어 중급 추천 78 cs.AI

Designer·Builder·Player·Reviewer가 반복 루프를 돌며 코드 정책으로 게임을 플레이·평가하게 해, GameCraft-Bench에서 최고 점수 77.89를 얻었다.

문제

코딩 에이전트는 실행되는 게임을 빠르게 만들 수 있다. 하지만 프로그램이 정상 동작한다고 해서 게임이 재미있다는 보장은 없다. 기존 방법은 GUI 에이전트가 스크린샷을 보며 게임을 테스트했다. 이 방식은 느리고, 게임 상태 정보를 놓치며, 플레이 데이터를 다양하게 모으기 어렵다. 그래서 '플레이 경험'을 기준으로 게임을 반복 개선하는 데 한계가 있었다.

방법

네 역할로 이루어진 반복 루프를 구성했다. Designer는 사용자 지시와 리뷰 피드백을 바탕으로 계획(개선 가설, 변경 사항, 수용 기준, 필요 에셋)을 세운다. Builder는 초안을 만들고, 에셋을 생성하고, 통합해 후보 게임을 만든다. Coding-Native Player는 게임의 프로그래밍 인터페이스를 이용해 전략·실력·탐험 성향이 서로 다른 정책 코드를 작성한다. 이 정책들을 반복·병렬로 실행해 Trajectory를 모은다. Reviewer는 성공률·플레이 시간 같은 공통 지표와 장르별 루브릭, 스크린샷 등 시각 근거, 사용자 선호를 종합한다. 그리고 버전 정보를 가린 상태에서 후보와 기존 버전을 A/B로 비교해 더 나은 쪽을 남기고, 다음 라운드에 쓸 피드백을 만든다.

결과

한계

저자들도 밝혔듯이 정책 기반 플레이어는 대리 전략일 뿐 실제 인간 플레이어 집단을 대표하지 않는다. 플레이 시간 같은 대리 지표만으로 재미를 입증할 수도 없다. 게임이 상태와 행동을 노출하는 프로그래밍 인터페이스를 갖춰야 적용할 수 있다. GameCraft-Bench는 일부 과제(45개)만 평가했다. 정책 생성·수정·실행·리뷰를 포함한 전체 비용 분석은 이 발췌문에서 확인하기 어렵다. 코드는 아직 공개되지 않았다.

의미

에이전트 기반 생성의 목표를 '동작하는 결과물'에서 '사용자 경험의 질'로 옮기려는 시도다. 매 행동마다 모델을 호출하는 GUI 테스트 대신 코드 정책으로 빠르게 플레이 데이터를 모으는 방식은, 게임 외의 인터랙티브 소프트웨어 평가에도 응용할 수 있다.

핵심 용어

Harness
여러 에이전트와 도구, 평가 단계를 묶어 반복 작업 흐름을 운영하는 실행 틀이다.
Coding-Native Player
화면을 보고 매번 판단하는 대신, 게임 상태를 읽고 행동을 고르는 정책 코드를 작성·실행해 플레이 기록을 모으는 테스트 에이전트다.
Trajectory
한 번의 플레이에서 기록된 상태·행동·이벤트·진행도·시간·종료 결과의 연속 기록이다.
게임별 루브릭(Game-specific Rubric)
장르에 따라 중요한 평가 기준을 따로 정한 채점표다. 예를 들어 레이싱 게임은 조향 반응성, 비주얼 노벨은 대화의 일관성을 본다.

원문

저자: Jiajun Chen, Haoyu Wu, Mingda Jia, Xihui Liu · 게시 2026-10-06 · 라이선스 arXiv 비독점 배포 라이선스 · 본문 기준 분석

이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.