논문 리뷰 · 2026년 10월 10일
SuperNav: 어떤 과제든 어떤 장면에서든 동작하는 에이전트형 내비게이션 시스템
SuperNav: An Agentic Navigation System for Any Task in Any Scene
사전학습된 MLLM을 파인튜닝 없이 내비게이션 전용 에이전트 하네스(Skill·Tool·맥락 관리)로 감싸, 여러 내비게이션 과제에서 비교한 기준선 4종보다 높은 성공률을 얻었다.
문제
서비스 로봇은 낯선 환경에서 다양한 요청을 처리해야 한다. MLLM을 파인튜닝해 행동을 직접 예측하는 방식은 학습 데이터 범위에 묶여 새 과제·장면으로 일반화가 약하고, 모듈형 제로샷 시스템은 과제마다 정해진 워크플로를 고쳐야 한다.
방법
MLLM은 요청 해석, 장면 이해, 의사결정만 맡고 이동 실행은 도구에 맡긴다. 에이전트 루프가 관측·이동·목표 진행 관리·종료 Tool 호출을 반복하고, 처리된 이미지는 경로만 남기고 이후 요청에서 빼 맥락을 줄인다. MLLM은 4방향 관측 이미지 위의 한 점(PointNav)으로 목적지를 지정하며, 깊이·자세를 쓰는 기하 기반 실행기나 학습된 실행기가 이를 수행한다. 탐색·복구·완료 판단을 위한 Navigation Skill은 Markdown 문서로 필요할 때 읽는다. 실험은 GPT-5.6 Terra로 했다.
결과
- 단일 객체 내비게이션 150개에서 SR 78.00%로, 가장 강한 기준선 UniNaVid(34.00%)보다 높았다(Geo-based Executor).
- 순서가 있는 다중 객체 내비게이션 150개에서 SR 34.00%로, 기준선 최고치 OmniNav Action Former(4.00%)보다 높았다.
- Demand-Bench 기반 요구 주도 내비게이션 200개에서 SR 59.50%로 OmniNav Action Former(37.50%)보다 높았다.
- HM3D-OVON val-unseen 120개 에피소드에서 OVON 전용 학습 없이 1m 기준 SR 73.33%, SPL 0.4105, 0.25m 기준 SR 68.33%, SPL 0.3837을 기록했다.
- 실제 4족 로봇에도 배포해 동작을 보였다고 보고했다.
한계
인스턴스 벤치마크는 저자들이 직접 구축했고, 요구 주도 평가는 변형한 프로토콜을 썼다. 기준선은 MLLM 파인튜닝 방식 위주라 비교 조건이 다르다. HM3D-OVON은 120개 부분집합으로 평가했다. 다중 객체 SR은 34%로 여전히 낮고, 긴 순서의 요구 주도 과제는 어렵다고 저자들이 밝혔다. 성능이 상용 MLLM(GPT-5.6 Terra)에 의존한다.
의미
범용 에이전트에서 효과를 본 하네스 설계(도구·스킬·맥락 관리)를 로봇 내비게이션에 옮긴 사례다. 내비게이션 데이터로 따로 학습시키지 않고 범용 모델의 능력을 그대로 활용하는 방향을 보여준다.
핵심 용어
- 에이전트 하네스(Agent Harness)
- 모델이 도구를 호출하고 결과를 받아 다시 판단하도록 실행 루프, 도구, 맥락 관리를 제공하는 틀.
- Visual-point 인터페이스
- MLLM이 관측 이미지 위 좌표 한 점으로 목적지를 고르면 이동 도구가 실제 경로를 계획해 이동하는 방식.
- SPL(Success weighted by Path Length)
- 성공 여부에 최단 경로 대비 실제 이동 경로의 효율을 곱한 지표. 성공해도 돌아가면 점수가 낮다.
- Navigation Skill
- 탐색, 복구, 완료 확인 요령을 적은 Markdown 지침. 모델이 필요할 때 맥락에 불러와 참고한다.
원문
저자: Jinkai Zhang, Jingyi Xu, Yuanhong Yu, Jiarui Guo, Ruizhen Hu, Hujun Bao, Xiaowei Zhou, Sida Peng · 게시 2026-10-08 · 라이선스 arXiv 비독점 배포 라이선스 · 본문 기준 분석
이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.