논문 리뷰 · 2026년 10월 8일
증거에서 행동으로: 도구 사용 에이전트는 어디서 실패하는가
From Evidence to Action: How Tool-Using Agents Fail
행동 전에 필요한 증거를 실제로 확보했는지 추적하는 벤치마크 SafeActBench를 만들어, 도구 사용 에이전트의 실패가 대부분 실행 전 조사 부족과 성급한 행동에서 시작됨을 보였다.
문제
도구 사용 에이전트는 환불, 기록 수정처럼 외부 상태를 바꾸는 행동을 한다. 그런데 최종 결과가 맞더라도 그 행동이 사전에 확보한 증거에 근거했는지는 보장되지 않는다. 기존 평가는 주로 과제 완료나 최종 상태만 보기 때문에, 증거에서 행동으로 이어지는 사슬 중 어디가 끊기는지 파악하기 어렵다.
방법
6개 업무 도메인, 656개 사례로 SafeActBench를 구축했다. 프로토콜은 5가지다. 정적 판단(Legacy, Allow/Block/Defer), 조사 후 행동하지 않기(V0), 단일 행동(V1), 선형 다중 행동(V2), 의존성 그래프(DAG) 다중 행동(V3). 출처 기반 Evidence Ledger는 각 사실이 어느 상호작용에서 어떤 개체·상태에 대해 확립됐는지 기록한다. 예를 들어 다른 청구 건의 금액이 같더라도 대상 건의 증거로 인정하지 않는다. 결정론적 평가기는 궤적을 재생하며 조사 완료, 도구·대상·인자의 정확성, 실행 결과 사용, 의존성 순서를 검사한다. LLM 판정은 쓰지 않는다. 5개 모델 계열을 각 계열의 전용 하네스와 공통 ReAct 하네스(Inspect)에 조합해 10개 구성으로 평가했다.
결과
- 최고 구성은 Claude-5 + Claude Code로 전체 정확 성공률(ECS) 67.2%였다. 최저는 GLM-5.2 + ZCode로 37.7%였다.
- 정적 판단 성능이 높아도 상호작용 실행은 약할 수 있었다. GLM–ZCode는 Legacy 97.7%였지만 V2는 12.1%였다. 같은 V1 사례로 재평가한 세 구성도 정적 정확도는 95% 이상, 상호작용 ECS는 52% 이하였다.
- 하네스 효과는 크고 모델마다 달랐다. DeepSeek-V4는 Inspect 57.5%에서 DSH 63.0%로 올랐다. GLM-5.2는 Inspect(41.0%)가 ZCode(37.7%)보다 나았다. 나머지 계열은 전용 하네스가 2.1~4.4%p 높았다.
- 저자들은 실패가 주로 실행 전에 시작된다고 보고했다. 조사를 불완전하게 끝내고 멈추거나, 필요한 증거를 확보하기 전에 행동하는 경우다. 증거를 확보한 뒤의 단일 행동 실행은 대체로 안정적이었다. 다중 행동에서는 선행 조건 미해결과 불완전 실행이 추가로 드러났다.
한계
사례는 656개, 도메인은 6개로 시뮬레이션된 도구 환경에서 평가했다. 평가는 관찰 가능한 궤적만 보므로, 모델이 내부적으로 무엇에 근거했는지는 판단할 수 없다고 저자들이 밝혔다. 증거 요구사항은 저자가 정의한 사례 명세에 의존한다. 평가 모델·하네스 구성은 10개다.
의미
실제 업무에 에이전트를 배치할 때는 결과가 맞는지뿐 아니라 근거를 확인하고 행동했는지가 중요하다. 이 연구는 조사 단계와 의존성 처리를 별도로 점검해야 한다는 진단 기준을 제공한다. 하네스 선택이 성능에 큰 영향을 준다는 점도 실무적 시사점이다.
핵심 용어
- 결과적 행동(Consequential Action)
- 환불, 문서 발송, 기록 수정처럼 애플리케이션 상태를 바꾸거나 외부 효과를 내는 도구 호출이다. 정보 조회 호출과 구분된다.
- 조사 후 비행동(Investigated Non-action)
- 행동하면 안 되는 상황에서 단순히 거절하지 않는 것이다. 필요한 조사를 마쳐 이유를 확인한 뒤 행동 없이 멈춰야 한다.
- Evidence Ledger
- 확립된 사실을 그 출처 상호작용과 대상 개체·상태에 묶어 기록하는 장부다. 행동 직전에 필요한 증거가 실제로 확보됐는지 판정하는 데 쓴다.
- 하네스(Harness)
- 모델을 감싸 도구 호출, 반복 루프, 프롬프트 구성을 관리하는 에이전트 실행 프레임워크다. 예로 Claude Code, Codex, ReAct 구현이 있다.
원문
저자: Hongzhan Lin, Shidong Cao, Ziyang Luo, Wenhao Chai, Mong-Li Lee, Wynne Hsu · 게시 2026-10-06 · 라이선스 arXiv 비독점 배포 라이선스 · 본문 기준 분석
이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.