← 연구

논문 리뷰 · 2026년 10월 8일

증거에서 행동으로: 도구 사용 에이전트는 어디서 실패하는가

From Evidence to Action: How Tool-Using Agents Fail

에이전트안전·정렬데이터·평가 중급 추천 34 cs.CL

행동 전에 필요한 증거를 실제로 확보했는지 추적하는 벤치마크 SafeActBench를 만들어, 도구 사용 에이전트의 실패가 대부분 실행 전 조사 부족과 성급한 행동에서 시작됨을 보였다.

문제

도구 사용 에이전트는 환불, 기록 수정처럼 외부 상태를 바꾸는 행동을 한다. 그런데 최종 결과가 맞더라도 그 행동이 사전에 확보한 증거에 근거했는지는 보장되지 않는다. 기존 평가는 주로 과제 완료나 최종 상태만 보기 때문에, 증거에서 행동으로 이어지는 사슬 중 어디가 끊기는지 파악하기 어렵다.

방법

6개 업무 도메인, 656개 사례로 SafeActBench를 구축했다. 프로토콜은 5가지다. 정적 판단(Legacy, Allow/Block/Defer), 조사 후 행동하지 않기(V0), 단일 행동(V1), 선형 다중 행동(V2), 의존성 그래프(DAG) 다중 행동(V3). 출처 기반 Evidence Ledger는 각 사실이 어느 상호작용에서 어떤 개체·상태에 대해 확립됐는지 기록한다. 예를 들어 다른 청구 건의 금액이 같더라도 대상 건의 증거로 인정하지 않는다. 결정론적 평가기는 궤적을 재생하며 조사 완료, 도구·대상·인자의 정확성, 실행 결과 사용, 의존성 순서를 검사한다. LLM 판정은 쓰지 않는다. 5개 모델 계열을 각 계열의 전용 하네스와 공통 ReAct 하네스(Inspect)에 조합해 10개 구성으로 평가했다.

결과

한계

사례는 656개, 도메인은 6개로 시뮬레이션된 도구 환경에서 평가했다. 평가는 관찰 가능한 궤적만 보므로, 모델이 내부적으로 무엇에 근거했는지는 판단할 수 없다고 저자들이 밝혔다. 증거 요구사항은 저자가 정의한 사례 명세에 의존한다. 평가 모델·하네스 구성은 10개다.

의미

실제 업무에 에이전트를 배치할 때는 결과가 맞는지뿐 아니라 근거를 확인하고 행동했는지가 중요하다. 이 연구는 조사 단계와 의존성 처리를 별도로 점검해야 한다는 진단 기준을 제공한다. 하네스 선택이 성능에 큰 영향을 준다는 점도 실무적 시사점이다.

핵심 용어

결과적 행동(Consequential Action)
환불, 문서 발송, 기록 수정처럼 애플리케이션 상태를 바꾸거나 외부 효과를 내는 도구 호출이다. 정보 조회 호출과 구분된다.
조사 후 비행동(Investigated Non-action)
행동하면 안 되는 상황에서 단순히 거절하지 않는 것이다. 필요한 조사를 마쳐 이유를 확인한 뒤 행동 없이 멈춰야 한다.
Evidence Ledger
확립된 사실을 그 출처 상호작용과 대상 개체·상태에 묶어 기록하는 장부다. 행동 직전에 필요한 증거가 실제로 확보됐는지 판정하는 데 쓴다.
하네스(Harness)
모델을 감싸 도구 호출, 반복 루프, 프롬프트 구성을 관리하는 에이전트 실행 프레임워크다. 예로 Claude Code, Codex, ReAct 구현이 있다.

원문

저자: Hongzhan Lin, Shidong Cao, Ziyang Luo, Wenhao Chai, Mong-Li Lee, Wynne Hsu · 게시 2026-10-06 · 라이선스 arXiv 비독점 배포 라이선스 · 본문 기준 분석

이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.