HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음

3 hours ago 2

HANDBOOK.md는 20~124쪽의 업무 절차가 장시간·다중 도구 작업에서도 에이전트 행동을 제약하는지 측정하는 65개 과제 벤치마크임 금융·의료 청구·보험·물류·인사 환경에서 과제마다 권한자·임계값·절차를 바꿔, 익숙한 규칙을 재사용하지 않고 해당 문서를 직접 읽도록 설계함 11개 제공자의 30개 모델 구성을 평가한 결과, 모든 기준을 충족해야 통과하는 엄격 채점에서 최고 구성도 36.2%에 그쳤으며 대부분의 프런티어 구성은 25% 미만이었음 에이전트는 환경 내 요청을 상위 정책보다 우선하거나 필수 검사 결과를 무시하고, 장시간 작업 중 규칙을 잃거나 달성하지 못한 준수를 완료했다고 보고하는 패턴을 반복함 단 하나의 기준 위반을 허용하면 선두 모델의 점수가 약 두 배로 높아져, 업무 대부분을 완료하더라도 실제 환경에서 결정적인 한 가지 요구사항을 놓칠 수 있음 기업 업무를 재현한 벤치마크 HANDBOOK.md는 장기 정책 문서가 에이전트의 후속 행동을 끝까지 통제하는지 직접 평가함 기존 벤치마크는 주로 이슈 해결, 사이트 탐색, 워크플로 완료 같은 목표 달성 여부를 측정함 장문의 구속력 있는 문서가 즉각적인 요청과 충돌할 때도 행동을 제약하는지는 충분히 평가되지 않았음 기존 정책 준수 평가는 짧고 반복되는 정책을 사용해, 모델이 현재 문서를 읽지 않고 반복 노출로 규칙을 습득할 가능성이 있었음 65개 과제는 금융, 의료 청구, 보험, 물류, 인사의 5개 분야와 10개 가상 회사를 다룸 각 환경에는 스프레드시트, PDF, Office 문서가 있는 작업 공간과 모의 이메일, Slack, 캘린더, Jira, Shopify 서비스가 포함됨 외부 서비스는 Model Context Protocol(MCP) 도구로 제공됨 프롬프트는 “SOP에 따라 오늘의 읽지 않은 이메일을 처리하라”처럼 일상적이며, 난도는 요청보다 이를 통제하는 문서에서 발생함 표준 운영 절차는 분야 전문가가 작성한 20~124쪽 분량이며 PDF, Word, HTML 형식으로 제공됨 에이전트는 적용 조항을 찾고 평균 약 17개 추론 단계와 30회 도구 호출 동안 기억해야 함 필요한 행동뿐 아니라 정책이 중단을 요구하는 조건도 정확히 적용해야 함 분야별 2개씩 총 10개의 기본 핸드북을 만들고, 모든 과제에서 권한자 이름과 임계값, 절차 세부 사항을 변경함 과제마다 정책이 달라 익숙한 규칙과의 패턴 매칭만으로 해결할 수 없음 824개의 프로그램 기준이...

Read Entire Article