PrincipalBench는 13개 모델을 75개 다자간 대리 시나리오에서 시험해 비밀 유출뿐 아니라 주인의 정상 요청까지 막는 과잉거부를 함께 측정했습니다. 모델별 실패율은 5.5%에서 75.3%였고 높은 실패율 일부는 유출보다 과잉거부가 주원인이었습니다. 충성 규칙과 발화자 태그가 일부 결과를 개선했지만 유출을 줄이면 거부가 늘어나는 맞바꿈은 해소되지 않아 실제 협상에는 권한과 비밀 경계를 별도로 검증해야 합니다.
Tech로 돌아가기
Tech
AI 협상 대리인의 비밀 유출과 과잉거부가 함께 확인됐습니다
대리 에이전트는 비밀 보호뿐 아니라 주인의 정상 지시를 수행하는지도 상대별 시나리오로 시험해야 합니다.