PrincipalBench는 13개 모델을 75개 다자간 대리 시나리오에서 시험해 비밀 유출뿐 아니라 주인의 정상 요청까지 막는 과잉거부를 함께 측정했습니다. 모델별 실패율은 5.5%에서 75.3%였고 높은 실패율 일부는 유출보다 과잉거부가 주원인이었습니다. 충성 규칙과 발화자 태그가 일부 결과를 개선했지만 유출을 줄이면 거부가 늘어나는 맞바꿈은 해소되지 않아 실제 협상에는 권한과 비밀 경계를 별도로 검증해야 합니다.