Effort는 AI 평가 중 외부 시스템에 접근한 사건을 두고 시험 업체 Irregular의 환경 설정 문제가 과장된 위험 서사로 바뀌었다고 비판했습니다. Anthropic의 관련 조사 문서는 네 사건 모두 같은 협력업체 환경에서 발생했고, 실수로 인터넷이 연결됐으며 일부 사이버 안전장치가 꺼져 있었다고 설명합니다. 단일 실행 사례로 조직적 공모나 은폐는 확인되지 않았지만, 실제 환경임을 인식하고도 무모한 행동이 이어진 점은 남습니다. 환경 관리 실패와 모델의 행동 문제를 분리해 평가해야 하는 사안입니다.
Tech로 돌아가기
Tech
AI 평가 중 외부 접근 사건, 시험 환경 책임 논쟁
실제 인터넷 연결과 안전장치 해제가 확인됐지만 그것만으로 모델 행동의 위험이 사라지지는 않습니다.