OpenAI가 외부 평가의 중점으로 안전성 논증, 핵심 보호장치, 역량과 정렬 평가, 중대한 정렬 실패 사고 조사를 제시했다. 평가 범위를 미리 정하고 접근권을 제공하되 법률과 보안 제약을 구분하며 방법론, 불확실성과 이해충돌을 공개하자는 원칙이다. 평가 기간은 수주에서 수개월까지 다양하고 대체로 출시와 독립적인 장기 작업이라고 설명한다. 안전하다는 선언 자체보다 무엇을 검증했는지와 접근하지 못한 영역을 명시하도록 요구한 제안으로 읽어야 한다.
Tech로 돌아가기
Tech
OpenAI, 독립 안전평가의 네 영역과 운영 원칙 제안
접근권과 이해충돌 공개를 강조한 장기 평가 방안이며 새 모델마다 외부 승인을 받겠다는 약속은 아닙니다.