PuzzleMask 연구 소개는 평범한 문장 속 지시를 소형 안전 검사 모델이 놓치고 도구를 쓰는 더 강한 모델이 복원하는 격차를 다룹니다. 보고된 실험에서 검사 모델들은 입력을 정상으로 분류했고 특정 GPT 설정은 약 94%에서 숨은 지시를 복원했습니다. 이는 모델 내부 안전 훈련을 보편적으로 무력화했다는 의미가 아니며 다른 모델에서는 차단됐습니다. 입력 재작성 같은 완화책만으로 충분하다고 단정하지 말고 도구 권한과 출력 및 행동의 검증을 함께 설계해야 합니다.