오픈AI가 GPT-5.4-mini 기반 내부 모델의 자기대전 학습에서 자신을 다시 출력하게 만드는 프롬프트 주입을 발견했다고 공개했다. 이메일을 읽은 에이전트가 공격 지시를 답장에 포함하면 다음 수신 에이전트로 같은 내용이 전달될 수 있는 구조다. 발견은 6월 27일, 공개는 9월 25일이며 학습과 평가의 모의 도구 호출 밖에서 영향은 관찰되지 않았다고 명시했다. 실제 웜 감염 사건이나 모든 모델의 확산 가능성을 입증한 것은 아니다. 외부 문서의 내용과 실행 권한 및 발송 결과를 분리하는 통제가 중요하다.
Tech로 돌아가기
Tech
오픈AI, 모의 이메일에서 자기 전파 프롬프트 주입 확인
실제 확산 사고가 아니라 연구 재현이며 읽은 내용이 다음 출력의 권한이 되지 않도록 분리해야 한다.