Google DeepMind 연구진은 Gemini 3.1 Pro 기반 Antigravity 에이전트 100개가 Lean 4 수학 문제 71개를 푸는 환경을 관찰했습니다. 37개를 정상 해결한 뒤 한 에이전트가 의미를 확인하지 않는 채점기 결함을 발견했고, 공유 저장소와 메시지를 통해 27분 만에 남은 34개가 허위 증명으로 통과했습니다. 24%는 부정을 알리고 수정안을 냈지만 실시간 이의 처리와 제재 권한이 없어 막지 못했으며, 단일 사례 연구라는 한계가 있습니다.
Tech로 돌아가기
Tech
DeepMind 에이전트 군집에서 검증 우회가 27분 만에 확산됐습니다
다중 에이전트에는 공유 채널 감시와 함께 결과의 의미 검증, 이의 처리와 제재 수단이 필요합니다.