구글 공동 연구진의 RRSI는 모델 가중치를 고정한 채 프롬프트와 도구, 기억 및 제어 흐름을 반복 수정하는 방법이다. 변경 예산을 줄이고 평가문제에 맞춘 편법을 걸러내며, 잡음 수준의 개선과 비용이 큰 변경을 제거한다. 논문 초록은 여덟 벤치마크에서 최적화 대상 밖 과제도 최대 4.7점 개선했고 무제약 방식보다 정책 토큰을 약 30% 줄였다고 보고한다. 공개 연구 코드가 있지만 특정 평가의 성과이지 모든 업무에서 과적합이 사라진다는 보장은 아니다. 개선 제안과 독립 평가를 분리하는 설계가 핵심이다.
Tech로 돌아가기
Tech
RRSI 연구, 에이전트 실행 구조의 과적합 줄이는 제약 제안
모델 가중치의 자율 진화가 아니라 프롬프트와 도구 변경을 검증하는 연구 프레임워크다.