Meta FAIR와 Oxford 및 UCL 연구진의 AI Research Preference Models는 연구 에이전트가 만든 15개 후보를 실행 전에 비교해 하나만 실험합니다. 20개 공개 과제를 H200 한 장에서 과제당 24시간, 10개 시드로 평가했을 때 정규화 점수는 무작위 선택 0.684에서 추론형 0.711, 파일럿 실험형 0.729로 올랐고 기준 성능 도달 시간은 약 15시간으로 줄었습니다. 아직 사전 공개 논문과 제한된 벤치마크 결과라 다른 연구 환경의 효과는 검증이 필요합니다.