Meta FAIR와 Oxford 및 UCL 연구진의 AI Research Preference Models는 연구 에이전트가 만든 15개 후보를 실행 전에 비교해 하나만 실험합니다. 20개 공개 과제를 H200 한 장에서 과제당 24시간, 10개 시드로 평가했을 때 정규화 점수는 무작위 선택 0.684에서 추론형 0.711, 파일럿 실험형 0.729로 올랐고 기준 성능 도달 시간은 약 15시간으로 줄었습니다. 아직 사전 공개 논문과 제한된 벤치마크 결과라 다른 연구 환경의 효과는 검증이 필요합니다.
Tech로 돌아가기
Tech
Meta 연구진이 GPU 실험 전 후보를 고르는 RPM을 공개했습니다
실험 후보 선별만 바꿔 24시간 성능을 약 15시간에 냈지만 벤치마크 밖 재현은 더 필요합니다.