Evaluation Club 발표는 프롬프트를 독립적인 완성품으로 취급하면 다른 지침과 결합할 때 생기는 실패를 놓친다고 설명한다. 같은 시나리오를 반복 실행하는 pass^k 평가와 적대적 사례를 만들고, 자동 최적화 뒤에는 미사용 시험 세트로 과적합을 점검하는 접근이다. 개인의 운영 경험과 사례에 기반한 제안이며, 특정 프롬프트 수정이 모든 모델에서 신뢰성을 보장하지는 않는다.