참가자 3,132명의 다섯 실험을 다룬 연구 보도에서 AI 조언을 볼 수 있을 때 판단 보류가 크게 줄었다. 처음 두 실험의 ‘모른다’ 응답은 대조군 36%와 44%에서 AI 이용군 6%와 3%로 낮아졌다. 연구진은 Step 3.5 Flash가 거의 맞히지 못하는 영화의 시각적 세부 문제를 의도적으로 골랐고 일부 조건에서 자신감은 높아졌지만 정답률은 떨어졌다. 금전 보상은 일부 개선을 보였으나 효과를 없애지는 못했다. 제한된 과제 실험이므로 모델 전반의 유용성보다 불확실성을 남겨 두는 UI와 검토 절차의 필요성을 시사한다.