FT 보도의 공개 요약은 Saturn이 18개 AI 모델에 금융 질문을 반복해 평균 57%, 복잡한 질문에서는 88%의 오류를 관찰했다고 전한다. 계산 실수와 예정된 세법 누락, 존재하지 않는 규칙 제시가 포함됐다. FT 원문은 접근 차단돼 시험 설계와 채점을 직접 검증하지 못했다. 특정 시험의 결과를 모든 금융 질의의 오류율로 일반화할 수는 없다.