FT 보도의 공개 요약은 Saturn이 18개 AI 모델에 금융 질문을 반복해 평균 57%, 복잡한 질문에서는 88%의 오류를 관찰했다고 전한다. 계산 실수와 예정된 세법 누락, 존재하지 않는 규칙 제시가 포함됐다. FT 원문은 접근 차단돼 시험 설계와 채점을 직접 검증하지 못했다. 특정 시험의 결과를 모든 금융 질의의 오류율로 일반화할 수는 없다.
Tech
세금과 연금의 답변은 계산뿐 아니라 적용 시점과 실제 규정을 대조해야 합니다.
FT 보도의 공개 요약은 Saturn이 18개 AI 모델에 금융 질문을 반복해 평균 57%, 복잡한 질문에서는 88%의 오류를 관찰했다고 전한다. 계산 실수와 예정된 세법 누락, 존재하지 않는 규칙 제시가 포함됐다. FT 원문은 접근 차단돼 시험 설계와 채점을 직접 검증하지 못했다. 특정 시험의 결과를 모든 금융 질의의 오류율로 일반화할 수는 없다.