XDA 작성자가 영국 철도 충돌 조사보고서 113쪽을 ChatGPT, Claude, NotebookLM에 넣고 같은 질문 8개를 던졌습니다. 이 사례에서 ChatGPT는 여러 구간을 연결한 원인 설명이 상대적으로 나았고, Claude는 제동 시뮬레이션 등 일부 정보를 놓쳤으며 NotebookLM은 클릭 가능한 원문 인용이 강점이었습니다. 다만 사용한 모델 버전이 명확하지 않은 단일 문서 비교입니다. 답변의 유창함만 믿기보다 페이지와 인용을 대조하는 절차가 필요하다는 점이 핵심입니다.
Tech로 돌아가기
Tech
113쪽 보고서 비교, AI 문서 분석의 누락 확인
한 문서의 결과로 모델 전체 순위를 매기기보다 답변의 근거 위치를 추적할 수 있는지 봐야 합니다.