Lemmalog는 긴 대화를 검색하는 대신 LLM이 코드와 디버거 출력을 사실로 바꾸고 Datalog가 규칙, 출처, 시간과 철회를 결정적으로 관리합니다. 전제가 반증되면 그 전제에 의존한 결론만 자동 무효화하고 다른 근거가 남은 결론은 유지해 장기 취약점 조사에서 폐기된 가설이 되살아나는 문제를 줄입니다. LongMemEval F1은 0.463으로 최고 전용 시스템보다 낮았지만 전체 문맥 방식보다 두 배 이상 높았고 질문당 문맥을 약 10만4000토큰에서 2700토큰으로 줄였습니다.

한줄 결론: 에이전트의 기억 검색과 현재 진실 상태를 분리하면 장기 조사에서 토큰과 잘못된 가설의 누적을 함께 줄일 수 있습니다.