한 개발자가 선택지 문자 하나만 생성하게 하고 로그 확률을 읽는 Python 함수를 만들어 일반 LLM을 분류와 점수화에 활용했습니다. 비전 모델에는 웹캠 이미지를 넣어 사람 유무, 실내 여부와 밝기를 묻습니다. RTX 3090의 Gemma 4 12B로 프레임당 질문 세 개를 처리했을 때 약 1FPS였다는 개인 측정을 제시했습니다. 전용 비전 모델보다 비효율적일 수 있으나 판정 조건을 자연어로 바꾸기 쉽다는 장점이 있으며, 성능과 확률 보정은 별도 검증이 필요합니다. 관련 해설도 토큰 로그 확률을 노출하는 API가 전제라고 설명하므로 모든 비전 API에 그대로 적용되지는 않습니다.
Tech로 돌아가기
Tech
LLM 토큰 확률 래퍼, 텍스트와 영상 분류에 적용
조건을 자연어로 바꿀 수 있지만, 출력 확률이 곧 실제 정답률이나 보정된 신뢰도인 것은 아닙니다.