Jev의 후속 평가에서 Every는 글 37개에 대한 판단 777건을 0.7초 안에 처리했지만 별도 결함 검사에서는 7개 중 6개만 찾았습니다. 약 1만6000회 호출한 다른 평가는 공개 분류 4종 중 3종에서 소형 GPT보다 높은 정확도와 556배 낮은 비용을 보고했고, 문서 업무 5회 재실행에서는 결과를 유지하며 라우팅 호출을 5067% 줄였습니다. 반면 긴 문서와 이메일 요청 판단에는 확신한 오답도 있었습니다. 별도 분석은 일반 Qwen의 단일 토큰 선택만으로도 2~3배 가속할 수 있음을 보여 줬습니다. 개발사 가이드는 코드가 제어 흐름을 맡고 모델을 검색, 라우팅과 의미 검사에 쓰도록 제안하며 숫자 계산의 약점도 인정합니다. 속도 수치는 조건이 서로 다르므로 실제 업무 데이터로 임계값과 누락률을 검증해야 합니다.
Tech로 돌아가기
Tech
Jev 실무 평가, 저비용 필터 효과와 오판 함께 확인
쉬운 판단을 먼저 처리하고 모호한 입력은 기존 모델이나 사람에게 넘기는 구성이 적합합니다.
출처
- Mini-Vibe Check: TypeSafe’s Jev Judged Everything I’ve Written in 0.7 Seconds
- Jev means structured output is interesting again
- onlyoneaman/jev-eval: TypeSafe's Jev vs gpt-5.4-mini and gpt-5.6-luna on four public classification sets: cases, per-item answers, scoring, charts — GitHub
- Example use cases - TypeSafe
- TypeSafe의 Jev가 내가 쓴 모든 글을 0.7초 만에 평가했다
- Jev 덕분에 구조화된 출력이 다시 흥미로워졌다
- Jev를 공개 데이터와 실제 업무에 시험하다: 분류기인가, 필터인가?
- Jev 활용 가이드 - 빠른 AI 판단을 어디에 쓸 수 있을까?
- Jev 1.13 jaggedness - TypeSafe