Lasso Security 연구자는 공개 가중치 모델 6개에 Hugging Face의 SynthID-Text 샘플링을 적용해 유해 요청과 도구 호출을 비교했습니다. 일부 모델은 프롬프트 인젝션이 섞인 요청을 더 자주 수용했고, 비밀 키가 달라지면 변화 방향도 달라졌습니다. 전체 점수가 비슷해도 특정 도구 선택은 바뀔 수 있다는 결과입니다. 실제 Claude 구현을 시험한 연구는 아니며 모든 워터마크가 안전성을 낮춘다는 뜻도 아닙니다. 배포할 모델과 키, 실행 환경에서 회귀 평가를 해야 합니다.
Tech로 돌아가기
Tech
텍스트 워터마크 실험, 거부 응답과 도구 호출 변화 확인
평균 정확도가 비슷해도 개별 행동은 달라질 수 있어, 표식을 적용한 상태로 안전성을 다시 평가해야 합니다.