LLM 배포 형식을 정리한 기술 가이드는 GGUF와 safetensors 같은 파일 컨테이너를 GPTQ나 AWQ 같은 양자화 방법과 구분했습니다. GGUF는 llama.cpp 계열에서 CPU와 GPU를 함께 쓰기 쉽고, GPTQ와 AWQ는 지원되는 GPU 서버 런타임, EXL2와 EXL3는 ExLlama 계열과 밀접하게 연결됩니다. Apple Silicon의 Python 작업에는 MLX도 선택지가 됩니다. 같은 4비트 표기라도 저장 구조와 실제 속도는 다르며 모델 가중치 외에 KV 캐시와 실행 여유 메모리가 필요합니다. 파일명만 보고 용량이나 호환성을 단정하지 않는 것이 핵심입니다.
Tech로 돌아가기
Tech
로컬 LLM 형식 비교, 컨테이너와 양자화 구분
메모리 용량뿐 아니라 하드웨어와 실행 엔진의 지원 조합을 먼저 확인해야 모델을 제대로 고를 수 있습니다.