로컬에서 LLM을 돌려보려고 ollama를 쓰고 있는데 GPU 메모리가 부족하다면서 자꾸 죽습니다. 그래픽카드는 RTX 4070 12GB고요, 13B급 모델을 올려보려고 했어요.
모델 로드하고 조금 긴 프롬프트를 넣으면 CUDA out of memory 가 나거나, 아니면 죽진 않는데 갑자기 응답이 엄청 느려집니다. nvidia-smi 보면 로드는 됐는데 추론할 때 뭔가 이상하고요.
양자화라는 걸 하면 메모리를 줄일 수 있다고 들었는데, 그냥 하면 되는 건지 품질이 많이 깎이는 건지 감이 안 옵니다. 12GB에서 13B는 무리인 걸까요? 어떻게 접근해야 할지 조언 부탁드려요.
댓글 0