TECH NOTES
기술노트
현장에서 검증된 개발 지식을 기록합니다.
4321
AI
로컬 LLM 서빙 — Ollama·vLLM·llama.cpp 비교와 운영 기준
로컬 LLM 서빙 도구 Ollama·vLLM·llama.cpp를 처리량·연속 배칭·양자화·GPU 메모리 기준으로 비교한다. KV 캐시 계산법, OpenAI 호환 API 붙이는 법, 상황별로 언제 무엇을 써야 하는지까지 실무 관점에서 정리했다.
Mobile
온디바이스 AI — 폰에서 도는 소형 LLM의 실전화(지연·프라이버시·비용을 뒤집다)
4비트로 양자화된 소형 LLM이 스마트폰 NPU 위에서 실전화됐다. 왜 온디바이스인지, 양자화·증류·LoRA·런타임·하이브리드 라우팅까지 앱 개발자 관점에서 2026년 기준으로 정리한다.
AI
LLM 양자화 — GPTQ·AWQ·GGUF, INT4가 뭘 버리고 뭘 지키나
가중치를 4비트로 줄여도 왜 멀쩡한지, GPTQ·AWQ·GGUF의 차이와 Q4_K_M 같은 이름 읽는 법, 품질과 크기의 스위트스폿까지 정리한 로컬 LLM 양자화 가이드.
AI
Llama.cpp 로컬 LLM 최적화 — 양자화와 GGUF 포맷
llama.cpp를 활용한 로컬 LLM 실행 시 양자화 수준별 성능 차이와 GGUF 포맷의 구조를 분석하고 최적 설정을 찾는 방법입니다.