TECH NOTES
기술노트
현장에서 검증된 개발 지식을 기록합니다.
4321
AI
로컬 LLM 서빙 — Ollama·vLLM·llama.cpp 비교와 운영 기준
로컬 LLM 서빙 도구 Ollama·vLLM·llama.cpp를 처리량·연속 배칭·양자화·GPU 메모리 기준으로 비교한다. KV 캐시 계산법, OpenAI 호환 API 붙이는 법, 상황별로 언제 무엇을 써야 하는지까지 실무 관점에서 정리했다.
AI
KV 캐시 — LLM이 토큰을 하나씩 뱉어도 빠른 이유
LLM이 긴 답변을 빠르게 만드는 비결인 KV 캐시의 원리와, 시퀀스·배치에 비례해 불어나는 메모리 부담, PagedAttention으로 낭비를 줄이는 법까지 정리했다.
AI
vLLM 1.1 LoRA 핫스왑 — 멀티 테넌트 LLM 서빙, 비용 50%↓
vLLM 1.1의 LoRA 핫스왑 기능으로 테넌트별 미세조정 모델을 한 GPU에 동거시켜 인프라 비용을 절반으로 줄인 운영기.
AI
vLLM 1.0 vs SGLang vs TGI — LLM 추론 서버 실측 비교
vLLM 1.0·SGLang·TGI 3대 LLM 추론 서버 실측. Llama 70B 처리량·레이턴시·메모리, 양자화 지원과 운영 부담을 워크로드별로 비교.