본문 바로가기
전체 75
75
AI16분 읽기
파인튜닝 vs RAG vs 프롬프트 엔지니어링 — 언제 무엇을 선택하나
파인튜닝, RAG, 프롬프트 엔지니어링을 비용·데이터·최신성·정확도 네 축으로 비교한다. 어떤 상황에서 무엇을 골라야 하는지 의사결정 플로우와 셋을 섞는 하이브리드 전략, 그리고 내가 직접 데인 실제 실패 사례와 교훈까지 정리했다.
#파인튜닝#RAG#프롬프트 엔지니어링
2026.09.01
74
Mobile15분 읽기
온디바이스 AI — 폰에서 도는 소형 LLM의 실전화(지연·프라이버시·비용을 뒤집다)
4비트로 양자화된 소형 LLM이 스마트폰 NPU 위에서 실전화됐다. 왜 온디바이스인지, 양자화·증류·LoRA·런타임·하이브리드 라우팅까지 앱 개발자 관점에서 2026년 기준으로 정리한다.
#온디바이스AI#SLM#양자화
2026.08.29
73
AI18분 읽기
컨텍스트 엔지니어링 — 프롬프트 그다음, LLM의 컨텍스트 윈도우를 설계하는 법
프롬프트 한 줄 튜닝을 넘어, 컨텍스트 윈도우를 고정 예산으로 보고 설계하는 법을 정리한다. RAG 청킹 전략과 오버랩, 임베딩·리트리벌·재순위, 컨텍스트 압축과 요약, lost in the middle 문제, 도구·메모리 배치, 프롬프트 캐싱, 평가까지 실전 코드로 다룬다.
#Context Engineering#RAG#LLM
2026.08.26
72
AI21분 읽기
에이전트 메모리 완전 정복 — LLM 에이전트가 장기 기억을 갖는 법
컨텍스트 윈도우만으론 왜 부족한가. 단기·장기 기억, 메모리 4유형, 벡터·요약·지식그래프, 저장·회수·망각과 반영, MemGPT식 계층 메모리, 실무 함정까지 2026년 관점으로 정리한다.
#AI#에이전트#LLM
2026.08.26
71
AI7분 읽기
시맨틱 캐싱 — LLM 응답을 임베딩으로 재사용해 비용 줄이기
같은 뜻 다른 표현의 질문에 과거 답을 재사용하는 시맨틱 캐싱. 유사도 임계값 튜닝, 캐시하면 안 되는 질문, 프롬프트 캐싱과의 차이를 실전 로그 기반으로 정리.
#시맨틱 캐싱#semantic cache#LLM
2026.08.22
70
AI6분 읽기
LLM 샘플링 파라미터 — top-k, min-p, 반복 페널티까지
temperature와 top-p 너머의 샘플링 손잡이. top-k와 min-p로 꼬리를 자르고 frequency·presence 페널티로 반복을 다스리는, 작업별 실전 레시피를 정리했다.
#샘플링#temperature#top-p
2026.08.20
69
AI7분 읽기
컨텍스트 엔지니어링 — 프롬프트가 아니라 컨텍스트를 설계하는 법
프롬프트 문장이 아니라 컨텍스트 윈도우에 무엇을·얼마나·어떤 순서로 넣을지 설계하는 컨텍스트 엔지니어링. 토큰 예산 함수, 롤링 요약, 캐시 정렬까지 실전 정리.
#컨텍스트 엔지니어링#context engineering#LLM
2026.08.20
68
AI5분 읽기
지식 증류(Distillation) — 큰 모델의 지능을 작은 모델에 옮기기
큰 교사 모델의 확률 분포를 작은 학생이 따라 배우는 지식 증류. 부드러운 라벨이 왜 강한지, 온도의 역할과 데이터 증류의 라이선스 주의점까지 짚었다.
#지식증류#Distillation#교사학생
2026.08.19
67
AI5분 읽기
전문가 혼합(MoE) — 파라미터는 크게, 계산은 조금만
토큰마다 일부 전문가만 켜서 파라미터는 키우고 계산은 아끼는 MoE 구조. 라우팅과 로드 밸런싱, 그리고 메모리는 왜 못 아끼는지 그 대가까지 정리했다.
#MoE#전문가혼합#라우팅
2026.08.18
66
AI5분 읽기
토크나이저와 BPE — LLM이 글자가 아니라 토큰을 보는 이유
LLM이 글자 대신 토큰을 보는 이유와 BPE의 병합 원리. 한국어가 토큰을 더 먹는 까닭, 숫자 계산 실수, 프롬프트 공백까지 토큰화가 부르는 실전 함정을 짚었다.
#토크나이저#BPE#서브워드
2026.08.17
65
AI6분 읽기
RoPE(회전 위치 임베딩) — 컨텍스트 길이를 늘리는 위치 인코딩
위치를 벡터에 더하지 않고 회전으로 심는 RoPE의 원리와, base 조정·보간으로 학습보다 긴 컨텍스트로 확장하는 트릭까지. 상대 거리가 자연히 드러나는 이유를 설명한다.
#RoPE#위치임베딩#트랜스포머
2026.08.16
64
AI5분 읽기
GQA·MQA — KV 캐시를 줄이는 어텐션 헤드 공유
여러 어텐션 헤드가 키·값을 공유해 KV 캐시를 몇 배 줄이는 GQA와 MQA. 품질 손실은 왜 작은지, 긴 컨텍스트·동시 요청에서 왜 이득이 큰지 정리했다.
#GQA#MQA#어텐션
2026.08.15