논문 속 90% 절약은 왜 현장에서 0%가 되는가 — KV 캐시 압축과 인프라 충돌의 물리학
나들으려고만든팟캐스트
0:00 / 0:00
논문 속 90% 절약은 왜 현장에서 0%가 되는가 — KV 캐시 압축과 인프라 충돌의 물리학
12 просмотров · 11 дн. назад
나들으려고만든팟캐스트
3 подписчика
12 просмотров · 11 дн. назад
거대 언어 모델과 장문 추론 에이전트의 최대 병목인 KV 캐시의 메모리 폭증 현상과, 학계에서 제안된 90% 압축 알고리즘들이 실제 상용 서빙 환경에서 무력화되는 원인을 심층 분석합니다. FlashAttention 커널이 어텐션 점수를 GPU 메인 메모리에 기록하지 않아 발생하는 점수 소실 문제와, PagedAttention의 16토큰 블록 할당 구조에서 흩어진 생존 토큰들이 물리적 메모리 회수를 가로막는 파편화의 역설을 규명합니다. 나아가 메모리 컴팩션의 복사 대역폭 비용과 RoPE 위치 인코딩 왜곡 문제를 짚어보고, 사전 회전 기하학을 활용한 TriAttention과 어텐션 헤드를 이원화하는 DuoAttention 등 최신 시스템적 돌파구를 통해 프로덕션 엔지니어가 반드시 갖추어야 할 물리적 메모리 관리 지침을 제시합니다.
출처
KV Cache Compression and Its Infra Problems | Efficient AI
https://research.nvidia.com/labs/eai/...
Logical KV Savings Are Not Physical Memory Savings
https://rickxie.cn/blog/logical-kv-sa...
Efficient Memory Management for Large Language Model Serving with PagedAttention
https://arxiv.org/abs/2309.06180
Efficient Streaming Language Models with Attention Sinks
https://arxiv.org/abs/2309.17453
H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models
https://arxiv.org/abs/2306.14048
SnapKV: LLM Knows What You Are Looking for Before Generation
https://arxiv.org/abs/2404.14469
PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Paged LLM Serving
https://arxiv.org/abs/2509.04377
DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads
https://arxiv.org/abs/2410.10819
이 영상의 내레이션은 AI 음성 합성으로 제작했습니다.
#KVCache #추론최적화 #AI인프라