Transformer 모델의 On-Device LLM 이식성 및 DRAM/VRAM 메모리 제약 배경엣지 디바이스 및 안드로이드 시스템 환경에서 대규모 언어 모델(LLM)을 구동하려면 하드웨어 리소스 제약을 정밀하게 계산해야 합니다. NPU, GPU, AP CPU 공유 메모리 구조를 사용하는 임베디드 디바이스에서는 VRAM 및 DRAM 대역폭 한계로 인해 Out of Memory (OOM) 에러 및 Thermal Throttling 현상이 빈번하게 발생합니다. 본 글에서는 Transformer 모델 매개변수(Parameters), 정밀도 데이터 타입(FP16, INT8, INT4), 문맥 길이(Context Length)에 따른 KV 캐시(Key-Value Cache)의 메모리 점유량을 수학적으로 계산하고..