엣지 AI 구동을 위한 INT8 고정소수점 양자화(Quantization) 도입 배경온디바이스 AI(On-Device AI) 기술이 발전함에 따라 제한된 자원을 가진 임베디드 디바이스에서 대규모 딥러닝 모델을 효율적으로 구동하는 기법이 중요해졌습니다. 서버 환경에서 학습된 모델은 일반적으로 FP32(32-bit Floating Point) 정밀도를 사용합니다. 그러나 FP32 모델을 가공 없이 에지 하드웨어에 배포하면 심각한 성능 저하가 발생합니다. 32비트 부동소수점 데이터는 모델 가중치 크기를 증가시켜 DRAM과 NPU(Neural Processing Unit) 간의 LPDDR 메모리 대역폭(Memory Bandwidth) 요구량을 폭증시키기 때문입니다. 이로 인해 시스템 엔지니어는 연산 병목 현상과..