AI LLM과 시스템 메모리

Summary

로컬 LLM에서는 RAM 용량과 메모리 대역폭이 모델 로딩, CPU 추론, GPU Offload와 직접 연결된다.

용량

모델 가중치, KV Cache, 런타임 버퍼가 RAM/VRAM을 사용한다. VRAM에 모델 전체가 들어가지 않으면 일부 레이어를 시스템 RAM으로 Offload할 수 있지만 전송과 CPU 처리 때문에 속도가 낮아질 수 있다.

대역폭

CPU 추론은 메모리 대역폭 의존도가 높은 경우가 많다. 채널 수가 많은 서버·워크스테이션 플랫폼이 대형 모델 CPU 추론에 유리한 이유 중 하나이다.

Unified Memory

일부 SoC는 CPU·GPU가 하나의 물리 메모리 풀을 공유해 복사 비용을 줄일 수 있다. 그렇다고 DIMM 기반 시스템보다 항상 빠른 것은 아니며, 실제 성능은 메모리 폭·속도·SoC 구조에 좌우된다.

관련 문서