NPU와 AI 가속기
신경망처리장치(Neural Processing Unit, NPU)는 행렬 곱과 누산, 활성화, 데이터 형식 변환처럼 신경망 추론에서 반복되는 연산을 높은 전력 효율로 처리한다. CPU·GPU보다 모든 작업이 빠른 범용 프로세서가 아니라 지원 연산과 데이터 형식에 맞춘 가속기다.
성능은 TOPS 하나로 정해지지 않는다. 정밀도, 희소성 조건, 메모리 대역폭, 온칩 SRAM, 모델 변환과 런타임 지원이 함께 작용한다. 서로 다른 정밀도와 조건에서 발표한 TOPS를 직접 비교하지 않는다.
모바일 SoC와 PC 프로세서의 NPU는 카메라·음성·생성형 AI의 저전력 지속 작업을 맡고, 외장 GPU와 데이터센터 가속기는 더 큰 모델과 학습·고처리량 추론을 담당할 수 있다. 작업은 CPU에서 전처리하고 NPU·GPU에서 연산한 뒤 다시 CPU로 결과를 가져오는 식으로 나뉜다.
하드웨어가 있어도 운영체제, 드라이버, 프레임워크와 모델이 해당 가속기를 지원해야 사용된다. 제품별 현행 지원은 현행 플랫폼에서 갱신한다.