본문으로 건너뛰기
학습경로 · 5 단계

ML 가속기 스택

하드웨어 → 드라이버 → 컴파일러 → 런타임 → 인프라 → 엣지. 가속기를 레이어로 훑는다.

하드웨어

NPU 아키텍처 준비 중 · 10편

왜 ML 워크로드가 또 다른 칩을 요구하는가 — 시스톨릭 어레이·데이터플로우.

HBM·GDDR 심화 12/12 발행

HBM과 GDDR의 분기점 — bandwidth·capacity·cost 트레이드오프.

대역폭

드라이버

NPU 드라이버 개발 준비 중 · 12편

IOMMU·DMA-BUF·command queue로 가속기를 커널에 붙이는 드라이버 스택.

IOMMU·DMA-BUF

컴파일러 · 코드젠

ML 컴파일러 준비 중 · 12편

그래프에서 커널까지, ML 컴파일러가 모델을 하드웨어로 낮추는 과정.

MLIR 심화 준비 중 · 16편

다단계 IR로 도메인별 최적화를 쌓는 MLIR의 dialect 설계.

XLA·OpenXLA 심화 준비 중 · 12편

HLO 그래프를 fuse·컴파일하는 XLA/OpenXLA 백엔드.

Triton DSL 준비 중 · 9편

block-level 프로그래밍 — CUDA보다 짧고 cuBLAS만큼 빠르게.

Apple Metal Stack 준비 중 · 10편

Apple GPU를 겨냥한 Metal — 셰이더·compute 커널·MPS 스택.

런타임 · 추론

Core ML 심화 준비 중 · 6편

Apple Neural Engine·Core ML로 온디바이스 추론을 올리는 실전.

ONNX Runtime 심화 준비 중 · 8편

ORT의 vendor 추상 — CPU·CUDA·TensorRT·CoreML·QNN.

TensorRT 심화 준비 중 · 8편

Network·BuilderConfig·Engine — TensorRT compile flow.

인프라 · 엣지

Designing Machine Learning Systems 준비 중 · 11편

Chip Huyen — research ML vs production ML의 결정적 차이.

ML 시스템 프로파일링 준비 중 · 8편

학습·추론 파이프라인의 병목을 계측·프로파일링하는 법.

TinyML·Edge AI 준비 중 · 12편

MCU·엣지에서 양자화된 모델을 돌리는 TinyML 실전.