학습경로 · 5 단계
ML 가속기 스택
하드웨어 → 드라이버 → 컴파일러 → 런타임 → 인프라 → 엣지. 가속기를 레이어로 훑는다.
하드웨어
NPU 아키텍처
준비 중 · 10편
왜 ML 워크로드가 또 다른 칩을 요구하는가 — 시스톨릭 어레이·데이터플로우.
HBM·GDDR 심화 12/12 발행
HBM과 GDDR의 분기점 — bandwidth·capacity·cost 트레이드오프.
대역폭
드라이버
NPU 드라이버 개발
준비 중 · 12편
IOMMU·DMA-BUF·command queue로 가속기를 커널에 붙이는 드라이버 스택.
IOMMU·DMA-BUF
컴파일러 · 코드젠
ML 컴파일러
준비 중 · 12편
그래프에서 커널까지, ML 컴파일러가 모델을 하드웨어로 낮추는 과정.
MLIR 심화
준비 중 · 16편
다단계 IR로 도메인별 최적화를 쌓는 MLIR의 dialect 설계.
XLA·OpenXLA 심화
준비 중 · 12편
HLO 그래프를 fuse·컴파일하는 XLA/OpenXLA 백엔드.
Triton DSL
준비 중 · 9편
block-level 프로그래밍 — CUDA보다 짧고 cuBLAS만큼 빠르게.
Apple Metal Stack
준비 중 · 10편
Apple GPU를 겨냥한 Metal — 셰이더·compute 커널·MPS 스택.
런타임 · 추론
Core ML 심화
준비 중 · 6편
Apple Neural Engine·Core ML로 온디바이스 추론을 올리는 실전.
ONNX Runtime 심화
준비 중 · 8편
ORT의 vendor 추상 — CPU·CUDA·TensorRT·CoreML·QNN.
TensorRT 심화
준비 중 · 8편
Network·BuilderConfig·Engine — TensorRT compile flow.
인프라 · 엣지
Designing Machine Learning Systems
준비 중 · 11편
Chip Huyen — research ML vs production ML의 결정적 차이.
ML 시스템 프로파일링
준비 중 · 8편
학습·추론 파이프라인의 병목을 계측·프로파일링하는 법.
TinyML·Edge AI
준비 중 · 12편
MCU·엣지에서 양자화된 모델을 돌리는 TinyML 실전.