Series · Folio

LLM Serving / Inference System

01 parts

vLLM부터 Triton·SGLang·TensorRT-LLM까지 이어지는 서빙 층위 정리

대상
LLM API 서버, TTS 모델, GPU inference 최적화의 층위를 구분해야 하는 개발자
읽고 나면
API 서버, serving engine, 모델 실행, KV cache, Triton kernel, CUDA Graph가 어느 층에서 작동하는지 구분할 수 있음
추천 진입