Tag index

#Quantization

04 entries
№004 embedding-research-engineering · 12

Embedding 압축과 ANN 서빙: Dimension부터 Re-index까지 (12/14)

Matryoshka 차원 축소, float16·int8·binary·PQ 양자화, HNSW·IVF·DiskANN 검색을 분리 평가하고 품질·메모리·지연·재색인의 Pareto frontier를 설계합니다.

#Embeddings #VectorSearch #ANN #Quantization
원본 embedding을 차원 축소와 양자화한 뒤 exact, HNSW, IVF-PQ, disk index로 나누어 품질과 메모리, 지연시간을 비교하는 서빙 지도
№003 reranker-engineering · 11

Reranker Serving: Batching·Quantization·Adaptive Cascade (11/14)

Candidate 수와 token 길이로 용량을 계산하고 dynamic batching, TEI·vLLM, quantization parity를 설계합니다. Adaptive cascade, timeout·fallback·관측성으로 p95 SLO를 지킵니다.

#Reranking #ModelServing #DynamicBatching #Quantization
짧고 긴 query-document pair를 token bucket으로 batch하고 작은 reranker에서 불확실한 후보만 큰 reranker로 보내는 production cascade
№002 llm-inference-systems-engineering · 08

저정밀 LLM 추론: FP8·INT8·INT4·FP4 Kernel과 Calibration (8/10)

LLM 추론의 FP8·INT8·INT4·FP4 표현, scale 단위, calibration과 outlier 처리를 비교합니다. Weight·activation·KV를 줄인 뒤 fused kernel, 실제 byte, 정확도와 SLO goodput으로 빠른 경로를 검증합니다.

#LLM #Inference #Quantization #FP8
BF16에서 W8A8·W4A16·W4A8KV4·FP8·FP4로 정밀도를 낮추며 scale, outlier, fused GEMM, 정확도와 SLO gate를 비교하는 저정밀 LLM 추론 구조
№001 llm-training-serving-foundations · 07

LLM Quantization: GPTQ·AWQ·SmoothQuant·FP8·KV Cache (7/10)

LLM 양자화를 weight-only, weight·activation, KV cache로 나누고 scale·zero point·granularity를 계산하며 GPTQ, AWQ, SmoothQuant, FP8, KIVI의 memory·kernel·품질을 설계합니다.

#LLM #Quantization #GPTQ #AWQ
Floating point tensor를 quantize해 weight-only, weight·activation, KV cache를 calibration, hardware kernel, 품질 평가로 연결하는 구조