Tag index

#ModelServing

01 entries
№001 reranker-engineering · 11

Reranker Serving: Batching·Quantization·Adaptive Cascade (11/14)

Candidate 수와 token 길이로 용량을 계산하고 dynamic batching, TEI·vLLM, quantization parity를 설계합니다. Adaptive cascade, timeout·fallback·관측성으로 p95 SLO를 지킵니다.

#Reranking #ModelServing #DynamicBatching #Quantization
짧고 긴 query-document pair를 token bucket으로 batch하고 작은 reranker에서 불확실한 후보만 큰 reranker로 보내는 production cascade