№003 embedding-research-engineering · 11
Embedding Benchmark 읽는 법: MTEB부터 오염까지 (11/14)
MTEB·MMTEB·BEIR·MIRACL·BRIGHT·AIR-Bench·LongEmbed·ConTEB의 평가 범위를 비교하고, 집계 점수·데이터 오염·버전·재현성 함정을 피하는 benchmark card를 만듭니다.
Tag index
MTEB·MMTEB·BEIR·MIRACL·BRIGHT·AIR-Bench·LongEmbed·ConTEB의 평가 범위를 비교하고, 집계 점수·데이터 오염·버전·재현성 함정을 피하는 benchmark card를 만듭니다.
STS·분류·clustering·bitext·retrieval metric을 구분하고 qrel·exact search·ANN recall·paired bootstrap·slice·RAG utility까지 포함한 재현 가능한 embedding 평가법을 설계합니다.
LLM serving을 open-loop trace로 재현해 TTFT·ITL·goodput·비용을 측정합니다. Input/output 결합 분포와 cache를 보존해 SLO knee를 찾고 peak·failure·rollout headroom으로 GPU capacity를 계산합니다.