Tag index

#InformationRetrieval

05 entries
№005 embedding-research-engineering · 11

Embedding Benchmark 읽는 법: MTEB부터 오염까지 (11/14)

MTEB·MMTEB·BEIR·MIRACL·BRIGHT·AIR-Bench·LongEmbed·ConTEB의 평가 범위를 비교하고, 집계 점수·데이터 오염·버전·재현성 함정을 피하는 benchmark card를 만듭니다.

#Embeddings #Benchmarking #Evaluation #DataContamination
MTEB와 다국어, zero-shot, reasoning, long-context benchmark를 목적별로 나누고 공개 점수에서 in-domain 평가로 좁혀 가는 구조
№004 embedding-research-engineering · 10

Embedding 평가 방법: Metric·Protocol·통계 (10/14)

STS·분류·clustering·bitext·retrieval metric을 구분하고 qrel·exact search·ANN recall·paired bootstrap·slice·RAG utility까지 포함한 재현 가능한 embedding 평가법을 설계합니다.

#Embeddings #Evaluation #Metrics #Benchmarking
하나의 embedding model을 STS, 분류, clustering, bitext, exact retrieval, ANN, RAG 단계에서 서로 다른 metric과 paired 통계로 평가하는 구조
№003 embedding-research-engineering · 05

Dense Retrieval 학습 계보: DPR에서 E5까지 (5/14)

DPR의 dual encoder에서 ANCE의 global hard negative, RocketQA의 정제, Contriever·RetroMAE의 retrieval pretraining, E5의 대규모 weak supervision까지 학습 recipe를 추적합니다.

#DenseRetrieval #Embeddings #DPR #ContrastiveLearning
DPR dual encoder에서 ANCE, RocketQA, Contriever, RetroMAE, E5로 이어지며 negative mining과 pretraining data가 확장되는 dense retrieval 계보
№002 embedding-research-engineering · 01

Embedding이란 무엇인가: 연구와 실전의 전체 지도 (1/14)

Token·문장·문서 embedding과 dense·sparse·multi-vector 표현을 구분하고, 학습·평가·검색·서빙으로 이어지는 14편 연구 로드맵과 첫 baseline을 세웁니다.

#Embeddings #RepresentationLearning #DenseRetrieval #RAG
텍스트와 이미지가 encoder를 지나 single vector, sparse vector, multi-vector가 되고 학습과 평가, ANN 검색으로 이어지는 임베딩 연구 지도
№001 reranker-engineering · 01

Reranker란 무엇인가: 두 단계 검색과 전체 지도 (1/14)

Retriever와 reranker의 역할을 분리하고 candidate recall 상한, scoring·interaction·학습 방식의 분류축을 세웁니다. 14편 학습 순서와 도입 전후의 실험 기준까지 정리합니다.

#RAG #Reranking #InformationRetrieval #LearningToRank
넓고 빠른 후보 검색 뒤 느리지만 정밀한 reranker가 최종 근거를 고르는 두 단계 검색 구조와 14편 학습 지도