Embedding이란 무엇인가: 연구와 실전의 전체 지도 (1/14)
Token·문장·문서 embedding과 dense·sparse·multi-vector 표현을 구분하고, 학습·평가·검색·서빙으로 이어지는 14편 연구 로드맵과 첫 baseline을 세웁니다.
Knowledge pillar · active
문서 파싱과 청킹에서 sparse·dense 검색, Embedding, Reranker, 검색 평가까지 이어지는 검색 계층입니다.
Token·문장·문서 embedding과 dense·sparse·multi-vector 표현을 구분하고, 학습·평가·검색·서빙으로 이어지는 14편 연구 로드맵과 첫 baseline을 세웁니다.
Cosine·dot product·L2의 관계와 vector norm, mean·CLS·last-token pooling을 해부하고 anisotropy·hubness·dimension 문제가 실제 nearest-neighbor 검색을 어떻게 바꾸는지 진단합니다.
Positive·negative로 vector 공간을 만드는 InfoNCE, multiple-negatives ranking loss, temperature와 batch size의 효과를 수식·gradient·구현·ablation 관점에서 설명합니다.
Pair·triplet·graded qrel을 설계하고 random·BM25·ANN·teacher hard negative를 채굴하며, false negative와 leakage를 정제하는 재현 가능한 embedding 데이터 파이프라인을 만듭니다.
DPR의 dual encoder에서 ANCE의 global hard negative, RocketQA의 정제, Contriever·RetroMAE의 retrieval pretraining, E5의 대규모 weak supervision까지 학습 recipe를 추적합니다.
INSTRUCTOR·E5부터 LLM2Vec·NV-Embed·GritLM·Qwen3까지 instruction embedding의 입력 계약, decoder attention 변환, pooling과 multi-task 학습의 장단점을 비교합니다.
문서에서 synthetic query를 만들고 Cross-Encoder·LLM teacher로 relabel·distill하며, LoRA·full tuning·model merging을 비교해 작은 in-domain embedding을 안전하게 학습합니다.
Monolingual·cross-lingual retrieval을 분리하고 언어 균형, parallel pair, tokenizer와 hard negative를 설계해 한국어·영어·혼합 질의에서 embedding 품질을 평가합니다.
Chunk-then-embed의 문맥 손실부터 long-context single vector, late chunking, CDE·situated embedding, token multi-vector까지 비교하고 긴 문서 retrieval 평가를 설계합니다.
STS·분류·clustering·bitext·retrieval metric을 구분하고 qrel·exact search·ANN recall·paired bootstrap·slice·RAG utility까지 포함한 재현 가능한 embedding 평가법을 설계합니다.
MTEB·MMTEB·BEIR·MIRACL·BRIGHT·AIR-Bench·LongEmbed·ConTEB의 평가 범위를 비교하고, 집계 점수·데이터 오염·버전·재현성 함정을 피하는 benchmark card를 만듭니다.
Matryoshka 차원 축소, float16·int8·binary·PQ 양자화, HNSW·IVF·DiskANN 검색을 분리 평가하고 품질·메모리·지연·재색인의 Pareto frontier를 설계합니다.
Frozen corpus·qrel에서 contrastive 학습과 hard-negative 정제, exact·통계 평가, dimension·quantization·ANN, RAG gate·shadow index까지 재현 가능한 실험을 완성합니다.
LLM backbone과 합성 데이터·증류, 소형·가변 차원, 문맥·추론, 멀티모달·multi-vector, 평가·privacy를 축으로 2024–2026 embedding 연구를 비판적으로 읽습니다.
Retriever와 reranker의 역할을 분리하고 candidate recall 상한, scoring·interaction·학습 방식의 분류축을 세웁니다. 14편 학습 순서와 도입 전후의 실험 기준까지 정리합니다.
Reranker 학습의 공통 언어인 pointwise·pairwise·listwise 목표를 수식과 작은 예제로 풉니다. RankNet, ListNet, LambdaRank·LambdaMART를 nDCG와 연결하고 loss 선택 기준을 세웁니다.
Query와 document를 한 Transformer에 넣는 Cross-Encoder의 joint attention과 score를 이해하고, batching·truncation·긴 문서 windowing 및 재현 가능한 baseline을 구현합니다.
T5가 relevance label token을 점수화하는 monoT5부터 pairwise duoT5, scalar ranking loss를 쓰는 RankT5, Fusion-in-Decoder listwise ListT5까지 입력·출력·loss·추론 비용을 분리해 설명합니다.
Single-vector bi-encoder와 full Cross-Encoder 사이에서 document token vector를 보존하는 ColBERT의 MaxSim을 계산합니다. ColBERTv2 compression·PLAID 검색과 reranker로 배치하는 기준까지 설명합니다.
Decoder-only LLM의 pointwise·pairwise·setwise·listwise 방식을 비교하고 RankGPT·RankZephyr·PRP·FIRST의 순서 편향, 파싱, token 비용과 안정성 평가를 다룹니다.
Production 후보 분포에서 graded positive와 hard negative를 만들고 false negative를 거르는 법을 익힙니다. Hybrid mining, 합성 label, split leakage와 dataset versioning도 다룹니다.
고정 candidate에서 reranker 효과를 분리하고 Recall ceiling, MRR·MAP·nDCG, paired confidence interval을 계산합니다. BEIR·BRIGHT·AIR-Bench의 역할과 latency·비용·최종 RAG 평가까지 설계합니다.
Cross-Encoder의 pointwise BCE, pairwise logistic, listwise softmax 학습을 비교하고 teacher score·permutation distillation, calibration, train-serve parity를 연결합니다.
2026년 7월 기준 BGE·Qwen3·Jina와 Cohere·Voyage 계열을 구조와 배포 조건으로 분류합니다. 한국어·code-switch·긴 문서용 in-domain bake-off, license·보안·비용 판단표를 만듭니다.
Candidate 수와 token 길이로 용량을 계산하고 dynamic batching, TEI·vLLM, quantization parity를 설계합니다. Adaptive cascade, timeout·fallback·관측성으로 p95 SLO를 지킵니다.
문서 관련성과 답변 기여도를 구분하고 multi-hop evidence selection, 중복 제거, 정보 이득 학습, prompt injection 방어와 시각 문서 reranking을 설계합니다.
Reasoning·test-time compute, contextual listwise ranking, RAG utility 학습, 효율화, 불확실성, 멀티모달과 공격 내성을 중심으로 2024–2026 reranker 연구를 비판적으로 읽습니다.
Frozen candidate set에서 Cross-Encoder baseline을 학습하고 paired 평가, latency·security gate, cascade, release manifest와 rollback까지 잇는 reranking 실전 설계입니다.
PDF·HTML·스캔 문서를 수집해 layout과 표, 페이지, 권한, 출처 metadata를 보존하는 ingestion pipeline을 설계하고, stable ID·parser version·품질 gate로 검색 이전의 데이터 오류를 추적하는 방법을 배웁니다.
고정 길이·overlap·문서 구조·semantic·late chunking의 원리와 비용을 비교하고, tokenizer 기반 구현·parent-child 연결·평가 grid를 통해 자신의 문서와 질문에 맞는 chunk 경계와 크기를 선택하는 방법을 배웁니다.
역색인이 query term의 후보 문서를 찾는 구조부터 TF·IDF·문서 길이 정규화가 BM25 점수로 결합되는 과정을 수치로 계산하고, 한글 분석기·희귀 코드 보존·field 설계·Python baseline으로 sparse retrieval을 구현합니다.
Bi-Encoder의 query·passage 분리 encoding과 contrastive loss·negative 학습을 이해하고, prefix·pooling·normalization 계약을 지킨 exact search로 dense retrieval을 구현·평가합니다.
Exact kNN을 기준으로 HNSW graph, IVF cluster, PQ 압축 원리를 이해하고, ANN Recall@k·p95 latency·memory·build/update 비용을 함께 측정해 corpus와 운영 조건에 맞는 vector index를 선택합니다.
Exact term에 강한 BM25와 paraphrase에 강한 dense 후보를 stable chunk ID로 합치고, raw score 대신 RRF와 calibrated score fusion을 사용해 순위를 만드는 Python 구현·평가·운영 방법을 배웁니다.
짧고 모호한 질문을 rewrite, expansion, multi-query, HyDE, decomposition으로 변환하되 코드·날짜·부정·권한을 보존하고, query drift·후보 recall·latency·비용으로 효과를 검증하는 방법을 배웁니다.
Hybrid 후보를 query와 함께 읽는 Cross-Encoder·monoT5·ColBERT의 구조와 비용을 비교하고, candidate recall·batching·truncation·nDCG·latency를 측정하는 reranking pipeline을 구현합니다.
검색·reranking 후보를 prompt에 그대로 넣지 않고, token budget 안에서 span 중복을 제거하고 MMR로 관련성과 다양성을 조절하며 parent 문맥·subquery coverage·모순 근거·인용 좌표를 보존하는 context selector를 구현합니다.
Source span 기반 gold dataset으로 Hit·Recall·Precision·MRR·nDCG를 계산하고, ingestion부터 answer까지 단계별 상한과 failure slice·bootstrap·version manifest로 검색 실험을 재현합니다.
ColBERT Late Interaction은 문서를 토큰별 embedding으로 저장하고 MaxSim으로 질문 단서를 찾습니다. 일반 dense retrieval과 계산 비용 차이를 RAG 관점에서 정리합니다.