Knowledge pillar · active

RAG 검색·랭킹

39 entries

문서 파싱과 청킹에서 sparse·dense 검색, Embedding, Reranker, 검색 평가까지 이어지는 검색 계층입니다.


№039 embedding-research-engineering · 01

Embedding이란 무엇인가: 연구와 실전의 전체 지도 (1/14)

Token·문장·문서 embedding과 dense·sparse·multi-vector 표현을 구분하고, 학습·평가·검색·서빙으로 이어지는 14편 연구 로드맵과 첫 baseline을 세웁니다.

#Embeddings #RepresentationLearning #DenseRetrieval #RAG
텍스트와 이미지가 encoder를 지나 single vector, sparse vector, multi-vector가 되고 학습과 평가, ANN 검색으로 이어지는 임베딩 연구 지도
№038 embedding-research-engineering · 02

Embedding Geometry: 유사도·정규화·Pooling·Hubness (2/14)

Cosine·dot product·L2의 관계와 vector norm, mean·CLS·last-token pooling을 해부하고 anisotropy·hubness·dimension 문제가 실제 nearest-neighbor 검색을 어떻게 바꾸는지 진단합니다.

#Embeddings #VectorGeometry #SimilaritySearch #Pooling
고차원 구면 위의 query와 document vector 사이 cosine 각도, vector norm, 중심부 hub와 pooling 경로를 함께 보여 주는 embedding geometry
№037 embedding-research-engineering · 03

Embedding 학습의 핵심: Contrastive Learning과 InfoNCE (3/14)

Positive·negative로 vector 공간을 만드는 InfoNCE, multiple-negatives ranking loss, temperature와 batch size의 효과를 수식·gradient·구현·ablation 관점에서 설명합니다.

#Embeddings #ContrastiveLearning #InfoNCE #RepresentationLearning
Anchor와 positive vector는 가까워지고 여러 negative vector는 멀어지며 temperature가 softmax 경계를 조절하는 contrastive embedding 학습
№036 embedding-research-engineering · 04

Embedding 학습 데이터: Positive·Hard Negative·False Negative (4/14)

Pair·triplet·graded qrel을 설계하고 random·BM25·ANN·teacher hard negative를 채굴하며, false negative와 leakage를 정제하는 재현 가능한 embedding 데이터 파이프라인을 만듭니다.

#Embeddings #TrainingData #HardNegatives #DataCuration
Query와 positive 문서 주변에서 random, BM25, dense hard negative를 채굴하고 teacher와 사람이 false negative를 걸러 내는 데이터 파이프라인
№035 embedding-research-engineering · 05

Dense Retrieval 학습 계보: DPR에서 E5까지 (5/14)

DPR의 dual encoder에서 ANCE의 global hard negative, RocketQA의 정제, Contriever·RetroMAE의 retrieval pretraining, E5의 대규모 weak supervision까지 학습 recipe를 추적합니다.

#DenseRetrieval #Embeddings #DPR #ContrastiveLearning
DPR dual encoder에서 ANCE, RocketQA, Contriever, RetroMAE, E5로 이어지며 negative mining과 pretraining data가 확장되는 dense retrieval 계보
№034 embedding-research-engineering · 06

Instruction·Multitask·LLM Embedding은 무엇이 다른가 (6/14)

INSTRUCTOR·E5부터 LLM2Vec·NV-Embed·GritLM·Qwen3까지 instruction embedding의 입력 계약, decoder attention 변환, pooling과 multi-task 학습의 장단점을 비교합니다.

#Embeddings #InstructionTuning #MultitaskLearning #LLM
Task instruction과 query 또는 document가 encoder-only와 bidirectionalized decoder LLM을 지나 task-conditioned embedding vector가 되는 비교
№033 embedding-research-engineering · 07

Synthetic Data·Distillation로 Embedding을 도메인 적응하기 (7/14)

문서에서 synthetic query를 만들고 Cross-Encoder·LLM teacher로 relabel·distill하며, LoRA·full tuning·model merging을 비교해 작은 in-domain embedding을 안전하게 학습합니다.

#Embeddings #SyntheticData #KnowledgeDistillation #DomainAdaptation
도메인 문서에서 LLM이 query를 생성하고 teacher reranker가 positive와 hard negative를 정제해 작은 embedding student로 distill하는 흐름
№032 embedding-research-engineering · 08

다국어·한국어 Embedding 학습과 평가 (8/14)

Monolingual·cross-lingual retrieval을 분리하고 언어 균형, parallel pair, tokenizer와 hard negative를 설계해 한국어·영어·혼합 질의에서 embedding 품질을 평가합니다.

#Embeddings #MultilingualNLP #KoreanNLP #CrossLingualRetrieval
한국어와 영어 query-document 조합이 공유 vector 공간에 정렬되고 언어별·방향별 retrieval matrix로 평가되는 multilingual embedding
№031 embedding-research-engineering · 09

긴 문서 Embedding: Chunking·Contextual·Multi-vector (9/14)

Chunk-then-embed의 문맥 손실부터 long-context single vector, late chunking, CDE·situated embedding, token multi-vector까지 비교하고 긴 문서 retrieval 평가를 설계합니다.

#Embeddings #LongContext #Chunking #MultiVector
긴 문서를 독립 chunk, 전체 문맥을 본 contextual chunk, single document vector와 token multi-vector로 표현하는 네 가지 retrieval 경로
№030 embedding-research-engineering · 10

Embedding 평가 방법: Metric·Protocol·통계 (10/14)

STS·분류·clustering·bitext·retrieval metric을 구분하고 qrel·exact search·ANN recall·paired bootstrap·slice·RAG utility까지 포함한 재현 가능한 embedding 평가법을 설계합니다.

#Embeddings #Evaluation #Metrics #Benchmarking
하나의 embedding model을 STS, 분류, clustering, bitext, exact retrieval, ANN, RAG 단계에서 서로 다른 metric과 paired 통계로 평가하는 구조
№029 embedding-research-engineering · 11

Embedding Benchmark 읽는 법: MTEB부터 오염까지 (11/14)

MTEB·MMTEB·BEIR·MIRACL·BRIGHT·AIR-Bench·LongEmbed·ConTEB의 평가 범위를 비교하고, 집계 점수·데이터 오염·버전·재현성 함정을 피하는 benchmark card를 만듭니다.

#Embeddings #Benchmarking #Evaluation #DataContamination
MTEB와 다국어, zero-shot, reasoning, long-context benchmark를 목적별로 나누고 공개 점수에서 in-domain 평가로 좁혀 가는 구조
№028 embedding-research-engineering · 12

Embedding 압축과 ANN 서빙: Dimension부터 Re-index까지 (12/14)

Matryoshka 차원 축소, float16·int8·binary·PQ 양자화, HNSW·IVF·DiskANN 검색을 분리 평가하고 품질·메모리·지연·재색인의 Pareto frontier를 설계합니다.

#Embeddings #VectorSearch #ANN #Quantization
원본 embedding을 차원 축소와 양자화한 뒤 exact, HNSW, IVF-PQ, disk index로 나누어 품질과 메모리, 지연시간을 비교하는 서빙 지도
№027 embedding-research-engineering · 14

실전: 재현 가능한 Embedding 연구 Pipeline 만들기 (14/14)

Frozen corpus·qrel에서 contrastive 학습과 hard-negative 정제, exact·통계 평가, dimension·quantization·ANN, RAG gate·shadow index까지 재현 가능한 실험을 완성합니다.

#Embeddings #MLOps #ContrastiveLearning #Evaluation
Corpus와 qrel 동결에서 embedding 대조 학습, exact 평가, 압축과 ANN, RAG 검증, shadow index 배포와 rollback으로 이어지는 실전 pipeline
№026 embedding-research-engineering · 13

Embedding 최근 연구 동향: 2024–2026 논문 지도 (13/14)

LLM backbone과 합성 데이터·증류, 소형·가변 차원, 문맥·추론, 멀티모달·multi-vector, 평가·privacy를 축으로 2024–2026 embedding 연구를 비판적으로 읽습니다.

#Embeddings #ResearchTrends #Multimodal #RepresentationLearning
2024년 LLM과 합성 데이터 기반 embedding에서 2025년 소형화와 문맥·멀티모달을 지나 2026년 reasoning과 situated retrieval로 확장되는 연구 지도
№025 reranker-engineering · 01

Reranker란 무엇인가: 두 단계 검색과 전체 지도 (1/14)

Retriever와 reranker의 역할을 분리하고 candidate recall 상한, scoring·interaction·학습 방식의 분류축을 세웁니다. 14편 학습 순서와 도입 전후의 실험 기준까지 정리합니다.

#RAG #Reranking #InformationRetrieval #LearningToRank
넓고 빠른 후보 검색 뒤 느리지만 정밀한 reranker가 최종 근거를 고르는 두 단계 검색 구조와 14편 학습 지도
№024 reranker-engineering · 02

Learning to Rank: Pointwise·Pairwise·Listwise와 LambdaMART (2/14)

Reranker 학습의 공통 언어인 pointwise·pairwise·listwise 목표를 수식과 작은 예제로 풉니다. RankNet, ListNet, LambdaRank·LambdaMART를 nDCG와 연결하고 loss 선택 기준을 세웁니다.

#Reranking #LearningToRank #RankNet #LambdaMART
Query별 후보 목록을 pointwise 점수, pairwise 선호, listwise 순열과 nDCG 가중치로 학습하는 Learning to Rank 지도
№023 reranker-engineering · 03

Cross-Encoder Reranker: Joint Attention부터 실전 추론까지 (3/14)

Query와 document를 한 Transformer에 넣는 Cross-Encoder의 joint attention과 score를 이해하고, batching·truncation·긴 문서 windowing 및 재현 가능한 baseline을 구현합니다.

#Reranking #CrossEncoder #Transformer #SentenceTransformers
Query와 document token을 한 Transformer에 넣어 모든 layer에서 joint attention한 뒤 relevance score로 재정렬하는 Cross-Encoder 구조
№022 reranker-engineering · 04

monoT5·duoT5·RankT5·ListT5: 생성형 Reranker의 계보 (4/14)

T5가 relevance label token을 점수화하는 monoT5부터 pairwise duoT5, scalar ranking loss를 쓰는 RankT5, Fusion-in-Decoder listwise ListT5까지 입력·출력·loss·추론 비용을 분리해 설명합니다.

#Reranking #monoT5 #RankT5 #ListT5
monoT5의 relevance token, duoT5의 문서 쌍 비교, RankT5의 scalar loss, ListT5의 후보 목록 비교로 이어지는 T5 reranker 계보
№021 reranker-engineering · 05

ColBERT Late Interaction: Multi-Vector 검색과 Reranking (5/14)

Single-vector bi-encoder와 full Cross-Encoder 사이에서 document token vector를 보존하는 ColBERT의 MaxSim을 계산합니다. ColBERTv2 compression·PLAID 검색과 reranker로 배치하는 기준까지 설명합니다.

#Reranking #ColBERT #LateInteraction #VectorSearch
Query token마다 document token 중 최대 유사도를 찾고 합산하는 ColBERT MaxSim과 사전 계산 가능한 multi-vector index 구조
№020 reranker-engineering · 06

LLM Reranker: Pointwise·Pairwise·Setwise·Listwise 설계 (6/14)

Decoder-only LLM의 pointwise·pairwise·setwise·listwise 방식을 비교하고 RankGPT·RankZephyr·PRP·FIRST의 순서 편향, 파싱, token 비용과 안정성 평가를 다룹니다.

#Reranking #LLM #RankGPT #RankZephyr
한 LLM이 문서 하나를 점수화하거나 두 문서를 비교하고 후보 집합의 승자 또는 전체 ID 순열을 만드는 네 가지 reranking paradigm
№019 reranker-engineering · 07

Reranker 학습 데이터: Positive·Hard Negative·False Negative (7/14)

Production 후보 분포에서 graded positive와 hard negative를 만들고 false negative를 거르는 법을 익힙니다. Hybrid mining, 합성 label, split leakage와 dataset versioning도 다룹니다.

#Reranking #HardNegative #TrainingData #DataQuality
실제 hybrid retriever 후보에서 direct evidence, partial evidence, near-miss hard negative와 false negative를 구분해 reranker dataset을 만드는 과정
№018 reranker-engineering · 09

Reranker 평가: Candidate Ceiling·nDCG·MRR·Latency·RAG 품질 (9/14)

고정 candidate에서 reranker 효과를 분리하고 Recall ceiling, MRR·MAP·nDCG, paired confidence interval을 계산합니다. BEIR·BRIGHT·AIR-Bench의 역할과 latency·비용·최종 RAG 평가까지 설계합니다.

#Reranking #Evaluation #NDCG #BEIR
고정 후보의 Recall 상한에서 MRR와 nDCG, p95 latency, 최종 답변 품질까지 단계별로 검증하는 reranker evaluation funnel
№017 reranker-engineering · 08

Reranker 학습 심화: Ranking Loss·Distillation·Calibration (8/14)

Cross-Encoder의 pointwise BCE, pairwise logistic, listwise softmax 학습을 비교하고 teacher score·permutation distillation, calibration, train-serve parity를 연결합니다.

#Reranking #RankingLoss #KnowledgeDistillation #Calibration
Human grade와 teacher score를 pointwise·pairwise·listwise loss로 학습하고 temperature calibration을 거쳐 serving score로 만드는 흐름
№016 reranker-engineering · 10

Reranker 모델 선택: 한국어·도메인·Open Model·API 비교법 (10/14)

2026년 7월 기준 BGE·Qwen3·Jina와 Cohere·Voyage 계열을 구조와 배포 조건으로 분류합니다. 한국어·code-switch·긴 문서용 in-domain bake-off, license·보안·비용 판단표를 만듭니다.

#Reranking #Multilingual #KoreanNLP #ModelSelection
한국어와 영어가 섞인 query, 긴 정책 문서, 로컬 GPU와 외부 API 조건을 품질·지연·license 축으로 비교하는 reranker 선택표
№015 reranker-engineering · 11

Reranker Serving: Batching·Quantization·Adaptive Cascade (11/14)

Candidate 수와 token 길이로 용량을 계산하고 dynamic batching, TEI·vLLM, quantization parity를 설계합니다. Adaptive cascade, timeout·fallback·관측성으로 p95 SLO를 지킵니다.

#Reranking #ModelServing #DynamicBatching #Quantization
짧고 긴 query-document pair를 token bucket으로 batch하고 작은 reranker에서 불확실한 후보만 큰 reranker로 보내는 production cascade
№013 reranker-engineering · 13

Reranker 최근 연구 동향: 2024–2026 논문 지도 (13/14)

Reasoning·test-time compute, contextual listwise ranking, RAG utility 학습, 효율화, 불확실성, 멀티모달과 공격 내성을 중심으로 2024–2026 reranker 연구를 비판적으로 읽습니다.

#Reranking #ResearchTrends #ReasoningModels #Multimodal
2024년 listwise LLM에서 2025년 reasoning과 utility alignment를 지나 2026년 contextual, efficient, multimodal, robust reranking으로 갈라지는 연구 지도
№011 rag-retrieval-foundations · 01

RAG 문서 수집: PDF·HTML을 검색 가능한 데이터로 바꾸기 (1/10)

PDF·HTML·스캔 문서를 수집해 layout과 표, 페이지, 권한, 출처 metadata를 보존하는 ingestion pipeline을 설계하고, stable ID·parser version·품질 gate로 검색 이전의 데이터 오류를 추적하는 방법을 배웁니다.

#RAG #DocumentParsing #PDF #Ingestion
원문 snapshot이 layout parsing과 OCR, 정규화, 품질 gate, versioned document store로 변환되는 RAG ingestion 흐름
№010 rag-retrieval-foundations · 02

RAG Chunking: 크기·Overlap·Semantic·Late Chunking 선택법 (2/10)

고정 길이·overlap·문서 구조·semantic·late chunking의 원리와 비용을 비교하고, tokenizer 기반 구현·parent-child 연결·평가 grid를 통해 자신의 문서와 질문에 맞는 chunk 경계와 크기를 선택하는 방법을 배웁니다.

#RAG #Chunking #Retrieval #Embedding
하나의 문서를 fixed token, structure-aware, semantic, late chunking으로 나누고 검색용 child와 답변용 parent를 연결하는 비교
№009 rag-retrieval-foundations · 03

Sparse Retrieval 기초: 역색인·TF-IDF·BM25 직접 계산하기 (3/10)

역색인이 query term의 후보 문서를 찾는 구조부터 TF·IDF·문서 길이 정규화가 BM25 점수로 결합되는 과정을 수치로 계산하고, 한글 분석기·희귀 코드 보존·field 설계·Python baseline으로 sparse retrieval을 구현합니다.

#RAG #Retrieval #BM25 #SparseRetrieval
질문 token이 역색인의 posting list를 찾아 TF, IDF, 문서 길이 정규화를 거쳐 BM25 순위를 만드는 과정
№008 rag-retrieval-foundations · 04

Dense Retrieval 기초: Bi-Encoder·Contrastive Learning·DPR (4/10)

Bi-Encoder의 query·passage 분리 encoding과 contrastive loss·negative 학습을 이해하고, prefix·pooling·normalization 계약을 지킨 exact search로 dense retrieval을 구현·평가합니다.

#RAG #DenseRetrieval #BiEncoder #DPR
Query encoder와 passage encoder가 vector를 만들고 positive는 가깝게 negative는 멀게 학습한 뒤 dot product로 검색하는 dense retrieval
№007 rag-retrieval-foundations · 05

ANN Vector Index: Flat·HNSW·IVF·PQ 선택법 (5/10)

Exact kNN을 기준으로 HNSW graph, IVF cluster, PQ 압축 원리를 이해하고, ANN Recall@k·p95 latency·memory·build/update 비용을 함께 측정해 corpus와 운영 조건에 맞는 vector index를 선택합니다.

#RAG #VectorSearch #ANN #HNSW
동일한 vector 공간을 Flat 전수 비교, HNSW graph 탐색, IVF cluster 탐색, PQ 압축 code로 검색하는 ANN index 비교
№006 rag-retrieval-foundations · 06

Hybrid Search: BM25와 Vector 검색을 RRF로 합치기 (6/10)

Exact term에 강한 BM25와 paraphrase에 강한 dense 후보를 stable chunk ID로 합치고, raw score 대신 RRF와 calibrated score fusion을 사용해 순위를 만드는 Python 구현·평가·운영 방법을 배웁니다.

#RAG #HybridSearch #BM25 #DenseRetrieval
BM25 sparse 순위와 dense vector 순위가 서로 다른 후보를 만든 뒤 stable ID로 합쳐 RRF 점수로 최종 순위를 만드는 hybrid search
№005 rag-retrieval-foundations · 08

Query Transformation: Rewrite·Expansion·HyDE·Decomposition (8/10)

짧고 모호한 질문을 rewrite, expansion, multi-query, HyDE, decomposition으로 변환하되 코드·날짜·부정·권한을 보존하고, query drift·후보 recall·latency·비용으로 효과를 검증하는 방법을 배웁니다.

#RAG #QueryTransformation #HyDE #QueryExpansion
원 질문이 standalone rewrite, keyword expansion, multi-query, HyDE hypothetical document, decomposition 경로로 분기되고 검색 결과가 합쳐지는 과정
№004 rag-retrieval-foundations · 07

Reranking: Cross-Encoder·monoT5·ColBERT의 역할 (7/10)

Hybrid 후보를 query와 함께 읽는 Cross-Encoder·monoT5·ColBERT의 구조와 비용을 비교하고, candidate recall·batching·truncation·nDCG·latency를 측정하는 reranking pipeline을 구현합니다.

#RAG #Reranking #CrossEncoder #ColBERT
Bi-Encoder 후보 생성 뒤 Cross-Encoder joint attention, monoT5 relevance token, ColBERT MaxSim으로 후보를 재정렬하는 비교
№003 rag-retrieval-foundations · 09

Context Selection: MMR·Dedup·Parent-Child·순서 최적화 (9/10)

검색·reranking 후보를 prompt에 그대로 넣지 않고, token budget 안에서 span 중복을 제거하고 MMR로 관련성과 다양성을 조절하며 parent 문맥·subquery coverage·모순 근거·인용 좌표를 보존하는 context selector를 구현합니다.

#RAG #ContextSelection #MMR #ContextWindow
Reranked 후보에서 중복 span을 제거하고 MMR과 coverage로 다양한 child를 선택한 뒤 parent 문맥과 citation을 token budget에 맞춰 배치하는 흐름
№002 rag-retrieval-foundations · 10

Retrieval Evaluation: Recall@k·MRR·nDCG와 실패 분석 (10/10)

Source span 기반 gold dataset으로 Hit·Recall·Precision·MRR·nDCG를 계산하고, ingestion부터 answer까지 단계별 상한과 failure slice·bootstrap·version manifest로 검색 실험을 재현합니다.

#RAG #RAGEvaluation #Retrieval #MRR
질문과 source span gold evidence가 ingestion, retrieval, ANN, fusion, rerank, context, answer 단계 metric과 failure slice로 연결되는 RAG 평가 harness