Series · Folio

Embedding 연구와 엔지니어링

14 parts

벡터 기하부터 학습·평가·검색·2026년 연구까지 이어지는 14편

텍스트와 멀티모달 입력을 벡터 공간에 표현하고 대조 학습, 데이터와 negative, 평가, 다국어, 긴 문서, 압축과 ANN, 최신 연구, production 실습으로 이어지는 임베딩 로드맵
대상
임베딩을 API 호출 수준에서 넘어 직접 평가·학습하고, 한국어·도메인 RAG와 대규모 검색에 맞게 최적화하려는 개발자와 연구자
읽고 나면
대조 학습과 negative mining, instruction·multitask·distillation, 다국어·긴 문서·멀티모달 표현을 이해하고, 재현 가능한 평가셋과 ANN production pipeline을 직접 설계할 수 있음
추천 진입

№001 embedding-research-engineering · 01

Embedding이란 무엇인가: 연구와 실전의 전체 지도 (1/14)

Token·문장·문서 embedding과 dense·sparse·multi-vector 표현을 구분하고, 학습·평가·검색·서빙으로 이어지는 14편 연구 로드맵과 첫 baseline을 세웁니다.

#Embeddings #RepresentationLearning #DenseRetrieval #RAG
텍스트와 이미지가 encoder를 지나 single vector, sparse vector, multi-vector가 되고 학습과 평가, ANN 검색으로 이어지는 임베딩 연구 지도
№002 embedding-research-engineering · 02

Embedding Geometry: 유사도·정규화·Pooling·Hubness (2/14)

Cosine·dot product·L2의 관계와 vector norm, mean·CLS·last-token pooling을 해부하고 anisotropy·hubness·dimension 문제가 실제 nearest-neighbor 검색을 어떻게 바꾸는지 진단합니다.

#Embeddings #VectorGeometry #SimilaritySearch #Pooling
고차원 구면 위의 query와 document vector 사이 cosine 각도, vector norm, 중심부 hub와 pooling 경로를 함께 보여 주는 embedding geometry
№003 embedding-research-engineering · 03

Embedding 학습의 핵심: Contrastive Learning과 InfoNCE (3/14)

Positive·negative로 vector 공간을 만드는 InfoNCE, multiple-negatives ranking loss, temperature와 batch size의 효과를 수식·gradient·구현·ablation 관점에서 설명합니다.

#Embeddings #ContrastiveLearning #InfoNCE #RepresentationLearning
Anchor와 positive vector는 가까워지고 여러 negative vector는 멀어지며 temperature가 softmax 경계를 조절하는 contrastive embedding 학습
№004 embedding-research-engineering · 04

Embedding 학습 데이터: Positive·Hard Negative·False Negative (4/14)

Pair·triplet·graded qrel을 설계하고 random·BM25·ANN·teacher hard negative를 채굴하며, false negative와 leakage를 정제하는 재현 가능한 embedding 데이터 파이프라인을 만듭니다.

#Embeddings #TrainingData #HardNegatives #DataCuration
Query와 positive 문서 주변에서 random, BM25, dense hard negative를 채굴하고 teacher와 사람이 false negative를 걸러 내는 데이터 파이프라인
№005 embedding-research-engineering · 05

Dense Retrieval 학습 계보: DPR에서 E5까지 (5/14)

DPR의 dual encoder에서 ANCE의 global hard negative, RocketQA의 정제, Contriever·RetroMAE의 retrieval pretraining, E5의 대규모 weak supervision까지 학습 recipe를 추적합니다.

#DenseRetrieval #Embeddings #DPR #ContrastiveLearning
DPR dual encoder에서 ANCE, RocketQA, Contriever, RetroMAE, E5로 이어지며 negative mining과 pretraining data가 확장되는 dense retrieval 계보
№006 embedding-research-engineering · 06

Instruction·Multitask·LLM Embedding은 무엇이 다른가 (6/14)

INSTRUCTOR·E5부터 LLM2Vec·NV-Embed·GritLM·Qwen3까지 instruction embedding의 입력 계약, decoder attention 변환, pooling과 multi-task 학습의 장단점을 비교합니다.

#Embeddings #InstructionTuning #MultitaskLearning #LLM
Task instruction과 query 또는 document가 encoder-only와 bidirectionalized decoder LLM을 지나 task-conditioned embedding vector가 되는 비교
№007 embedding-research-engineering · 07

Synthetic Data·Distillation로 Embedding을 도메인 적응하기 (7/14)

문서에서 synthetic query를 만들고 Cross-Encoder·LLM teacher로 relabel·distill하며, LoRA·full tuning·model merging을 비교해 작은 in-domain embedding을 안전하게 학습합니다.

#Embeddings #SyntheticData #KnowledgeDistillation #DomainAdaptation
도메인 문서에서 LLM이 query를 생성하고 teacher reranker가 positive와 hard negative를 정제해 작은 embedding student로 distill하는 흐름
№008 embedding-research-engineering · 08

다국어·한국어 Embedding 학습과 평가 (8/14)

Monolingual·cross-lingual retrieval을 분리하고 언어 균형, parallel pair, tokenizer와 hard negative를 설계해 한국어·영어·혼합 질의에서 embedding 품질을 평가합니다.

#Embeddings #MultilingualNLP #KoreanNLP #CrossLingualRetrieval
한국어와 영어 query-document 조합이 공유 vector 공간에 정렬되고 언어별·방향별 retrieval matrix로 평가되는 multilingual embedding
№009 embedding-research-engineering · 09

긴 문서 Embedding: Chunking·Contextual·Multi-vector (9/14)

Chunk-then-embed의 문맥 손실부터 long-context single vector, late chunking, CDE·situated embedding, token multi-vector까지 비교하고 긴 문서 retrieval 평가를 설계합니다.

#Embeddings #LongContext #Chunking #MultiVector
긴 문서를 독립 chunk, 전체 문맥을 본 contextual chunk, single document vector와 token multi-vector로 표현하는 네 가지 retrieval 경로
№010 embedding-research-engineering · 10

Embedding 평가 방법: Metric·Protocol·통계 (10/14)

STS·분류·clustering·bitext·retrieval metric을 구분하고 qrel·exact search·ANN recall·paired bootstrap·slice·RAG utility까지 포함한 재현 가능한 embedding 평가법을 설계합니다.

#Embeddings #Evaluation #Metrics #Benchmarking
하나의 embedding model을 STS, 분류, clustering, bitext, exact retrieval, ANN, RAG 단계에서 서로 다른 metric과 paired 통계로 평가하는 구조
№011 embedding-research-engineering · 11

Embedding Benchmark 읽는 법: MTEB부터 오염까지 (11/14)

MTEB·MMTEB·BEIR·MIRACL·BRIGHT·AIR-Bench·LongEmbed·ConTEB의 평가 범위를 비교하고, 집계 점수·데이터 오염·버전·재현성 함정을 피하는 benchmark card를 만듭니다.

#Embeddings #Benchmarking #Evaluation #DataContamination
MTEB와 다국어, zero-shot, reasoning, long-context benchmark를 목적별로 나누고 공개 점수에서 in-domain 평가로 좁혀 가는 구조
№012 embedding-research-engineering · 12

Embedding 압축과 ANN 서빙: Dimension부터 Re-index까지 (12/14)

Matryoshka 차원 축소, float16·int8·binary·PQ 양자화, HNSW·IVF·DiskANN 검색을 분리 평가하고 품질·메모리·지연·재색인의 Pareto frontier를 설계합니다.

#Embeddings #VectorSearch #ANN #Quantization
원본 embedding을 차원 축소와 양자화한 뒤 exact, HNSW, IVF-PQ, disk index로 나누어 품질과 메모리, 지연시간을 비교하는 서빙 지도
№013 embedding-research-engineering · 13

Embedding 최근 연구 동향: 2024–2026 논문 지도 (13/14)

LLM backbone과 합성 데이터·증류, 소형·가변 차원, 문맥·추론, 멀티모달·multi-vector, 평가·privacy를 축으로 2024–2026 embedding 연구를 비판적으로 읽습니다.

#Embeddings #ResearchTrends #Multimodal #RepresentationLearning
2024년 LLM과 합성 데이터 기반 embedding에서 2025년 소형화와 문맥·멀티모달을 지나 2026년 reasoning과 situated retrieval로 확장되는 연구 지도
№014 embedding-research-engineering · 14

실전: 재현 가능한 Embedding 연구 Pipeline 만들기 (14/14)

Frozen corpus·qrel에서 contrastive 학습과 hard-negative 정제, exact·통계 평가, dimension·quantization·ANN, RAG gate·shadow index까지 재현 가능한 실험을 완성합니다.

#Embeddings #MLOps #ContrastiveLearning #Evaluation
Corpus와 qrel 동결에서 embedding 대조 학습, exact 평가, 압축과 ANN, RAG 검증, shadow index 배포와 rollback으로 이어지는 실전 pipeline