Tag index

#Embeddings

14 entries
№014 embedding-research-engineering · 14

실전: 재현 가능한 Embedding 연구 Pipeline 만들기 (14/14)

Frozen corpus·qrel에서 contrastive 학습과 hard-negative 정제, exact·통계 평가, dimension·quantization·ANN, RAG gate·shadow index까지 재현 가능한 실험을 완성합니다.

#Embeddings #MLOps #ContrastiveLearning #Evaluation
Corpus와 qrel 동결에서 embedding 대조 학습, exact 평가, 압축과 ANN, RAG 검증, shadow index 배포와 rollback으로 이어지는 실전 pipeline
№013 embedding-research-engineering · 13

Embedding 최근 연구 동향: 2024–2026 논문 지도 (13/14)

LLM backbone과 합성 데이터·증류, 소형·가변 차원, 문맥·추론, 멀티모달·multi-vector, 평가·privacy를 축으로 2024–2026 embedding 연구를 비판적으로 읽습니다.

#Embeddings #ResearchTrends #Multimodal #RepresentationLearning
2024년 LLM과 합성 데이터 기반 embedding에서 2025년 소형화와 문맥·멀티모달을 지나 2026년 reasoning과 situated retrieval로 확장되는 연구 지도
№012 embedding-research-engineering · 12

Embedding 압축과 ANN 서빙: Dimension부터 Re-index까지 (12/14)

Matryoshka 차원 축소, float16·int8·binary·PQ 양자화, HNSW·IVF·DiskANN 검색을 분리 평가하고 품질·메모리·지연·재색인의 Pareto frontier를 설계합니다.

#Embeddings #VectorSearch #ANN #Quantization
원본 embedding을 차원 축소와 양자화한 뒤 exact, HNSW, IVF-PQ, disk index로 나누어 품질과 메모리, 지연시간을 비교하는 서빙 지도
№011 embedding-research-engineering · 11

Embedding Benchmark 읽는 법: MTEB부터 오염까지 (11/14)

MTEB·MMTEB·BEIR·MIRACL·BRIGHT·AIR-Bench·LongEmbed·ConTEB의 평가 범위를 비교하고, 집계 점수·데이터 오염·버전·재현성 함정을 피하는 benchmark card를 만듭니다.

#Embeddings #Benchmarking #Evaluation #DataContamination
MTEB와 다국어, zero-shot, reasoning, long-context benchmark를 목적별로 나누고 공개 점수에서 in-domain 평가로 좁혀 가는 구조
№010 embedding-research-engineering · 10

Embedding 평가 방법: Metric·Protocol·통계 (10/14)

STS·분류·clustering·bitext·retrieval metric을 구분하고 qrel·exact search·ANN recall·paired bootstrap·slice·RAG utility까지 포함한 재현 가능한 embedding 평가법을 설계합니다.

#Embeddings #Evaluation #Metrics #Benchmarking
하나의 embedding model을 STS, 분류, clustering, bitext, exact retrieval, ANN, RAG 단계에서 서로 다른 metric과 paired 통계로 평가하는 구조
№009 embedding-research-engineering · 09

긴 문서 Embedding: Chunking·Contextual·Multi-vector (9/14)

Chunk-then-embed의 문맥 손실부터 long-context single vector, late chunking, CDE·situated embedding, token multi-vector까지 비교하고 긴 문서 retrieval 평가를 설계합니다.

#Embeddings #LongContext #Chunking #MultiVector
긴 문서를 독립 chunk, 전체 문맥을 본 contextual chunk, single document vector와 token multi-vector로 표현하는 네 가지 retrieval 경로
№008 embedding-research-engineering · 08

다국어·한국어 Embedding 학습과 평가 (8/14)

Monolingual·cross-lingual retrieval을 분리하고 언어 균형, parallel pair, tokenizer와 hard negative를 설계해 한국어·영어·혼합 질의에서 embedding 품질을 평가합니다.

#Embeddings #MultilingualNLP #KoreanNLP #CrossLingualRetrieval
한국어와 영어 query-document 조합이 공유 vector 공간에 정렬되고 언어별·방향별 retrieval matrix로 평가되는 multilingual embedding
№007 embedding-research-engineering · 07

Synthetic Data·Distillation로 Embedding을 도메인 적응하기 (7/14)

문서에서 synthetic query를 만들고 Cross-Encoder·LLM teacher로 relabel·distill하며, LoRA·full tuning·model merging을 비교해 작은 in-domain embedding을 안전하게 학습합니다.

#Embeddings #SyntheticData #KnowledgeDistillation #DomainAdaptation
도메인 문서에서 LLM이 query를 생성하고 teacher reranker가 positive와 hard negative를 정제해 작은 embedding student로 distill하는 흐름
№006 embedding-research-engineering · 06

Instruction·Multitask·LLM Embedding은 무엇이 다른가 (6/14)

INSTRUCTOR·E5부터 LLM2Vec·NV-Embed·GritLM·Qwen3까지 instruction embedding의 입력 계약, decoder attention 변환, pooling과 multi-task 학습의 장단점을 비교합니다.

#Embeddings #InstructionTuning #MultitaskLearning #LLM
Task instruction과 query 또는 document가 encoder-only와 bidirectionalized decoder LLM을 지나 task-conditioned embedding vector가 되는 비교
№005 embedding-research-engineering · 05

Dense Retrieval 학습 계보: DPR에서 E5까지 (5/14)

DPR의 dual encoder에서 ANCE의 global hard negative, RocketQA의 정제, Contriever·RetroMAE의 retrieval pretraining, E5의 대규모 weak supervision까지 학습 recipe를 추적합니다.

#DenseRetrieval #Embeddings #DPR #ContrastiveLearning
DPR dual encoder에서 ANCE, RocketQA, Contriever, RetroMAE, E5로 이어지며 negative mining과 pretraining data가 확장되는 dense retrieval 계보
№004 embedding-research-engineering · 04

Embedding 학습 데이터: Positive·Hard Negative·False Negative (4/14)

Pair·triplet·graded qrel을 설계하고 random·BM25·ANN·teacher hard negative를 채굴하며, false negative와 leakage를 정제하는 재현 가능한 embedding 데이터 파이프라인을 만듭니다.

#Embeddings #TrainingData #HardNegatives #DataCuration
Query와 positive 문서 주변에서 random, BM25, dense hard negative를 채굴하고 teacher와 사람이 false negative를 걸러 내는 데이터 파이프라인
№003 embedding-research-engineering · 03

Embedding 학습의 핵심: Contrastive Learning과 InfoNCE (3/14)

Positive·negative로 vector 공간을 만드는 InfoNCE, multiple-negatives ranking loss, temperature와 batch size의 효과를 수식·gradient·구현·ablation 관점에서 설명합니다.

#Embeddings #ContrastiveLearning #InfoNCE #RepresentationLearning
Anchor와 positive vector는 가까워지고 여러 negative vector는 멀어지며 temperature가 softmax 경계를 조절하는 contrastive embedding 학습
№002 embedding-research-engineering · 02

Embedding Geometry: 유사도·정규화·Pooling·Hubness (2/14)

Cosine·dot product·L2의 관계와 vector norm, mean·CLS·last-token pooling을 해부하고 anisotropy·hubness·dimension 문제가 실제 nearest-neighbor 검색을 어떻게 바꾸는지 진단합니다.

#Embeddings #VectorGeometry #SimilaritySearch #Pooling
고차원 구면 위의 query와 document vector 사이 cosine 각도, vector norm, 중심부 hub와 pooling 경로를 함께 보여 주는 embedding geometry
№001 embedding-research-engineering · 01

Embedding이란 무엇인가: 연구와 실전의 전체 지도 (1/14)

Token·문장·문서 embedding과 dense·sparse·multi-vector 표현을 구분하고, 학습·평가·검색·서빙으로 이어지는 14편 연구 로드맵과 첫 baseline을 세웁니다.

#Embeddings #RepresentationLearning #DenseRetrieval #RAG
텍스트와 이미지가 encoder를 지나 single vector, sparse vector, multi-vector가 되고 학습과 평가, ANN 검색으로 이어지는 임베딩 연구 지도