Tag index

#RAG

61 entries
№059 llm-wiki-engineering · 01

LLM Wiki란 무엇인가: AI 챗봇·RAG·전통 위키와 구분하기 (1/6)

LLM Wiki의 뜻을 지속 가능한 지식 산출물이라는 기준으로 정의합니다. 전통 위키·AI 챗봇·RAG·DeepWiki를 구분하고 출처·구조·검수·갱신·재사용의 판별 기준을 제시합니다.

#LLMWiki #AI지식베이스 #RAG #DeepWiki
원천 문서가 LLM을 거쳐 출처가 연결된 페이지와 그래프로 변환되고 사람과 AI 에이전트가 다시 사용하는 LLM Wiki 개념도
№058 embedding-research-engineering · 14

실전: 재현 가능한 Embedding 연구 Pipeline 만들기 (14/14)

Frozen corpus·qrel에서 contrastive 학습과 hard-negative 정제, exact·통계 평가, dimension·quantization·ANN, RAG gate·shadow index까지 재현 가능한 실험을 완성합니다.

#Embeddings #MLOps #ContrastiveLearning #Evaluation
Corpus와 qrel 동결에서 embedding 대조 학습, exact 평가, 압축과 ANN, RAG 검증, shadow index 배포와 rollback으로 이어지는 실전 pipeline
№056 embedding-research-engineering · 13

Embedding 최근 연구 동향: 2024–2026 논문 지도 (13/14)

LLM backbone과 합성 데이터·증류, 소형·가변 차원, 문맥·추론, 멀티모달·multi-vector, 평가·privacy를 축으로 2024–2026 embedding 연구를 비판적으로 읽습니다.

#Embeddings #ResearchTrends #Multimodal #RepresentationLearning
2024년 LLM과 합성 데이터 기반 embedding에서 2025년 소형화와 문맥·멀티모달을 지나 2026년 reasoning과 situated retrieval로 확장되는 연구 지도
№055 reranker-engineering · 13

Reranker 최근 연구 동향: 2024–2026 논문 지도 (13/14)

Reasoning·test-time compute, contextual listwise ranking, RAG utility 학습, 효율화, 불확실성, 멀티모달과 공격 내성을 중심으로 2024–2026 reranker 연구를 비판적으로 읽습니다.

#Reranking #ResearchTrends #ReasoningModels #Multimodal
2024년 listwise LLM에서 2025년 reasoning과 utility alignment를 지나 2026년 contextual, efficient, multimodal, robust reranking으로 갈라지는 연구 지도
№053 reranker-engineering · 10

Reranker 모델 선택: 한국어·도메인·Open Model·API 비교법 (10/14)

2026년 7월 기준 BGE·Qwen3·Jina와 Cohere·Voyage 계열을 구조와 배포 조건으로 분류합니다. 한국어·code-switch·긴 문서용 in-domain bake-off, license·보안·비용 판단표를 만듭니다.

#Reranking #Multilingual #KoreanNLP #ModelSelection
한국어와 영어가 섞인 query, 긴 정책 문서, 로컬 GPU와 외부 API 조건을 품질·지연·license 축으로 비교하는 reranker 선택표
№052 reranker-engineering · 09

Reranker 평가: Candidate Ceiling·nDCG·MRR·Latency·RAG 품질 (9/14)

고정 candidate에서 reranker 효과를 분리하고 Recall ceiling, MRR·MAP·nDCG, paired confidence interval을 계산합니다. BEIR·BRIGHT·AIR-Bench의 역할과 latency·비용·최종 RAG 평가까지 설계합니다.

#Reranking #Evaluation #NDCG #BEIR
고정 후보의 Recall 상한에서 MRR와 nDCG, p95 latency, 최종 답변 품질까지 단계별로 검증하는 reranker evaluation funnel
№051 reranker-engineering · 07

Reranker 학습 데이터: Positive·Hard Negative·False Negative (7/14)

Production 후보 분포에서 graded positive와 hard negative를 만들고 false negative를 거르는 법을 익힙니다. Hybrid mining, 합성 label, split leakage와 dataset versioning도 다룹니다.

#Reranking #HardNegative #TrainingData #DataQuality
실제 hybrid retriever 후보에서 direct evidence, partial evidence, near-miss hard negative와 false negative를 구분해 reranker dataset을 만드는 과정
№050 reranker-engineering · 05

ColBERT Late Interaction: Multi-Vector 검색과 Reranking (5/14)

Single-vector bi-encoder와 full Cross-Encoder 사이에서 document token vector를 보존하는 ColBERT의 MaxSim을 계산합니다. ColBERTv2 compression·PLAID 검색과 reranker로 배치하는 기준까지 설명합니다.

#Reranking #ColBERT #LateInteraction #VectorSearch
Query token마다 document token 중 최대 유사도를 찾고 합산하는 ColBERT MaxSim과 사전 계산 가능한 multi-vector index 구조
№049 reranker-engineering · 03

Cross-Encoder Reranker: Joint Attention부터 실전 추론까지 (3/14)

Query와 document를 한 Transformer에 넣는 Cross-Encoder의 joint attention과 score를 이해하고, batching·truncation·긴 문서 windowing 및 재현 가능한 baseline을 구현합니다.

#Reranking #CrossEncoder #Transformer #SentenceTransformers
Query와 document token을 한 Transformer에 넣어 모든 layer에서 joint attention한 뒤 relevance score로 재정렬하는 Cross-Encoder 구조
№048 embedding-research-engineering · 01

Embedding이란 무엇인가: 연구와 실전의 전체 지도 (1/14)

Token·문장·문서 embedding과 dense·sparse·multi-vector 표현을 구분하고, 학습·평가·검색·서빙으로 이어지는 14편 연구 로드맵과 첫 baseline을 세웁니다.

#Embeddings #RepresentationLearning #DenseRetrieval #RAG
텍스트와 이미지가 encoder를 지나 single vector, sparse vector, multi-vector가 되고 학습과 평가, ANN 검색으로 이어지는 임베딩 연구 지도
№047 reranker-engineering · 01

Reranker란 무엇인가: 두 단계 검색과 전체 지도 (1/14)

Retriever와 reranker의 역할을 분리하고 candidate recall 상한, scoring·interaction·학습 방식의 분류축을 세웁니다. 14편 학습 순서와 도입 전후의 실험 기준까지 정리합니다.

#RAG #Reranking #InformationRetrieval #LearningToRank
넓고 빠른 후보 검색 뒤 느리지만 정밀한 reranker가 최종 근거를 고르는 두 단계 검색 구조와 14편 학습 지도
№045 advanced-rag-architectures · 10

Advanced RAG 평가: RAGAS·ARES·RAGChecker (10/10)

Graph·multi-hop·multimodal·long-context·agentic RAG를 retrieval, claim support, trajectory, cost로 분해하고 RAGAS·ARES·RAGChecker 기반 재현 가능한 실험을 설계합니다.

#RAG #RAGEvaluation #RAGAS #ARES
RAG를 retrieval, context, claim generation, trajectory, operations 층으로 나누고 deterministic·human·model judge와 실험 manifest로 release를 판정하는 평가 구조
№043 rag-agent-harness-foundations · 10

Production RAG Agent Harness: Trajectory 평가와 Release Gate (10/10)

State·tool·router·evidence·memory·durable runtime·trace·security를 production harness로 통합하고 final state와 trajectory의 품질·비용·보안 gate로 안전하게 릴리스합니다.

#Agent #AgentHarness #Evaluation #Trajectory
RAG Agent 실행 모듈을 typed state·policy로 감싸고 durable runtime·trace·trajectory evaluation·release gate로 검증하는 production harness 구조
№042 rag-retrieval-foundations · 10

Retrieval Evaluation: Recall@k·MRR·nDCG와 실패 분석 (10/10)

Source span 기반 gold dataset으로 Hit·Recall·Precision·MRR·nDCG를 계산하고, ingestion부터 answer까지 단계별 상한과 failure slice·bootstrap·version manifest로 검색 실험을 재현합니다.

#RAG #RAGEvaluation #Retrieval #MRR
질문과 source span gold evidence가 ingestion, retrieval, ANN, fusion, rerank, context, answer 단계 metric과 failure slice로 연결되는 RAG 평가 harness
№040 advanced-rag-architectures · 09

Learned Retrieval Policy: Self-RAG·FLARE·RouteRAG (9/10)

검색 여부·시점·source·query·종료를 하나의 policy로 모델링하고 Self-RAG, FLARE, Adaptive-RAG부터 2026 RouteRAG·Reflective RAG까지 단계적으로 비교합니다.

#RAG #AgenticRAG #SelfRAG #FLARE
Query와 evidence state에서 no retrieval, text·graph search, rewrite, verify, answer를 고르고 observation과 reward로 학습하는 RAG policy loop
№039 llm-rag-foundations · 09

LLM 추론 입문: Prefill·Decode·KV Cache·Temperature 이해하기 (9/10)

프롬프트가 token이 된 뒤 prefill과 autoregressive decode를 거치는 과정을 설명하고, KV cache·TTFT·token latency·temperature·top-p가 RAG의 context 비용과 답변 안정성에 미치는 영향을 정리합니다.

#LLMInference #KVCache #Prefill #Decoding
긴 프롬프트를 병렬 처리하는 prefill과 KV cache를 재사용해 한 token씩 생성하는 decode 단계
№038 rag-retrieval-foundations · 09

Context Selection: MMR·Dedup·Parent-Child·순서 최적화 (9/10)

검색·reranking 후보를 prompt에 그대로 넣지 않고, token budget 안에서 span 중복을 제거하고 MMR로 관련성과 다양성을 조절하며 parent 문맥·subquery coverage·모순 근거·인용 좌표를 보존하는 context selector를 구현합니다.

#RAG #ContextSelection #MMR #ContextWindow
Reranked 후보에서 중복 span을 제거하고 MMR과 coverage로 다양한 child를 선택한 뒤 parent 문맥과 citation을 token budget에 맞춰 배치하는 흐름
№036 advanced-rag-architectures · 08

Reranker·Generator 학습: RankT5·RA-DIT (8/10)

실제 retrieval candidate로 monoT5·RankT5 reranker를 학습하고, noisy·contradictory·no-answer context에서 근거 있는 답을 생성하도록 RA-DIT식 dual tuning을 설계합니다.

#RAG #Reranking #RankT5 #RADIT
Dense retriever 후보를 RankT5 reranker가 정렬하고 source가 연결된 context로 generator를 학습하며 LM feedback으로 retriever까지 조정하는 dual tuning 흐름
№034 rag-retrieval-foundations · 08

Query Transformation: Rewrite·Expansion·HyDE·Decomposition (8/10)

짧고 모호한 질문을 rewrite, expansion, multi-query, HyDE, decomposition으로 변환하되 코드·날짜·부정·권한을 보존하고, query drift·후보 recall·latency·비용으로 효과를 검증하는 방법을 배웁니다.

#RAG #QueryTransformation #HyDE #QueryExpansion
원 질문이 standalone rewrite, keyword expansion, multi-query, HyDE hypothetical document, decomposition 경로로 분기되고 검색 결과가 합쳐지는 과정
№032 advanced-rag-architectures · 07

Dense Retriever 학습: Hard Negative·Synthetic Query (7/10)

Domain RAG의 dense retriever를 positive·in-batch·hard negative로 학습하고, ANCE mining과 GPL·InPars·Promptagator식 synthetic query를 안전하게 만드는 방법을 설명합니다.

#RAG #DenseRetrieval #HardNegative #ContrastiveLearning
문서에서 synthetic query와 positive pair를 만들고 BM25·ANN·teacher로 hard negative를 채굴해 bi-encoder를 학습·평가·재색인하는 retriever flywheel
№031 rag-retrieval-foundations · 07

Reranking: Cross-Encoder·monoT5·ColBERT의 역할 (7/10)

Hybrid 후보를 query와 함께 읽는 Cross-Encoder·monoT5·ColBERT의 구조와 비용을 비교하고, candidate recall·batching·truncation·nDCG·latency를 측정하는 reranking pipeline을 구현합니다.

#RAG #Reranking #CrossEncoder #ColBERT
Bi-Encoder 후보 생성 뒤 Cross-Encoder joint attention, monoT5 relevance token, ColBERT MaxSim으로 후보를 재정렬하는 비교
№029 advanced-rag-architectures · 06

Long Context vs RAG: 언제 무엇을 쓸까? (6/10)

큰 context window가 있어도 retrieval이 필요한 이유를 attention·비용·신선도·권한으로 나누고, Long Context·RAG·Hybrid를 query별로 선택하는 라우터를 설계합니다.

#RAG #LongContext #ContextWindow #QueryRouting
질문의 corpus 범위, freshness, ACL, citation, cost 조건에 따라 Long Context, RAG, retrieve-then-read hybrid로 분기하는 의사결정 흐름
№028 rag-agent-harness-foundations · 06

Agent Memory 설계: Working·Episodic·Semantic·Procedural (6/10)

Agent state·context·memory·corpus를 구분하고 working·episodic·semantic·procedural memory의 write·retrieve·update·forget lifecycle을 provenance·유효 기간·ACL·민감도로 설계합니다.

#Agent #Memory #RAG #MemGPT
현재 run의 working state, 과거 사건의 episodic memory, 검증된 사실의 semantic memory, versioned procedure를 분리하고 쓰기·검색·통합·갱신·망각하는 Agent memory architecture
№027 rag-retrieval-foundations · 06

Hybrid Search: BM25와 Vector 검색을 RRF로 합치기 (6/10)

Exact term에 강한 BM25와 paraphrase에 강한 dense 후보를 stable chunk ID로 합치고, raw score 대신 RRF와 calibrated score fusion을 사용해 순위를 만드는 Python 구현·평가·운영 방법을 배웁니다.

#RAG #HybridSearch #BM25 #DenseRetrieval
BM25 sparse 순위와 dense vector 순위가 서로 다른 후보를 만든 뒤 stable ID로 합쳐 RRF 점수로 최종 순위를 만드는 hybrid search
№025 advanced-rag-architectures · 05

Multimodal Document RAG: ColPali·VisRAG (5/10)

PDF의 텍스트·표·차트·레이아웃을 보존하기 위해 OCR과 layout parsing, ColPali late interaction, VisRAG visual retrieval을 비교하고 hybrid 문서 RAG를 설계합니다.

#RAG #MultimodalRAG #ColPali #VisRAG
PDF 페이지를 OCR과 layout element로 변환하는 text lane, page image를 patch vector로 검색하는 visual lane, 두 결과를 합치는 multimodal RAG
№023 rag-agent-harness-foundations · 05

근거 충분성 판정: Self-RAG·CRAG·FLARE로 재검색하기 (5/10)

질문을 evidence requirement로 분해하고 relevance·coverage·support·contradiction·freshness를 판정해 Self-RAG·CRAG·FLARE식 재검색·확인 질문·안전 종료를 bounded loop로 구현합니다.

#RAG #SelfRAG #CRAG #Evidence
질문의 evidence requirement와 source span ledger를 비교해 충분, 부분 충족, 무관, 모순, 오래됨으로 판정하고 query rewrite·다른 source·확인 질문·안전 종료로 교정하는 RAG loop
№022 rag-retrieval-foundations · 05

ANN Vector Index: Flat·HNSW·IVF·PQ 선택법 (5/10)

Exact kNN을 기준으로 HNSW graph, IVF cluster, PQ 압축 원리를 이해하고, ANN Recall@k·p95 latency·memory·build/update 비용을 함께 측정해 corpus와 운영 조건에 맞는 vector index를 선택합니다.

#RAG #VectorSearch #ANN #HNSW
동일한 vector 공간을 Flat 전수 비교, HNSW graph 탐색, IVF cluster 탐색, PQ 압축 code로 검색하는 ANN index 비교
№020 advanced-rag-architectures · 04

Hierarchical RAG: Parent-Child·RAPTOR·HippoRAG (4/10)

작은 chunk의 검색 정밀도와 큰 문맥의 이해를 함께 얻는 parent-child retrieval부터 RAPTOR 요약 트리, HippoRAG 연상 그래프까지 계층형 RAG를 비교 설계합니다.

#RAG #RAPTOR #HippoRAG #KnowledgeGraph
Flat chunk, parent-child 문서 계층, RAPTOR 요약 트리, HippoRAG 연상 그래프의 검색 단위와 정보 흐름을 비교한 표지
№019 rag-retrieval-foundations · 04

Dense Retrieval 기초: Bi-Encoder·Contrastive Learning·DPR (4/10)

Bi-Encoder의 query·passage 분리 encoding과 contrastive loss·negative 학습을 이해하고, prefix·pooling·normalization 계약을 지킨 exact search로 dense retrieval을 구현·평가합니다.

#RAG #DenseRetrieval #BiEncoder #DPR
Query encoder와 passage encoder가 vector를 만들고 positive는 가깝게 negative는 멀게 학습한 뒤 dot product로 검색하는 dense retrieval
№017 advanced-rag-architectures · 03

Multi-hop RAG: Retrieve↔Reason Loop와 Evidence Chain (3/10)

한 번의 검색으로 풀 수 없는 bridge·comparison·constraint 질문을 subgoal과 unresolved slot으로 분해하고 retrieval observation으로 다음 query를 만드는 multi-hop RAG를 설계합니다.

#RAG #MultiHop #IRCoT #Reasoning
복합 질문을 subgoal로 분해하고 검색 결과의 bridge entity로 다음 query를 만든 뒤 출처가 연결된 evidence chain으로 답을 검증하는 multi-hop RAG loop
№015 rag-agent-harness-foundations · 03

Query Router와 Adaptive RAG: 질문마다 다른 검색 경로 (3/10)

질문의 지식 필요성·신선도·식별자·복잡도·모호성·위험도를 판별해 no retrieval, direct lookup, single·iterative search, clarification을 선택하고 routing regret로 검증하는 RAG router를 설계합니다.

#RAG #QueryRouting #AdaptiveRAG #Agent
질문 분석 결과에 따라 검색 없음, 정확 조회, 단일 검색, 반복 검색, 사용자 확인 경로로 분기하고 confidence와 예산 gate가 경로를 통제하는 Adaptive RAG router
№014 rag-retrieval-foundations · 03

Sparse Retrieval 기초: 역색인·TF-IDF·BM25 직접 계산하기 (3/10)

역색인이 query term의 후보 문서를 찾는 구조부터 TF·IDF·문서 길이 정규화가 BM25 점수로 결합되는 과정을 수치로 계산하고, 한글 분석기·희귀 코드 보존·field 설계·Python baseline으로 sparse retrieval을 구현합니다.

#RAG #Retrieval #BM25 #SparseRetrieval
질문 token이 역색인의 posting list를 찾아 TF, IDF, 문서 길이 정규화를 거쳐 BM25 순위를 만드는 과정
№012 advanced-rag-architectures · 02

Microsoft GraphRAG 해부: Local·Global·DRIFT Search (2/10)

Microsoft GraphRAG의 TextUnit·entity·relationship·Leiden community·community report indexing을 따라가고 local·global·DRIFT search의 질문 유형·비용·평가 기준을 구분합니다.

#RAG #GraphRAG #KnowledgeGraph #Microsoft
TextUnit에서 entity·relation을 추출해 Leiden community report를 만들고 entity 중심 local, corpus 중심 global, 반복 탐색 DRIFT로 routing하는 Microsoft GraphRAG 구조
№011 llm-rag-foundations · 02

LLM 토큰화 입문: BPE부터 Context Window 계산까지 (2/10)

LLM이 문자열을 직접 읽지 않고 토큰 ID로 바꾸는 이유를 문자·단어·subword 관점에서 설명하고, BPE·SentencePiece·특수 토큰·한국어 비용·RAG chunk 예산을 실습으로 연결합니다.

#LLM #Tokenization #BPE #ContextWindow
한국어 질문이 subword 토큰과 토큰 ID를 거쳐 context window에 들어가는 과정
№010 rag-retrieval-foundations · 02

RAG Chunking: 크기·Overlap·Semantic·Late Chunking 선택법 (2/10)

고정 길이·overlap·문서 구조·semantic·late chunking의 원리와 비용을 비교하고, tokenizer 기반 구현·parent-child 연결·평가 grid를 통해 자신의 문서와 질문에 맞는 chunk 경계와 크기를 선택하는 방법을 배웁니다.

#RAG #Chunking #Retrieval #Embedding
하나의 문서를 fixed token, structure-aware, semantic, late chunking으로 나누고 검색용 child와 답변용 parent를 연결하는 비교
№008 advanced-rag-architectures · 01

Knowledge Graph RAG 기초: Entity·Relation·Path (1/10)

Vector 유사도 검색과 Knowledge Graph의 차이를 이해하고 entity·relation·claim·provenance·entity resolution·graph traversal을 설계해 관계형 질문에 답하는 RAG를 만듭니다.

#RAG #KnowledgeGraph #GraphRAG #Retrieval
문서 chunk에서 entity, relation, claim과 provenance를 추출해 graph와 vector index를 함께 만들고 query entity에서 관련 path와 원문 근거를 검색하는 Knowledge Graph RAG 구조
№006 rag-agent-harness-foundations · 01

RAG Agent는 무엇인가: Workflow에서 상태 기반 제어 루프로 (1/10)

고정 RAG pipeline을 observe·decide·act·evaluate 상태 루프로 바꾸고, LLM과 deterministic harness의 책임을 분리해 종료 조건·예산·불변식·실패 상태를 가진 첫 RAG Agent를 Python으로 구현합니다.

#RAG #Agent #AgentHarness #StateMachine
사용자 목표가 상태 저장소, LLM 행동 제안, 정책 게이트, 도구 실행, 관찰과 근거 판정을 순환한 뒤 답변 또는 실패로 끝나는 RAG Agent Harness
№005 rag-retrieval-foundations · 01

RAG 문서 수집: PDF·HTML을 검색 가능한 데이터로 바꾸기 (1/10)

PDF·HTML·스캔 문서를 수집해 layout과 표, 페이지, 권한, 출처 metadata를 보존하는 ingestion pipeline을 설계하고, stable ID·parser version·품질 gate로 검색 이전의 데이터 오류를 추적하는 방법을 배웁니다.

#RAG #DocumentParsing #PDF #Ingestion
원문 snapshot이 layout parsing과 OCR, 정규화, 품질 gate, versioned document store로 변환되는 RAG ingestion 흐름
№001 rag-techniques · 01

RAPTOR — 재귀 요약 트리로 긴 문맥을 검색하는 RAG 기법

RAPTOR는 문서를 재귀적으로 클러스터링·요약해 추상화 레벨이 다른 트리를 쌓는 RAG 인덱싱 기법입니다. GMM+UMAP 클러스터링부터 collapsed tree 검색까지 코드와 함께 정리합니다.

#RAG #Retrieval #RAPTOR #LangChain
rag-techniques 시리즈 1편 — RAPTOR 재귀 요약 트리 기반 Retrieval