LLM은 Wiki 문서를 어떻게 찾는가: 검색 개선과 효율적인 구축법
LLM이 위키 전체를 읽지 않고 필요한 문서를 찾는 과정을 FTS·임베딩·RRF·중복 제거·재정렬로 설명하고, 증분 인덱싱과 평가를 갖춘 효율적인 LLM Wiki 구축 순서를 실제 구현 사례로 정리합니다.
Tag index
LLM이 위키 전체를 읽지 않고 필요한 문서를 찾는 과정을 FTS·임베딩·RRF·중복 제거·재정렬로 설명하고, 증분 인덱싱과 평가를 갖춘 효율적인 LLM Wiki 구축 순서를 실제 구현 사례로 정리합니다.
LLM Wiki와 RAG의 차이를 query-time 검색 기술과 build-time 지식 수명주기로 나눕니다. Vector RAG·GraphRAG·Wiki가 한 시스템에서 결합되는 구조와 선택 기준을 설명합니다.
LLM Wiki의 뜻을 지속 가능한 지식 산출물이라는 기준으로 정의합니다. 전통 위키·AI 챗봇·RAG·DeepWiki를 구분하고 출처·구조·검수·갱신·재사용의 판별 기준을 제시합니다.
Frozen corpus·qrel에서 contrastive 학습과 hard-negative 정제, exact·통계 평가, dimension·quantization·ANN, RAG gate·shadow index까지 재현 가능한 실험을 완성합니다.
Frozen candidate set에서 Cross-Encoder baseline을 학습하고 paired 평가, latency·security gate, cascade, release manifest와 rollback까지 잇는 reranking 실전 설계입니다.
LLM backbone과 합성 데이터·증류, 소형·가변 차원, 문맥·추론, 멀티모달·multi-vector, 평가·privacy를 축으로 2024–2026 embedding 연구를 비판적으로 읽습니다.
Reasoning·test-time compute, contextual listwise ranking, RAG utility 학습, 효율화, 불확실성, 멀티모달과 공격 내성을 중심으로 2024–2026 reranker 연구를 비판적으로 읽습니다.
문서 관련성과 답변 기여도를 구분하고 multi-hop evidence selection, 중복 제거, 정보 이득 학습, prompt injection 방어와 시각 문서 reranking을 설계합니다.
2026년 7월 기준 BGE·Qwen3·Jina와 Cohere·Voyage 계열을 구조와 배포 조건으로 분류합니다. 한국어·code-switch·긴 문서용 in-domain bake-off, license·보안·비용 판단표를 만듭니다.
고정 candidate에서 reranker 효과를 분리하고 Recall ceiling, MRR·MAP·nDCG, paired confidence interval을 계산합니다. BEIR·BRIGHT·AIR-Bench의 역할과 latency·비용·최종 RAG 평가까지 설계합니다.
Production 후보 분포에서 graded positive와 hard negative를 만들고 false negative를 거르는 법을 익힙니다. Hybrid mining, 합성 label, split leakage와 dataset versioning도 다룹니다.
Single-vector bi-encoder와 full Cross-Encoder 사이에서 document token vector를 보존하는 ColBERT의 MaxSim을 계산합니다. ColBERTv2 compression·PLAID 검색과 reranker로 배치하는 기준까지 설명합니다.
Query와 document를 한 Transformer에 넣는 Cross-Encoder의 joint attention과 score를 이해하고, batching·truncation·긴 문서 windowing 및 재현 가능한 baseline을 구현합니다.
Token·문장·문서 embedding과 dense·sparse·multi-vector 표현을 구분하고, 학습·평가·검색·서빙으로 이어지는 14편 연구 로드맵과 첫 baseline을 세웁니다.
Retriever와 reranker의 역할을 분리하고 candidate recall 상한, scoring·interaction·학습 방식의 분류축을 세웁니다. 14편 학습 순서와 도입 전후의 실험 기준까지 정리합니다.
Enterprise RAG knowledge base를 immutable release manifest로 빌드합니다. Data·ACL·retrieval·latency gate와 shadow·canary, atomic activation, rollback runbook을 연결합니다.
Graph·multi-hop·multimodal·long-context·agentic RAG를 retrieval, claim support, trajectory, cost로 분해하고 RAGAS·ARES·RAGChecker 기반 재현 가능한 실험을 설계합니다.
문서 수집과 chunking부터 embedding·cosine retrieval·context 조립·근거 기반 생성·Recall@k 평가까지 최소 RAG를 Python으로 연결하고, 실패를 검색과 생성 단계로 분리해 추적합니다.
State·tool·router·evidence·memory·durable runtime·trace·security를 production harness로 통합하고 final state와 trajectory의 품질·비용·보안 gate로 안전하게 릴리스합니다.
Source span 기반 gold dataset으로 Hit·Recall·Precision·MRR·nDCG를 계산하고, ingestion부터 answer까지 단계별 상한과 failure slice·bootstrap·version manifest로 검색 실험을 재현합니다.
RAG 삭제 요청을 source·raw·chunk·embedding·index·cache·trace·snapshot에 전파합니다. Tombstone, legal hold, retention, restore 방지와 deletion receipt로 완료를 검증합니다.
검색 여부·시점·source·query·종료를 하나의 policy로 모델링하고 Self-RAG, FLARE, Adaptive-RAG부터 2026 RouteRAG·Reflective RAG까지 단계적으로 비교합니다.
프롬프트가 token이 된 뒤 prefill과 autoregressive decode를 거치는 과정을 설명하고, KV cache·TTFT·token latency·temperature·top-p가 RAG의 context 비용과 답변 안정성에 미치는 영향을 정리합니다.
검색·reranking 후보를 prompt에 그대로 넣지 않고, token budget 안에서 span 중복을 제거하고 MMR로 관련성과 다양성을 조절하며 parent 문맥·subquery coverage·모순 근거·인용 좌표를 보존하는 context selector를 구현합니다.
RAG ingestion의 completeness·validity·ACL·freshness를 lineage와 quality assertion으로 추적합니다. Parser·metadata·embedding·retrieval drift를 metric·trace·probe로 감지합니다.
실제 retrieval candidate로 monoT5·RankT5 reranker를 학습하고, noisy·contradictory·no-answer context에서 근거 있는 답을 생성하도록 RA-DIT식 dual tuning을 설계합니다.
BERT의 양방향 encoder와 GPT의 causal decoder를 attention mask·학습 목표·입출력 관점에서 비교하고, bi-encoder 검색·cross-encoder reranking·LLM 생성에 각각 어떻게 쓰이는지 설명합니다.
짧고 모호한 질문을 rewrite, expansion, multi-query, HyDE, decomposition으로 변환하되 코드·날짜·부정·권한을 보존하고, query drift·후보 recall·latency·비용으로 효과를 검증하는 방법을 배웁니다.
RAG embedding model·dimension·chunking·index 설정을 새 generation으로 이전합니다. Snapshot backfill, dual write, shadow read, atomic alias cutover와 rollback을 검증합니다.
Domain RAG의 dense retriever를 positive·in-batch·hard negative로 학습하고, ANCE mining과 GPL·InPars·Promptagator식 synthetic query를 안전하게 만드는 방법을 설명합니다.
Hybrid 후보를 query와 함께 읽는 Cross-Encoder·monoT5·ColBERT의 구조와 비용을 비교하고, candidate recall·batching·truncation·nDCG·latency를 측정하는 reranking pipeline을 구현합니다.
RAG freshness를 event·observed·processed·indexed·active time으로 측정합니다. CDC, watermark, tombstone과 bitemporal metadata로 최신·시점 검색과 권한 회수를 안전하게 운영합니다.
큰 context window가 있어도 retrieval이 필요한 이유를 attention·비용·신선도·권한으로 나누고, Long Context·RAG·Hybrid를 query별로 선택하는 라우터를 설계합니다.
Agent state·context·memory·corpus를 구분하고 working·episodic·semantic·procedural memory의 write·retrieve·update·forget lifecycle을 provenance·유효 기간·ACL·민감도로 설계합니다.
Exact term에 강한 BM25와 paraphrase에 강한 dense 후보를 stable chunk ID로 합치고, raw score 대신 RRF와 calibrated score fusion을 사용해 순위를 만드는 Python 구현·평가·운영 방법을 배웁니다.
Enterprise RAG에서 tenant 경계와 document·chunk ACL을 설계합니다. Filtered ANN, 권한 회수 SLO, cache·reranker·citation까지 이어지는 authorization invariant를 구현합니다.
PDF의 텍스트·표·차트·레이아웃을 보존하기 위해 OCR과 layout parsing, ColPali late interaction, VisRAG visual retrieval을 비교하고 hybrid 문서 RAG를 설계합니다.
n-gram에서 neural language model과 autoregressive LLM으로 이어지는 핵심을 조건부확률·teacher forcing·causal mask·생성 루프로 설명하고, hallucination과 RAG가 필요한 이유까지 연결합니다.
질문을 evidence requirement로 분해하고 relevance·coverage·support·contradiction·freshness를 판정해 Self-RAG·CRAG·FLARE식 재검색·확인 질문·안전 종료를 bounded loop로 구현합니다.
Exact kNN을 기준으로 HNSW graph, IVF cluster, PQ 압축 원리를 이해하고, ANN Recall@k·p95 latency·memory·build/update 비용을 함께 측정해 corpus와 운영 조건에 맞는 vector index를 선택합니다.
RAG metadata를 typed field와 controlled vocabulary로 설계합니다. SKOS concept ID와 entity resolution으로 자유 문자열을 정규화하고 provenance가 있는 검색 projection을 구축합니다.
작은 chunk의 검색 정밀도와 큰 문맥의 이해를 함께 얻는 parent-child retrieval부터 RAPTOR 요약 트리, HippoRAG 연상 그래프까지 계층형 RAG를 비교 설계합니다.
Bi-Encoder의 query·passage 분리 encoding과 contrastive loss·negative 학습을 이해하고, prefix·pooling·normalization 계약을 지킨 exact search로 dense retrieval을 구현·평가합니다.
RAG 문서의 경로, source object, version, parser representation, chunk ID를 분리합니다. SHA-256·MinHash로 중복 후보를 찾고 stable span과 tombstone으로 멱등 upsert·삭제를 설계합니다.
한 번의 검색으로 풀 수 없는 bridge·comparison·constraint 질문을 subgoal과 unresolved slot으로 분해하고 retrieval observation으로 다음 query를 만드는 multi-hop RAG를 설계합니다.
스칼라·벡터·행렬의 차이부터 one-hot과 dense embedding, dot product·cosine similarity·정규화까지 작은 숫자로 계산하고, query와 문서가 검색되는 원리를 RAG 코드로 연결합니다.
질문의 지식 필요성·신선도·식별자·복잡도·모호성·위험도를 판별해 no retrieval, direct lookup, single·iterative search, clarification을 선택하고 routing regret로 검증하는 RAG router를 설계합니다.
역색인이 query term의 후보 문서를 찾는 구조부터 TF·IDF·문서 길이 정규화가 BM25 점수로 결합되는 과정을 수치로 계산하고, 한글 분석기·희귀 코드 보존·field 설계·Python baseline으로 sparse retrieval을 구현합니다.
PDF RAG 문서 파싱을 native text, selective OCR, layout, reading order, table structure로 분해합니다. canonical element와 page·bbox를 보존하고 평가셋으로 parser 품질을 검증하는 방법을 설명합니다.
Microsoft GraphRAG의 TextUnit·entity·relationship·Leiden community·community report indexing을 따라가고 local·global·DRIFT search의 질문 유형·비용·평가 기준을 구분합니다.
LLM이 문자열을 직접 읽지 않고 토큰 ID로 바꾸는 이유를 문자·단어·subword 관점에서 설명하고, BPE·SentencePiece·특수 토큰·한국어 비용·RAG chunk 예산을 실습으로 연결합니다.
고정 길이·overlap·문서 구조·semantic·late chunking의 원리와 비용을 비교하고, tokenizer 기반 구현·parent-child 연결·평가 grid를 통해 자신의 문서와 질문에 맞는 chunk 경계와 크기를 선택하는 방법을 배웁니다.
Enterprise RAG 지식 파이프라인을 원문 snapshot, canonical document, chunk, index generation으로 분리합니다. 변경·삭제·ACL을 멱등 처리하고 검증된 지식만 원자적으로 배포하는 수명주기를 설계합니다.
Vector 유사도 검색과 Knowledge Graph의 차이를 이해하고 entity·relation·claim·provenance·entity resolution·graph traversal을 설계해 관계형 질문에 답하는 RAG를 만듭니다.
RAG Agent를 만들기 전에 토큰·임베딩·Transformer·검색·생성·평가·하네스가 한 요청에서 어떻게 연결되는지 전체 지도를 세우고, 10편의 학습 순서와 실습 기준까지 정리합니다.
고정 RAG pipeline을 observe·decide·act·evaluate 상태 루프로 바꾸고, LLM과 deterministic harness의 책임을 분리해 종료 조건·예산·불변식·실패 상태를 가진 첫 RAG Agent를 Python으로 구현합니다.
PDF·HTML·스캔 문서를 수집해 layout과 표, 페이지, 권한, 출처 metadata를 보존하는 ingestion pipeline을 설계하고, stable ID·parser version·품질 gate로 검색 이전의 데이터 오류를 추적하는 방법을 배웁니다.
ColBERT Late Interaction은 문서를 토큰별 embedding으로 저장하고 MaxSim으로 질문 단서를 찾습니다. 일반 dense retrieval과 계산 비용 차이를 RAG 관점에서 정리합니다.
Harness-1의 auto-seeding과 evidence graph를 ColBERT, Cross-Encoder, Personalized PageRank로 확장하는 설계를 정리합니다. 각 모델의 역할과 리스크, 구현 순서를 함께 봅니다.
도메인 RAG 검색이 hard coding 개선 뒤에도 막혔을 때, SPLADE 학습 전에 dense·sparse·fusion·rerank stage trace로 실패 원인을 분리한 기록입니다.
RAPTOR는 문서를 재귀적으로 클러스터링·요약해 추상화 레벨이 다른 트리를 쌓는 RAG 인덱싱 기법입니다. GMM+UMAP 클러스터링부터 collapsed tree 검색까지 코드와 함께 정리합니다.