LLM은 Wiki 문서를 어떻게 찾는가: 검색 개선과 효율적인 구축법
LLM이 위키 전체를 읽지 않고 필요한 문서를 찾는 과정을 FTS·임베딩·RRF·중복 제거·재정렬로 설명하고, 증분 인덱싱과 평가를 갖춘 효율적인 LLM Wiki 구축 순서를 실제 구현 사례로 정리합니다.
Tag index
LLM이 위키 전체를 읽지 않고 필요한 문서를 찾는 과정을 FTS·임베딩·RRF·중복 제거·재정렬로 설명하고, 증분 인덱싱과 평가를 갖춘 효율적인 LLM Wiki 구축 순서를 실제 구현 사례로 정리합니다.
Single-vector bi-encoder와 full Cross-Encoder 사이에서 document token vector를 보존하는 ColBERT의 MaxSim을 계산합니다. ColBERTv2 compression·PLAID 검색과 reranker로 배치하는 기준까지 설명합니다.
Retriever와 reranker의 역할을 분리하고 candidate recall 상한, scoring·interaction·학습 방식의 분류축을 세웁니다. 14편 학습 순서와 도입 전후의 실험 기준까지 정리합니다.
문서 수집과 chunking부터 embedding·cosine retrieval·context 조립·근거 기반 생성·Recall@k 평가까지 최소 RAG를 Python으로 연결하고, 실패를 검색과 생성 단계로 분리해 추적합니다.
Source span 기반 gold dataset으로 Hit·Recall·Precision·MRR·nDCG를 계산하고, ingestion부터 answer까지 단계별 상한과 failure slice·bootstrap·version manifest로 검색 실험을 재현합니다.
검색·reranking 후보를 prompt에 그대로 넣지 않고, token budget 안에서 span 중복을 제거하고 MMR로 관련성과 다양성을 조절하며 parent 문맥·subquery coverage·모순 근거·인용 좌표를 보존하는 context selector를 구현합니다.
짧고 모호한 질문을 rewrite, expansion, multi-query, HyDE, decomposition으로 변환하되 코드·날짜·부정·권한을 보존하고, query drift·후보 recall·latency·비용으로 효과를 검증하는 방법을 배웁니다.
Python RAG Agent의 검색 계층을 typed port로 격리합니다. ACL·tenant filter, source span, 전체 deadline 전파, HTTPX timeout과 빈 결과·장애 분리를 구현합니다.
스칼라·벡터·행렬의 차이부터 one-hot과 dense embedding, dot product·cosine similarity·정규화까지 작은 숫자로 계산하고, query와 문서가 검색되는 원리를 RAG 코드로 연결합니다.
질문의 지식 필요성·신선도·식별자·복잡도·모호성·위험도를 판별해 no retrieval, direct lookup, single·iterative search, clarification을 선택하고 routing regret로 검증하는 RAG router를 설계합니다.
역색인이 query term의 후보 문서를 찾는 구조부터 TF·IDF·문서 길이 정규화가 BM25 점수로 결합되는 과정을 수치로 계산하고, 한글 분석기·희귀 코드 보존·field 설계·Python baseline으로 sparse retrieval을 구현합니다.
고정 길이·overlap·문서 구조·semantic·late chunking의 원리와 비용을 비교하고, tokenizer 기반 구현·parent-child 연결·평가 grid를 통해 자신의 문서와 질문에 맞는 chunk 경계와 크기를 선택하는 방법을 배웁니다.
Vector 유사도 검색과 Knowledge Graph의 차이를 이해하고 entity·relation·claim·provenance·entity resolution·graph traversal을 설계해 관계형 질문에 답하는 RAG를 만듭니다.
ColBERT Late Interaction은 문서를 토큰별 embedding으로 저장하고 MaxSim으로 질문 단서를 찾습니다. 일반 dense retrieval과 계산 비용 차이를 RAG 관점에서 정리합니다.
도메인 RAG 검색이 hard coding 개선 뒤에도 막혔을 때, SPLADE 학습 전에 dense·sparse·fusion·rerank stage trace로 실패 원인을 분리한 기록입니다.
RAPTOR는 문서를 재귀적으로 클러스터링·요약해 추상화 레벨이 다른 트리를 쌓는 RAG 인덱싱 기법입니다. GMM+UMAP 클러스터링부터 collapsed tree 검색까지 코드와 함께 정리합니다.