Open Knowledge Format(OKF)란? AI 에이전트 지식을 Markdown으로 공유하는 법
Open Knowledge Format(OKF)는 흩어진 조직 지식을 Markdown과 YAML frontmatter로 묶어 사람과 AI 에이전트가 함께 읽고 옮기게 하는 공개 형식입니다. 구조, 장점, 한계와 시작법을 쉽게 설명합니다.
Knowledge pillar · active
Graph·멀티홉·멀티모달 RAG와 문서 수명주기, LLM Wiki, 지식 거버넌스를 함께 다룹니다.
Open Knowledge Format(OKF)는 흩어진 조직 지식을 Markdown과 YAML frontmatter로 묶어 사람과 AI 에이전트가 함께 읽고 옮기게 하는 공개 형식입니다. 구조, 장점, 한계와 시작법을 쉽게 설명합니다.
LLM이 위키 전체를 읽지 않고 필요한 문서를 찾는 과정을 FTS·임베딩·RRF·중복 제거·재정렬로 설명하고, 증분 인덱싱과 평가를 갖춘 효율적인 LLM Wiki 구축 순서를 실제 구현 사례로 정리합니다.
LLM Wiki의 뜻을 지속 가능한 지식 산출물이라는 기준으로 정의합니다. 전통 위키·AI 챗봇·RAG·DeepWiki를 구분하고 출처·구조·검수·갱신·재사용의 판별 기준을 제시합니다.
LLM Wiki가 주목받는 이유를 코드 온보딩 비용, 문서 노후화, AI 에이전트의 문맥 부족, 탐색과 질의의 결합으로 설명합니다. DeepWiki 공개 지표와 최신 연구의 한계도 함께 봅니다.
LLM Wiki를 코드베이스, 개인·연구, 조직 지식, 계약·그래프, 에이전트 메모리 다섯 유형으로 분류합니다. 입력·산출물·소비자·검수·보안 기준으로 내게 맞는 구조를 선택합니다.
LLM Wiki와 RAG의 차이를 query-time 검색 기술과 build-time 지식 수명주기로 나눕니다. Vector RAG·GraphRAG·Wiki가 한 시스템에서 결합되는 구조와 선택 기준을 설명합니다.
LLM Wiki 구현의 전반부를 Python 코드로 설계합니다. 원천 inventory·hash·정규화·계약·bounded context·structured output·evidence 검증을 거쳐 안전한 page proposal을 만듭니다.
LLM Wiki 구현의 후반부를 완성합니다. Proposal을 staging에 렌더링하고 evidence·schema·link·graph·secret·coverage를 검증한 뒤 사람 승인과 증분 갱신으로 운영합니다.
Microsoft GraphRAG의 TextUnit·entity·relationship·Leiden community·community report indexing을 따라가고 local·global·DRIFT search의 질문 유형·비용·평가 기준을 구분합니다.
Vector 유사도 검색과 Knowledge Graph의 차이를 이해하고 entity·relation·claim·provenance·entity resolution·graph traversal을 설계해 관계형 질문에 답하는 RAG를 만듭니다.
한 번의 검색으로 풀 수 없는 bridge·comparison·constraint 질문을 subgoal과 unresolved slot으로 분해하고 retrieval observation으로 다음 query를 만드는 multi-hop RAG를 설계합니다.
작은 chunk의 검색 정밀도와 큰 문맥의 이해를 함께 얻는 parent-child retrieval부터 RAPTOR 요약 트리, HippoRAG 연상 그래프까지 계층형 RAG를 비교 설계합니다.
PDF의 텍스트·표·차트·레이아웃을 보존하기 위해 OCR과 layout parsing, ColPali late interaction, VisRAG visual retrieval을 비교하고 hybrid 문서 RAG를 설계합니다.
큰 context window가 있어도 retrieval이 필요한 이유를 attention·비용·신선도·권한으로 나누고, Long Context·RAG·Hybrid를 query별로 선택하는 라우터를 설계합니다.
검색 여부·시점·source·query·종료를 하나의 policy로 모델링하고 Self-RAG, FLARE, Adaptive-RAG부터 2026 RouteRAG·Reflective RAG까지 단계적으로 비교합니다.
실제 retrieval candidate로 monoT5·RankT5 reranker를 학습하고, noisy·contradictory·no-answer context에서 근거 있는 답을 생성하도록 RA-DIT식 dual tuning을 설계합니다.
Domain RAG의 dense retriever를 positive·in-batch·hard negative로 학습하고, ANCE mining과 GPL·InPars·Promptagator식 synthetic query를 안전하게 만드는 방법을 설명합니다.
Graph·multi-hop·multimodal·long-context·agentic RAG를 retrieval, claim support, trajectory, cost로 분해하고 RAGAS·ARES·RAGChecker 기반 재현 가능한 실험을 설계합니다.
Enterprise RAG 지식 파이프라인을 원문 snapshot, canonical document, chunk, index generation으로 분리합니다. 변경·삭제·ACL을 멱등 처리하고 검증된 지식만 원자적으로 배포하는 수명주기를 설계합니다.
PDF RAG 문서 파싱을 native text, selective OCR, layout, reading order, table structure로 분해합니다. canonical element와 page·bbox를 보존하고 평가셋으로 parser 품질을 검증하는 방법을 설명합니다.
RAG metadata를 typed field와 controlled vocabulary로 설계합니다. SKOS concept ID와 entity resolution으로 자유 문자열을 정규화하고 provenance가 있는 검색 projection을 구축합니다.
Enterprise RAG에서 tenant 경계와 document·chunk ACL을 설계합니다. Filtered ANN, 권한 회수 SLO, cache·reranker·citation까지 이어지는 authorization invariant를 구현합니다.
RAG freshness를 event·observed·processed·indexed·active time으로 측정합니다. CDC, watermark, tombstone과 bitemporal metadata로 최신·시점 검색과 권한 회수를 안전하게 운영합니다.
RAG embedding model·dimension·chunking·index 설정을 새 generation으로 이전합니다. Snapshot backfill, dual write, shadow read, atomic alias cutover와 rollback을 검증합니다.
RAG ingestion의 completeness·validity·ACL·freshness를 lineage와 quality assertion으로 추적합니다. Parser·metadata·embedding·retrieval drift를 metric·trace·probe로 감지합니다.
RAG 삭제 요청을 source·raw·chunk·embedding·index·cache·trace·snapshot에 전파합니다. Tombstone, legal hold, retention, restore 방지와 deletion receipt로 완료를 검증합니다.
Enterprise RAG knowledge base를 immutable release manifest로 빌드합니다. Data·ACL·retrieval·latency gate와 shadow·canary, atomic activation, rollback runbook을 연결합니다.
RAG 문서의 경로, source object, version, parser representation, chunk ID를 분리합니다. SHA-256·MinHash로 중복 후보를 찾고 stable span과 tombstone으로 멱등 upsert·삭제를 설계합니다.
RAPTOR는 문서를 재귀적으로 클러스터링·요약해 추상화 레벨이 다른 트리를 쌓는 RAG 인덱싱 기법입니다. GMM+UMAP 클러스터링부터 collapsed tree 검색까지 코드와 함께 정리합니다.