№003 advanced-rag-architectures · 09
Learned Retrieval Policy: Self-RAG·FLARE·RouteRAG (9/10)
검색 여부·시점·source·query·종료를 하나의 policy로 모델링하고 Self-RAG, FLARE, Adaptive-RAG부터 2026 RouteRAG·Reflective RAG까지 단계적으로 비교합니다.
Tag index
검색 여부·시점·source·query·종료를 하나의 policy로 모델링하고 Self-RAG, FLARE, Adaptive-RAG부터 2026 RouteRAG·Reflective RAG까지 단계적으로 비교합니다.
Agent의 state·observation·action 전체 trajectory를 offline imitation과 on-policy RL로 학습합니다. Outcome·step reward, credit assignment, replay와 episode 평가를 설계합니다.
도구 문서와 JSON Schema에서 function call 학습 데이터를 만들고 SFT·execution reward로 학습합니다. No-call·병렬·연속 호출, schema drift와 보안 평가를 설계합니다.