Tag index

#ReinforcementLearning

03 entries
№003 advanced-rag-architectures · 09

Learned Retrieval Policy: Self-RAG·FLARE·RouteRAG (9/10)

검색 여부·시점·source·query·종료를 하나의 policy로 모델링하고 Self-RAG, FLARE, Adaptive-RAG부터 2026 RouteRAG·Reflective RAG까지 단계적으로 비교합니다.

#RAG #AgenticRAG #SelfRAG #FLARE
Query와 evidence state에서 no retrieval, text·graph search, rewrite, verify, answer를 고르고 observation과 reward로 학습하는 RAG policy loop
№002 llm-reasoning-reliability-foundations · 09

Agent Trajectory Learning: Long-Horizon Credit Assignment (9/10)

Agent의 state·observation·action 전체 trajectory를 offline imitation과 on-policy RL로 학습합니다. Outcome·step reward, credit assignment, replay와 episode 평가를 설계합니다.

#LLM #Agent #Trajectory #ReinforcementLearning
긴 Agent episode를 상태 관찰 행동 보상 전이로 기록하고 outcome과 step reward를 각 결정에 배분해 offline imitation과 on-policy 학습 및 replay 평가로 연결하는 구조
№001 llm-reasoning-reliability-foundations · 08

Tool-Use Learning: Function Calling SFT·Execution Reward 설계 (8/10)

도구 문서와 JSON Schema에서 function call 학습 데이터를 만들고 SFT·execution reward로 학습합니다. No-call·병렬·연속 호출, schema drift와 보안 평가를 설계합니다.

#LLM #ToolUse #FunctionCalling #ToolCalling
도구 registry와 schema에서 다양한 호출 과제를 만들고 구조 검증과 sandbox 실행 보상으로 LLM을 학습한 뒤 실제 실행 성공과 정책 위반을 평가하는 구조