Tag index

#RAGEvaluation

04 entries
№004 advanced-rag-architectures · 10

Advanced RAG 평가: RAGAS·ARES·RAGChecker (10/10)

Graph·multi-hop·multimodal·long-context·agentic RAG를 retrieval, claim support, trajectory, cost로 분해하고 RAGAS·ARES·RAGChecker 기반 재현 가능한 실험을 설계합니다.

#RAG #RAGEvaluation #RAGAS #ARES
RAG를 retrieval, context, claim generation, trajectory, operations 층으로 나누고 deterministic·human·model judge와 실험 manifest로 release를 판정하는 평가 구조
№002 rag-retrieval-foundations · 10

Retrieval Evaluation: Recall@k·MRR·nDCG와 실패 분석 (10/10)

Source span 기반 gold dataset으로 Hit·Recall·Precision·MRR·nDCG를 계산하고, ingestion부터 answer까지 단계별 상한과 failure slice·bootstrap·version manifest로 검색 실험을 재현합니다.

#RAG #RAGEvaluation #Retrieval #MRR
질문과 source span gold evidence가 ingestion, retrieval, ANN, fusion, rerank, context, answer 단계 metric과 failure slice로 연결되는 RAG 평가 harness
№001 llm-reasoning-reliability-foundations · 05

LLM Hallucination과 Factuality: Claim·Evidence·Citation 평가 (5/10)

LLM 답을 atomic claim으로 분해해 근거 지지·모순·부족으로 판정합니다. FActScore·SAFE·ALCE 관점의 factuality와 citation 정확성·coverage, RAG 오류 귀속을 설계합니다.

#LLM #Hallucination #Factuality #Grounding
LLM 장문 답변을 atomic claim으로 분해하고 각 claim을 evidence span과 대조해 지원 모순 근거 부족으로 판정하며 citation 정확성과 coverage를 계산하는 구조