Tag index

#Evaluation

10 entries
№009 embedding-research-engineering · 14

실전: 재현 가능한 Embedding 연구 Pipeline 만들기 (14/14)

Frozen corpus·qrel에서 contrastive 학습과 hard-negative 정제, exact·통계 평가, dimension·quantization·ANN, RAG gate·shadow index까지 재현 가능한 실험을 완성합니다.

#Embeddings #MLOps #ContrastiveLearning #Evaluation
Corpus와 qrel 동결에서 embedding 대조 학습, exact 평가, 압축과 ANN, RAG 검증, shadow index 배포와 rollback으로 이어지는 실전 pipeline
№007 embedding-research-engineering · 11

Embedding Benchmark 읽는 법: MTEB부터 오염까지 (11/14)

MTEB·MMTEB·BEIR·MIRACL·BRIGHT·AIR-Bench·LongEmbed·ConTEB의 평가 범위를 비교하고, 집계 점수·데이터 오염·버전·재현성 함정을 피하는 benchmark card를 만듭니다.

#Embeddings #Benchmarking #Evaluation #DataContamination
MTEB와 다국어, zero-shot, reasoning, long-context benchmark를 목적별로 나누고 공개 점수에서 in-domain 평가로 좁혀 가는 구조
№006 embedding-research-engineering · 10

Embedding 평가 방법: Metric·Protocol·통계 (10/14)

STS·분류·clustering·bitext·retrieval metric을 구분하고 qrel·exact search·ANN recall·paired bootstrap·slice·RAG utility까지 포함한 재현 가능한 embedding 평가법을 설계합니다.

#Embeddings #Evaluation #Metrics #Benchmarking
하나의 embedding model을 STS, 분류, clustering, bitext, exact retrieval, ANN, RAG 단계에서 서로 다른 metric과 paired 통계로 평가하는 구조
№005 reranker-engineering · 09

Reranker 평가: Candidate Ceiling·nDCG·MRR·Latency·RAG 품질 (9/14)

고정 candidate에서 reranker 효과를 분리하고 Recall ceiling, MRR·MAP·nDCG, paired confidence interval을 계산합니다. BEIR·BRIGHT·AIR-Bench의 역할과 latency·비용·최종 RAG 평가까지 설계합니다.

#Reranking #Evaluation #NDCG #BEIR
고정 후보의 Recall 상한에서 MRR와 nDCG, p95 latency, 최종 답변 품질까지 단계별로 검증하는 reranker evaluation funnel
№004 embedding-research-engineering · 08

다국어·한국어 Embedding 학습과 평가 (8/14)

Monolingual·cross-lingual retrieval을 분리하고 언어 균형, parallel pair, tokenizer와 hard negative를 설계해 한국어·영어·혼합 질의에서 embedding 품질을 평가합니다.

#Embeddings #MultilingualNLP #KoreanNLP #CrossLingualRetrieval
한국어와 영어 query-document 조합이 공유 vector 공간에 정렬되고 언어별·방향별 retrieval matrix로 평가되는 multilingual embedding
№003 rag-agent-harness-foundations · 10

Production RAG Agent Harness: Trajectory 평가와 Release Gate (10/10)

State·tool·router·evidence·memory·durable runtime·trace·security를 production harness로 통합하고 final state와 trajectory의 품질·비용·보안 gate로 안전하게 릴리스합니다.

#Agent #AgentHarness #Evaluation #Trajectory
RAG Agent 실행 모듈을 typed state·policy로 감싸고 durable runtime·trace·trajectory evaluation·release gate로 검증하는 production harness 구조
№002 llm-reasoning-reliability-foundations · 01

Chain-of-Thought 입문: LLM 추론문과 실제 근거 구분하기 (1/10)

Chain-of-Thought가 중간 token으로 계산을 확장하는 원리를 익히고 정답성·설득력·충실성을 분리합니다. RAG Agent에서는 숨은 생각 대신 증거·도구 결과·검증 기록으로 추론을 감사하는 방법을 설계합니다.

#LLM #ChainOfThought #Reasoning #RAGAgent
질문에서 여러 중간 추론 token을 거쳐 답을 만들되 추론문과 인과적 증명을 구분하고 외부 증거와 도구로 검증하는 구조