글 지도
144 · field notesFallback index
목록으로 보기
LLM · RAG Agent 기초부터 만들기 · 10편
- RAG Agent 공부 순서: 토큰부터 Harness까지 한 장으로 보기 (1/10)
- LLM 토큰화 입문: BPE부터 Context Window 계산까지 (2/10)
- 벡터와 임베딩 입문: Cosine Similarity가 RAG 검색이 되는 원리 (3/10)
- 신경망 학습 입문: Logit·Softmax·Loss·Gradient 한 번에 연결하기 (4/10)
- 언어모델 입문: 다음 토큰 예측이 문장 생성이 되는 이유 (5/10)
- Self-Attention 입문: Q·K·V와 Scaled Dot-Product 손으로 계산하기 (6/10)
- Transformer 구조 입문: Attention·Residual·LayerNorm·FFN 조립하기 (7/10)
- BERT와 GPT 차이: Encoder·Decoder를 RAG 부품으로 이해하기 (8/10)
- LLM 추론 입문: Prefill·Decode·KV Cache·Temperature 이해하기 (9/10)
- 첫 RAG 만들기: Chunking·Embedding·검색·생성·평가 전체 연결 (10/10)
RAG 검색 계층 제대로 만들기 · 10편
- RAG 문서 수집: PDF·HTML을 검색 가능한 데이터로 바꾸기 (1/10)
- RAG Chunking: 크기·Overlap·Semantic·Late Chunking 선택법 (2/10)
- Sparse Retrieval 기초: 역색인·TF-IDF·BM25 직접 계산하기 (3/10)
- Dense Retrieval 기초: Bi-Encoder·Contrastive Learning·DPR (4/10)
- ANN Vector Index: Flat·HNSW·IVF·PQ 선택법 (5/10)
- Hybrid Search: BM25와 Vector 검색을 RRF로 합치기 (6/10)
- Reranking: Cross-Encoder·monoT5·ColBERT의 역할 (7/10)
- Query Transformation: Rewrite·Expansion·HyDE·Decomposition (8/10)
- Context Selection: MMR·Dedup·Parent-Child·순서 최적화 (9/10)
- Retrieval Evaluation: Recall@k·MRR·nDCG와 실패 분석 (10/10)
Reranker 엔지니어링 · 14편
- Reranker란 무엇인가: 두 단계 검색과 전체 지도 (1/14)
- Learning to Rank: Pointwise·Pairwise·Listwise와 LambdaMART (2/14)
- Cross-Encoder Reranker: Joint Attention부터 실전 추론까지 (3/14)
- monoT5·duoT5·RankT5·ListT5: 생성형 Reranker의 계보 (4/14)
- ColBERT Late Interaction: Multi-Vector 검색과 Reranking (5/14)
- LLM Reranker: Pointwise·Pairwise·Setwise·Listwise 설계 (6/14)
- Reranker 학습 데이터: Positive·Hard Negative·False Negative (7/14)
- Reranker 학습 심화: Ranking Loss·Distillation·Calibration (8/14)
- Reranker 평가: Candidate Ceiling·nDCG·MRR·Latency·RAG 품질 (9/14)
- Reranker 모델 선택: 한국어·도메인·Open Model·API 비교법 (10/14)
- Reranker Serving: Batching·Quantization·Adaptive Cascade (11/14)
- RAG에서의 Reranker: Utility·다양성·보안·멀티모달 (12/14)
- Reranker 최근 연구 동향: 2024–2026 논문 지도 (13/14)
- 실전: 재현 가능한 Production Reranking Pipeline 만들기 (14/14)
Embedding 연구와 엔지니어링 · 14편
- Embedding이란 무엇인가: 연구와 실전의 전체 지도 (1/14)
- Embedding Geometry: 유사도·정규화·Pooling·Hubness (2/14)
- Embedding 학습의 핵심: Contrastive Learning과 InfoNCE (3/14)
- Embedding 학습 데이터: Positive·Hard Negative·False Negative (4/14)
- Dense Retrieval 학습 계보: DPR에서 E5까지 (5/14)
- Instruction·Multitask·LLM Embedding은 무엇이 다른가 (6/14)
- Synthetic Data·Distillation로 Embedding을 도메인 적응하기 (7/14)
- 다국어·한국어 Embedding 학습과 평가 (8/14)
- 긴 문서 Embedding: Chunking·Contextual·Multi-vector (9/14)
- Embedding 평가 방법: Metric·Protocol·통계 (10/14)
- Embedding Benchmark 읽는 법: MTEB부터 오염까지 (11/14)
- Embedding 압축과 ANN 서빙: Dimension부터 Re-index까지 (12/14)
- Embedding 최근 연구 동향: 2024–2026 논문 지도 (13/14)
- 실전: 재현 가능한 Embedding 연구 Pipeline 만들기 (14/14)
RAG Agent · Harness 제대로 만들기 · 10편
- RAG Agent는 무엇인가: Workflow에서 상태 기반 제어 루프로 (1/10)
- Tool Calling 설계: JSON Schema와 안전한 실행 계약 (2/10)
- Query Router와 Adaptive RAG: 질문마다 다른 검색 경로 (3/10)
- Agent Planning 패턴: ReAct·Plan/Execute·ReWOO·Tree Search (4/10)
- 근거 충분성 판정: Self-RAG·CRAG·FLARE로 재검색하기 (5/10)
- Agent Memory 설계: Working·Episodic·Semantic·Procedural (6/10)
- Durable Agent Execution: Checkpoint·Retry·Idempotency (7/10)
- Agent Observability: Trace·Span·Event로 실패 재현하기 (8/10)
- RAG Agent 보안: Prompt Injection·Capability·실행 직전 승인 (9/10)
- Production RAG Agent Harness: Trajectory 평가와 Release Gate (10/10)
Advanced RAG 실전 설계 · 10편
- Knowledge Graph RAG 기초: Entity·Relation·Path (1/10)
- Microsoft GraphRAG 해부: Local·Global·DRIFT Search (2/10)
- Multi-hop RAG: Retrieve↔Reason Loop와 Evidence Chain (3/10)
- Hierarchical RAG: Parent-Child·RAPTOR·HippoRAG (4/10)
- Multimodal Document RAG: ColPali·VisRAG (5/10)
- Long Context vs RAG: 언제 무엇을 쓸까? (6/10)
- Dense Retriever 학습: Hard Negative·Synthetic Query (7/10)
- Reranker·Generator 학습: RankT5·RA-DIT (8/10)
- Learned Retrieval Policy: Self-RAG·FLARE·RouteRAG (9/10)
- Advanced RAG 평가: RAGAS·ARES·RAGChecker (10/10)
LLM 학습·구조·서빙 기초 · 10편
- LLM 사전학습 데이터 파이프라인: 수집·정제·중복 제거·혼합 (1/10)
- LLM 사전학습 목표와 Scaling Law: Token·Parameter·Compute 예산 (2/10)
- 현대 Decoder LLM 구조: RMSNorm·RoPE·GQA·SwiGLU·MoE (3/10)
- Instruction Tuning과 SFT: Chat Template·Loss Mask·데이터 품질 (4/10)
- Preference Optimization: RLHF·DPO·KTO·GRPO 제대로 구분하기 (5/10)
- LoRA·QLoRA·DoRA와 PEFT: Rank·Target Module·Merge 설계 (6/10)
- LLM Quantization: GPTQ·AWQ·SmoothQuant·FP8·KV Cache (7/10)
- 분산 LLM 학습: DDP·ZeRO·FSDP·TP·PP·CP (8/10)
- 효율적인 LLM 추론 서빙: Prefill·Decode·KV Cache (9/10)
- RAG Agent 모델 선택과 배포: 평가·Canary·Rollback (10/10)
LLM 추론·신뢰성·Agent 학습 · 10편
- Chain-of-Thought 입문: LLM 추론문과 실제 근거 구분하기 (1/10)
- Test-time Compute: Self-Consistency·Best-of-N·Search 설계 (2/10)
- Verifier와 Process Supervision: ORM·PRM·Value Model (3/10)
- LLM 불확실성과 Calibration: 모르면 멈추게 만들기 (4/10)
- LLM Hallucination과 Factuality: Claim·Evidence·Citation 평가 (5/10)
- Structured Generation: JSON Schema·FSM·CFG로 출력 강제하기 (6/10)
- Synthetic Data와 Distillation: Rejection Sampling·Model Collapse (7/10)
- Tool-Use Learning: Function Calling SFT·Execution Reward 설계 (8/10)
- Agent Trajectory Learning: Long-Horizon Credit Assignment (9/10)
- Model Routing과 Cascades: Compound AI System 설계 (10/10)
하네스 엔지니어링 · 8편
- 하네스 엔지니어링이란? AI 에이전트 환경 설계 7축 로드맵 (1/8)
- AI 에이전트 과업 분해 가이드 — 큰 작업을 4단계로 쪼개는 Plan 에이전트 패턴 (2/8)
- CLAUDE.md 작성 가이드 — AI 에이전트가 읽을 지식 3계층 (전역·프로젝트·로컬) (3/8)
- AI 에이전트 도구 설계 가이드 — Tool · Skill · Plugin · MCP 차이와 SKILL.md 작성법 (4/8)
- Claude Code 권한 설정 가이드 — allow / ask / deny와 permission mode 매트릭스 (5/8)
- AI 에이전트 메모리 패턴 — PROGRESS.md로 세션 핸드오프 만들기 (6/8)
- Claude Code Subagent 만들기 — code-reviewer · researcher 역할 분리 패턴 (7/8)
- AI 에이전트 검증 루프 설계 — 실패 로그 패턴과 Hooks 자동화 (8/8)
AI 에이전트 운영: Hermes·OpenClaw에서 자율 조직까지 · 7편
- Hermes Agent 사용법: 설치보다 먼저 첫 작업 계약을 만든다 (1/7)
- VPS에 Hermes Agent 구축하기: Gateway·격리·복구까지 (2/7)
- Hermes Agent 구축 후 최적화: Tool·Memory·Skill을 줄이는 순서 (3/7)
- OpenClaw 사용법: Gateway·Workspace·Channel을 이해하는 첫날 (4/7)
- OpenClaw 구축: Docker Gateway와 Slack을 안전하게 연결하기 (5/7)
- OpenClaw 구축 후 최적화: 20봇을 1 workflow로 줄인 기록 (6/7)
- AI 사용률 90%인데 출시는 빨라지지 않았다: Block의 Stage 5와 그 대가 (7/7)
개인 도메인 블로그 운영기 · 3편
[책리뷰]-개발함정을 탈출하라 · 2편
LLM 추론 시스템 엔지니어링 · 10편
- GPU Roofline으로 LLM 추론 병목 읽기: FLOPS·Bandwidth·Arithmetic Intensity (1/10)
- LLM 추론 메모리 계산: Weight·Activation·KV Cache·Workspace (2/10)
- Transformer 추론 커널: GEMM·Attention·FlashAttention·Fusion (3/10)
- Continuous Batching·Chunked Prefill: LLM Scheduler 설계 (4/10)
- Paged KV Cache·Prefix Caching: Block·Eviction·Reuse (5/10)
- Speculative Decoding: Draft·Verify·Acceptance와 Serving 설계 (6/10)
- 분산 LLM 추론: TP·PP·EP·Context Parallel·P/D 분리 (7/10)
- 저정밀 LLM 추론: FP8·INT8·INT4·FP4 Kernel과 Calibration (8/10)
- LLM Serving SLO 운영: Admission Control·Fairness·Autoscaling (9/10)
- LLM Serving 벤치마킹과 Capacity Planning: Trace·Goodput·비용 (10/10)
Enterprise RAG 지식 파이프라인 · 10편
- Enterprise RAG 지식 수명주기: 수집·변환·검증·배포를 한 파이프라인으로 (1/10)
- RAG 문서 구조 추출: PDF Layout·OCR·표·읽기 순서를 보존하는 법 (2/10)
- RAG 문서 ID·Versioning·Dedup: Rename·재처리·중복·삭제를 구분하는 법 (3/10)
- RAG Metadata Schema·Ontology·Entity Resolution: 검색 필터를 지식 계약으로 (4/10)
- RAG ACL·Multi-tenancy·Security Filtering: 검색 전에 권한을 지키는 법 (5/10)
- RAG Freshness·Temporal Retrieval·CDC: 최신 문서를 정확히 검색하는 법 (6/10)
- RAG Embedding·Index Migration: Dual Write·Shadow Read·무중단 전환 (7/10)
- RAG Data Quality·Drift·Observability: 조용한 검색 품질 저하를 찾는 법 (8/10)
- RAG Deletion·Retention·Privacy Governance: Embedding까지 삭제를 증명하는 법 (9/10)
- Production RAG Knowledge Base Release Runbook: Build·Canary·Rollback (10/10)
Python으로 만드는 Production RAG Agent · 10편
- Production RAG Agent 프로젝트 구조: Vertical Slice·Port·Adapter로 시작하기 (1/10)
- LLM API Client 설계: Message·Streaming Event·Structured Error (2/10)
- LLM Client 복원력: Timeout·Retry·Rate Limit·Circuit Breaker (3/10)
- Retrieval Service Adapter: ACL Filter·Deadline·Empty Result 구분 (4/10)
- RAG Prompt·Context Builder: Evidence Budget과 Citation 검증 (5/10)
- Typed Agent Runtime: Tool Registry와 반드시 끝나는 Bounded Loop (6/10)
- RAG Session 영속화: PostgreSQL·Redis·Idempotency 설계 (7/10)
- FastAPI SSE 스트리밍: Backpressure·취소·재연결 설계 (8/10)
- RAG Agent 테스트: Fake·Contract·Record/Replay 설계 (9/10)
- Production RAG Agent 배포: CI·관찰성·Canary·Rollback (10/10)
단독 글 · 6편
- OpenAI SDK vs Temporal vs LangGraph — LLM 에이전트 백엔드 비교 2026
- RAPTOR — 재귀 요약 트리로 긴 문맥을 검색하는 RAG 기법
- Retrieval 성능의 한계에 부딪쳤을 때 1: SPLADE보다 먼저 봐야 할 것
- LLM Serving은 vLLM만 뜻할까: Qwen3-TTS-Triton으로 보는 서빙의 층위
- ColBERT Late Interaction은 일반 dense retrieval과 뭐가 다를까?
- [RAG] Harness-1 확장 설계: ColBERT·Cross-Encoder·PPR은 어디에 붙일까?