RAG Agent 공부 순서: 토큰부터 Harness까지 한 장으로 보기 (1/10)
RAG Agent를 만들기 전에 토큰·임베딩·Transformer·검색·생성·평가·하네스가 한 요청에서 어떻게 연결되는지 전체 지도를 세우고, 10편의 학습 순서와 실습 기준까지 정리합니다.
Knowledge pillar · active
LLM 기초와 학습, 추론 신뢰성, GPU kernel·scheduler·capacity planning까지 모델 실행 전 과정을 설명합니다.
RAG Agent를 만들기 전에 토큰·임베딩·Transformer·검색·생성·평가·하네스가 한 요청에서 어떻게 연결되는지 전체 지도를 세우고, 10편의 학습 순서와 실습 기준까지 정리합니다.
LLM이 문자열을 직접 읽지 않고 토큰 ID로 바꾸는 이유를 문자·단어·subword 관점에서 설명하고, BPE·SentencePiece·특수 토큰·한국어 비용·RAG chunk 예산을 실습으로 연결합니다.
스칼라·벡터·행렬의 차이부터 one-hot과 dense embedding, dot product·cosine similarity·정규화까지 작은 숫자로 계산하고, query와 문서가 검색되는 원리를 RAG 코드로 연결합니다.
LLM 학습에서 자주 만나는 parameter·logit·softmax·cross entropy·backpropagation·gradient descent를 세 토큰 예제로 계산하고, pretraining과 inference의 차이까지 RAG 개발 관점에서 설명합니다.
n-gram에서 neural language model과 autoregressive LLM으로 이어지는 핵심을 조건부확률·teacher forcing·causal mask·생성 루프로 설명하고, hallucination과 RAG가 필요한 이유까지 연결합니다.
Transformer의 핵심인 query·key·value를 검색 비유와 행렬 shape로 설명하고, score·scale·mask·softmax·weighted sum을 작은 숫자로 직접 계산해 multi-head와 RAG context까지 연결합니다.
Transformer가 attention 하나가 아니라 token·position embedding, multi-head attention, residual, LayerNorm, FFN을 반복한 구조임을 설명하고 encoder와 decoder의 RAG 역할까지 비교합니다.
BERT의 양방향 encoder와 GPT의 causal decoder를 attention mask·학습 목표·입출력 관점에서 비교하고, bi-encoder 검색·cross-encoder reranking·LLM 생성에 각각 어떻게 쓰이는지 설명합니다.
프롬프트가 token이 된 뒤 prefill과 autoregressive decode를 거치는 과정을 설명하고, KV cache·TTFT·token latency·temperature·top-p가 RAG의 context 비용과 답변 안정성에 미치는 영향을 정리합니다.
문서 수집과 chunking부터 embedding·cosine retrieval·context 조립·근거 기반 생성·Recall@k 평가까지 최소 RAG를 Python으로 연결하고, 실패를 검색과 생성 단계로 분리해 추적합니다.
GPU Roofline 모델로 LLM prefill과 decode의 FLOP·HBM byte·arithmetic intensity를 계산합니다. compute·memory·launch·통신 병목을 구분하고 측정 기반 최적화 순서를 설계합니다.
LLM 추론 GPU 메모리를 weight, runtime buffer, KV cache, allocator와 headroom으로 나눠 계산합니다. GQA·TP·prefix cache·동시성을 반영해 OOM 전 admission capacity를 설계합니다.
Transformer 추론을 GEMM, normalization, RoPE, attention, sampling 커널로 분해합니다. Prefill·decode shape와 HBM 이동, FlashAttention·fusion·fallback을 측정해 serving 성능을 검증합니다.
Scheduler가 iteration마다 decode와 prefill token을 묶는 원리를 설명합니다. Chunked prefill, admission, preemption, fairness를 TTFT·ITL budget과 연결해 continuous batching을 설계합니다.
KV cache를 logical block과 physical page로 나눠 할당합니다. Prefix identity, copy-on-write, refcount, eviction, offload를 연결해 RAG Agent의 cache hit와 tenant 격리를 설계합니다.
Speculative decoding의 draft·target verification과 acceptance/rejection 식을 설명합니다. Draft 길이, tree 후보, KV rollback, scheduler와 품질 검증을 연결해 decode 지연을 줄이는 조건을 찾습니다.
분산 LLM 추론의 replica, tensor·pipeline·expert·context parallel과 prefill/decode 분리를 비교합니다. Weight·KV·activation·collective와 topology를 계산해 SLO goodput에 맞는 배치를 설계합니다.
LLM 추론의 FP8·INT8·INT4·FP4 표현, scale 단위, calibration과 outlier 처리를 비교합니다. Weight·activation·KV를 줄인 뒤 fused kernel, 실제 byte, 정확도와 SLO goodput으로 빠른 경로를 검증합니다.
LLM serving의 TTFT·ITL SLO를 goodput으로 정의하고 admission, token fairness와 overload를 설계합니다. Queue work·KV·cold-start를 반영해 replica와 prefill/decode pool을 autoscale합니다.
LLM serving을 open-loop trace로 재현해 TTFT·ITL·goodput·비용을 측정합니다. Input/output 결합 분포와 cache를 보존해 SLO knee를 찾고 peak·failure·rollout headroom으로 GPU capacity를 계산합니다.
원시 문서를 학습 가능한 토큰 시퀀스로 바꾸는 LLM 사전학습 데이터 파이프라인을 출처·라이선스, 품질 필터, PII, 중복 제거, 오염 검사, 데이터 혼합, 패킹, manifest까지 설계합니다.
Causal LM의 next-token loss부터 parameter·token·compute 관계, Kaplan·Chinchilla scaling law, pilot run과 안정성, inference 비용을 반영한 over-training 판단까지 설명합니다.
현대 decoder-only LLM block을 pre-norm·RMSNorm, RoPE, SwiGLU, MHA·MQA·GQA, KV cache, dense·MoE로 분해하고 각 구조가 학습 안정성, 메모리, 통신, latency에 미치는 영향을 계산합니다.
Base LLM을 instruct model로 바꾸는 SFT를 chat template, assistant-only loss mask, packing, tool·grounding 데이터, 오염 방지, behavior·retention 평가까지 설계합니다.
LoRA의 low-rank update 수식과 trainable parameter를 계산하고 rank·alpha·target module을 고르는 법, QLoRA의 4-bit frozen base, DoRA, adapter merge·동적 serving·평가 계약까지 설계합니다.
RLHF·PPO, DPO·IPO, KTO, GRPO를 feedback 형태와 online·offline 학습으로 비교하고 reward hacking, KL drift, verifiable reward, RAG Agent 평가를 설계합니다.
LLM 양자화를 weight-only, weight·activation, KV cache로 나누고 scale·zero point·granularity를 계산하며 GPTQ, AWQ, SmoothQuant, FP8, KIVI의 memory·kernel·품질을 설계합니다.
LLM 분산 학습을 parameter·gradient·optimizer·activation 원장으로 계산하고 DDP, ZeRO, FSDP, tensor·pipeline·context parallel의 통신, checkpoint, 확장 효율을 설계합니다.
LLM 추론을 queue·prefill·decode로 분해하고 TTFT·ITL·goodput을 계산하며 PagedAttention, continuous batching, prefix cache, speculative decoding, P/D 분리와 SLO를 설계합니다.
RAG Agent 모델을 grounding·tool calling·long context·latency·cost·license로 비교하고 hard gate와 Pareto frontier를 거쳐 offline, shadow, canary, rollback으로 안전하게 배포합니다.
Chain-of-Thought가 중간 token으로 계산을 확장하는 원리를 익히고 정답성·설득력·충실성을 분리합니다. RAG Agent에서는 숨은 생각 대신 증거·도구 결과·검증 기록으로 추론을 감사하는 방법을 설계합니다.
LLM 추론 시 여러 후보에 계산 예산을 쓰는 self-consistency, pass@k, Best-of-N, verifier search를 구분합니다. 난이도별 adaptive budget과 중단 조건을 품질·지연·비용 SLO로 설계합니다.
LLM 후보를 고르는 ORM·PRM·value model·generative verifier를 구분합니다. 단계 label과 search 결합, calibration, distribution shift, reward hacking을 RAG Agent 사례로 설계합니다.
LLM의 token 확률·verbal confidence·sample agreement·semantic entropy를 구분하고 Brier·ECE·risk-coverage로 calibration을 평가합니다. RAG Agent가 답변·재검색·질문·중단을 선택하도록 설계합니다.
LLM 답을 atomic claim으로 분해해 근거 지지·모순·부족으로 판정합니다. FActScore·SAFE·ALCE 관점의 factuality와 citation 정확성·coverage, RAG 오류 귀속을 설계합니다.
Teacher LLM으로 instruction·rationale·response를 합성하고 rejection sampling으로 정제합니다. SFT·on-policy distillation, 오염·편향·model collapse를 평가합니다.
도구 문서와 JSON Schema에서 function call 학습 데이터를 만들고 SFT·execution reward로 학습합니다. No-call·병렬·연속 호출, schema drift와 보안 평가를 설계합니다.
요청별로 모델·RAG·test-time compute를 router와 cascade로 배분합니다. 품질·비용·지연 제약, counterfactual 학습, Pareto frontier와 drift 운영을 설계합니다.
Agent의 state·observation·action 전체 trajectory를 offline imitation과 on-policy RL로 학습합니다. Outcome·step reward, credit assignment, replay와 episode 평가를 설계합니다.
LLM 구조화 출력을 prompt와 재시도에 맡기지 않고 JSON Schema·FSM·CFG로 토큰을 제한합니다. 문법 컴파일, token mask, 의미 검증과 지연 평가를 설계합니다.
Qwen3-TTS-Triton v0.3.0을 계기로 serving, vLLM, Triton kernel, CUDA Graph, batching, KV cache가 각각 어느 층위인지 초심자 관점에서 정리합니다.