AI 사용률 90%인데 출시는 빨라지지 않았다: Block의 Stage 5와 그 대가 (7/7)
Block이 3,500명 엔지니어링 조직을 Agentic Engineering으로 전환한 과정을 추적합니다. AI Champions, repo readiness, review·cloud workspace·world model과 구조조정 뒤 남은 질문을 함께 봅니다.
Knowledge pillar · active
Agent 상태·도구·메모리·복구·보안과 코딩 에이전트 환경, Python 서비스 구현, 운영 방식을 연결합니다.
Block이 3,500명 엔지니어링 조직을 Agentic Engineering으로 전환한 과정을 추적합니다. AI Champions, repo readiness, review·cloud workspace·world model과 구조조정 뒤 남은 질문을 함께 봅니다.
OpenClaw를 설치하고 Gateway·내장 Agent runtime·Workspace·Session·Channel의 관계를 확인합니다. Dashboard에서 읽기 전용 첫 작업을 검증하고 안전하게 메시징으로 확장하는 순서를 정리합니다.
VPS에 배포한 Hermes Agent의 성공률·비용·지연·위험을 함께 측정합니다. Toolset 최소화, Memory와 Skill 분리, 모델 실험, Cron 승격 순서로 반복 업무를 안정화합니다.
로컬에서 검증한 Hermes Agent를 Linux VPS의 항상 켜진 서비스로 옮깁니다. 전용 계정, Messaging Gateway, 사용자 허용 목록, Docker 실행 격리, 백업과 재시작 검증을 연결합니다.
Nous Research의 Hermes Agent를 처음 설치하고 모델·도구·세션·프로젝트 문맥을 확인합니다. 막연한 비서 대신 검증 가능한 첫 작업을 정해 안전하게 사용하는 순서를 정리합니다.
Linux VPS에 OpenClaw Docker Gateway를 version pin과 영속 volume으로 구축하고 Slack Socket Mode를 연결합니다. SecretRef, 사용자·채널 allowlist, sandbox, health check와 rollback을 포함합니다.
Python Production RAG Agent를 model·vector DB·웹 framework에 묶이지 않게 설계합니다. Vertical Slice와 Port·Adapter, typed contract, composition root, fake 기반 첫 테스트를 연결합니다.
Python RAG Agent의 LLM SDK를 application에서 격리합니다. typed message, streaming event state machine, usage, provider 오류 번역과 취소 가능한 client를 구현합니다.
LLM API 장애를 재시도로 증폭하지 않도록 전체 deadline, attempt timeout, Retry-After, full jitter, 동시성 제한과 circuit breaker를 Python으로 설계합니다.
Python RAG Agent의 검색 계층을 typed port로 격리합니다. ACL·tenant filter, source span, 전체 deadline 전파, HTTPX timeout과 빈 결과·장애 분리를 구현합니다.
검색 Evidence를 결정적 context bundle로 조립합니다. token budget, 중복 제거, 원문 span, untrusted data 격리와 server-side citation ID 검증을 Python으로 구현합니다.
Python RAG Agent를 typed state machine으로 구현합니다. Tool registry, schema·권한 검증, step·tool·deadline budget, 종료 이유와 deterministic reducer를 연결합니다.
FastAPI RAG Agent를 SSE API로 엽니다. event contract, bounded queue, backpressure, disconnect 취소, terminal error와 Last-Event-ID 재연결을 구현합니다.
RAG Agent를 외부 API 없이 검증합니다. deterministic fake, 공통 contract suite, HTTPX transport, 비밀정보를 제거한 record/replay와 fault injection을 설계합니다.
고정 RAG pipeline을 observe·decide·act·evaluate 상태 루프로 바꾸고, LLM과 deterministic harness의 책임을 분리해 종료 조건·예산·불변식·실패 상태를 가진 첫 RAG Agent를 Python으로 구현합니다.
질문의 지식 필요성·신선도·식별자·복잡도·모호성·위험도를 판별해 no retrieval, direct lookup, single·iterative search, clarification을 선택하고 routing regret로 검증하는 RAG router를 설계합니다.
ReAct, plan-execute, ReWOO, tree search를 비용과 적응성으로 비교하고 dependency·success criteria·failure policy를 가진 plan DAG와 replan trigger·stop rule을 설계합니다.
질문을 evidence requirement로 분해하고 relevance·coverage·support·contradiction·freshness를 판정해 Self-RAG·CRAG·FLARE식 재검색·확인 질문·안전 종료를 bounded loop로 구현합니다.
Agent state·context·memory·corpus를 구분하고 working·episodic·semantic·procedural memory의 write·retrieve·update·forget lifecycle을 provenance·유효 기간·ACL·민감도로 설계합니다.
프로세스·네트워크 장애 뒤에도 RAG Agent를 안전하게 재개하도록 checkpoint·replay·idempotency·timeout·retry·cancellation·compensation을 설계합니다.
RAG Agent의 router·retrieval·model·tool·checkpoint를 trace·span·event·artifact로 연결하고 version·비용·latency·error를 기록해 최초 실패 지점을 재현합니다.
Python RAG Agent를 release합니다. 재현 가능한 container, CI·offline eval gate, OpenTelemetry, probe, canary, schema migration과 digest rollback을 연결합니다.
State·tool·router·evidence·memory·durable runtime·trace·security를 production harness로 통합하고 final state와 trajectory의 품질·비용·보안 gate로 안전하게 릴리스합니다.
Agent session을 PostgreSQL versioned event로 저장합니다. optimistic concurrency, idempotency key·request hash·lease, Redis cache와 crash window를 Python·SQL로 구현합니다.
LLM의 tool call을 실제 API 실행과 분리하고 JSON Schema 입력 계약, 의미·권한 검증, 구조화된 결과와 오류 envelope, side-effect·idempotency·version metadata를 갖춘 안전한 tool registry를 설계합니다.
검색 문서와 tool result를 untrusted data로 격리하고 provenance·taint·최소 capability·human approval·commit-time authorization으로 Agent 부작용과 정보 유출을 막습니다.
Harness-1의 auto-seeding과 evidence graph를 ColBERT, Cross-Encoder, Personalized PageRank로 확장하는 설계를 정리합니다. 각 모델의 역할과 리스크, 구현 순서를 함께 봅니다.
OpenAI Agents SDK, Temporal, LangGraph는 자주 비교되지만 셋은 같은 층이 아닙니다. 만드는 도구·운영 엔진·판단 흐름이라는 세 층을 한 장으로 정리하고, 언제 무엇을 써야 하는지 정직하게 가이드합니다.
OpenClaw로 여러 프로젝트의 개발·QA·반복 업무를 동시에 자동화하려다 약 20개 봇을 한 프로젝트와 한 workflow로 줄였습니다. 실패 원인과 측정·Skill·Memory·권한 최적화 순서를 정리합니다.
하네스 엔지니어링은 프롬프트만이 아니라 AI 에이전트가 일하는 환경 전체(규칙·도구·기억·권한·역할·검증)를 체계적으로 설계하는 방법론입니다. 정의·에이전트 루프·7가지 설계 축을 입문자 눈높이로 정리합니다.
Claude Code·OpenCode 에이전트에게 큰 작업을 맡길 때 왜 실패하는지, 좋은 분해의 4가지 조건과 plan 에이전트로 계획과 실행을 분리하는 패턴을 정리합니다. 실전 템플릿과 CLAUDE.md 규칙 예시 포함.
CLAUDE.md(AGENTS.md)는 백과사전이 아니라 50줄짜리 맵이어야 합니다. 맵 → docs/ → 코드의 3계층 구조, OpenAI 실패 사례, Agent Legibility 개념, 점진 발전 4주 플랜을 정리합니다.
Claude Code·OpenCode 에이전트의 도구 레이어를 Tool → Skill → Plugin 3계층과 MCP(Model Context Protocol)로 나눠 정리합니다. SKILL.md 작성 레시피, MCP 서버 설정 예시, 도구 추가 전 체크리스트 포함.
Claude Code의 allow/ask/deny 3단계 권한, default/plan/auto permission mode, hooks를 조합해 최소 권한 자동화 파이프라인을 설계하는 방법을 실제 settings.json 예시와 함께 정리합니다.
Claude Code·OpenCode·OpenClaw에서 세션이 끊겨도 에이전트가 어제까지의 결정을 기억하게 만드는 메모리 패턴을 정리합니다. PROGRESS.md 템플릿, --continue와 새 세션 선택 기준, 구조적 커밋 메시지, 세션 핸드오프 프로토콜 포함.
Claude Code에서 subagent로 역할을 분리해 code-reviewer·researcher·test-writer 전문 에이전트를 만드는 방법을 정리합니다. 실제 정의 파일 3개 예시, tools.allow/deny 설계, 확장 순서와 흔한 실수까지 포함합니다.
Claude Code 기반 AI 에이전트가 같은 실수를 반복하지 않도록 만드는 검증 루프 설계법. 실패 로그를 남기고 Hooks로 해당 축만 보강하는 4단 루프(관찰·진단·보강·검증)를 실전 시나리오와 함께 정리합니다.