태그: #ai-engineering
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 11 편
비전 모델 개발·파인튜닝 완전 가이드 2026 — CNN, ViT, DETR, SAM 2, VLM 까지 실전 의사결정 트리
2026년 비전 모델 개발은 더 이상 ResNet 한 줄 가져다 학습하는 시대가 아니다. CNN, ViT, DETR, SAM 2, 그리고 LLaVA·Qwen-VL·Gemini Vision·Claude Vision 같은 VLM 까지 — 같은 사진 한 장에 대해서도 어떤 모델을 쓰느냐로 비용이 100배, 정확도가 30%p 갈린다. 이 글은 분류·탐지·세그멘테이션·OCR·캡셔닝·VQA 라는 6가지
2026-05-14 · 30 분 읽기 #computer-vision#vision-model#cnn#vit#detr개발자의 팟캐스트 큐레이션 2026 — Latent Space·Changelog·SE Daily까지, 출근길에 듣는 일급 대담
책장이 판단의 뼈대를, 영상이 그 뼈대 위의 살을 만든다면, 팟캐스트는 그 살 위에 흐르는 혈관이다. 출근길·산책길·설거지하면서 흘려듣는 사이에 업계의 맥박이 머리에 새겨진다. 이 글은 2026년 5월 기준으로 일급의 신호를 주는 팟캐스트를 카테고리별로 큐레이션한다. Latent Space·Changelog·JS Party·Software Engineering Daily·Pragmatic E
2026-05-14 · 46 분 읽기 #developer-podcasts#latent-space#changelog#podcasts#learning에이전트 평가 시스템 2026 — Inspect AI·Promptfoo·Phoenix·LangSmith·OpenAI Evals 심층 비교 (모델이 아니라 에이전트를 측정한다)
LLM 평가는 모델을 측정한다. 에이전트 평가는 모델 + 하네스 + 도구가 실제 작업을 끝까지 끌고 가는지를 측정한다. 두 개는 완전히 다른 문제다. 2026년 현재 에이전트 평가 프레임워크의 지도를 그린다 — UK AISI의 Inspect AI(점점 골든 스탠더드), Promptfoo(OSS CLI), Arize Phoenix(OSS 옵저버빌리티+eval), LangSmith(LangCha
2026-05-14 · 34 분 읽기 #agent-evaluation#inspect-ai#promptfoo#phoenix#langsmithLLM 랜드마크 논문 가이드 — Attention부터 GPT·LLaMA·DeepSeek·o1·Claude까지 (참고문헌 포함, 2026)
LLM 분야의 진짜 변화는 어떤 논문에서 시작됐는가. 2017년 Attention is All You Need부터 2026년의 추론 모델까지, 반드시 알아야 할 랜드마크 논문 20여 편을 시기·주제별로 정리한다. 각 논문은 '왜 중요한가·한 줄 요약·후속 영향'으로 압축하고, arXiv·블로그 링크를 끝에 모았다. 시간 부족한 엔지니어를 위한 LLM 논문 지도.
2026-05-14 · 22 분 읽기 #llm#research-papers#transformer#gpt#llamaAI 코딩 어시스턴트의 한계 2026 — 솔직한, 그러나 공정한 평가 (안 되는 일들에 대하여)
AI 코딩 어시스턴트는 강력하다. 그러나 강력함의 모양은 균일하지 않다. 깊은 버그 디버깅, 대규모 코드베이스의 아키텍처, 미묘한 성능 회귀, 동시성 정확성, 진짜 새로운 기술, 멀티 레포 변경, 보안 코드, 레거시의 암묵 가정, 긴 세션의 prompt drift — 2026년 중반에도 사람의 판단이 multiplier로 남는 영역들. 안티-AI가 아니라 calibrated. 어디서 빛나고
2026-05-14 · 40 분 읽기 #ai-coding#ai-limitations#honest-take#ai-engineering#claude-codeAI 하네스 해부 — 모델을 에이전트로 만드는 스캐폴딩 (루프·도구·컨텍스트, 그리고 직접 만들기)
모델은 엔진이고, 하네스는 차다. 같은 엔진에 다른 차를 얹으면 주행 경험이 완전히 달라진다. 2026년 AI 엔지니어링의 진짜 무게중심은 모델이 아니라 그 모델을 둘러싼 스캐폴딩 — 하네스 — 에 있다. 에이전트 루프의 해부, 도구 실행 계층, 컨텍스트 관리와 context rot, System Prompt의 역할, 제어 흐름(서브에이전트·훅·권한 게이트), 실패 모드와 복원, 실제 하네스
2026-05-14 · 26 분 읽기 #ai-harness#ai-agent#llm#agent-loop#tool-executionPython 완전 가이드 — FastAPI·AsyncIO·Pydantic·uv·Polars·AI 엔지니어링 (Season 2 Ep 5, 2025)
Python은 "느리고 GIL에 갇힌" 언어였다. 2024~2025년의 Python은 free-threading(No-GIL) 실험, JIT 컴파일러, uv라는 혁명적 패키지 매니저, Polars의 Rust 백엔드 DataFrame, Pydantic v2의 Rust Core, FastAPI의 타입 안전 API, 그리고 LangChain·LangGraph·Pydantic AI로 이어지는 AI
2026-04-15 · 16 분 읽기 #python#fastapi#asyncio#pydantic#uvLLM 완전 가이드 — Transformer·Attention·RLHF·RAG·Agent·Evaluation (Season 2 Ep 6, 2025)
LLM을 "프롬프트에 답하는 블랙박스"로만 쓰면 임계점에서 막힌다. Transformer의 Attention이 실제로 어떻게 토큰 관계를 계산하는지, Pre-training → SFT → RLHF → DPO 파이프라인이 왜 이 순서로 설계됐는지, RAG 1/2/3세대의 차이와 Agentic RAG의 본질, Agent 설계(ReAct, Plan-and-Execute, Multi-Agent)의
2026-04-15 · 19 분 읽기 #llm#transformer#attention#rlhf#dpoAI 엔지니어링 실전 — LLM API, RAG, 에이전트, LoRA/DPO, 벡터 DB, 평가, 관측, Prompt Injection 완전 가이드 (2025)
LLM API 프로덕션 호출의 진짜 어려움, RAG가 단순 조회가 아닌 이유, 에이전트 패턴(ReAct/Plan-Execute/ReWOO), 파인튜닝 언제/언제 하지 말까(LoRA/QLoRA/DPO), 벡터 DB 선택 매트릭스, LLM 평가의 근본적 어려움, 비용 최적화, Prompt Injection 방어까지. 데모가 아닌 '진짜 프로덕션' AI 앱을 만드는 법.
2026-04-15 · 20 분 읽기 #ai-engineering#llm#rag#ai-agent#loraAI Engineering 프로덕션 실전 완전 가이드 — RAG·Evals·Fine-tuning·LLMOps·Guardrails·Prompt Caching·비용 최적화까지 2025-2026년 현장 노하우
LLM을 프로토타입에서 프로덕션으로 가져가는 여정은 Jupyter 노트북의 데모와 다르다. RAG 파이프라인 설계, eval harness 구축, fine-tuning 결정 트리, LLMOps 관측 가능성, Guardrails와 안전성, Prompt Caching과 비용 최적화까지 2025-2026년 AI 엔지니어의 현장 가이드를 500줄로 정리한다.
2026-04-15 · 20 분 읽기 #ai-engineering#llm#rag#evaluation#fine-tuningAI 하네스란 무엇인가: Skills, Context, Hooks, Permissions로 AI를 제어하는 오케스트레이션 아키텍처
AI 하네스(Harness)는 AI 모델을 감싸서 제어하는 오케스트레이션 레이어입니다. System Prompt, Tools, Context, Skills, Hooks, Permissions, Memory의 7가지 구성 요소를 해부하고, Claude Agent SDK와 LangGraph로 직접 만드는 방법까지 — AI 엔지니어 필독 가이드.
2026-03-23 · 56 분 읽기 #ai-harness#claude-code#agent-sdk#skills#context