태그: #agents
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 10 편
AI 에이전트를 프로덕션에서 운영한다는 것 — 멱등성, 예산, 그리고 확신에 찬 오답
에이전트를 프로토타입에서 프로덕션으로 옮길 때 늦게 발견되는 운영 표면이 있습니다. 재시도된 도구 호출의 멱등성, 예산과 스텝 한도, 비결정적 제어 흐름의 관측 가능성, 도구별 권한 경계, 그리고 에이전트가 확신에 차서 틀렸을 때의 에스컬레이션 경로입니다. 최근 GeekNews Ask GN에 올라온 분석은 벤치마크 트레이스 6,780건에서 중복 도구 실행 8,042건을 찾았고, 그중 159건
2026-07-31 · 29 분 읽기 #ai#agents#observability#reliability#mcpAI 에이전트는 프로덕션에서 어떻게 실패하는가 — 14가지 실패 모드, 그리고 재시도가 안전하지 않은 이유
에이전트를 프로덕션에 올리면 세 가지가 아픕니다. 첫째, 실패는 모델이 아니라 시스템 설계에서 납니다 — UC 버클리의 MAST 연구는 실행 트레이스 1642건을 분류해 14가지 실패 모드를 뽑았고, 그중 44.2%가 시스템 설계 이슈였습니다. 둘째, 가장 흔한 실패 모드 두 개(단계 반복 15.7%, 종료 조건 미인지 12.4%)가 곧바로 토큰 청구서입니다. 셋째, 바로 그 두 개가 재시도
2026-07-17 · 40 분 읽기 #ai#agents#observability#reliability#mcp시뮬레이션된 고객은 절대 떠나지 않는다 — LLM 유저 시뮬레이터가 에이전트 점수를 부풀리는 지점
τ-bench 계열의 대화형 에이전트 벤치마크에서 "사용자" 역할은 또 다른 LLM이 맡습니다. 그런데 이 시뮬레이터는 측정 대상이 아니라 측정 도구이고, 도구는 교정을 받아야 합니다. 2026년에 나온 세 편의 검증 연구는 같은 방향을 가리킵니다 — 시뮬레이션된 사용자는 너무 협조적입니다. 실제 사람 451명으로 τ-bench 프로토콜을 그대로 돌린 연구는 시뮬레이터가 만드는 "이지 모드"
2026-07-16 · 41 분 읽기 #ai#llm#evaluation#agents#simulationMCP가 세션을 걷어낸다 — 2026-07-28 리비전의 스테이트리스 코어 읽기
MCP 사양의 다음 리비전 2026-07-28은 출시 이후 가장 큰 변경입니다. 핵심은 프로토콜 계층에서 상태를 걷어내는 것 — initialize 핸드셰이크와 Mcp-Session-Id 세션이 사라지고, 모든 요청이 meta에 프로토콜 버전과 클라이언트 능력을 실어 스스로를 설명합니다. 그 대가로 서버가 되묻는 방식이 MRTR(Multi Round-Trip Requests)로 뒤집히고, S
2026-07-16 · 31 분 읽기 #mcp#ai#protocol#agents#integrationUniClawBench로 보는 2026년의 에이전트 벤치마크 — 살아 있는 컨테이너와 숨은 감독자
홍콩대(HKU) MMLab이 2026년 7월 arXiv에 올린 UniClawBench는 "능력 중심(capability-driven)"을 표방하는 프로액티브 에이전트 벤치마크입니다. 정적으로 미리 기록된 정답을 맞히는 대신, 살아 있는 Docker 컨테이너 안에서 단계별 체크포인트로 채점하고, 실행자·숨은 감독자·사용자 에이전트로 이루어진 닫힌 고리로 다중 턴 피드백을 시뮬레이션합니다. 40
2026-07-11 · 10 분 읽기 #ai#agents#evaluation#benchmark#llmModel Context Protocol(MCP) 레퍼런스 — AI를 외부 세계에 연결하는 열린 표준
Model Context Protocol(MCP)은 애플리케이션이 LLM에 컨텍스트를 제공하는 방식을 표준화한 열린 프로토콜입니다. 이 글은 MCP가 실제로 무엇인지를 공식 문서에 근거해 정리한 엔지니어용 레퍼런스입니다 — 왜 M×N 통합 문제를 푸는지, 호스트·클라이언트·서버 구조와 두 계층(데이터/전송), 세 가지 서버 프리미티브(도구·리소스·프롬프트), stdio와 Streamable
2026-07-11 · 13 분 읽기 #mcp#ai#agents#llm#protocolMicrosoft Flint 읽기 — 에이전트가 차트를 그리게 만드는 시각화 언어
Microsoft Research가 공개한 Flint는 에이전트를 시각화하는 언어가 아니라, AI 에이전트가 데이터로부터 보기 좋은 차트를 안정적으로 만들게 해주는 중간 언어입니다. 컴파일러가 스케일·축·색·레이아웃 같은 낮은 수준의 결정을 데이터와 시맨틱 타입으로부터 대신 유도하고, 하나의 명세를 Vega-Lite·ECharts·Chart.js로 컴파일합니다. 이 글은 Flint가 실제로
2026-07-11 · 11 분 읽기 #ai#agents#data-visualization#llm#microsoft코딩 벤치마크는 에이전트 시대와 어긋나 있다 — 리더보드가 에이전트를 잘못 비교하는 세 가지 이유
Tessl 연구진이 2026년 6월 arXiv에 올린 포지션 논문은, 오늘날의 코딩 벤치마크가 에이전트형 소프트웨어 엔지니어링과 근본적으로 어긋나 있다고 주장합니다. 벤치마크는 개별 모델을 재려고 만들어졌는데, 우리는 그것으로 모델·하네스·컨텍스트·환경·피드백이 얽힌 시스템 전체를 비교하고 있기 때문입니다. 논문은 세 가지 구체적 어긋남 — 모델과 하네스를 뭉뚱그리는 점수, 단일 정답 채점이
2026-07-11 · 12 분 읽기 #ai#agents#evaluation#software-engineering#coding-benchmarks효과적인 AI 에이전트 만들기 — 워크플로 다섯 패턴과 에이전트 레퍼런스
Anthropic의 엔지니어링 가이드 "Building Effective Agents"를 실무 레퍼런스로 정리했습니다. 워크플로와 에이전트의 정확한 구분, 모든 것의 기본 블록인 증강된 LLM(검색·도구·메모리), 다섯 가지 워크플로 패턴(프롬프트 체이닝·라우팅·병렬화·오케스트레이터-워커·이밸류에이터-옵티마이저)을 각각 언제 쓰는지와 예시로 다룹니다. 자율 에이전트가 실제로 무엇인지, 언제
2026-07-11 · 17 분 읽기 #ai#agents#llm#engineering#anthropic스텝마다 얼마나 생각할지 고르기 — Ares의 적응형 추론 노력 라우팅
Ares(2026년 3월 프리프린트)를 실무 관점에서 정리했습니다. 이 논문은 추론 노력을 태스크 전체가 아니라 스텝 단위의 비용 레버로 다룹니다. 가벼운 라우터가 상호작용 이력을 보고 각 스텝에 필요한 가장 낮은 추론 레벨을 예측해, 모든 스텝을 최대 노력으로 돌리는 낭비를 줄입니다. 저자들은 TAU-Bench·BrowseComp-Plus·WebArena에서 추론 토큰을 최대 52.7%까지
2026-07-11 · 8 분 읽기 #ai#agents#llm#efficiency