태그: #ai
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 220 편
DeepSeek V4 Flash가 실제로 바꾸는 것 — 리더보드가 아니라 능력당 단가의 문제
2026년 7월 31일 DeepSeek이 V4-Flash API를 공개 베타로 전환했습니다. 아키텍처는 4월의 프리뷰와 동일한 284B 총 파라미터 · 13B 활성 MoE에 1M 컨텍스트이고, 바뀐 것은 사후학습뿐입니다. 공식 체인지로그가 공개한 점수는 Terminal Bench 2.1에서 82.7, Toolathlon verified 70.3인데, 이 숫자들은 DeepSeek이 자사 하네스
2026-07-31 · 20 분 읽기 #ai#llm#deepseek#inference-cost#moeAI로 코드베이스를 옮기는 실전 절차 — 심판을 먼저 세우고, 줄 수가 아니라 리뷰율을 측정한다
2026년 상반기에 공개된 대규모 LLM 마이그레이션 사례들(53만 줄 Zig to Rust, 16만 5천 줄 Python to TypeScript)에서 공통된 절차를 뽑아 실행 가능한 순서로 정리합니다. 핵심은 순서입니다 — 번역을 시작하기 전에 동작 오라클을 세우고, 일부러 망가뜨린 코드로 그 오라클이 떨어지는지부터 확인합니다. 그다음 검증 가능한 경계로 잘라 큐를 만들고, 완료 판정을
2026-07-31 · 23 분 읽기 #ai#migration#refactoring#testing#engineering사내 지식베이스를 LLM으로 만든다는 것 — 권한 인지 검색, 신선도, 그리고 출시 전 평가셋
Cerebras가 2026년 7월 15일에 공개한 사내 지식베이스 구축기는 하루 15,000건 넘는 질의를 사람과 자동화와 에이전트가 함께 던지는 시스템의 내부 구조를 드러냅니다. 하지만 사내 지식베이스에서 팀이 실제로 과소평가하는 부분은 청킹이나 리랭킹이 아니라 권한, 신선도, 삭제 전파, 그리고 진실 공급원 충돌입니다. HR 문서를 흘리는 검색은 없는 것만 못하고, 이미 폐기한 런북을 자
2026-07-31 · 26 분 읽기 #ai#rag#enterprise-search#llm#platform-engineeringRAG · 파인튜닝 · 롱컨텍스트 — 내 문제엔 뭘 써야 하나: 논문이 실제로 잰 것, 그리고 아무도 재지 않은 것
LLM 아키텍처에서 가장 많이 나오는 질문이지만, 대부분의 답은 출처 없는 의사결정 트리입니다. 이 글은 측정된 것만 가지고 답합니다. 파인튜닝은 새 지식을 넣는 데 실패한다는 것이 여러 논문에서 반복 측정됐고(Ovadia 등, Gekhman 등), 정반대로 보이는 농업 사례 연구는 사실 다른 개입(비지도 계속사전학습 vs 지도 Q&A 튜닝)을 잰 것이라 충돌이 아닙니다. 롱컨텍스트는 위치·
2026-07-17 · 43 분 읽기 #rag#llm#fine-tuning#long-context#aiLLM API 비용을 실제로 줄이는 법 — "캐싱 90% 할인"이 청구서에서는 왜 25%인가
프롬프트 캐싱의 캐시 읽기는 입력 가격의 10분의 1입니다. 그런데 그게 청구서를 90% 깎아 주지는 않습니다. Anthropic이 자기 문서에 올려 둔 계산 예제를 그대로 따라가면, 캐시가 완전히 걸린 상태에서도 총액은 0.705달러에서 0.525달러로 25.5%만 줄어듭니다. 이유는 단순합니다 — 할인은 그 항목에 쓰는 돈의 비율만큼만 청구서를 줄이고, 출력 토큰이 이미 비용의 60%를
2026-07-17 · 39 분 읽기 #llm#cost-optimization#prompt-caching#api#ai이미지 한 장으로 영상 만들기 — Kling·Veo·Sora vs Wan·HunyuanVideo, 무엇을 언제 고르나
이미지 한 장과 프롬프트로 영상을 만드는 모델을 고를 때 실제로 결정을 가르는 건 데모 릴의 화질이 아니라 초당 가격, 입력 이미지 제약, 라이선스 세 가지입니다. 2026년 7월 기준으로 각 벤더의 공식 가격표와 문서만 직접 확인해 정리했습니다. 호스티드 쪽은 sora-2가 720p 초당 0.10달러, Veo 3.1 Fast가 오디오 포함 720p 초당 0.10달러이고, Kling은 초 단
2026-07-17 · 39 분 읽기 #ai#video-generation#image-to-video#open-weights#licensingAI 코딩 에이전트, 무엇을 어떤 일에 쓰는가 — 네 벤더의 공식 문서로만 확인한 선택 기준
Claude Code · Cursor · GitHub Copilot · OpenAI Codex 중 무엇을 쓸지 고를 때 가장 많이 묻는 질문은 "뭐가 제일 싼가"입니다. 그런데 네 회사가 공개한 가격만으로는 이 질문에 답이 나오지 않습니다. 사용량을 파는 단위가 넷 다 다르기 때문입니다 — Anthropic은 Pro 대비 배수(5배·20배)로, Cursor는 포함된 API 사용액을 달러로,
2026-07-17 · 42 분 읽기 #ai#ai-coding-agent#claude-code#cursor#github-copilotAI 에이전트는 프로덕션에서 어떻게 실패하는가 — 14가지 실패 모드, 그리고 재시도가 안전하지 않은 이유
에이전트를 프로덕션에 올리면 세 가지가 아픕니다. 첫째, 실패는 모델이 아니라 시스템 설계에서 납니다 — UC 버클리의 MAST 연구는 실행 트레이스 1642건을 분류해 14가지 실패 모드를 뽑았고, 그중 44.2%가 시스템 설계 이슈였습니다. 둘째, 가장 흔한 실패 모드 두 개(단계 반복 15.7%, 종료 조건 미인지 12.4%)가 곧바로 토큰 청구서입니다. 셋째, 바로 그 두 개가 재시도
2026-07-17 · 40 분 읽기 #ai#agents#observability#reliability#mcpAI 에이전트의 메모리는 실제로 어떻게 만드는가 — 네 가지 설계와, 벤치마크가 실제로 증명한 것
"에이전트 메모리"는 한 가지 기술이 아니라 최소 네 가지 서로 다른 설계를 뭉뚱그린 말입니다 — 파일 스크래치패드, 요약/컴팩션, 벡터 회수, 지식 그래프. 이 글은 각각이 실제로 무엇을 하는지 제품 문서로 확인하고, 그다음 훨씬 불편한 질문을 던집니다: 어느 쪽이 낫다는 근거가 실제로 측정된 적이 있나? Mem0 논문(arXiv:2504.19413)의 표를 직접 읽어 보면, 헤드라인인 "
2026-07-17 · 38 분 읽기 #ai#ai-agent#agent-memory#llm#benchmark브라우저·컴퓨터를 조작하는 AI 에이전트, 지금 어디까지 왔나 — 벤치마크 숫자가 실제로 재는 것
"컴퓨터 유즈 에이전트가 OSWorld에서 83.5%를 찍었다"와 "가장 강한 에이전트도 20.6%밖에 못 끝낸다"는 둘 다 2026년에 나온 사실이고, 둘 다 맞습니다. 앞은 OSWorld 1.0, 뒤는 같은 팀이 만든 OSWorld 2.0입니다. 이 글은 그 간극이 어디서 오는지를 원 논문과 벤치마크 저자들의 자체 측정으로 따라갑니다. OSWorld 과제의 절반 가까이는 GUI를 거의 쓰
2026-07-17 · 46 분 읽기 #ai#computer-use#browser-agents#benchmark#prompt-injectionAI 코드 리뷰는 실제로 쓸 만한가 — 측정된 증거가 말하는 정확도와 거짓 양성
AI 코드 리뷰 도구의 마케팅 문구에는 "PR의 80%에 사람 코멘트가 필요 없다" 같은 숫자가 넘치지만, 정작 정밀도와 거짓 양성률을 함께 공개한 곳은 거의 없습니다. 공개된 측정치를 모아 보면 방향은 대체로 일치합니다 — 오픈소스 PR에서 AI 리뷰 코멘트가 실제 코드 변경으로 이어진 비율은 도구에 따라 0.9~19.2%로, 사람 코멘트의 60%에 크게 못 미쳤습니다(Gan 등, 깃허브
2026-07-17 · 47 분 읽기 #ai#code-review#static-analysis#evaluation#software-engineering시뮬레이션된 고객은 절대 떠나지 않는다 — LLM 유저 시뮬레이터가 에이전트 점수를 부풀리는 지점
τ-bench 계열의 대화형 에이전트 벤치마크에서 "사용자" 역할은 또 다른 LLM이 맡습니다. 그런데 이 시뮬레이터는 측정 대상이 아니라 측정 도구이고, 도구는 교정을 받아야 합니다. 2026년에 나온 세 편의 검증 연구는 같은 방향을 가리킵니다 — 시뮬레이션된 사용자는 너무 협조적입니다. 실제 사람 451명으로 τ-bench 프로토콜을 그대로 돌린 연구는 시뮬레이터가 만드는 "이지 모드"
2026-07-16 · 41 분 읽기 #ai#llm#evaluation#agents#simulationPD 분리는 처리량을 늘리지 않는다 — 프리필/디코드 분리가 실제로 사는 것
프리필과 디코드를 다른 GPU로 쪼개는 PD 분리는 2026년 vLLM·SGLang·TensorRT-LLM에 모두 들어온 설계지만, 어디를 봐도 "2배에서 7배"라는 숫자만 돌아다닙니다. 그런데 vLLM 공식 문서는 같은 기능을 두고 "분리 프리필은 처리량을 개선하지 않는다"고 대문자로 못 박아 두었습니다. 둘 다 맞습니다 — 그 벤더 숫자들은 전부 처리량이 아니라 goodput(SLO를 지
2026-07-16 · 30 분 읽기 #llm#ai#inference#kv-cache#vllmMCP가 세션을 걷어낸다 — 2026-07-28 리비전의 스테이트리스 코어 읽기
MCP 사양의 다음 리비전 2026-07-28은 출시 이후 가장 큰 변경입니다. 핵심은 프로토콜 계층에서 상태를 걷어내는 것 — initialize 핸드셰이크와 Mcp-Session-Id 세션이 사라지고, 모든 요청이 meta에 프로토콜 버전과 클라이언트 능력을 실어 스스로를 설명합니다. 그 대가로 서버가 되묻는 방식이 MRTR(Multi Round-Trip Requests)로 뒤집히고, S
2026-07-16 · 31 분 읽기 #mcp#ai#protocol#agents#integration이슈 하나로 공급망 끝까지 — CI 안의 에이전트가 무너진 방식과, 방어가 실제로 막아준 만큼
2026년 6월 1일 GMO Flatt Security의 RyotaK가 공개한 Claude Code GitHub Actions 취약점은, CI 파이프라인에 들어온 에이전트가 어떻게 저장소 전체를 넘기는 통로가 되는지를 끝까지 따라간 사례입니다. 봇 판정 한 줄이 신뢰 경계를 무너뜨리고, 이슈 본문에 심긴 지시가 명령이 되고, 읽기 전용처럼 보이는 명령 하나가 유출 채널이 됩니다. 이 글은 그
2026-07-16 · 40 분 읽기 #security#ai#prompt-injection#supply-chain#ci-cd문서에서 지식 그래프로 — 정직한 구축 파이프라인
'문서에서 지식 그래프를 뽑는다'는 데모에서는 LLM 호출 한 번처럼 보입니다. 하지만 고객의 문서를 실제로 쿼리 가능한 그래프로 바꾸는 일은 여섯 단계의 파이프라인이고, 비용과 고통의 대부분은 추출이 아니라 엔티티 해소에 있습니다. 이 글은 스키마(온톨로지)를 먼저 정하는 이유, LLM 기반 스키마 제약 추출(LangChain LLMGraphTransformer, LlamaIndex의 Si
2026-07-15 · 19 분 읽기 #knowledge-graph#ai#llm#data-engineeringGraph RAG란 무엇인가 — 벡터 RAG가 막히는 곳, 그리고 이게 값을 하는 순간
RAG의 표준 레시피(청크 → 임베딩 → 상위 k개 검색)는 답이 한 조각에 들어 있을 때 잘 작동하지만, 멀티홉 질문과 코퍼스 전체를 관통하는 글로벌 센스메이킹 질문에서는 구조적으로 막힙니다. Microsoft의 GraphRAG는 이 두 사각지대를 겨냥해, LLM으로 코퍼스에서 지식 그래프를 뽑고 Leiden 알고리즘으로 커뮤니티를 찾아 요약을 미리 만들어 둡니다. 그런 다음 글로벌 질문은
2026-07-15 · 16 분 읽기 #rag#graph-rag#knowledge-graph#ai#llm무엇을 깊게 배우고, 무엇을 흘려보낼 것인가 — AI가 다 답해주는 시대의 학습 전략
AI가 3초 만에 거의 모든 것을 답해주는 시대에, 무엇을 깊게 배우고 무엇을 흘려보낼 것인가. 인지심리학은 불편한 답을 내놓습니다. 기억을 만드는 것은 정보를 보는 행위가 아니라 스스로 꺼내는 행위입니다. Roediger와 Karpicke의 실험에서 지문을 평균 14.2회 읽은 집단은 일주일 뒤 40%를 기억했고, 3.4회만 읽고 스스로 회상한 집단은 61%를 기억했습니다. 그런데 더 못
2026-07-12 · 24 분 읽기 #career#learning#ai#software-engineering코드 생성이 싸질 때 값이 오르는 기술 — 감가하는 것과 절상하는 것
코드 생성이 싸고 흔해지면 가치는 사라지지 않고 이동합니다 — 병목이 남아 있는 쪽으로. 지금 그 병목은 검증과 판단과 통합입니다. Jason Wei의 검증 비대칭성, DORA 2025(처리량은 올랐는데 배포 불안정성은 계속 상승), LinearB의 800만 PR 분석(AI가 만든 PR은 리뷰를 4.6배 오래 기다린다), Stack Overflow 2025(개발자 66%가 "거의 맞지만 정확
2026-07-12 · 27 분 읽기 #career#software-engineering#ai#skills#code-reviewAI는 정말 개발자를 빠르게 만드는가 — 측정된 숫자들이 말하는 것
무작위 대조 실험 두 개가 정반대의 답을 내놓았습니다. 하나는 AI를 쓴 개발자가 55.8% 빨랐다고 했고, 다른 하나는 19% 느렸다고 했습니다. 그런데 뒤의 숫자를 낸 METR은 2026년 2월 후속 연구를 발표하면서, 2025년 결과 위에 이제는 현재를 반영하지 않는다는 경고 배너를 스스로 붙였습니다. 이야기가 사라지는 게 아니라 오히려 날카로워집니다 — 후속 실험조차 참가자 자기선택
2026-07-12 · 36 분 읽기 #career#ai#productivity#software-engineering#developer-experience