태그: #llm
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 216 편
모두를 위한 AI 1편 — 16M 파라미터 언어모델을 15분에 처음부터 학습시키기
GPU 한 장으로 언어모델을 처음부터 학습시켜 봅니다. TinyStories 데이터셋과 1,600만 파라미터짜리 디코더 전용 트랜스포머로 15분 만에 읽히는 영어 동화를 생성했습니다. 어텐션 마스크가 왜 필요한지, 가중치 묶기가 무엇을 절약하는지, perplexity 20이 실제로 어떤 문장을 뜻하는지를 실제 학습 로그와 생성 결과로 확인합니다. RTX 3090 실측 기준.
2026-08-19 · 15 분 읽기 #ai#llm#transformer#pytorch#hands-onAI 엔지니어 회의 영어: 모른다고 말하면서 신뢰를 잃지 않는 법
AI 팀 회의에서 가장 자주 필요한 영어는 확신을 표현하는 말이 아니라 불확실성을 신뢰감 있게 표현하는 말입니다. 평가 결과와 그 한계를 함께 말하기, 원인이 아직 불명확한 회귀 보고, 지표는 올랐는데 품질은 아닐 때, 라벨링 이견, 비용과 지연 시간 트레이드오프, 연구 일정과 제품 일정의 충돌, 비기술 이해관계자에게 불확실성 설명하기, 남의 실험에 이견 제기하기, 재현이 안 될 때까지 상황
2026-08-16 · 47 분 읽기 #english#business-english#meeting#ai#llmQwen3.8-27B의 하이브리드 어텐션 — 64개 층 중 16개만 KV 캐시를 쌓는 구조
27B 모델이 26만 토큰 컨텍스트를 노트북에서 감당하는 이유는 파라미터 수가 아니라 층 구성에 있습니다. Qwen3.8-27B는 64개 층 중 48개를 선형 어텐션(Gated DeltaNet)으로, 16개만 일반 어텐션으로 배치해 KV 캐시가 자라는 층 자체를 4분의 1로 줄였습니다. 이 구조가 무엇을 아끼고 무엇을 잃는지, FP8 블록 양자화가 어디에 적용되는지, 그리고 로컬 추론을 검토
2026-08-14 · 15 분 읽기 #llm#inference#quantization#local-llm#attention분류하지 말고 지어내라는 기법과 그 검증 — 가짜 레이블이 원본 질의보다 나은 이유
수백 개짜리 분류 체계를 프롬프트에 넣는 대신, 작은 모델에게 그럴듯한 가짜 분류를 지어내게 하고 그것을 임베딩으로 실제 분류에 붙이는 기법이 논의됐습니다. 왜 이것이 동작할 수 있는지는 임베딩 공간의 비대칭성으로 설명됩니다. 다만 원문에는 측정 결과가 없고, 댓글에는 이 기법이 정말 원본 질의를 직접 임베딩하는 것보다 나은지 묻는 정확한 반론과 더 싼 대안이 함께 나왔습니다. 무엇을 어떻게
2026-08-14 · 13 분 읽기 #llm#embedding#classification#search#retrievalGemini 3.7 Flash의 도입가와 3주 주기 — 모델 원가를 계약이 아니라 확률로 잡아야 하는 이유
Gemini 3.7 Flash 발표에서 실무자가 봐야 할 것은 벤치마크 상승폭이 아니라 두 가지입니다. 하나는 특정 날짜에 단가가 두 배로 오르는 도입가 구조이고, 다른 하나는 직전 모델이 3주 전에 나왔다는 사실입니다. 이 둘이 겹치면 모델 원가는 고정비가 아니라 만료일이 붙은 조건부 값이 됩니다. 공개된 벤치마크가 무엇을 비교하고 무엇을 비교하지 않는지, 그리고 발표에서 끝내 공개되지 않
2026-08-14 · 13 분 읽기 #llm#cost-optimization#benchmark#api-design#capacity-planningCerebras Ultrafast와 에이전트 루프의 병목 — 초당 750토큰이 줄이지 못하는 시간
Cerebras와 OpenAI가 초당 최대 750토큰을 내는 추론 티어를 공개했습니다. 발표문이 밝히는 원리는 연산량이 아니라 데이터 이동이고, 가중치를 웨이퍼 위 SRAM에 올려 두는 방식입니다. 왜 배치 1의 디코딩이 메모리 대역폭에 묶이는지, 발표된 배속 수치가 무엇을 재고 무엇을 재지 않는지, 그리고 토큰 생성이 빨라져도 줄지 않는 시간이 여러분의 에이전트 루프에서 몇 퍼센트인지 계산
2026-08-14 · 14 분 읽기 #llm#inference#hardware#latency#performance하네스 지문과 버전 관리 — 기록 없는 변경을 추적 가능하게
프롬프트 커밋도 모델 변경도 없는데 성공률이 움직였다면, 무엇을 되돌려야 할까요. 하네스 엔지니어링 시리즈 7편은 하네스를 구성하는 모든 결정을 정규화된 해시 하나로 요약하는 하네스 지문을 다룹니다. 지문에 무엇을 넣고 무엇을 빼는지, 왜 지문이 같아야 비교가 성립하는지, 그리고 지문 이력으로 회귀를 이등분해 롤백하는 방법까지 정리했습니다.
2026-08-12 · 9 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트하네스 엔지니어로 성장하기 — 왜 생긴 직무이고 무엇을 연습해야 하나
하네스 엔지니어라는 직함은 채용 공고에 드물지만, 그 일은 에이전트를 배포하는 모든 팀에 이미 있습니다. 하네스 엔지니어링 시리즈 마지막 8편에서 이 직무가 왜 생겼는지, 기존 소프트웨어 역량이 어떻게 재배치되는지, 그리고 관측과 지문부터 자기 개선 루프까지 여섯 개의 근육을 하네스 RPG의 6개 티어로 단계별 연습하는 경로를 정리했습니다.
2026-08-12 · 9 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트도구 표면 설계 — 스키마 한 줄이 성공률을 움직입니다
도구를 더 붙였는데 에이전트 성공률이 떨어지는 일은 드물지 않습니다. 도구 표면은 에이전트의 인터페이스이고, 이름·설명·파라미터·실패 반환·응답 크기가 전부 설계 대상입니다. 하네스 엔지니어링 시리즈 3편에서 도구 수의 저주, 네임스페이싱과 설명 문구, 포카요케 파라미터, 실패를 돌려주는 형식까지 도구 표면 설계를 정리했습니다.
2026-08-12 · 10 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트컨텍스트 예산 — 무엇을 넣을지가 아니라 무엇을 뺄지가 설계입니다
컨텍스트 창은 아직 남았는데 에이전트 정확도는 떨어집니다. 컨텍스트는 유한한 주의 예산이고, 도구 스키마도 그 예산을 먹습니다. 하네스 엔지니어링 시리즈 2편에서 프롬프트 누적을 플레이북으로 바꾸는 법, 드롭 정책과 컴팩션의 기준, 서브에이전트 위임의 비용까지 컨텍스트 예산 설계를 정리했습니다.
2026-08-12 · 11 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트지금 주목받는 오픈소스 (1) AI 에이전트와 LLM 도구
LLM 애플리케이션 스택은 추론 서버, 오케스트레이션, 게이트웨이, 에이전트, RAG로 층이 갈라졌습니다. 각 층에서 실제로 쓰이는 오픈소스 12개를 스타 순위가 아니라 역할별로 묶어 소개합니다. 프로젝트마다 무엇을 대체하는지, 성숙도가 어느 정도인지, 어떤 상황에서 쓰면 안 되는지를 함께 정리했고, 저장소 경로와 라이선스, 스타 수, 최근 푸시 날짜는 2026년 8월 12일 GitHub에서
2026-08-12 · 10 분 읽기 #open-source#llm#ai-agent#ai-platform#rag하네스 엔지니어링이란 무엇인가 — 모델은 고정 입력이고, 배포하는 것은 그 주위 전부입니다
같은 모델을 쓰는데 왜 팀마다 에이전트 성과가 다를까요. 대부분의 팀에게 모델은 고정 입력이고, 실제로 배포하는 것은 도구 표면, 실패 반환 형식, 루프와 정지 조건, 컨텍스트 정책, 권한, 평가자까지 모델을 둘러싼 하네스 전부입니다. 하네스 엔지니어링 시리즈 1편으로, 하네스의 정의와 여섯 개의 손잡이, 그리고 프롬프트 엔지니어링이라는 이름이 이 일을 과소평가하는 이유를 정리했습니다.
2026-08-12 · 11 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트루프 설계 — 무한 루프와 조기 포기 사이
에이전트 루프의 실패는 두 방향입니다. 같은 호출을 수십 번 반복하는 무한 루프와, 한 번 막히자마자 포기하는 조기 정지. 하네스 엔지니어링 시리즈 4편에서 재시도 상한, 고정 스텝·목표 체크·확신도라는 세 가지 정지 조건, 확신도 기반 정지의 함정, 그리고 사람·서브에이전트로의 에스컬레이션까지 루프 설계를 정리했습니다.
2026-08-12 · 10 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트리워드 해킹 — 지표는 오르는데 과제는 실패합니다
에이전트가 테스트를 통과시키는 가장 싼 방법이 테스트를 고치는 것이라면, 에이전트는 그렇게 합니다. 리워드 해킹은 버그가 아니라 우리가 정의한 목표를 정확히 최적화한 결과입니다. 하네스 엔지니어링 시리즈 6편에서 채점 기준 완화와 assertion 삭제 같은 흔한 형태, 권한 격리가 지우는 절반, 그리고 견제 지표 설계까지 리워드 해킹 대응을 정리했습니다.
2026-08-12 · 10 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트국내 개발 블로그 명글 큐레이션 3 — AI와 ML 실무, 직접 열어 확인한 14편
AI와 ML을 실무에서 다루는 한국어 글 중에서 구체적이고 재현 가능한 14편을 골랐습니다. LangChain RAG 파이프라인 전 과정, 임베딩과 벡터 유사도로 본 의미 검색의 원리, 벡터 데이터베이스 일곱 종 비교, pgvector에서 Qdrant로 옮긴 마이그레이션 기록, Ollama에서 vLLM으로 옮겨 처리량을 끌어올린 과정, LLM 서빙 지표의 트레이드오프, 사용량 추적기 자작기,
2026-08-12 · 23 분 읽기 #curation#큐레이션#ai#llm#rag평가자 병목 — 약한 채점자가 시스템 전체의 상한이 됩니다
하네스를 아무리 고쳐도 점수가 안 오른다면, 병목은 하네스가 아니라 평가자일 수 있습니다. 측정할 수 없는 품질은 선택할 수 없고, 그래서 약한 채점자가 시스템 전체의 상한이 됩니다. 하네스 엔지니어링 시리즈 5편에서 스모크 테스트부터 단위 테스트, 루브릭, 채점 자료 격리, 견제 지표 패널까지 평가자의 사다리와 평가 보정을 먼저 해야 하는 이유를 정리했습니다.
2026-08-12 · 10 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트텍스트 생성 오픈 모델, 크기대별로 고르는 법
오픈 텍스트 생성 모델을 고를 때 크기는 성능 등급이 아니라 배치 제약입니다. 이 글은 온디바이스용 소형, 단일 GPU에 올리는 중형, 서버가 필요한 대형으로 나눠 각 구간에서 실제로 확인한 모델들의 파라미터, 컨텍스트, 라이선스를 정리하고, MoE 모델의 메모리 계산이 왜 다른지, 컨텍스트 확장이 왜 공짜가 아닌지, 카드가 요구하는 실행 조건을 무시하면 무엇이 깨지는지를 설명합니다. 오픈
2026-08-12 · 12 분 읽기 #ai#llm#huggingface#open-source-llm#text-generation한국어를 지원하는 오픈 모델과 토크나이저 비용
한국어 지원이라는 표기는 그 언어를 처리한다는 뜻이지 잘한다는 보장이 아닙니다. 이 글은 2026-08-12에 확인한 한국어 전용·이중언어 오픈 모델과 다국어 모델의 카드 값을 정리하고, 토크나이저가 한국어를 어떻게 쪼개는지가 왜 그대로 비용과 컨텍스트 소모로 이어지는지, 그리고 그것을 직접 재는 방법을 설명합니다. 한국어 모델에서 특히 갈리는 라이선스 유형도 함께 다룹니다. 오픈 모델 가이
2026-08-12 · 12 분 읽기 #ai#llm#huggingface#open-source-llm#korean-nlp라이선스와 배포: 유형 읽는 법과 양자화 배포판 출처 확인
오픈 모델의 license 필드에 적힌 짧은 식별자는 목차일 뿐이고 실제 조건은 전문에 있습니다. 이 글은 2026-08-12에 실제로 마주친 라이선스 유형들을 정리하고, 커뮤니티 라이선스와 비상업 조건이 무엇을 요구하는지, 게이트 저장소가 배포 파이프라인에서 왜 문제가 되는지, 그리고 GGUF 같은 양자화 배포판의 출처를 어떻게 확인해야 하는지를 설명합니다. 오픈 모델 가이드 시리즈 마지막
2026-08-12 · 13 분 읽기 #ai#llm#huggingface#open-source-llm#license코드 모델 고르기: 자동완성과 대화형, FIM, 라이선스
코드 모델은 편집기 안에서 커서 위치를 채우는 자동완성용과 질문에 답하는 대화형이 서로 다른 제품입니다. 이 글은 2026-08-12에 확인한 오픈 코드 모델들의 파라미터, 컨텍스트, FIM 지원 표기, 라이선스를 정리하고, 기본 모델에 채팅을 시키면 왜 실패하는지, 코드 모델에서 라이선스가 왜 특히 조심스러운지를 설명합니다. 오픈 모델 가이드 시리즈 7편입니다.
2026-08-12 · 13 분 읽기 #ai#llm#huggingface#open-source-llm#code-llm