태그: #llm
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 216 편
Advanced Prompt Engineering 완전 가이드 2025: CoT, ToT, Self-Consistency, 메타프롬프팅
Prompt Engineering 심화! Chain-of-Thought(CoT), Tree-of-Thought(ToT), Self-Consistency, ReAct, 메타프롬프팅, Structured Output(JSON Mode), System Prompt 설계, Few-shot 최적화, Prompt Chaining, 평가(auto-eval), 프로덕션 프롬프트 관리.
2026-04-14 · 40 분 읽기 #prompt-engineering#chain-of-thought#tree-of-thought#few-shot#system-promptAdvanced RAG 파이프라인 완전 가이드 2025: 청킹 전략, 리랭킹, 에이전틱 RAG, 평가
Advanced RAG의 모든 것! 문서 청킹 전략(Semantic/Recursive/Agentic), 리랭킹(Cohere/ColBERT/Cross-encoder), Query Transformation, 에이전틱 RAG(Self-RAG/CRAG), Multi-modal RAG, 평가(RAGAS/TruLens), 프로덕션 최적화.
2026-04-13 · 36 분 읽기 #rag#chunking#reranking#agentic-rag#evaluationUnsloth로 LLM 파인튜닝 완전 가이드 2025: QLoRA, 4bit 양자화, 2배 빠른 학습
Unsloth로 LLM 파인튜닝의 모든 것! QLoRA/LoRA 원리, 4bit 양자화(bitsandbytes), Unsloth 2x 속도 비밀, Llama 3/Mistral/Qwen 파인튜닝, 데이터 준비, 학습 설정, VRAM 최적화, GGUF/GPTQ 변환, 배포까지.
2026-03-25 · 25 분 읽기 #unsloth#llm#fine-tuning#qlora#lora한국어 LLM 학습 데이터 제작 완전 가이드: Hugging Face 데이터셋, 전처리, 품질 관리까지
LLM 학습 데이터 제작의 모든 것! Hugging Face 데이터셋(종류/로딩/변환), 한국어 데이터 수집(크롤링/합성/번역), 전처리(토크나이징/정제/중복제거), Instruction Tuning 포맷(Alpaca/ShareGPT/OpenAI), 품질 관리, RLHF/DPO 데이터셋.
2026-03-25 · 35 분 읽기 #llm#training-data#huggingface#dataset#korean-nlpAI Agent 개발 완전 가이드 2025: Tool Calling, ReAct, Multi-Agent, MCP까지
AI Agent 개발의 모든 것! Tool Calling(Function Calling) 원리, ReAct 패턴, Multi-Agent 아키텍처(CrewAI/AutoGen/LangGraph), MCP(Model Context Protocol), Agent 프레임워크 비교, Tool Calling 성능 최적화, 프로덕션 배포 전략.
2026-03-25 · 39 분 읽기 #ai-agent#tool-calling#function-calling#react-pattern#multi-agentLiteLLM 완전 가이드 2025: 100+ LLM을 하나의 API로 통합하는 프록시 서버
LiteLLM의 모든 것! 100+ LLM 통합 API, OpenAI 호환 프록시 서버, 비용 추적/예산 관리, 로드 밸런싱/폴백, 모델 라우팅, 가상 키, 레이트 리밋, Guardrails, 프로덕션 배포(Docker/K8s).
2026-03-25 · 26 분 읽기 #litellm#llm#api#proxy#openaiBFCL 벤치마크 완전 가이드 2025: Tool Calling 성능 평가, 리더보드 분석, 모델 비교
BFCL(Berkeley Function Calling Leaderboard)의 모든 것! 벤치마크 카테고리(Simple/Multiple/Parallel/Relevance/AST), 평가 메트릭, 모델 성능 비교(Claude/GPT/Gemini/Llama), 자체 모델 평가 방법, Tool Calling 개선 전략.
2026-03-25 · 35 분 읽기 #bfcl#benchmark#tool-calling#function-calling#evaluation2025 오픈소스 AI 모델 완전 비교: DeepSeek R1 vs Llama 4 vs Qwen 3 vs Mistral — 누가 왕인가
DeepSeek R1(671B/37B), Llama 4 Scout/Maverick, Qwen 3(235B MoE), Mistral 8x22B — 2025년 오픈소스 AI 모델 4강 완전 비교. 벤치마크, 라이센스, 배포 방법, 비용 분석까지.
2026-03-22 · 32 분 읽기 #open-source#ai#llm#deepseek#llamaMCP(Model Context Protocol) 완전 가이드: 9,700만 다운로드의 AI 표준이 된 이유
Anthropic이 만들고 OpenAI, Google이 채택한 MCP. 월간 9,700만 다운로드, Linux Foundation 기부, MCP 서버 구축 실전 가이드까지 — AI 에이전트 시대의 USB-C 표준.
2026-03-22 · 37 분 읽기 #mcp#ai#anthropic#openai#googleAI 프롬프트 엔지니어링 완전 가이드: 개발자가 알아야 할 프롬프트 기법 30선
Zero-shot부터 Chain-of-Thought, Tree-of-Thought, ReAct, Few-shot, Self-Consistency까지 — 개발자를 위한 프롬프트 엔지니어링 30가지 기법을 실전 예시와 함께. Claude, GPT-4, Gemini에서 최대 성능을 끌어내는 방법.
2026-03-22 · 49 분 읽기 #prompt-engineering#ai#llm#chatgpt#claude집에서 AI 슈퍼컴퓨터를: NVIDIA DGX Spark로 LLM 공부하고 ComfyUI로 콘텐츠 만들기
NVIDIA DGX Spark($3,999)로 200B 파라미터 LLM을 로컬에서 돌리고, ComfyUI로 FLUX/SDXL 이미지를 생성하는 완전 가이드. 스펙 비교, 벤치마크, 셋업 방법, 비용 분석까지 — 개인 AI 슈퍼컴퓨터 시대가 열렸다.
2026-03-21 · 53 분 읽기 #nvidia#dgx-spark#comfyui#local-ai#llm2025년 AI 논문 트렌딩 총정리: HuggingFace 인기 논문부터 10대 연구 트렌드까지
HuggingFace 트렌딩 논문 TOP 10과 2025년 AI 연구 10대 트렌드를 개발자 관점에서 리뷰합니다. DeepSeek-R1의 순수 RL 추론, Nemotron-Cascade 30B/3B MoE, GRPO, vLLM PagedAttention, 100만 토큰 컨텍스트의 한계, 비디오 생성 벤치마크까지.
2026-03-21 · 67 분 읽기 #ai-research#papers#huggingface#reasoning#moe토스뱅크 ML Engineer (MLOps) 합격 완벽 가이드: MLFlow부터 LLM 플랫폼까지 기술스택 총정리
토스뱅크 ML Platform Team의 MLOps Engineer JD를 완전 분석합니다. MLFlow, Airflow, JupyterHub, Kubeflow, Triton Inference Server, ScyllaDB Feature Store, LLM 플랫폼까지 — 합격을 위한 기술스택 딥다이브, 면접 예상 질문 30선, 6개월 학습 로드맵.
2026-03-21 · 67 분 읽기 #mlops#ml-platform#tossbank#kubernetes#mlflow[Architecture] LiteLLM 완전 가이드: 100+ LLM 통합 서빙과 비용 관리
LiteLLM으로 OpenAI, Anthropic, Azure, Bedrock 등 100+ LLM을 하나의 API로 통합하는 방법, Proxy 서버 구축, 비용 추적, Rate Limiting, Load Balancing까지 총정리합니다.
2026-03-20 · 19 분 읽기 #architecture#litellm#llm#ai-gateway#mlopsPrompt Engineering 2025 실전 가이드: GPT-4o와 Claude 3.5를 최대한 활용하는 법
모델이 아무리 좋아도 프롬프트가 엉망이면 결과도 엉망입니다. 2025년 현재 프로덕션에서 실제로 효과가 입증된 프롬프트 엔지니어링 기법 6가지를 코드와 함께 설명합니다.
2026-03-18 · 15 분 읽기 #prompt-engineering#llm#ai-development#gpt-4o#claudeLLM 환각(Hallucination) 완전 해부: 왜 AI는 거짓말을 하고, 어떻게 막는가
LLM이 왜 사실이 아닌 것을 자신있게 말하는지 기술적 원인을 분석하고, RAG, 자기비판, Chain of Verification 등 5가지 실전 해결 전략을 코드와 함께 설명합니다.
2026-03-18 · 15 분 읽기 #환각#hallucination#llm#AI신뢰성#ai-developmentContext Window 100만 토큰 시대: RAG는 사라지는가?
Gemini 1.5 Pro의 100만 토큰, Claude의 20만 토큰 컨텍스트 윈도우가 등장하면서 "RAG가 필요 없어지는 것 아니냐"는 질문이 많아졌습니다. 실제 비용, 속도, 품질을 비교해서 솔직하게 답합니다.
2026-03-18 · 12 분 읽기 #context-window#rag#llm#long-context#ai-developmentFine-tuning 실전 가이드: LoRA와 QLoRA로 나만의 모델 만들기
H100 7대 없어도 됩니다. LoRA와 QLoRA를 사용하면 소비자용 GPU 한 장으로 70B 모델을 파인튜닝할 수 있습니다. 실전 코드와 함께 처음부터 끝까지 설명합니다.
2026-03-18 · 12 분 읽기 #fine-tuning#lora#qlora#llm#ai-developmentTool Calling 실전 가이드: AI가 외부 세계를 다루는 방법과 흔한 함정들
Tool Calling은 LLM을 진짜 에이전트로 만드는 핵심 메커니즘입니다. OpenAI function calling 구현부터 병렬 실행, 그리고 현업에서 실제로 마주치는 함정과 해결법까지 실전 중심으로 정리했습니다.
2026-03-18 · 13 분 읽기 #tool-calling#function-calling#ai-agent#llm#ai-developmentLLM Agent 설계 패턴 완전 가이드: ReAct부터 Multi-Agent까지
ReAct, Chain of Thought, Plan-and-Execute, Reflection, Tree of Thoughts — LLM Agent를 실제로 만들 때 어떤 패턴을 언제 써야 하는지, 현업 엔지니어 관점에서 정리했습니다.
2026-03-18 · 12 분 읽기 #ai-agent#react#llm#설계패턴#ai-development