タグ: #llm
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 208 件
コンテキストエンジニアリング — AIエージェントに記憶を設計する方法
プロンプトエンジニアリングの時代が終わり、コンテキストエンジニアリングが中核スキルとして浮上しました。コンテキストウィンドウの経済学、メモリ階層の設計、会話から事実を自動抽出してユーザープロフィールを構築するパターン、RAGとメモリの区別、compaction戦略、評価手法と落とし穴まで、実務の観点から整理します。
2026-06-12 · 28 分で読めます #ai#context-engineering#llm#ai-agent#memoryLLM論文キュレーション 2024-2026 - Llama・DeepSeek・Qwen・Mistral・Phi・RLHF・DPO・CoT・RAG・FlashAttention・vLLM 詳細ガイド
LLMを構築し運用するエンジニアのための2024-2026必読論文30+本キュレーション。基盤モデル(Llama 3/4、DeepSeek-V3/R1、Qwen3、Mistral、Phi-4、Gemma 3)、学習革新(MoE、MLA、GQA)、ポストトレーニング(RLHF、DPO、ORPO、KTO)、推論(CoT、ToT、GRPO)、エージェント(ReAct、SWE-Agent)、検索(RAG、GraphRAG、ColBERT)、効率
2026-05-16 · 25 分で読めます #llm#papers#llama#deepseek#qwenLLMファインチューニングフレームワーク2026 — Axolotl / Unsloth / LLaMA-Factory / TRL / PEFT / TorchTune 徹底ガイド
2026年のLLMファインチューニング生態系を一気に整理する。Axolotl・Unsloth・LLaMA-Factory・TRL・PEFT・TorchTuneといったオープンソースフレームワークから、LLM Foundry(MosaicML、Databricksが買収)、Modal・Together・OpenAI・Anthropic・Cohereのクラウドファインチューニング API まで。QLoRA・FSDP・DeepSpeed Ze
2026-05-16 · 37 分で読めます #llm#finetuning#axolotl#unsloth#llama-factoryLLM サービング & ローカル推論 2026 — vLLM / llama.cpp / MLX / Ollama / LM Studio / SGLang / TGI 徹底比較
2026 年の LLM サービング・推論フレームワークの地図を描く。データセンター陣営(vLLM・SGLang・TGI・Triton・TensorRT-LLM)、ローカル陣営(llama.cpp・MLX・llamafile・Ollama・LM Studio・GPT4All)、新興陣営(KTransformers・MLC LLM・Modular MAX)、そしてクラウドサービング SaaS(Together・Fireworks・Groq・
2026-05-16 · 34 分で読めます #llm#model-serving#inference#vllm#llama-cppAIエージェントフレームワーク 2026 完全ガイド — LangGraph・AutoGen・CrewAI・Semantic Kernel・OpenAI Agents SDK・Claude Agent SDK・Pydantic AI 徹底比較
2026年5月時点でプロダクションのAIエージェント市場をリードする10のフレームワーク(LangGraph 0.3、AutoGen 0.4、CrewAI Flows、Semantic Kernel Agent Framework、OpenAI Agents SDK、Claude Agent SDK、Pydantic AI、Smol Agents、LlamaIndex Agent Workflows、Vercel AI SDK)のアーキ
2026-05-16 · 22 分で読めます #ai-agent#langgraph#autogen#crewai#semantic-kernelSlack bot で AI チームメンバーを作る — Claude・Gemini・OpenClaw 連携 + MCP でツール拡張 (2026 ハンズオン)
AI を最もレバレッジ高くデプロイする表面は IDE ではなく Slack だ — チーム全体が、仕事が起きる場所で使う。この記事はなぞって進めるハンズオンだ。Slack アプリを作り、Bolt SDK でメンションに応答する最小 bot を立ち上げ、Claude・Gemini・OpenClaw Gateway を連携し、thread コンテキストを扱い、MCP で bot に GitHub・Jira・DB のようなツールを持たせ、st
2026-05-14 · 21 分で読めます #slack-bot#llm#claude#gemini#openclaw推論モデル(reasoning models) 2026年ガイド — o3·o4·DeepSeek R1·Claude Thinking·Gemini Deep Think·QwQ 徹底比較
2024年9月のo1がtest-time computeという新しい軸を開いてから1年半。2026年現在、『推論モデル(reasoning model)』はもはや別の系統ではなく、すべてのフロンティアモデルが入れる『状態(mode)』になった。OpenAI o3·o3-pro·o4、DeepSeek R1·R1-0528·V3.1 reasoner、Anthropic Claude Sonnet 4.5·Opus 4.5のextende
2026-05-14 · 30 分で読めます #reasoning-models#o3#o4#deepseek-r1#claude-thinkingLLM ランドマーク論文ガイド — Attention から GPT・LLaMA・DeepSeek・o1・Claude まで (参考文献付き、2026)
LLM 分野の本当の変化は、どの論文から始まったのか。2017 年の Attention is All You Need から 2026 年の推論モデルまで、必ず知っておくべきランドマーク論文 20 編余りを時期・テーマ別に整理する。各論文は『なぜ重要か・一言要約・後続の影響』で凝縮し、arXiv・ブログのリンクを末尾にまとめた。時間の足りないエンジニアのための LLM 論文地図。
2026-05-14 · 22 分で読めます #llm#research-papers#transformer#gpt#llamaAI harness 解剖 — モデルを agent に変える scaffolding(loop・tool・context、そして自作する)
モデルは engine で、harness は車だ。同じ engine に違う車を載せれば、走行体験はまったく変わる。2026 年の AI engineering の本当の重心はモデルではなく、そのモデルを取り囲む scaffolding — harness — にある。agent loop の解剖、tool execution 層、context 管理と context rot、System Prompt の役割、制御フロー(sub-
2026-05-14 · 22 分で読めます #ai-harness#ai-agent#llm#agent-loop#tool-executionANN アルゴリズム完全ガイド 2025: HNSW、IVF、Product Quantization、LSH — Vector DB の内部はどう動くか
Pinecone、Weaviate、Qdrant、pgvector が数億ベクトルから数ミリ秒で類似項目を見つける仕組み。HNSW、IVF、Product Quantization、LSH など ANN アルゴリズムの数学と実装を深く掘り下げる。
2026-04-15 · 19 分で読めます #ann#hnsw#ivf#product-quantization#lshAI Engineering 実戦 — LLM API・RAG・Agent・LoRA/DPO・Vector DB・評価・Observability・Prompt Injection (2025)
本番LLM API呼び出しの本当の難しさ、RAGが単純検索ではない理由、Agentパターン (ReAct・Plan-Execute・ReWOO)、Fine-tuning (LoRA・QLoRA・DPO) をいつやり、いつやらないか、Vector DB決定マトリクス、LLM評価が根本的に難しい理由、コスト最適化、そしてPrompt Injection防御まで。デモではなく、本番AIアプリを出荷する方法。
2026-04-15 · 9 分で読めます #ai-engineering#llm#rag#ai-agent#loraAdvanced Prompt Engineering 完全ガイド 2025: CoT, ToT, Self-Consistency, メタプロンプティング
Prompt Engineering深掘り!Chain-of-Thought(CoT)、Tree-of-Thought(ToT)、Self-Consistency、ReAct、メタプロンプティング、Structured Output(JSON Mode)、System Prompt設計、Few-shot最適化、Prompt Chaining、評価(auto-eval)、プロダクションプロンプト管理。
2026-04-14 · 26 分で読めます #prompt-engineering#chain-of-thought#tree-of-thought#few-shot#system-promptAdvanced RAGパイプライン完全ガイド 2025:チャンキング戦略、リランキング、エージェンティックRAG、評価
Advanced RAGの全て!文書チャンキング戦略(Semantic/Recursive/Agentic)、リランキング(Cohere/ColBERT/Cross-encoder)、Query Transformation、エージェンティックRAG(Self-RAG/CRAG)、マルチモーダルRAG、評価(RAGAS/TruLens)、本番最適化。
2026-04-13 · 25 分で読めます #rag#chunking#reranking#agentic-rag#evaluationUnslothでLLMファインチューニング完全ガイド2025:QLoRA、4bit量子化、2倍高速学習
UnslothでのLLMファインチューニングの全て!QLoRA/LoRA原理、4bit量子化(bitsandbytes)、Unsloth 2倍速の秘密、Llama 3/Mistral/Qwenファインチューニング、データ準備、学習設定、VRAM最適化、GGUF/GPTQ変換、デプロイまで。
2026-03-25 · 23 分で読めます #unsloth#llm#fine-tuning#qlora#loraLiteLLM完全ガイド2025:100以上のLLMを1つのAPIで統合するプロキシサーバー
LiteLLMの全て!100以上のLLM統合API、OpenAI互換プロキシサーバー、コスト追跡/予算管理、ロードバランシング/フォールバック、モデルルーティング、仮想キー、レート制限、Guardrails、プロダクション展開(Docker/K8s)。
2026-03-25 · 22 分で読めます #litellm#llm#api#proxy#openaiBFCLベンチマーク完全ガイド2025:Tool Calling性能評価、リーダーボード分析、モデル比較
BFCL(Berkeley Function Calling Leaderboard)の全て!ベンチマークカテゴリ(Simple/Multiple/Parallel/Relevance/AST)、評価メトリック、モデル性能比較(Claude/GPT/Gemini/Llama)、自社モデル評価方法、Tool Calling改善戦略。
2026-03-25 · 30 分で読めます #bfcl#benchmark#tool-calling#function-calling#evaluation韓国語LLM学習データ制作完全ガイド:Hugging Faceデータセット、前処理、品質管理まで
LLM学習データ制作の全て!Hugging Faceデータセット(種類/ローディング/変換)、韓国語データ収集(クローリング/合成/翻訳)、前処理(トークン化/クリーニング/重複除去)、Instruction Tuningフォーマット(Alpaca/ShareGPT/OpenAI)、品質管理、RLHF/DPOデータセット。
2026-03-25 · 28 分で読めます #llm#training-data#huggingface#dataset#korean-nlpAIエージェント開発完全ガイド2025:Tool Calling、ReAct、Multi-Agent、MCPまで
AIエージェント開発の全て!Tool Calling(Function Calling)の原理、ReActパターン、Multi-Agentアーキテクチャ(CrewAI/AutoGen/LangGraph)、MCP(Model Context Protocol)、Agentフレームワーク比較、Tool Calling性能最適化、プロダクション配備戦略。
2026-03-25 · 30 分で読めます #ai-agent#tool-calling#function-calling#react-pattern#multi-agent2025年オープンソースAIモデル完全比較:DeepSeek R1 vs Llama 4 vs Qwen 3 vs Mistral
DeepSeek R1(671B/37B)、Llama 4 Scout/Maverick、Qwen 3(235B MoE)、Mistral 8x22B — 2025年オープンソースAIモデル4強完全比較。ベンチマーク、ライセンス、デプロイ方法、コスト分析まで。
2026-03-22 · 59 分で読めます #open-source#ai#llm#deepseek#llamaMCP(Model Context Protocol)完全ガイド:9,700万ダウンロードのAI標準になった理由
Anthropicが作り、OpenAI・Googleが採用したMCP。月間9,700万ダウンロード、Linux Foundation寄贈、MCPサーバー構築実践ガイドまで。
2026-03-22 · 61 分で読めます #mcp#ai#anthropic#openai#google