ブログ
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3508 件
#2026-03 764#japanese 587#deep-dive 254#kubernetes 247#culture 236#career 224#ai 214#llm 208#devops 193#2026-04 144#security 139#observability 113#database 110#communication 107#architecture 100#productivity 88#finance 87#mindset 80#ai-papers 79#history 79#it 78#psychology 78#english 75#networking 74#deep-learning 73#gpu 70#linux 70#performance 70#cs-fundamentals 63#ai-agent 61#postgresql 59#rag 59#economy 57#mlops 53#self-improvement 53#ai-platform 51#food 51#learning 51#python 51#travel 51
プロダクション RAG パターン — 素朴な RAG が失敗する理由と、実際に効く技法
デモ用の RAG は半日で作れますが、プロダクションで静かに壊れる場所は、たいてい生成ではなく検索です。本稿はチャンキング、埋め込みとハイブリッド検索(BM25 + ベクトル)、リランキング、コンテキスチュアル・リトリーバル、クエリ書き換え、そして評価を、それぞれ何であり・いつ効き・何を代償に払うのかで整理します。Anthropic のコンテキスチュアル・リトリーバルの数値のように出典のある数字だけを引用し、RAG は魔法ではないこと、
2026-07-11 · 18 分で読めます #ai#rag#llm#retrieval#embeddingsForward Deployed Engineer(FDE)を目指す — 本当に必要なソフトウェア知識の地図
Forward Deployed Engineer(FDE)はPalantirが生み出した職種で、エンジニアが顧客企業に直接入り込み、製品を彼らの実環境にデプロイ・統合する役割です。最近はOpenAIやAnthropicといったAI企業が、自社モデルを顧客インフラに載せるためにこの職種を大量に採用し、再び注目を集めています。この記事はFDEを目指す人のために、役割の実像(実際のソースに基づく)と本当に重要なソフトウェア知識 — Linu
2026-07-11 · 11 分で読めます #career#fde#software-engineering#palantir#solutions-engineeringLLM学習データ前処理の完全ガイド — Webクロールからトークンパッキングまで、最新論文とともに
よいモデルはよいデータから生まれ、よいデータは前処理パイプラインから生まれます。Webクロール収集 → 本文抽出 → 言語識別 → ヒューリスティック・分類器による品質フィルタリング → 厳密・近似(MinHash)重複除去 → PII・有害性処理 → ベンチマーク汚染除去 → トークナイズとシーケンスパッキングまで、事前学習データの全工程を段階ごとに解説します。あわせてSFTデータ整備の要点、datatrove・Dolma・NeMo
2026-07-09 · 13 分で読めます #ai#llm#data-engineering#preprocessing#training自動化の三つの部族 — Zapier・Make・n8n、RPA、そして2026年のエージェンティック自動化
「これを自動化して」という言葉を前に、人はしばしば見当違いのツールを手に取ります。自動化には互いに異なる三つの部族があるからです — APIをつなぐワークフロー自動化(Zapier・Make・n8n)、APIのない画面を人のように操作するRPA(UiPath・Power Automate)、そして判断まで肩代わりするAIエージェント。各部族の正体と2026年の地形(課金モデルの罠、n8n 2.0のAIノード、Zapier Agents、
2026-07-09 · 10 分で読めます #automation#rpa#zapier#n8n#ai-agentsGPU Operator × KubeVirt 総まとめ — コンポーネント・設定・バージョン、部分MIGと手動MIGまで
Kubernetes GPUインフラの二本柱を1ページに総整理します。GPU Operatorのオペランド構成、ClusterPolicy設定、バージョン体系とあわせて、ノードの一部のGPUだけにMIGを適用するカスタム設定と、nvidia-smiでMIGを手動で作成・削除する方法を扱います。さらに、KubernetesでVMを動かすKubeVirtの4大コンポーネント(virt-operator・controller・handler・
2026-07-09 · 12 分で読めます #kubernetes#gpu#kubevirt#mig#nvidiaKeycloakで SSO を構築する — Realm・Client・フローから 2026 年の新機能まで
社内アプリ 20 個にログインをそれぞれ実装する代わりに、1 つのアイデンティティサーバーがすべてを代行できるようにするのが SSO です。オープンソースの標準である Keycloak を、Realm・Client・Role・Identity Provider という 4 つの中核概念で理解し、OIDC Authorization Code + PKCE のログインフローを 1 ステップずつ追い、Quarkus ディストリビューションの
2026-07-09 · 14 分で読めます #keycloak#sso#oidc#security#devops3Dを作る2つの道 — 復元(NeRF・ガウシアンスプラッティング)と生成(TRELLIS・Hunyuan3D)
「3Dモデルを作る」という言葉には、まったく異なる2つの問題が隠れています。実際に存在するシーンを複数枚の写真からよみがえらせる復元(reconstruction)と、存在しないものをテキストや画像1枚から作り出す生成(generation)です。復元の系譜をSfMからNeRF、そして流れを変えた3Dガウシアンスプラッティングとfeedforward復元(Meta MapAnything)まで追い、生成の系譜をDreamFusionのS
2026-07-09 · 14 分で読めます #3d#ai#gaussian-splatting#nerf#computer-vision2026年ロボット企業マップ — ヒューマノイド激戦とVLAモデル、そしてエンジニアの参入経路
2026年はヒューマノイドの出荷台数が前年比約7倍(5万台見込み)へ跳ね上がる変曲点です。390億ドルのバリュエーションを持つFigureと自社VLAモデルHelix、2026年夏に量産へ入るTesla Optimus Gen 3、すでに5,500台を販売した価格破壊者Unitree、ロボットの汎用頭脳を売るPhysical Intelligence(π0)まで — 主要企業をハードウェア・頭脳・市場の軸で整理し、RT-2からGR00T
2026-07-09 · 10 分で読めます #robotics#ai#vla#trends#careerマルチGPU・マルチノード学習プラットフォーム総まとめ — フレームワークの地図からSlurm・Kubeflow実践ガイドまで
GPU複数枚・ノード複数台でモデルを学習させる全体の地形を1枚に整理します。AIライブラリ・フレームワークのエコシステム地図(PyTorch・JAX・HuggingFace・DeepSpeed・Ray)、並列化戦略(DDP・FSDP・ZeRO・TP・PP)をいつ何で選ぶか、torchrunの単一ノードからマルチノードへの拡張、HPC標準であるSlurmの使い方ガイド(sbatchスクリプトとマルチノードtorchrunの連携)、Kube
2026-07-09 · 11 分で読めます #ai#ml#distributed-training#slurm#kubeflowDockerからPodmanへ — デーモンレス・コンテナエンジン移行完全ガイド
Podmanはデーモンなし(fork-exec)で動き、rootlessがデフォルトという点で、Dockerとはアーキテクチャの哲学から異なります。内部動作(conmon・crun)、設定ファイルの場所と意味、GPUを使うためのCDI設定、compose.yamlをそのまま使う二つの方法(Podmanソケット+docker compose vs podman-compose)、SELinuxボリュームラベルのような移行の罠、バージョン・
2026-07-08 · 12 分で読めます #docker#podman#containers#devops#linuxLLMキャッシングの原理 — プロンプトキャッシングとPrefix Cacheはなぜお金を節約できるのか
プロンプトの前半が同じだと、なぜコストが10分の1になるのでしょうか。答えはトランスフォーマー内部のKVキャッシュにあります。アテンションが因果的(causal)なので、前方トークンのKey/Valueベクトルは後ろに何が来ても変わらず、保存して再利用できるのです。prefillとdecodeの区別、KVキャッシュのメモリ計算、vLLM・SGLangのprefix cache実装、そしてAnthropic・OpenAIプロンプトキャッシ
2026-07-08 · 13 分で読めます #ai#llm#caching#inference#performance最新LLM量子化技術の総まとめ — GPTQ・AWQからFP8・MXFP4・KVキャッシュ量子化まで
量子化はモデルの数値をより少ないビットで表現し、メモリとコストを削る技術です。ビットを減らしても品質が持ちこたえる理由(外れ値とスケーリング)、GPTQとAWQのアプローチの違い、llama.cpp GGUFのk-quant、QLoRAのNF4、そして2026年の中心軸であるFP8とマイクロスケーリングFP4(MXFP4・NVFP4)、次のボトルネックであるKVキャッシュ量子化まで — W4A16のような表記の読み方とハードウェア・目的
2026-07-08 · 13 分で読めます #ai#llm#quantization#inference#optimization所有権の逆襲とAI現実点検 — 今週のHN・GeekNewsホットトピック
今週のHacker NewsとGeekNews上位を貫く流れは二つ。オープンソース地図・オープンハードウェア・交換式バッテリーへと広がる「所有権の逆襲」、そしてオープンウェイトの価格圧力とエージェント減速論が導く「AI現実点検」。二つの流れがなぜ同じ問い — コントロール — に収束するのか、七つのホットトピックで読み解きます。
2026-07-07 · 9 分で読めます #trends#hackernews#geeknews#ai#opensourceFDE(Forward Deployed Engineer)完全解剖 — いまAI業界で最も熱い職種
企業のGenAIパイロットの95%が測定可能な成果を出せていないという調査が示すとおり、いまAIのボトルネックはモデルではなくデプロイです。その溝を埋める職種がFDE — 顧客環境に入り込んで本番AIを自ら構築するエンジニア。パランティアで生まれ、OpenAI・Anthropicが数十億ドルを賭けて複製中のこの職種の起源、実際の仕事、必要スキル、報酬、トレードオフ、準備法まで全部整理します。
2026-07-07 · 14 分で読めます #career#fde#ai#palantir#rolesAIモデル開発、最初から最後まで — データからデプロイまでの現実的なライフサイクル
モデル開発は事前学習からではなく、決定のはしごから始まります — プロンプトで足りるか、RAGで足りるか、ファインチューニングが必要か。評価セットをモデルより先に作るeval-firstの原則、データ品質と合成データの罠、スケーリング則と分散学習、LoRA・DPOへと続くファインチューニングのスペクトラム、量子化と連続バッチングによるサービング、そしてデプロイ後のデータフライホイールまで — AIモデル開発の全ライフサイクルを実務の順序
2026-07-07 · 15 分で読めます #ai#ml#llm#mlops#trainingNVIDIA GPU Operator 完全攻略 — インストール・デプロイからMIG分割設定まで
KubernetesでGPUノードを手作業でセットアップする時代は終わりました。NVIDIA GPU Operatorがドライバーからデバイスプラグイン、モニタリングまでをオペレーターパターンで管理する仕組みと、Helmでのインストール・検証方法、そしてA100/H100一枚をハードウェア分離された複数のGPUに分割して使うMIGの概念・single/mixed戦略・ノードラベルによる設定・カスタムプロファイル・運用上の注意点まで、実際
2026-07-07 · 13 分で読めます #kubernetes#gpu#nvidia#mig#devopsOh My OpenCode の使い方 — OpenCode をマルチエージェントチームに
OpenCode の上に載せるオーケストレーションレイヤー Oh My OpenCode で非同期サブエージェントのチームを組む。インストール・設定・実行・コスト安全までを実践ガイドとしてまとめる。
2026-07-06 · 28 分で読めます #oh-my-opencode#opencode#ai-coding-agent#cli#developer-toolsLiteLLM 実践ガイド — 100以上の LLM を一つのインターフェースで
OpenAI、Anthropic、Gemini、Bedrock、OpenRouter、ローカルモデルまでを同一の OpenAI 形式で呼び出す LiteLLM の実践クイックスタート。インストールからストリーミング、Router、Proxy Server までを最短経路で整理する。
2026-07-06 · 14 分で読めます #litellm#llm#ai-gateway#python#openai-compatibleOpenRouter の使い方 — 一つの API で300以上の LLM を使う
OpenRouter 一つで60以上のプロバイダの300以上のモデルを OpenAI 互換の方式で呼び出す方法 — キー発行、最初の curl リクエスト、SDK ドロップイン、ルーティングとフォールバック、ストリーミングまで実務目線で整理する。
2026-07-06 · 12 分で読めます #openrouter#llm#ai-gateway#api#openai-compatible技術面接準備プレイブック — コーディング・システム設計・行動面接まで
技術面接は実力の試験であると同時に、独立した一つの技術です。コーディング面接のパターン学習法、システム設計面接の5段階フレーム、STAR法による行動面接のストーリーバンク作り、職種別の定番質問、そして8週間の逆算プランまで — 面接官が実際に見ているシグナルを基準に準備法を整理します。職種知識マップ編、AI勉強法編と続く三部作の第2編です。
2026-07-06 · 13 分で読めます #career#interview#skills#preparation