タグ: #mlops
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 53 件
いま注目のオープンソース (5) データと ML パイプライン
データパイプラインはスケジューラ一つでは解決しません。取り込み、変換、オーケストレーション、実行エンジン、モデルのライフサイクル、検索ストアが、それぞれ別のツールの領域になりました。この記事では、これらの層で実際に使われているオープンソース 11 件を、スター数の順位ではなく担当する区間ごとにまとめて紹介します。何を置き換えるのか、成熟度はどの程度か、いつ使うべきでないのかも併せて記し、リポジトリのパスとライセンス、スター数、最終プッシ
2026-08-12 · 8 分で読めます #open-source#data-engineering#mlops#python#rust韓国の開発ブログ名文キュレーション 3 — AIとML実務、直接開いて確認した14本
AIとMLを実務で扱う韓国語記事から、具体的で再現可能な14本を選びました。LangChainによるRAGパイプラインの全工程、埋め込みとベクトル類似度から見た意味検索の原理、ベクトルデータベース7種の比較、pgvectorからQdrantへの移行記録、OllamaからvLLMへ移してスループットを上げた過程、LLMサービングの指標のトレードオフ、使用量トラッカーの自作記、Transformer論文のレビューとコード実装、BERTの整理
2026-08-12 · 24 分で読めます #curation#큐레이션#ai#llm#ragコーディングエージェントのコストは上限ではなく摩擦で抑える
Databricksが2026年7月と8月に相次いで公開した二本のエンジニアリング記事は、コーディングエージェントの支出を扱う方法が予算上限からゲートウェイと段階的な摩擦へ移りつつあることを示しています。この記事はその設計を分解します。なぜハード予算が最後の手段なのか、なぜ日次の暴走防止と月次のガバナンスを分けるのか、なぜ増分ひとつの大きさが設計のすべてなのか、そして実際にコストを支配するのがモデル単価ではなくコンテキストなのはなぜかを
2026-08-09 · 15 分で読めます #mlops#llm#cost#ai-gateway#developer-productivitySlurmでGPUクラスタを使う — 提出より大事なのはなぜ動かないかを知ること
GPUクラスタでSlurmを実務で使うのに必要なことだけを整理しました。パーティション、QoS、アカウントという座標系をまず立て、sbatchスクリプトでGPUとCPU、メモリを要求する方法とその間のバインディングの落とし穴を扱います。マルチノード学習をsrunとランデブーで立ち上げる二つのパターンを実際に動くスクリプトで提示し、配列ジョブと依存関係チェーンでスイープと再開をスケジューラに任せる方法も入れました。後半はすべて失敗事例です
2026-08-02 · 22 分で読めます #mlops#slurm#hpc#gpu-cluster#distributed-trainingLLM Opsが実際にやっていること — 再現性、汚染、チェックポイント、昇格、そしてロールバック
LLM Opsをツールの一覧ではなく責任の一覧として整理しました。学習の実行を再構築できるようにする実行マニフェストに何を含めるべきか、評価セットのデータ汚染をどう防ぎ監査するか、チェックポイント間隔を障害率から逆算する公式と保管コストの実際の数字、評価をCIに組み込む際に何をゲートにするかを扱います。後半では学習とサービングの間の引き継ぎで実際に壊れる箇所、デプロイ後の回帰検知、ロールバック設計を扱います。ツールはカテゴリ別にのみ紹介
2026-08-02 · 23 分で読めます #mlops#llmops#reproducibility#evaluation#model-registry公開された学習事例から学ぶ — 何を試し、何が失敗したか
公開された大規模学習の技術報告書とログブック七件を選び、成功指標ではなく失敗とその対応だけを抜き出して整理しました。Llama 3 405Bの54日間419件の中断統計からチェックポイント周期を逆算し、DeepSeek-V3とKimi K2が損失スパイクをそれぞれ異なる層でなくした方法を比較します。Olmo系列が安定性の修正をアーキテクチャに残した理由、OPT-175BとBLOOMのログブックが残した失敗記録の原型、SmolLM3とMa
2026-08-02 · 23 分で読めます #mlops#llm-training#case-study#training-stability#scalingマルチGPU学習の四つの並列化 — 何を分割し、何を通信するか
データ並列、テンソル並列、パイプライン並列、コンテキスト並列がそれぞれ何を分割し、その代償として何を通信するのかを数字で整理しました。まずAdam混合精度学習のパラメータあたり16バイトの内訳を組み立て、ZeROステージ1〜3がその内訳のどの項をGPU数で割るのかを計算します。続いて活性化メモリの計算式でチェックポインティングがなぜ100GBを1GBに変えるのかを確認し、各並列化の通信量をステップあたりバイト数に換算して、NVLink内
2026-08-02 · 21 分で読めます #mlops#distributed-training#multi-gpu#fsdp#deepspeed2026年のLLM学習スタック地図 — 各層が何を代わりにやってくれて、何を隠すか
LLM学習フレームワークを三つの層に分けて系譜を整理しました。下の層はPyTorch分散、DeepSpeed、Megatron-Coreのような実行エンジンで、真ん中はtorchtitanやMegatron-Bridgeのような学習ループ、上の層はTRLやAxolotlのように設定ファイルでファインチューニングを回してくれる道具です。各層が何を代わりにやってくれて、代わりに何を隠すのか、そして上位フレームワークがむしろ邪魔になる地点はど
2026-08-02 · 21 分で読めます #mlops#llm-training#pytorch#trl#frameworkマルチGPU・マルチノード学習プラットフォーム総まとめ — フレームワークの地図からSlurm・Kubeflow実践ガイドまで
GPU複数枚・ノード複数台でモデルを学習させる全体の地形を1枚に整理します。AIライブラリ・フレームワークのエコシステム地図(PyTorch・JAX・HuggingFace・DeepSpeed・Ray)、並列化戦略(DDP・FSDP・ZeRO・TP・PP)をいつ何で選ぶか、torchrunの単一ノードからマルチノードへの拡張、HPC標準であるSlurmの使い方ガイド(sbatchスクリプトとマルチノードtorchrunの連携)、Kube
2026-07-09 · 11 分で読めます #ai#ml#distributed-training#slurm#kubeflowAIモデル開発、最初から最後まで — データからデプロイまでの現実的なライフサイクル
モデル開発は事前学習からではなく、決定のはしごから始まります — プロンプトで足りるか、RAGで足りるか、ファインチューニングが必要か。評価セットをモデルより先に作るeval-firstの原則、データ品質と合成データの罠、スケーリング則と分散学習、LoRA・DPOへと続くファインチューニングのスペクトラム、量子化と連続バッチングによるサービング、そしてデプロイ後のデータフライホイールまで — AIモデル開発の全ライフサイクルを実務の順序
2026-07-07 · 15 分で読めます #ai#ml#llm#mlops#trainingNVIDIA GPU Operator 完全攻略 — インストール・デプロイからMIG分割設定まで
KubernetesでGPUノードを手作業でセットアップする時代は終わりました。NVIDIA GPU Operatorがドライバーからデバイスプラグイン、モニタリングまでをオペレーターパターンで管理する仕組みと、Helmでのインストール・検証方法、そしてA100/H100一枚をハードウェア分離された複数のGPUに分割して使うMIGの概念・single/mixed戦略・ノードラベルによる設定・カスタムプロファイル・運用上の注意点まで、実際
2026-07-07 · 13 分で読めます #kubernetes#gpu#nvidia#mig#devopsVision LLM の学習法 — 入力と出力をどう教えるか
ビジョン言語モデルは整列事前学習からインストラクションファインチューニングまで段階的に学習されます。ビジョンエンコーダの凍結戦略、データ構成、入力フォーマットと出力形式、損失計算まで、何をどう教えるかを学習パイプラインの観点で整理します。
2026-06-26 · 32 分で読めます #mlops#vision-language-model#multimodal#training#instruction-tuningLLM推論サービング2026 — vLLM、SGLang、TensorRT-LLMの比較
2026年のLLM推論サービングを一目で整理します。prefillとdecodeの性質の違い、continuous batching、paged KVキャッシュといった核心原理から、vLLM、SGLang、TensorRT-LLMの強み弱みの比較と選択ガイド、実際のデプロイ設定まで、開発者の視点で扱います。
2026-06-26 · 26 分で読めます #llm-serving#vllm#sglang#tensorrt-llm#inferenceマルチモーダルLLMのサービング — 画像入力が生む新たな課題
テキスト専用LLMサービングとの違いから、ビジョンエンコーダの追加段階、可変のビジュアルトークン数、プリフィルコストの急増、マルチモーダルKVキャッシュとバッチングの難しさ、遅延分解とスループット最適化、コストと運用の落とし穴まで、マルチモーダルLLMサービングの実務を整理します。
2026-06-26 · 24 分で読めます #mlops#multimodal#llm-serving#vllm#kv-cache推論を速く — Speculative Decodingとスループット最適化
LLMのdecodeが遅い根本的な理由から、speculative decodingで速度を引き上げる原理、MedusaやEAGLEのような変種、chunked prefillとprefill/decodeの分離、遅延とスループットのトレードオフ、そしてTTFTやTPOTのような測定指標まで、推論高速化の核心を整理します。
2026-06-26 · 23 分で読めます #speculative-decoding#throughput#inference#mlops#latencyオープンソース ML プラットフォーム & MLOps 2026 完全ガイド - Kubeflow・Metaflow・Flyte・ZenML・MLflow・BentoML・ClearML・DVC・Weights & Biases 徹底比較
2026年5月時点、本番 ML パイプラインを支える OSS MLOps スタックは 7 レイヤに収れんした。実験追跡(MLflow 3.0・W&B・Comet・Neptune.ai・Aim)、パイプラインオーケストレーション(Kubeflow・Metaflow・Flyte・ZenML)、モデルレジストリ、サービング(BentoML 1.4・Seldon Core 2・KServe・Triton・Ray Serve)、特徴量ストア(Fe
2026-05-16 · 22 分で読めます #japanese#mlops#kubeflow#metaflow#flyteMLOpsプラットフォーム 2026 完全版 - MLflow · Kubeflow · W&B · Vertex AI · SageMaker · Databricks · BentoML · Ray · Modal · Hugging Face 徹底ガイド
2026年5月時点のMLOpsプラットフォーム30種を一気に比較する。MLflow 3、Kubeflow 1.10、Weights & Biases、Comet、Neptune.ai、ClearML、Vertex AI、SageMaker、Azure ML、Databricks ML + Mosaic AI、Hugging Face Inference Endpoints、Determined、Anyscale + Ray Train、
2026-05-16 · 21 分で読めます #mlops#mlflow#kubeflow#weights-and-biases#vertex-aiFeature Store 2026 完全ガイド - Feast・Tecton・Hopsworks・Databricks・Vertex AI・SageMaker・Featureform・Bytewax・Materialize・RisingWave・Fennel・Chalk 徹底比較
2026年5月時点のフィーチャーストア市場を本気で整理する。Feast(CNCF サンドボックス)、Tecton(Eppo 一部資産統合)、Hopsworks、Vertex AI Feature Store、SageMaker Feature Store、Databricks Feature Engineering in Unity Catalog、Featureform、ストリーミング基盤の Bytewax/Feldera/Mater
2026-05-16 · 27 分で読めます #feature-store#feast#tecton#hopsworks#databricksMLOps 完全ガイド — Model Serving・Feature Store・Drift・A/B Test・GPU Economics (Season 2 Ep 7, 2025)
モデルを学習することと本番で運用することは全く別のゲームである。Serving (TorchServe・Triton・vLLM・TGI)、Feature Store (Feast・Tecton)、Training Infra (Ray・Determined)、Experiment Tracking (MLflow・W&B)、Data/Concept Drift 検知、Model A/B Test と Shadow Deployment、
2026-04-15 · 15 分で読めます #mlops#model-serving#feature-store#drift-detection#ab-testingLLMOps 完全ガイド: モデル・プロンプト・評価セットの3軸バージョン管理、Canary、コスト統制、プラットフォームチーム (2025)
LLM プロダクトを速く作る方法は簡単になった。持続可能に回し続ける方法が難しい。モデル・プロンプト・評価セットの3軸バージョン管理、Shadow/Canary/Blue-Green デプロイ、トークン・キャッシュ・モデルルーティングによるコスト統制、組織構造(AI プラットフォーム/Model プラットフォーム/Product AI)、失敗事例、KPI・オンコールまで。MLOps の延長線上にありながら、LLM 固有の課題に正面から向
2026-04-15 · 14 分で読めます #llmops#mlops#devops#canary#cost-control