タグ: #training
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 8 件
LoRAのrankを変えたら学習率も変えるべきか — μA(2026)が分けた二つのレジーム、そしてその測定の限界
LoRAでrankを変えると最適学習率を探し直す必要があるという通念と、「1/rスケーリングを使えば学習率はrankと無関係になる」という通念が、実務では同時に流通しています。2026年2月にarXivへ投稿されたμA(Maximal-Update Adaptation)論文は、この二つがどちらも正しいと言います — ただし、どのα規約とどの初期化を使うかによって。本稿では、μAが導いた二つのレジーム(ηがrankの-1/2乗に比例する
2026-07-16 · 33 分で読めます #llm#lora#fine-tuning#peft#trainingLLM学習データ前処理の完全ガイド — Webクロールからトークンパッキングまで、最新論文とともに
よいモデルはよいデータから生まれ、よいデータは前処理パイプラインから生まれます。Webクロール収集 → 本文抽出 → 言語識別 → ヒューリスティック・分類器による品質フィルタリング → 厳密・近似(MinHash)重複除去 → PII・有害性処理 → ベンチマーク汚染除去 → トークナイズとシーケンスパッキングまで、事前学習データの全工程を段階ごとに解説します。あわせてSFTデータ整備の要点、datatrove・Dolma・NeMo
2026-07-09 · 13 分で読めます #ai#llm#data-engineering#preprocessing#trainingAIモデル開発、最初から最後まで — データからデプロイまでの現実的なライフサイクル
モデル開発は事前学習からではなく、決定のはしごから始まります — プロンプトで足りるか、RAGで足りるか、ファインチューニングが必要か。評価セットをモデルより先に作るeval-firstの原則、データ品質と合成データの罠、スケーリング則と分散学習、LoRA・DPOへと続くファインチューニングのスペクトラム、量子化と連続バッチングによるサービング、そしてデプロイ後のデータフライホイールまで — AIモデル開発の全ライフサイクルを実務の順序
2026-07-07 · 15 分で読めます #ai#ml#llm#mlops#trainingVision LLM の学習法 — 入力と出力をどう教えるか
ビジョン言語モデルは整列事前学習からインストラクションファインチューニングまで段階的に学習されます。ビジョンエンコーダの凍結戦略、データ構成、入力フォーマットと出力形式、損失計算まで、何をどう教えるかを学習パイプラインの観点で整理します。
2026-06-26 · 32 分で読めます #mlops#vision-language-model#multimodal#training#instruction-tuningLLMをゼロから作ってみる — スタンフォードCS336流の学習ロードマップ
スタンフォードのCS336(Language Modeling from Scratch)がHacker Newsの上位に登場し続け、ゼロからのLLM構築が再び話題になっています。トークナイザーからアテンション、分散学習、スケーリング則、アライメント、推論最適化までカリキュラム全体を解剖し、20週間の学習プランとミニプロジェクトのアイデアをまとめました。
2026-06-12 · 24 分で読めます #llm#transformer#cs336#deep-learning#tokenizerディープラーニング学習手法完全ガイド: 最適化から分散学習まで
ディープラーニングモデルを効果的に学習するためのすべての技術を網羅する完全ガイド。勾配降下法、オプティマイザー、学習率スケジューリング、正則化、バッチ正規化、転移学習、ファインチューニング、分散学習を実践的なコード例と共に解説。
2026-03-17 · 35 分で読めます #deep-learning#training#optimization#regularization#distributed-trainingディープラーニングデバッグ完全ガイド:学習失敗の診断から性能最適化まで
ディープラーニング学習失敗を体系的に診断・解決する完全ガイド。Loss NaN、勾配消失・爆発、過学習、収束遅延、メモリ不足エラーを実践コード例とともに解説。
2026-03-17 · 25 分で読めます #deep-learning#debugging#pytorch#training#optimizationText-to-Imageモデル学習方法論完全ガイド: GANからFlow Matchingまで
GAN、VAE、Diffusion、Flow Matchingに至るText-to-Image生成モデルアーキテクチャの学習方法論を論文ベースで詳細に分析します。Stable Diffusion、DALL-E、Imagen、Fluxなどの主要モデルの学習戦略とファインチューニング手法を包括的に解説します。
2026-03-01 · 64 分で読めます #deep-learning#text-to-image#diffusion#stable-diffusion#generative-ai