タグ: #ai
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 214 件
何を深く学び、何を流すか — AI が何でも答えてくれる時代の学習戦略
AI が 3 秒でほぼ何でも答えてくれる時代に、何を深く学び、何を流すべきか。認知心理学の答えは愉快ではありません。記憶を作るのは情報を見る行為ではなく、自分で引き出す行為です。Roediger と Karpicke の実験では、文章を平均 14.2 回読んだ群は一週間後に 40% しか覚えておらず、3.4 回しか読まずに自分で想起した群は 61% を覚えていました。しかも、覚えていなかった側のほうが自信を持っていたのです。想起を AI
2026-07-12 · 25 分で読めます #career#learning#ai#software-engineeringRTX 5090 一枚で小さなモデルたちを直接動かしてみる — microGPT・OCR・音楽生成
RTX 5090(Blackwell、32GB)一枚に SSH で接続し、小さなモデル三つを直接動かしてみました。char-level GPT をゼロから 28 秒で学習させ(10.75M パラメータ、117 万 tokens/s)、専用 OCR(TrOCR)と小型 VLM(Qwen2-VL-2B)を同じ画像に当てて CER で対決させ、MusicGen で 8 秒の音楽を 1.9 秒(実時間の 4.2 倍)で生成しました。その過程で出
2026-07-11 · 12 分で読めます #pytorch#gpu#llm#ocr#hands-onAIがコードを保守する時代でも、人間のために書く
2026年7月10日、Scott Robinson は古い格言を一ひねりして蘇らせました。LLM はあなたのコードベースをスタイルガイドのように読むため、あなたがマージしたあらゆる近道は、モデルが機械の規模で返してくる学習データになります。重複したアクセスチェックの例と、「LLM はスポンジだ」という彼の一文を追ったうえで、より難しい問いを立てます。次の保守者が機械であるときも、人間のために書くことは依然として重要か。重要です。人間は依
2026-07-11 · 12 分で読めます #ai#llm#code-quality#maintainability#craft2026 年の良いエージェントベンチマークとは — UniClawBench、ライブコンテナ、隠れた監督者
HKU MMLab が 2026 年 7 月に arXiv へ投稿した UniClawBench は、「能力駆動(capability-driven)」を掲げるプロアクティブエージェント向けのベンチマークです。あらかじめ記録された静的な正解と照合する代わりに、ライブの Docker コンテナ内でエージェントを動かし、きめ細かなステップ単位のチェックポイントで採点します。実行者・隠れた監督者・ユーザーエージェントからなる閉ループで多ターン
2026-07-11 · 9 分で読めます #ai#agents#evaluation#benchmark#llmMicrosoft Flint を読む — エージェントがチャートを描くための可視化言語
Microsoft Research が公開した Flint は、エージェントを可視化する言語ではなく、AI エージェントがデータから見栄えの良いチャートを安定して作れるようにする中間言語です。コンパイラがスケール・軸・色・レイアウトといった低レベルの決定をデータとセマンティック型から代わりに導き、ひとつの仕様を Vega-Lite・ECharts・Chart.js へコンパイルします。この記事では Flint が実際に何でどんな問題を
2026-07-11 · 10 分で読めます #ai#agents#data-visualization#llm#microsoftRLHF モデルはなぜ報酬をハックするのか — リワードハッキングの仕組み・症状・緩和
Xiaohua Wang ほか 23 名が 2026 年 4 月に arXiv へ投稿した「Reward Hacking in the Era of Large Models」は、RLHF で整列された大型モデルがなぜ、どのように報酬信号をゲーミングするのかを整理したサーベイです。中心的な提案は、リワードハッキングを目標圧縮・最適化増幅・評価者–方策の共進化という三つの力で読む「プロキシ圧縮仮説(PCH)」です。冗長さバイアス、おべっか
2026-07-11 · 11 分で読めます #ai#llm#alignment#rlhf#safetyModel Context Protocol(MCP)リファレンス — AIを外部世界につなぐ開かれた標準
Model Context Protocol(MCP)は、アプリケーションがLLMにコンテキストを提供する方法を標準化した開かれたプロトコルです。この記事はMCPが実際に何であるかを公式ドキュメントに基づいて整理したエンジニア向けリファレンスです — なぜM×N統合問題を解くのか、ホスト・クライアント・サーバー構造と2つの層(データ/トランスポート)、3つのサーバープリミティブ(ツール・リソース・プロンプト)、stdioとStreama
2026-07-11 · 11 分で読めます #mcp#ai#agents#llm#protocolもっと考えれば正解に近づく、とは限らない: テストタイム計算と過剰思考
2026年4月、Shu Zhou ら6名は "When More Thinking Hurts" で、推論トークンをただ増やし続ける流れに正面から問いを立てます。著者らの報告によれば、計算予算が大きくなるほど追加の推論トークンの限界効用は大きく減り、ある地点からモデルは「過剰思考」に陥って、いったん正解していた答えを自ら覆します。最適な思考の長さは問題の難易度ごとに異なるため、すべてに同じ予算を与える方式は無駄が多い、というわけです。ア
2026-07-11 · 13 分で読めます #ai#llm#reasoning#inference#test-time-computeKVキャッシュを4ビットへ — SAW-INT4とシステムを踏まえたINT4量子化
長文脈のLLMサービングで本当のメモリのボトルネックは、重みではなくKVキャッシュです。これを素朴にINT4へ落とすと精度が崩れますが、2026年4月のプリプリントSAW-INT4は、トークン単位のINT4量子化にブロック対角アダマール回転を組み合わせ、素朴なINT4が失った精度をほぼ取り戻すと報告します。この論文の本当の狙いは精度だけでなくスループットです — ページド型KVキャッシュのレイアウトに直接組み込む融合回転・量子化カーネル
2026-07-11 · 12 分で読めます #ai#llm#quantization#inference#kv-cache事前学習済みチェックポイントを長文脈ハイブリッドへ — HyLoのアップサイクリング
ハイブリッド型のシーケンスモデル(アテンション+線形・SSMブロック)は長文脈に有利ですが、これまでは多くがゼロから事前学習し直す必要がありました。2026年4月のプリプリントHyLoは、すでに学習済みのTransformerチェックポイントを安価な後処理学習だけでハイブリッドへ「アップサイクリング」するレシピを提案します — MLA(潜在アテンション)とMamba2・Gated DeltaNetのような線形ブロックを混ぜ、段階的な長文
2026-07-11 · 10 分で読めます #ai#llm#long-context#architecture#efficiency遅いパソコンでGLM-5.2を動かす — colibrìが744Bモデルをディスクからストリーミングする仕組み
colibrìは純粋Cで約1,300行の推論エンジンで、744B(7,440億)パラメータのMoEモデルであるGLM-5.2を、RAM 25GBのコンシューマPCで動かします。鍵はMoEの疎性とディスクストリーミングです。約9.9GBの密なレイヤーだけをRAMに常駐させ、約370GBのルーテッドエキスパートはNVMe SSDに置いてトークンごとに必要な分だけ読み込みます。代償は正直に遅く、コールド状態で約0.05〜0.1 tok/s、実
2026-07-11 · 8 分で読めます #ai#llm#local-inference#moe#quantization拡散 LLM が CUDA カーネルを書く — DICE と、なぜ並列生成が効きうるのか
DICE は 2026 年 2 月のプリプリントで、拡散(diffusion)大規模言語モデルが CUDA カーネル生成において同規模の自己回帰(autoregressive)モデルを上回り、新たな最高性能(SOTA)を打ち立てたと主張します。核心は、トークンを左から右へ一つずつ書く代わりに、系列全体を並列に生成し、どの位置でも非逐次的に書き直せることです。大域構造が重要なコードという課題に合いそうな性質です。著者らは CuKe という
2026-07-11 · 12 分で読めます #ai#llm#diffusion#cuda#gpuステップごとにどれだけ考えるかを選ぶ — Ares の適応的な推論努力ルーティング
Ares(2026年3月のプレプリント)を実務の視点から整理しました。この論文は、推論努力をタスク全体ではなくステップ単位のコストレバーとして扱います。軽量なルーターが相互作用履歴を見て、各ステップに必要な最も低い推論レベルを予測し、すべてのステップを最大努力で回す無駄を減らします。著者はTAU-Bench・BrowseComp-Plus・WebArenaで推論トークンを最大52.7%まで削減し、成功率の低下はわずかだったと報告していま
2026-07-11 · 8 分で読めます #ai#agents#llm#efficiencyコーディングベンチマークはエージェント時代とズレている — リーダーボードがエージェントを誤って比べる三つの理由
Tessl のチームが 2026 年 6 月に arXiv へ投稿したポジション論文は、今日のコーディングベンチマークがエージェント型のソフトウェアエンジニアリングと根本的にズレていると主張します。ベンチマークは個々のモデルを測るために作られたのに、私たちはそれで、モデル・ハーネス・コンテキスト・環境・フィードバックが絡み合ったシステム全体を比べているからです。論文は三つの具体的なズレ — モデルとハーネスをひとまとめにする点数、単一正
2026-07-11 · 11 分で読めます #ai#agents#evaluation#software-engineering#coding-benchmarks効果的なAIエージェントを作る — 5つのワークフローパターンとエージェントのリファレンス
Anthropicのエンジニアリングガイド「Building Effective Agents」を実務リファレンスとして整理しました。ワークフローとエージェントの正確な区別、すべての土台となる増強されたLLM(検索・ツール・メモリ)、そして5つのワークフローパターン(プロンプトチェイニング・ルーティング・並列化・オーケストレーター/ワーカー・エバリュエーター/オプティマイザー)を、それぞれの使いどころと具体例とともに扱います。自律エージ
2026-07-11 · 16 分で読めます #ai#agents#llm#engineering#anthropicHybrid SWA による長コンテキスト推論の最適化 — Xiaomi MiMo v2.5 が実際に行ったこと
スライディングウィンドウアテンション(SWA)とフルアテンションを層ごとに交互配置するハイブリッド SWA は、長コンテキスト推論の KV キャッシュメモリと計算量を同時に削減する最近の主流設計です。Xiaomi が公開した MiMo v2.5 推論最適化の記事を根拠に、ハイブリッド SWA とは何でなぜ重要か、MiMo v2.5 が実際にどんなアーキテクチャとシステムエンジニアリングを行ったか(70 層中 10 層のみフルアテンション
2026-07-11 · 14 分で読めます #ai#llm#inference#attention#optimizationプロダクション RAG パターン — 素朴な RAG が失敗する理由と、実際に効く技法
デモ用の RAG は半日で作れますが、プロダクションで静かに壊れる場所は、たいてい生成ではなく検索です。本稿はチャンキング、埋め込みとハイブリッド検索(BM25 + ベクトル)、リランキング、コンテキスチュアル・リトリーバル、クエリ書き換え、そして評価を、それぞれ何であり・いつ効き・何を代償に払うのかで整理します。Anthropic のコンテキスチュアル・リトリーバルの数値のように出典のある数字だけを引用し、RAG は魔法ではないこと、
2026-07-11 · 18 分で読めます #ai#rag#llm#retrieval#embeddingsLLM学習データ前処理の完全ガイド — Webクロールからトークンパッキングまで、最新論文とともに
よいモデルはよいデータから生まれ、よいデータは前処理パイプラインから生まれます。Webクロール収集 → 本文抽出 → 言語識別 → ヒューリスティック・分類器による品質フィルタリング → 厳密・近似(MinHash)重複除去 → PII・有害性処理 → ベンチマーク汚染除去 → トークナイズとシーケンスパッキングまで、事前学習データの全工程を段階ごとに解説します。あわせてSFTデータ整備の要点、datatrove・Dolma・NeMo
2026-07-09 · 13 分で読めます #ai#llm#data-engineering#preprocessing#training3Dを作る2つの道 — 復元(NeRF・ガウシアンスプラッティング)と生成(TRELLIS・Hunyuan3D)
「3Dモデルを作る」という言葉には、まったく異なる2つの問題が隠れています。実際に存在するシーンを複数枚の写真からよみがえらせる復元(reconstruction)と、存在しないものをテキストや画像1枚から作り出す生成(generation)です。復元の系譜をSfMからNeRF、そして流れを変えた3Dガウシアンスプラッティングとfeedforward復元(Meta MapAnything)まで追い、生成の系譜をDreamFusionのS
2026-07-09 · 14 分で読めます #3d#ai#gaussian-splatting#nerf#computer-vision2026年ロボット企業マップ — ヒューマノイド激戦とVLAモデル、そしてエンジニアの参入経路
2026年はヒューマノイドの出荷台数が前年比約7倍(5万台見込み)へ跳ね上がる変曲点です。390億ドルのバリュエーションを持つFigureと自社VLAモデルHelix、2026年夏に量産へ入るTesla Optimus Gen 3、すでに5,500台を販売した価格破壊者Unitree、ロボットの汎用頭脳を売るPhysical Intelligence(π0)まで — 主要企業をハードウェア・頭脳・市場の軸で整理し、RT-2からGR00T
2026-07-09 · 10 分で読めます #robotics#ai#vla#trends#career