タグ: #ai-papers
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 79 件
SOTA 3D ビジョン分析 — 単眼深度と 3D ガウシアンスプラッティング
3D ビジョンの SOTA の流れを整理します。単眼深度推定(相対・メートル深度)と Depth Anything 系の概念、ステレオ・MVS の概要、そして NeRF から 3D ガウシアンスプラッティングへと続くリアルタイムレンダリングの発展を、表現・学習・応用の観点からアーキテクチャの原理を中心に見ていきます。
2026-06-30 · 41 分で読めます #ai-papers#3d-vision#monocular-depth#gaussian-splatting#nerfSOTA自動運転認識分析 — BEV、Occupancy、エンドツーエンド
自動運転認識の最新の流れを整理します。認識-予測-計画-制御のスタック、BEVマルチカメラ融合、occupancy networkの3D占有表現、ビジョン中心対LiDAR融合、エンドツーエンド学習とワールドモデルまでアーキテクチャの原理を見ていきます。
2026-06-30 · 34 分で読めます #ai-papers#autonomous-driving#bev#occupancy-network#end-to-endSOTA音声認識・合成分析 — Whisperからコーデック言語モデルまで
音声認識(ASR)と音声合成(TTS)の最新の流れを整理します。HMMからCTC/アテンション、Whisperの大規模弱教師あり学習、そしてTacotronからニューラルボコーダとコーデック言語モデルまで、系譜とアーキテクチャの原理を見ていきます。
2026-06-30 · 32 分で読めます #ai-papers#speech-recognition#text-to-speech#whisper#neural-codecロボットの安全とアラインメント — 強力なロボットを信頼するには
ますます強力になるロボットをどう信頼できるのか。物理的安全、制約付き強化学習と安全層、分布外への対応、人とロボットの協働安全、検証と標準、そして身体性AIのアラインメント課題までをバランスよく見ていきます。
2026-06-29 · 34 分で読めます #ai-papers#robotics#safety#alignment#reinforcement-learningロボットの目 — 3D認識とSLAM
ロボットが世界をどう見るのかを扱います。RGB-D・LiDAR・ステレオのセンサー、SLAMのパイプライン、点群とボクセル、6D姿勢推定、深層学習による認識、そしてNeRFと3Dガウシアンまで、ロボット認識の全体像をコードと図で見ていきます。
2026-06-29 · 31 分で読めます #ai-papers#robotics#slam#3d-perception#pointcloudヒューマノイドの全身制御 — 二足で歩き、手で扱う
ヒューマノイドロボットが二足で歩き、手で物を扱うまで、二足歩行制御と全身制御(whole-body control)の核心概念を整理します。ZMPとMPC、強化学習ベースのロコモーション、バランスと転倒回復、歩行と操作の統合、そしてシミュレーション学習を実機へ移す流れを図とともに見ていきます。
2026-06-29 · 39 分で読めます #ai-papers#robotics#humanoid#locomotion#whole-body-controlロボットはどう学ぶのか — 模倣学習と強化学習
ロボットが技能を獲得する四つの方法を概観し、模倣学習(テレオペレーション・行動クローニング・DAgger)と強化学習(報酬・方策・探索)の原理、長所と短所、データ効率の違い、そして両者を組み合わせる方法を、図と比較表で整理します。
2026-06-29 · 32 分で読めます #ai-papers#robotics#imitation-learning#reinforcement-learning#robot-learningワールドモデル — ロボットが未来を想像する
ワールドモデルの概念(環境の動力学を学習すること)を説明し、モデルベース強化学習、潜在空間での予測、動画予測・生成モデルのロボット応用、想像ロールアウトと MPC による計画、そして歩行・操作への適用と限界を、図で整理します。
2026-06-29 · 33 分で読めます #ai-papers#robotics#world-models#model-based-rl#planning人の映像から学ぶロボット — ウェブスケールデータの夢
人が物を扱う映像からロボットは学べるのか。アフォーダンスと軌道、ドメインギャップ、表現学習と事前学習、ワンショット模倣、ウェブ動画のスケールアップ、そしてロボットデータとの結合まで、事例と限界を押さえます。
2026-06-29 · 37 分で読めます #ai-papers#robotics#imitation-learning#representation-learning#videoSim-to-Real — シミュレーションで学んだことを現実へ
シミュレーションで学習したロボット方策が現実で崩れる理由(現実ギャップ)を分析し、ドメインランダム化・ドメイン適応・システム同定・デジタルツインといった対応手法、触覚や摩擦など再現が難しい物理、そして zero-shot 転移の可能性と限界を、図と事例で説明します。
2026-06-29 · 33 分で読めます #ai-papers#robotics#sim-to-real#domain-randomization#digital-twinロボット基盤モデル — 一つの方策で多くの仕事を
一つの方策で複数のロボット、複数の作業をこなそうとするロボット基盤モデルの流れを整理します。ジェネラリスト方策の概念、Open X-Embodimentのような大規模ロボットデータ、クロスエンボディメント、VLAとの関係、スケーリングの観点、そしてデータ・安全・評価という課題を図とともに見ていきます。
2026-06-29 · 36 分で読めます #ai-papers#robotics#foundation-model#generalist-policy#open-x-embodiment触覚センシングと精緻な操作 — ロボットが指先で感じる
ロボットが指先で世界を感じ始めています。ビジョンベースの触覚センサ(GelSight系)と電子皮膚、触覚が担う滑り・力・材質の検知、視覚と触覚の融合、精緻なインハンド操作、そして触覚のsim2realと学習方法を図とともに整理します。
2026-06-29 · 40 分で読めます #ai-papers#robotics#tactile-sensing#manipulation#gelsightヒューマノイドのための二つの脳 — GR00T N1とHelix
ヒューマノイドロボットのためのVLAは、速い反射と遅い思考を併せ持つ必要があります。NVIDIA GR00T N1とFigure AI Helixを中心に、速い低レベル制御(System 1)と遅い計画(System 2)を結合するデュアルシステム・アーキテクチャ、学習方式、課題と展望を整理します。
2026-06-27 · 27 分で読めます #ai-papers#robotics#humanoid#groot-n1#helixロボットが見て聞いて動く — VLAモデル RT-2とOpenVLAのレビュー
ビジョン・言語・行動(VLA)モデルは、カメラ映像と自然言語の指示を受け取り、ロボットの行動を直接出力します。RT-2、Open X-Embodiment、OpenVLAを中心に、VLAパラダイムの考え方、アーキテクチャ、行動トークン化、長所と限界を整理します。
2026-06-27 · 27 分で読めます #ai-papers#robotics#vla#rt-2#openvlaDiffusion Policyとπ0 — 滑らかなロボット行動の秘密
離散行動トークンの限界を超えて、行動を連続値で生成する二つの流れを見ていきます。Diffusion Policyは行動をデノイジングで生成し、π0はflow-matchingで高周波の連続行動を作ります。両アプローチの考え方、アーキテクチャ、制御周波数、長所と限界を整理します。
2026-06-27 · 27 分で読めます #ai-papers#robotics#diffusion-policy#pi0#flow-matchingマルチモーダルAIの学習法 — 複数の感覚を一つのモデルへ
画像・テキスト・音声・動画を一つのモデルで扱うマルチモーダルAIの学習原理を整理します。モダリティの整列と対照学習、融合方式、共有埋め込み空間、事前学習と微調整、データと評価、そしてハルシネーションなどの限界まで、学習パイプラインをコードとともに見ていきます。
2026-06-26 · 30 分で読めます #ai-papers#multimodal#clip#vision-language#contrastive-learningOCR を超えて — OCR-free な文書理解と統合モデル
従来の OCR パイプラインは検出・認識・レイアウトを段階に分けますが誤差が累積します。Donut 系と VLM ベースの OCR-free 文書理解、高解像度と表処理、統合モデルへの流れまで、文書 AI の転換を整理します。
2026-06-26 · 38 分で読めます #ai-papers#ocr-free#document-understanding#multimodal#donutAIハードウェアの最新研究動向 2026 — 論文で見る未来
2026年のAIハードウェア研究の流れを分野ごとに概観します。ウェハスケールとフォトニクス、インメモリコンピューティング、FP4低精度学習、スパース性とMoEハードウェア、光インターコネクト、次世代メモリ、ニューロモルフィック、ハードウェア・ソフトウェア協調設計まで、核心的なアイデアと意義、限界を整理します。
2026-06-16 · 37 分で読めます #ai-papers#ai-hardware#photonics#compute-in-memory#low-precisionLLM ランドマーク論文ロードマップ 2026 - Transformer / Scaling Laws / Flash Attention / Mamba / DeepSeek-R1 / Titans 徹底解説
2017年の Attention Is All You Need から 2026年の Titans と DeepSeek-R1 まで、LLM 時代を作った 50 篇超のランドマーク論文をテーマ別に整理する。Transformer、BERT、GPT 1-3、Scaling Laws、Chinchilla、InstructGPT、PaLM、FlashAttention 1-3、LLaMA 1-4、GPT-4、Mistral と Mixtra
2026-05-16 · 31 分で読めます #llm-papers#transformer#scaling-laws#flash-attention#mambaMixture of Experts(MoE)アーキテクチャ論文深掘り分析:GShardからDeepSeek-MoEまで
Mixture of Expertsアーキテクチャの核心論文を分析し、GShard、Switch Transformer、Mixtral、DeepSeek-MoEのルーティング戦略と学習安定性手法を比較します。
2026-03-14 · 34 分で読めます #ai-papers#moe#transformer#deepseek