タグ: #computer-vision
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 14 件
みんなのためのAI 第5回 — 47万パラメータの U-Net で白黒写真に色をつける、そしてなぜ色が褪せたのか
シリーズ最小の47万パラメータ U-Net で CIFAR-10 の白黒画像をカラーに復元しました。形は正確に保たれましたが色が目に見えて褪せています。これはモデルの容量の問題ではなく L1 損失を選んだ結果です。skip connection が何を運ぶのか、そして回帰損失がなぜ彩度を殺すのかを実際の結果画像で確認します。
2026-08-23 · 14 分で読めます #ai#computer-vision#unet#colorization#pytorch3Dを作る2つの道 — 復元(NeRF・ガウシアンスプラッティング)と生成(TRELLIS・Hunyuan3D)
「3Dモデルを作る」という言葉には、まったく異なる2つの問題が隠れています。実際に存在するシーンを複数枚の写真からよみがえらせる復元(reconstruction)と、存在しないものをテキストや画像1枚から作り出す生成(generation)です。復元の系譜をSfMからNeRF、そして流れを変えた3Dガウシアンスプラッティングとfeedforward復元(Meta MapAnything)まで追い、生成の系譜をDreamFusionのS
2026-07-09 · 14 分で読めます #3d#ai#gaussian-splatting#nerf#computer-visionSOTA リアルタイム動画分析 — 追跡、理解、効率的推論
リアルタイム動画分析の SOTA の流れを整理します。行動認識・物体追跡・時間的セグメンテーションといった動画理解の課題、SAM 2 系の動画セグメンテーション・追跡の概念、トランスフォーマーベースの動画モデル、そして軽量化・ストリーミングによるリアルタイム推論最適化を、アーキテクチャの原理を中心に見ていきます。
2026-06-30 · 42 分で読めます #ai-papers#video-understanding#object-tracking#sam2#action-recognitionSOTA セグメンテーション・検出モデル分析 — SAM と DETR、YOLO の系譜
物体検出と画像セグメンテーションの SOTA 系譜を整理します。2 段階の R-CNN から 1 段階の YOLO/SSD、トランスフォーマーベースの DETR へと続く検出の流れと、セマンティック・インスタンス・パノプティックのセグメンテーション、そしてプロンプト可能セグメンテーションを開いた Segment Anything(SAM)まで、アーキテクチャの原理を中心に見ていきます。
2026-06-30 · 37 分で読めます #ai-papers#computer-vision#object-detection#segmentation#samSOTA 3D ビジョン分析 — 単眼深度と 3D ガウシアンスプラッティング
3D ビジョンの SOTA の流れを整理します。単眼深度推定(相対・メートル深度)と Depth Anything 系の概念、ステレオ・MVS の概要、そして NeRF から 3D ガウシアンスプラッティングへと続くリアルタイムレンダリングの発展を、表現・学習・応用の観点からアーキテクチャの原理を中心に見ていきます。
2026-06-30 · 41 分で読めます #ai-papers#3d-vision#monocular-depth#gaussian-splatting#nerfロボットの目 — 3D認識とSLAM
ロボットが世界をどう見るのかを扱います。RGB-D・LiDAR・ステレオのセンサー、SLAMのパイプライン、点群とボクセル、6D姿勢推定、深層学習による認識、そしてNeRFと3Dガウシアンまで、ロボット認識の全体像をコードと図で見ていきます。
2026-06-29 · 31 分で読めます #ai-papers#robotics#slam#3d-perception#pointcloudコンピュータビジョン・フレームワーク2026完全ガイド - OpenCV 4・MediaPipe・Detectron2・YOLO v11・MMDetection・SAM 2・Grounding DINO徹底解説
2026年のコンピュータビジョン・スタックはもはや「ピクセルを触る仕事」ではない。OpenCV 4.10はONNX推論を基本機能として取り込み、MediaPipe Studioはモバイル実時間パイプラインを一行に縮め、YOLO v11はUltralyticsからNAS・セグメンテーション・姿勢推定までを一つのモデルに束ね、SAM 2は動画マスクを実時間で追跡し、Grounding DINO 1.6とFlorence-2は「テキストから箱
2026-05-16 · 32 分で読めます #computer-vision#opencv#mediapipe#detectron2#yoloVision モデル開発・fine-tuning 完全ガイド 2026 — CNN、ViT、DETR、SAM 2、VLM の実戦 decision tree
2026 年の vision モデル開発はもう ResNet を 1 行で持ってきて学習する時代ではない。CNN、ViT、DETR、SAM 2、そして LLaVA・Qwen-VL・Gemini Vision・Claude Vision のような VLM まで — 同じ写真 1 枚に対しても、どのモデルを使うかで cost が 100 倍、accuracy が 30 pp 変わる。この記事は classification・detectio
2026-05-14 · 26 分で読めます #computer-vision#vision-model#cnn#vit#detrCNNアーキテクチャ完全ガイド:LeNetからEfficientNetとVision Transformerまで
CNNアーキテクチャの歴史と進化を理解するための完全ガイド。LeNet、AlexNet、VGG、ResNet、DenseNet、EfficientNet、Vision Transformerまで、構造分析とPyTorch実装を通じて主要モデルをすべてマスターする。
2026-03-17 · 21 分で読めます #cnn#computer-vision#deep-learning#resnet#vggtorchvision完全ガイド — 画像分類からObject Detection、Segmentationまで
torchvisionのtransforms v2、事前学習済みモデル(ResNet〜ViT)、データセット、Object Detection(Faster R-CNN, YOLO)、Segmentation、そして実践的なファインチューニングまで。コンピュータビジョンの実務をPyTorchで攻略します。
2026-03-02 · 10 分で読めます #ai-platform#pytorch#torchvision#computer-vision#cnn自律走行/ロボティクス技術スタック完全攻略:C++、ROS2、CUDA、TensorRTからVLM/VLA、シミュレーションまで
自律走行とロボティクスの中核技術スタックを総まとめする。Modern C++、ROS/ROS2、CUDA並列プログラミング、TensorRT最適化、モデル軽量化(量子化/プルーニング)、センサーフュージョン(GPS/IMU/カメラ/LiDAR)、VLM/VLAモデル、SIL/HILテスト、シミュレーション(CARLA/Isaac Sim)、自律走行フルスタック、VR/ARデジタルツイン、クラウドインフラまで、13の中核領域を実践的な観点
2026-03-01 · 27 分で読めます #autonomous-driving#robotics#ros2#cuda#tensorrtSegment Anything Model 完全攻略:SAM 1 → SAM 2 → SAM 3 論文分析と実践ガイド
Meta AIのSegment Anything Model(SAM)シリーズを完全攻略する。SAM 1(画像プロンプタブルセグメンテーション)、SAM 2(動画リアルタイムセグメンテーション)、SAM 3(概念認識セグメンテーション)まで、アーキテクチャ、データセット、核心的イノベーション、性能ベンチマーク、そしてインストール・実行方法を総まとめする。
2026-03-01 · 26 分で読めます #sam#segment-anything#computer-vision#image-segmentation#video-segmentationResNet論文の徹底分析:残差結合(Residual Connection)がディープラーニングの深さの限界を突破した方法
Microsoft ResearchのResNet論文を深層分析する。Degradation問題の発見、Skip Connectionの数学的原理、Bottleneck構造、ImageNet ILSVRC 2015優勝アーキテクチャを数式とコードで整理し、ResNetが現代ディープラーニングに与えた影響を展望する。
2026-03-01 · 42 分で読めます #resnet#residual-learning#cnn#computer-vision#image-classificationVision Transformer(ViT)論文の徹底分析:1枚の画像は16x16の単語に値する
GoogleのViT論文を深層分析する。画像をパッチシーケンスに変換する革新的アプローチ、Patch EmbeddingとPosition Embeddingの原理、CNN比での性能とデータ効率性のトレードオフ、そしてDeiT、Swin Transformer、BEiTなどの後続研究まで総整理する。
2026-03-01 · 43 分で読めます #vit#vision-transformer#computer-vision#transformer#image-classification