标签: #computer-vision
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 12 篇
人人可懂的 AI 第5篇 — 用47万参数的 U-Net 给黑白照片上色,以及颜色为何发灰
本系列最小的模型 —— 47万参数的 U-Net —— 把 CIFAR-10 的黑白图像还原成彩色。形状保留得很好,颜色却明显发灰。这不是容量问题,而是选用 L1 损失的必然结果。我们用真实输出图像说明 skip connection 究竟运送了什么,以及回归损失为何会抽干饱和度。
2026-08-23 · 10 分钟阅读 #ai#computer-vision#unet#colorization#pytorch打造 3D 的两条路径 — 重建(NeRF・高斯泼溅)与生成(TRELLIS・Hunyuan3D)
"制作 3D 模型"这句话里,其实藏着两个完全不同的问题。重建(reconstruction)是从多张照片中,把真实存在的场景复原成 3D;生成(generation)则是从一段文字或一张图像里,凭空造出并不存在的东西。本文沿着重建的谱系,从 SfM 到 NeRF,再到改变格局的 3D 高斯泼溅与前馈式重建(Meta MapAnything)一路梳理;又沿着生成的谱系,从 DreamFusion 的 SDS 蒸馏到原生 3D 扩散,再到
2026-07-09 · 13 分钟阅读 #3d#ai#gaussian-splatting#nerf#computer-visionSOTA 3D 视觉解析 — 单目深度与 3D 高斯溅射
梳理 3D 视觉的 SOTA 脉络。围绕单目深度估计(相对深度与度量深度)与 Depth Anything 系概念、立体与 MVS 概览,以及从 NeRF 到 3D 高斯溅射一路演进的实时渲染,从表示、学习、应用的角度,以架构原理为中心展开分析。
2026-06-30 · 37 分钟阅读 #ai-papers#3d-vision#monocular-depth#gaussian-splatting#nerfSOTA 实时视频分析 — 追踪、理解、高效推理
梳理实时视频分析的 SOTA 走向。围绕架构原理,本文考察行动识别、物体追踪、时间分割等视频理解任务,SAM 2 系列的视频分割与追踪概念,基于 Transformer 的视频模型,以及通过轻量化与流式处理实现的实时推理优化。
2026-06-30 · 37 分钟阅读 #ai-papers#video-understanding#object-tracking#sam2#action-recognitionSOTA 分割·检测模型解析 — SAM、DETR 与 YOLO 的谱系
梳理目标检测与图像分割的 SOTA 谱系。以架构原理为主线,从两阶段的 R-CNN 到单阶段的 YOLO/SSD,再到基于 Transformer 的 DETR,串起检测的发展脉络;同时覆盖语义、实例、全景分割,直至开启可提示分割的 Segment Anything(SAM)。
2026-06-30 · 33 分钟阅读 #ai-papers#computer-vision#object-detection#segmentation#sam机器人之眼 — 3D 感知与 SLAM
本文讲述机器人如何看世界。我们会依次介绍 RGB-D、LiDAR、立体相机等传感器,SLAM 流水线,点云与体素,6D 姿态估计,基于深度学习的感知,以及 NeRF 与 3D 高斯溅射,用代码和图示把机器人感知的全貌梳理一遍。
2026-06-29 · 28 分钟阅读 #ai-papers#robotics#slam#3d-perception#pointcloudCNN 架构完全指南:从 LeNet 到 EfficientNet、Vision Transformer
CNN 架构的历史与演进完全指南。通过结构分析和 PyTorch 实现,完整掌握从 LeNet、AlexNet、VGG、ResNet、DenseNet、EfficientNet 到 Vision Transformer 的全部主要模型。
2026-03-17 · 30 分钟阅读 #cnn#computer-vision#deep-learning#resnet#vgg计算机视觉完全指南:从 CNN 到 ViT、YOLO、Stable Diffusion
从 ResNet、EfficientNet 等 CNN 架构,到 YOLO 目标检测、SAM 分割、Vision Transformer,直至 Stable Diffusion 生成模型,全面讲解计算机视觉的完整指南。
2026-03-17 · 18 分钟阅读 #computer-vision#cnn#yolo#vit#stable-diffusiontorchvision 完全指南 — 从图像分类到 Object Detection、Segmentation
从 torchvision 的 transforms v2、预训练模型(ResNet〜ViT)、数据集,到 Object Detection(Faster R-CNN、YOLO)、Segmentation,再到实战微调。用 PyTorch 全面掌握计算机视觉实务。
2026-03-02 · 10 分钟阅读 #ai-platform#pytorch#torchvision#computer-vision#cnnSegment Anything Model 完全解析:从 SAM 1 到 SAM 2 再到 SAM 3 的论文解读与实战指南
全面梳理 Meta AI 的 Segment Anything Model(SAM)系列。从 SAM 1(图像可提示分割)、SAM 2(视频实时分割)到 SAM 3(概念感知分割),系统整理架构、数据集、核心创新、性能基准,以及安装与运行方法。
2026-03-01 · 27 分钟阅读 #sam#segment-anything#computer-vision#image-segmentation#video-segmentationVision Transformer(ViT)论文深度解析:一张图像相当于16x16个单词
深度解析Google的ViT论文:将图像转换为patch序列的创新方法、Patch Embedding与Position Embedding的原理、相较CNN的性能与数据效率权衡,以及DeiT、Swin Transformer、BEiT等后续研究的全面梳理。
2026-03-01 · 40 分钟阅读 #vit#vision-transformer#computer-vision#transformer#image-classificationResNet 论文全面解析:残差连接(Residual Connection)如何突破深度学习的深度极限
深入解析 Microsoft 的 ResNet 论文。用公式和代码梳理 Degradation 问题的发现、Skip Connection 的数学原理、Bottleneck 结构、ImageNet ILSVRC 2015 冠军架构,并纵览 ResNet 对现代深度学习产生的影响。
2026-03-01 · 36 分钟阅读 #resnet#residual-learning#cnn#computer-vision#image-classification