标签: #ai-papers
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 62 篇
SOTA 3D 视觉解析 — 单目深度与 3D 高斯溅射
梳理 3D 视觉的 SOTA 脉络。围绕单目深度估计(相对深度与度量深度)与 Depth Anything 系概念、立体与 MVS 概览,以及从 NeRF 到 3D 高斯溅射一路演进的实时渲染,从表示、学习、应用的角度,以架构原理为中心展开分析。
2026-06-30 · 37 分钟阅读 #ai-papers#3d-vision#monocular-depth#gaussian-splatting#nerfSOTA 实时视频分析 — 追踪、理解、高效推理
梳理实时视频分析的 SOTA 走向。围绕架构原理,本文考察行动识别、物体追踪、时间分割等视频理解任务,SAM 2 系列的视频分割与追踪概念,基于 Transformer 的视频模型,以及通过轻量化与流式处理实现的实时推理优化。
2026-06-30 · 37 分钟阅读 #ai-papers#video-understanding#object-tracking#sam2#action-recognitionSOTA 视频生成模型解析 — 时空扩散 Transformer
从时空潜在补丁与扩散 Transformer 的视角,梳理视频生成的根本难题 — 时间一致性与计算成本。本文围绕 Sora 提出的概念与后续模型系列,以架构为中心分析条件化、评估与物理一致性方面的局限。
2026-06-30 · 13 分钟阅读 #ai-papers#video-generation#diffusion-transformer#spatiotemporal#text-to-videoSOTA 分割·检测模型解析 — SAM、DETR 与 YOLO 的谱系
梳理目标检测与图像分割的 SOTA 谱系。以架构原理为主线,从两阶段的 R-CNN 到单阶段的 YOLO/SSD,再到基于 Transformer 的 DETR,串起检测的发展脉络;同时覆盖语义、实例、全景分割,直至开启可提示分割的 Segment Anything(SAM)。
2026-06-30 · 33 分钟阅读 #ai-papers#computer-vision#object-detection#segmentation#samSOTA 文本嵌入模型解析 — 检索与 RAG 的心脏
文本嵌入是检索与 RAG 系统的心脏。本文梳理对比学习与 InfoNCE、双编码器、难负例、E5/BGE/GTE 系列、Matryoshka 表征学习、MTEB 基准,直至最新嵌入模型的原理与实务应用。
2026-06-30 · 29 分钟阅读 #ai-papers#embedding#retrieval#rag#contrastive-learningSOTA 音乐·音频生成分析 — 神经编解码器与生成模型
从音频表示方式(波形·频谱图·神经编解码器)到自回归音频语言模型、基于扩散的音频、文本-音乐条件化,以谱系为中心进行梳理。从架构角度分析 EnCodec、MusicGen、AudioLM 系列的原理,以及商用模型、评估与著作权争议。
2026-06-30 · 13 分钟阅读 #ai-papers#audio-generation#music-generation#neural-codec#audio-language-modelSOTA 图像生成模型分析 — 从扩散模型到 FLUX
以谱系为中心,梳理文本-图像生成的最前沿:从扩散模型原理到潜在扩散、DiT、rectified flow,再到 FLUX 系列。通过架构原理、对比表和图解,分析 SOTA 模型之间共同的结构与差异。
2026-06-30 · 16 分钟阅读 #ai-papers#diffusion-models#text-to-image#latent-diffusion#rectified-flowSOTA 自动驾驶感知解析 — BEV、Occupancy、端到端
梳理自动驾驶感知的最新趋势。从感知-预测-规划-控制的技术栈、BEV 多摄像头融合、occupancy network 的 3D 占用表示、视觉中心与激光雷达融合之争,到端到端学习与世界模型,逐一审视其架构原理。
2026-06-30 · 30 分钟阅读 #ai-papers#autonomous-driving#bev#occupancy-network#end-to-endSOTA 语音识别与合成解析 — 从 Whisper 到编解码器语言模型
梳理语音识别(ASR)与语音合成(TTS)的最新趋势。从 HMM 到 CTC/注意力机制,从 Whisper 的大规模弱监督学习,到 Tacotron、神经声码器与编解码器语言模型,逐一审视其脉络与架构原理。
2026-06-30 · 30 分钟阅读 #ai-papers#speech-recognition#text-to-speech#whisper#neural-codec机器人基础模型 — 一个策略应对多种任务
本文梳理机器人基础模型这一潮流——它试图用一个策略应对多种机器人、多种任务。我们会依次看通用策略的概念、Open X-Embodiment 这类大规模机器人数据、跨具身、与 VLA 的关系、扩展(scaling)视角,以及数据、安全、评估这三大课题,全程配以图示。
2026-06-29 · 34 分钟阅读 #ai-papers#robotics#foundation-model#generalist-policy#open-x-embodiment世界模型 — 机器人如何在头脑中想象未来
解释世界模型的概念(学习环境动力学),涵盖基于模型的强化学习、潜在空间预测、视频预测与生成模型在机器人上的应用、通过想象 rollout 与 MPC 进行规划,以及在行走与操作上的应用与当前局限,并用图示加以整理。
2026-06-29 · 29 分钟阅读 #ai-papers#robotics#world-models#model-based-rl#planning机器人之眼 — 3D 感知与 SLAM
本文讲述机器人如何看世界。我们会依次介绍 RGB-D、LiDAR、立体相机等传感器,SLAM 流水线,点云与体素,6D 姿态估计,基于深度学习的感知,以及 NeRF 与 3D 高斯溅射,用代码和图示把机器人感知的全貌梳理一遍。
2026-06-29 · 28 分钟阅读 #ai-papers#robotics#slam#3d-perception#pointcloud人形机器人全身控制 — 双腿行走,双手操作
从人形机器人双腿行走到用手操作物体,本文梳理双足行走控制与全身控制(whole-body control)的核心概念。我们结合图示,依次讲解 ZMP 与 MPC、基于强化学习的运动控制(locomotion)、平衡与跌倒恢复、行走与操作的整合,以及把仿真中学到的策略迁移到实机的流程。
2026-06-29 · 34 分钟阅读 #ai-papers#robotics#humanoid#locomotion#whole-body-control机器人安全与对齐 — 如何信任强大的机器人
我们要如何信任日益强大的机器人?本文从物理安全、约束强化学习与安全层、分布偏移应对、人机协作安全、验证与标准,直到具身 AI 的对齐难题,进行一次均衡的梳理。
2026-06-29 · 31 分钟阅读 #ai-papers#robotics#safety#alignment#reinforcement-learning从人类视频中学习的机器人 — 网络规模数据的梦想
机器人能从人处理物品的视频中学习吗。本文梳理了可供性与轨迹、领域差距、表征学习与预训练、单样本模仿、网络视频规模化、以及与机器人数据的结合,并诚实地列出案例与局限。
2026-06-29 · 33 分钟阅读 #ai-papers#robotics#imitation-learning#representation-learning#video机器人如何学习 — 模仿学习与强化学习
概览机器人习得技能的四种方式,深入剖析模仿学习(遥操作、行为克隆、DAgger)与强化学习(奖励、策略、探索)的原理、优缺点、数据效率上的差异,以及如何将两者结合,并用图示与对比表加以梳理。
2026-06-29 · 28 分钟阅读 #ai-papers#robotics#imitation-learning#reinforcement-learning#robot-learningSim-to-Real — 把仿真中学到的东西带入现实
分析仿真中学到的机器人策略为何在现实中崩溃的原因(现实差距),讲解域随机化、域适应、系统辨识、数字孪生等应对手法,以及触觉、摩擦等难以复现的物理因素,还有 zero-shot 迁移的可能性与局限,并配以图示和案例说明。
2026-06-29 · 28 分钟阅读 #ai-papers#robotics#sim-to-real#domain-randomization#digital-twin触觉感知与精细操作 — 机器人用指尖去感受世界
机器人开始用指尖感受世界。本文结合图示梳理了基于视觉的触觉传感器(GelSight 系列)与电子皮肤、触觉负责的滑移·力·材质感知、视觉与触觉的融合、精细的手内操作,以及触觉的 sim2real 与学习方法。
2026-06-29 · 35 分钟阅读 #ai-papers#robotics#tactile-sensing#manipulation#gelsight机器人能看、能听、能动 — VLA 模型 RT-2 与 OpenVLA 评述
视觉-语言-行动(VLA)模型接收摄像头画面和自然语言指令,直接输出机器人的动作。本文以 RT-2、Open X-Embodiment、OpenVLA 为主线,梳理 VLA 范式的思路、架构、动作分词方式,以及优势与局限。
2026-06-27 · 24 分钟阅读 #ai-papers#robotics#vla#rt-2#openvla为人形机器人准备的两个大脑 — GR00T N1与Helix
面向人形机器人的VLA必须同时具备快速反射与缓慢思考的能力。本文以NVIDIA GR00T N1和Figure AI Helix为中心,梳理结合快速低层控制(System 1)与缓慢规划(System 2)的双系统架构、训练方式、面临的课题与展望。
2026-06-27 · 25 分钟阅读 #ai-papers#robotics#humanoid#groot-n1#helix