视频理解——从3D Conv到Tube Transformer,算力黑洞的探索史

发布时间:2026/9/28 11:15:16

视频理解——从3D Conv到Tube Transformer,算力黑洞的探索史
为啥说大的因为视频数据太特么大了。一张 224x224 的图算起来轻松一段 10 秒的 1080p 视频每秒 30 帧那就是 300 张图像素量是单张图的 300 倍。处理视频本质上是在处理一个三维信号——高度、宽度、时间。这个额外的时间维度既是视频的宝藏包含了丰富的运动信息也是算力的噩梦。视频理解最早期的思路特别朴素把视频当成一堆独立的图像每帧分别过 2D 分类器然后对结果做投票或者平均。这就是Frame-based 视频分类简单、有 baselines但完全忽略了帧与帧之间的时序关系。你要是做一个跑步和走路的分类单帧看有时候人都是同一个姿势根本分不出来必须靠前后帧的运动速度来判断。所以大家开始做3D 卷积。核心就是把 2D 卷积的 kernel 扩展一个维度变成 3D同时对空间和时间进行卷积。C3D是早期代表作用 3x3x3 的卷积核同时提取空间和时间特征在 UCF101 上比 2D 方法有了明显提升。但 C3D 的参数量巨大计算量更是天文数字——一个 3D 卷积层的 FLOPs 是等效 2D 卷积层的 3 倍以上而且随着网络加深这个差距呈指数级放大。你在 ResNet-50 上做 3D 卷积的版本参数量轻松突破 1 亿训练一个模型需要几百块 GPU 跑好几个星期。后来I3DInflated 3D ConvNet提出了一种巧妙的膨胀方法——把在 ImageNet 上预训练好的 2D 卷积核沿着时间维度复制一份并做平均变成 3D 核然后在大规模视频数据集Kinetics上 fine-tune。这样既利用了 ImageNet 的海量预训练知识又适应了视频的时序特性。I3D 在当时的动作识别任务上直接拉开第二名一大截成了那个时代的标准 backbone。但 3D 卷积依然太慢了。于是TSNTemporal Segment Networks和TSMTemporal Shift Module这类方法试图走伪 3D的路线——用 2D 卷积处理空间然后用 shift 操作沿着时间维度做特征置换模拟时序上的信息流动。TSM 的精妙之处在于它不需要额外的参数只是把特征图在通道维度上做一次移位shift就能让网络感知到前后帧的信息。这个操作的 FLOPs 增加几乎为零但效果接近 I3D在当时简直是神来之笔。再后来SlowFast网络出来了FAIR 做的把视频处理分成了两条路一条慢路径以低帧率捕捉空间语义另一条快路径以高帧率捕捉运动变化两者再融合。这设计灵感来源于生物视觉的P 通路和M 通路一个管色彩纹理、一个管运动感知。SlowFast 在 Kinetics-400 上达到了很高的精度推理速度比 I3D 快架构设计也很优雅算得上是 3D 卷积时代的巅峰之作。2021 年之后Video Transformer开始取代 3D CNN 成为视频理解的主流。TimeSformer用自注意力机制分别在空间和时间两个维度上做 attention把 O(T²H²W²) 的复杂度假解耦成了 O(T² H²W²)让 Transformer 处理视频变得可行。VideoMAE则用掩码自编码器的思路只对可见的 patch 做编码、对掩掉的 patch 做重建用极少的计算量学到了很好的视频表示在 Kinetics 上性能碾压了很多全监督的方法。ViViT也是类似的路子把时空注意力拆解在计算效率和精度之间找平衡。但是这个但是太重要了视频理解到现在也没有一个真正的杀手级应用。动作识别这玩意儿实验室里刷 Kinetics 刷得飞起到了真实安防场景一个摔倒检测的精度惨不忍睹——因为真实场景里的摔倒姿态千奇百怪而且一半以上被遮挡了。短视频推荐倒是用到了视频理解但人家用的是很轻量化的模型只做粗粒度的场景和动作类别判断根本不需要 SOTA 的精度。自动驾驶里的行为预测确实需要视频理解但人家的 sensor fusion pipeline 里视频只是其中一路信号还要融合 LiDAR、雷达、高精地图单独的视频模型只需要在嵌入式设备上跑得非常快、非常轻。视频理解的商业化困境在于它解决的任务要么用 2D 图像就能解决个七七八八要么需要极致的精度但算力不允许。卡在一个高不成低不就的位置上。还有一个致命的问题——视频标注成本比图像高一个数量级。图像标注一张几十秒视频标注一个动作需要标注员看完整段视频确定动作的起止帧、标注关键帧、做时序定位。ActivityNet 的标注单价是图像标注的 5-10 倍。所以视频领域的数据集规模远小于图像领域——Kinetics-400 也就 30 万段视频而 ImageNet 有 1400 万张图。这个数据量差距直接限制了视频模型的发展潜力。另一个被严重忽略的问题是视频帧率的标准化。你训练的时候用的是 30 FPS 的 Kinetics部署的时候摄像头可能是 60 FPS 的工业相机也可能是 10 FPS 的监控设备。不同帧率下同一个动作的运动速度快慢完全不同模型直接迁移过去就崩了。所以现在很多工作开始做帧率自适应的训练或者干脆用光流作为运动信息的替代但光流算起来又贵得要死简直是拆东墙补西墙。视频理解的未来方向我个人觉得在以下几个方面第一高效的时空 Token 化。不要把所有帧的所有 patch 都塞进 Transformer你得智能地选择哪些帧重要、哪些 patch 重要用稀疏注意力和可变形采样来降低计算量。第二自监督预训练。视频里有天然的时间顺序和空间对应关系不需要标签就能做很多自监督任务预测被遮挡的帧、判断帧序是否被打乱、做时空对比学习。VideoMAE 已经证明了这条路走得通而且潜力还远未挖尽。第三和语言模型的融合。给视频配文字描述做 Video-Text 对齐这样可以用语言的先验来辅助视频理解这也是当下多模态大模型热潮的一部分。但说句实在话——如果你现在要入视觉识别这个行当我劝你别在视频理解上花太多精力除非你的导师或者公司在这条路上有明确的资源和数据积累。因为视频理解的投入产出比太低了——你要投入的算力、标注成本、工程复杂度都比 2D 任务高一个量级但带来的商业价值在大多数场景下并不匹配。它是个富人游戏只有 Google、Meta、字节跳动这种级别的公司玩得起。六个方向全聊完了。图像分类、目标检测、实例分割、ReID、视觉跟踪、视频理解每个都是一本书的体量我这六篇文章最多只能算是随性版的入门导读 实战吐槽。想真的入行别光看我写的去跑代码、踩坑、看真实场景的脏数据那些才是真正让你成长的东西。

相关新闻

OpenClaw:本地化开源AI助手的部署与应用指南

OpenClaw:本地化开源AI助手的部署与应用指南

2026/8/23 4:14:50

1. OpenClaw 项目概述OpenClaw 是一款运行在本地设备上的开源 AI 个人助手,支持 macOS、Windows 和 Linux 三大主流操作系统。与常见的云端 AI 服务不同,OpenClaw 的设计理念强调"数据不出本地",所有对话记录、技能插件和用户偏好都…

高光谱图像超分辨率重建技术解析与应用

高光谱图像超分辨率重建技术解析与应用

2026/9/6 9:16:03

1. 高光谱图像超分辨率重建的现状与挑战高光谱图像超分辨率重建(Hyperspectral Image Super-Resolution, HSI-SR)是遥感图像处理领域的重要研究方向。与普通RGB图像不同,高光谱图像包含数百个连续的光谱波段,能够提供丰富的地物光…

计算机毕业设计之基于.NET仓库管理系统的设计与实现

计算机毕业设计之基于.NET仓库管理系统的设计与实现

2026/8/23 4:14:51

该系统充分利用MVC框架的简洁性、高效性和易用性,net语言,结合SQL Server数据库技术,构建了一个功能完善的仓库管理系统。系统涵盖了销售员、采购员、库管员、客户、供应商、货物库存、货物接收等多个核心模块,实现了货物库存的快…

CANN/GE ACL数据集缓冲区添加函数

CANN/GE ACL数据集缓冲区添加函数

2026/9/28 4:08:17

aclmdlAddDatasetBuffer 【免费下载链接】ge GE(Graph Engine)是面向昇腾的图编译器和执行器,提供了计算图优化、多流并行、内存复用和模型下沉等技术手段,加速模型执行效率,减少模型内存占用。 GE 提供对 PyTorch、Te…

用ffmpeg高效批量调整图片尺寸的实战指南

用ffmpeg高效批量调整图片尺寸的实战指南

2026/9/27 1:30:29

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱

2026/9/28 2:15:29

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱 【免费下载链接】transformers 🤗 Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and mu…

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南

2026/9/28 3:14:54

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南 【免费下载链接】rustfs 🚀2.3x faster than MinIO for 4KB object payloads. RustFS is an open-source, S3-compatible high-performance object storage system sup…

Java Integer缓存揭秘:128陷阱原理、避坑与面试全解

Java Integer缓存揭秘:128陷阱原理、避坑与面试全解

2026/9/28 3:58:00

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据

2026/9/28 3:47:14

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据 【免费下载链接】rustfs 🚀2.3x faster than MinIO for 4KB object payloads. RustFS is an open-source, S3-compatible high-performance object storage system supporting mi…

远程协作的工作台整理

远程协作的工作台整理

2026/9/26 14:29:04

远程协作的工作台整理远程协作的核心不是再加一个工具,而是让交接信息足够完整。异步任务要写明目标、输入位置、完成标准和需要决策的人。 工作台的最小配置 将日程、待办、代码和沟通入口收拢到少数固定位置;通知按紧急程度分层。工作台不需要模仿办公…

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

2026/9/28 5:05:21

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

2026/9/26 23:35:16

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…