2014 年,计算机视觉圈子里发生了一件让很多人意外的事。
那一年深度学习已经在图像识别上打得所有对手溃不成军,AlexNet 在 ImageNet 上的胜利让整个学术界相信,卷积神经网络几乎是万能的。可是当研究者们把同样的思路搬到视频动作识别领域,想让神经网络认出视频里的人到底是在跳舞、打拳还是骑自行车的时候,却发现自己被一个诞生于传统方法时代的老古董按在地上摩擦。
(相关资料图)
这个老古董叫密集轨迹
**密集轨迹(Dense Trajectories)**:一种传统的视频动作识别方法,通过追踪视频中密集分布的点随时间的运动路径,再手工设计特征来描述这些轨迹的形状和纹理,不依赖神经网络学习。
在当时最权威的 UCF101 动作识别数据集上,密集轨迹结合手工特征能拿到 87.9% 的准确率,而想尽办法魔改的深度学习模型,最好也只能徘徊在 65% 到 70% 之间。中间差了将近 20 个百分点。
20 个百分点意味着什么?
意味着每 5 个动作视频里,深度学习方法就要比手工特征多认错 1 个。这种差距在图像识别领域早就是不可想象的,因为深度学习在那边已经把传统方法甩开了一大截。可是到了视频领域,风水轮流转,神经网络成了那个被吊打的后进生。
这篇论文,牛津大学 Karen Simonyan 和 Andrew Zisserman 在 2014 年发表的《Two-Stream Convolutional Networks for Action Recognition in Videos》,就是要解决这个尴尬的局面。而他们最后做到的事情,是第一次让深度学习在这个任务上反超了手工特征,把准确率拉到了 88% 以上。
这两个人当时都在牛津的 VGG 实验室,几个月后他们又发表了 VGGNet,那篇论文后来几乎成了每个学计算机视觉的人的入门必读。两篇论文几乎是同期完成的,这本身就说明当时这个实验室的产出效率有多高。
视频比图像难在哪
要理解这篇论文的巧妙之处,得先明白视频识别到底比图像识别难在什么地方。
一张静态图片,你要判断里面的人在做什么,靠的是空间信息,人的姿势、周围的物体、场景布局。这恰好是卷积神经网络最擅长的事情,因为 CNN 本质上就是一层一层地提取图像里的空间模式,从边缘到纹理再到物体部件,最后拼出整体的判断。
但视频不一样。视频的核心信息其实藏在时间维度里,一个人挥手和放下手臂,单看某一帧图像可能长得差不多,但连起来看运动方向和速度,才能分辨出这个人到底是在打招呼还是在扇风。
问题是,标准的卷积神经网络天生不擅长处理时间信息。它设计出来就是为了吃图片的,你直接把一堆帧堆起来喂给它,网络并不知道该怎么理解"先后顺序"和"运动轨迹"这种东西。当时也有研究者尝试直接把视频帧当作 3D 数据扔进 3D 卷积网络里,让网络自己去学习时间上的规律,但效果并不理想,始终追不上手工设计的运动轨迹特征。
这就是问题的根源。空间信息 CNN 很强,时间信息 CNN 很弱,而动作识别恰恰是两者都要用到的任务。
核心思路:把一个问题拆成两个更简单的问题
Simonyan 和 Zisserman 的解法,现在回头看简单到有点不可思议,但在当时是一次真正的认知转变。
他们没有强行让一个网络同时学会理解空间和时间,而是把问题拆成两条独立的流,一条专门负责看"这是什么",另一条专门负责看"这在怎么动"。
第一条叫空间流
**空间流(Spatial Stream)**:一个标准的卷积神经网络,输入是视频里的单帧静态图像,负责识别画面里的物体、场景和人物姿态等空间信息。
空间流本质上跟做图像分类没什么区别,输入就是视频里随便抽出来的一帧图片,网络看一眼就能大致猜出这个场景是在球场上还是厨房里,画面里有没有球拍或者锅。这部分完全复用了图像识别领域已经很成熟的技术,甚至可以直接用在 ImageNet 上预训练好的模型来做迁移学习,省了大量的训练数据和时间。
第二条叫时间流,这才是真正的创新点
**时间流(Temporal Stream)**:另一个独立的卷积神经网络,输入不是原始图像,而是经过计算得到的光流场,专门用来捕捉画面中物体的运动信息。
时间流不直接看原始画面,它看的是一种叫光流的东西。
**光流(Optical Flow)**:描述视频中相邻两帧之间每个像素点的运动方向和运动速度的一种表示方法,通常用一张图来可视化,图中不同的颜色或方向代表不同的运动方向。
简单说,光流就是把"运动"这件事本身画成了一张图。如果一个人的手在往上抬,光流图上对应手部的位置就会出现一个指向上方的箭头形状的模式;如果整个背景在往左移动,说明摄像机在向右平移,光流图上就会显示出大片一致朝左的运动模式。
把光流单独抽出来作为一种独立的输入,喂给一个专门的卷积网络去学习,这个网络就不再需要费劲去猜"画面里有什么东西",它只需要专心搞懂"东西是怎么动的"就够了。
这两条流各自训练好之后,最后把它们对同一个动作类别打出的分数做一个加权平均,就是最终的判断结果。
这个设计想明白之后其实特别符合直觉。想象你在健身房看一个人做动作,想判断他是在做深蹲还是做俯卧撑。你其实是同时在用两种方式看,一种是看他此刻的身体姿态大概是什么样子,另一种是看他身体各部位在往哪个方向移动。如果你被蒙上眼睛只能看一张静态照片,你可能会把深蹲蹲到最低点的照片和其他蹲姿混淆;但如果你能看到连续的运动轨迹,哪怕画面模糊看不清人脸和背景,你照样能一眼分辨出这是深蹲还是俯卧撑。反过来,如果你只看运动轨迹却完全看不到画面内容,遇到那些运动模式相似但语境完全不同的动作,比如挥手打招呼和挥手赶苍蝇,你也会判断错误。这就是为什么必须两条流一起用,少了任何一条,系统都会在某一类动作上栽跟头。
论文里的实验数据也印证了这一点。如果只用空间流单独做判断,在 UCF101 上的准确率是 73%;如果只用时间流单独判断,准确率反而更高,达到 83.7%,这说明运动信息对动作识别来说其实比静态画面更关键。但把两条流结合起来之后,准确率跳到了 88% 以上,比单独任何一条流都高出一大截。这个提升幅度足够说明,两种信息是互补的,而不是重复的,少了任何一部分都会漏掉一部分判断线索。
论文里展示的第一层卷积核可视化图也很有意思。空间流学出来的滤波器,长得跟图像分类网络里常见的那种边缘检测器、颜色检测器差不多,这符合预期。而时间流学出来的滤波器,大多是明显带有方向性的模式,像是专门用来捕捉某个特定方向上运动强度变化的探测器。这不是巧合,这是网络自己从光流数据里学出来的规律,它发现在这种输入下,方向信息才是真正有用的东西,于是所有的滤波器都往这个方向去演化。
光流怎么算出来的:多帧堆叠的设计
一个自然会冒出来的问题是,光流只能反映相邻两帧之间的运动,那如果一个动作持续时间比较长,比如挥拍这个动作本身要花上十几帧才能完成,只看两帧之间的光流够不够?
论文的做法是不只用一对帧的光流,而是把连续多帧,比如 10 帧,两两计算出的光流场堆叠在一起,当作一个多通道的输入喂给时间流网络。这样网络看到的就不是某一瞬间的运动快照,而是一段时间窗口内运动是怎么演变的。
这就好比你要判断一个人是不是在挥高尔夫球杆,只看一帧运动信息可能只捕捉到手臂正在往后摆,这个动作本身也可能是别的运动的一部分。但如果你能看到连续十几帧的运动轨迹,从后摆到挥杆到收杆的完整过程,你的判断会准得多。如果不做这种多帧堆叠,只用单帧光流,网络就相当于只能看到运动的一个瞬间切片,对于那些需要完整周期才能识别的动作,比如挥拍、跳远,系统很容易因为信息不全而误判。论文的实验也验证了这一点,堆叠多帧光流相比只用单帧光流,准确率有明显提升。
论文里还测试了另一种处理方式,叫轨迹约束的光流。
**轨迹约束光流(Trajectory-constrained flow)**:一种改良版光流计算方式,沿着物体的运动轨迹去采样光流,而不是简单地在固定网格位置采样,试图更精确地捕捉物体真实的运动路径。
这种方法理论上应该更精确,因为它考虑了物体本身的运动路径,而不是简单粗暴地在画面网格上采样。但实验结果显示,这种更复杂的处理方式带来的提升并不明显,普通的密集光流已经足够好用。这个结果其实也挺有意思,它说明有时候更复杂的工程设计未必能换来对应的性能提升,简单直接的方案反而更稳健,这也是做研究时经常会遇到的一个提醒。
数据不够怎么办:多任务训练和迁移学习
深度学习的老问题是需要海量数据才能训练出好模型,而当时的视频动作识别数据集,比如 UCF101,只有 1 万多个视频片段,这个规模跟动辄百万级的 ImageNet 完全不能比。数据太少,网络很容易过拟合,学到的不是动作的本质规律,而是训练集里的噪声和偶然模式。
论文用了两个办法来缓解这个问题。
空间流那条线,直接借用了在 ImageNet 上已经训练好的图像分类网络参数做初始化,这属于迁移学习的经典操作,相当于让网络提前学会了识别各种物体和场景的基础能力,再针对动作识别任务做微调,不用从零开始摸索。
时间流那条线没法直接借用 ImageNet 的预训练模型,因为输入的是光流而不是自然图像,两者的数据分布完全不同。于是论文采用了另一个思路,叫多任务学习。
**多任务学习(Multi-task Learning)**:让同一个神经网络同时在多个相关但不完全相同的数据集或任务上训练,通过共享底层特征表示,缓解单个任务数据量不足的问题。
具体做法是把 UCF101 和另一个动作识别数据集 HMDB51 放在一起训练,网络共享大部分参数,但在最后输出层为两个数据集分别设置独立的分类头。这样网络能从两份数据里一起汲取养分,变相扩大了可用的训练数据规模。
这个思路放在生活里也很好理解。假设你想培养一个厨师只学会做川菜,但你手上的川菜菜谱数量有限,厨师练习机会不够,很容易学得偏。如果你同时让他学做川菜和粤菜,虽然两个菜系不完全一样,但刀工、火候控制、调味的基本功是通用的,厨师在两边的练习中都能锻炼到这些底层能力,最终无论是回到专攻川菜还是粤菜,水平都会比单独练一个菜系更扎实。如果不做这种多任务训练,单独用 UCF101 那 1 万多个视频去训练一个从头开始的深度网络,很容易因为样本太少而学到一些训练集特有的偶然规律,一旦换一批新视频测试,准确率就会明显下降。
最终结果和当时的意义
把空间流和时间流结合起来,加上多任务训练的技巧,这篇论文最终在 UCF101 数据集上达到了 88.0% 的准确率,在 HMDB51 数据集上达到了 59.4% 的准确率。这两个数字第一次让深度学习方法的表现追上并小幅超过了当时最好的手工特征方法。
这件事在当时的分量不小。图像识别领域深度学习的胜利已经让很多人相信这是大势所趋,但视频领域迟迟没能跟上,让不少人怀疑是不是视频里的时间信息本质上就不适合用卷积网络去学。这篇论文用实验结果回答了这个疑问,不是网络学不会时间信息,而是之前的做法没有找到合适的方式把时间信息喂给网络。把光流这种已经把运动信息显式表达出来的数据交给网络,网络照样能学得很好。
这个双流的框架思路后来影响了大量的后续研究。
3 年后,Carreira 和 Zisserman(还是同一个 Zisserman)在 2017 年发表了 I3D 网络,把双流网络里的 2D 卷积换成了 3D 卷积,并且引入了一个新的大规模视频数据集 Kinetics 做预训练,直接把 UCF101 上的准确率推到了 98% 左右,这个数字放在今天来看已经接近这个数据集的天花板了。
再往后,2018 年 Facebook 的研究者提出了 SlowFast 网络,思路上跟双流网络一脉相承,但做了更精细的分工,一条通路用低帧率处理捕捉场景和空间语义,另一条通路用高帧率处理捕捉快速的运动细节,这本质上是双流思想的一次升级版重构,只是不再依赖手工计算的光流,而是让网络自己从原始帧序列里学出类似的时空分工。
从这条演化路径可以看出,双流网络提出的核心洞察,空间信息和时间信息值得分开处理再融合,直到今天依然是视频理解领域一个绕不开的基本设计原则,只是具体的实现方式随着算力和数据规模的增长在不断迭代。
写在后面
读这篇论文最让我意外的一点是,解决问题的关键往往不是造一个更复杂的模型,而是换一种角度重新定义输入。研究者没有硬着头皮去逼一个网络同时学会看图和看动,而是先用传统计算机视觉里现成的光流算法,把"运动"这个抽象概念提前翻译成一张具体的图,再交给网络去学。这种把问题拆解、先用简单工具把复杂信息显式化、再让深度学习去处理简化后的表示,其实是很多领域里绕过技术瓶颈的常见套路,不一定要指望模型自己什么都学会。
另外一个值得琢磨的细节是,论文里提到轨迹约束光流这种更精细的工程改进反而没带来预期的提升,这个小小的反差挺提醒人的,复杂不等于更好,有时候朴素的方案反而更稳。
如果今天要重新设计一套动作识别系统,还有没有必要保留这种手工计算光流的中间步骤,还是应该完全交给端到端的网络自己去学?这个问题现在的答案可能已经偏向后者,但双流网络提出的那个分而治之的思路,依然值得放在心里。
Q&A
Q1:双流卷积网络是什么?
A:双流卷积网络是牛津大学研究者在2014年提出的视频动作识别方法,用两个独立的卷积神经网络分别处理静态画面(空间流)和运动信息(时间流),再把两者的判断结果结合起来,第一次让深度学习方法在动作识别任务上超过了传统手工特征方法。
Q2:双流网络为什么要分成空间流和时间流两条通路?
A:因为静态图像和运动信息是两种性质不同的数据,标准卷积网络擅长处理空间信息但不擅长处理时间信息。把两者拆开各自用专门的网络处理,再融合结果,比强行让一个网络同时学两种信息效果更好,实验显示两条流结合后准确率达到88%,比单独任何一条流都高。
Q3:光流在双流网络里起什么作用?
A:光流是把视频里每个像素的运动方向和速度可视化成一张图的技术,时间流网络直接以光流图作为输入,这样网络不需要自己从原始帧里摸索运动规律,而是直接学习已经被显式表达出来的运动模式,大幅提升了时间信息的识别效果。
免责声明:本网站所有信息,并不代表本站赞同其观点和对其真实性负责,投资者据此操作,风险请自担。
老鹰黄蜂重启交易谈判:希尔德换芬尼-史密斯,只差选秀权?,火箭,选秀权,老鹰黄蜂,巴迪·希尔德,多利安·芬尼-史密斯
今年以来,打酒铺业态悄然兴起。不过,热度之下,单店盈利、产品同质化、供应链管控等问题逐步暴露,这门“打酒生意”究竟是长期增量,还是阶段性风口?白酒企业争相布局现打现卖、支持消费者自助按需打酒,去包装化
周一(9月21日),美联储隔夜逆回购协议(RRP)使用规模为5.82亿美元(交易对手15家),上个交易日报5.76亿美元。
巴萨名宿雷克萨奇:皇马是历史上最受裁判照顾的球队,巴萨,皇马,巴塞罗那队,皇家马德里,巴黎圣日耳曼,欧冠联赛阶段,卡尔斯·雷克萨奇
CFi.CN讯:数据显示,朱老六2026年上半年营收1.25亿元,同比增17.27%;归母净利润3059万元,大增178.93%;毛利率跃升至37.93%,同比
商务部等8部门办公厅公布第三批城市一刻钟便民生活圈全域推进先行区试点名单,确定30个城市,试点利用2年左右时间实现主城区和有条件的县城社区全覆盖。
南财智讯9月21日电,连连数字(02598.HK)发布翌日披露报表,2026年9月21日因董事根据2021年首次公开发行前购股权计划行使购股权而发行新普通股850000股,每股发行价2.96元;同日,
格隆汇9月21日丨安车检测公布,高级管理人员李云彬先生计划在本次减持计划预披露公告之日起十五个交易日后的三个月内,以集中竞价方式减持不超过34万股的公司股份
巍巍雪域高原,孕育出源远流长的藏医药文化。从高原藏药起步,历经二十余载深耕,秉承“科学成就健康,健康成就未来”理念的西藏诺迪康药业股份有限公司(股票简称:西藏药业,股票代码:600211)从一方本土药
人民财讯9月21日电,燕京啤酒(000729)9月21日公告,公司控股股东之一致行动人北京燕京啤酒集团有限公司(简称“燕京集团”)于9月21日以集中竞价交易方式增持公司股份455.83万股,占本公司总
马切吉亚尼:米兰没右后卫,希拉改打边路更合适,莱切,米兰,边路,马切吉亚尼,希拉(歌手),塞尔希奥·拉莫斯·加西亚
据生意社监测,锰硅9月21日均差为-64.70元/吨(均差=M10-M20=5709.40-5774.10)。当日,均差由负向扩大转为缩小,表明锰硅跌速减缓,行情出现拐点现象。
交易所最新数据显示,9月21日北向资金共成交2839.12亿元,占两市总成交额的13.98%。药明康德、寒武纪、兆易创新位列沪股通成交前三,成交额分别为21.14亿、16.49亿、15.57亿;宁德时
股票回购增持再贷款是赋能资本市场高质量发展的重要创新政策,湖北证监局9月21日提供的统计数据显示,政策实施以来,湖北辖区累计有31家次上市公司开展股票回购增持再贷款业务,核定贷款金额上限达64.1亿元

起重机作为一种高度复杂的运输系统,其运行涉及多个运动维度的精确协调。在典型的起重机操作中,起升机构负责垂直方向的载荷移动,大车机构实现水平方向的整体位移,而小车机构则完成精确的定位调整。这些运动往往需要同时或交替进行,这就要求驱动系统中的减速机必须具备出色的负载能力和精准的控制性能。针对起重机系统的特殊需求,诺...

乡村振兴有效衔接考核评估反馈问题整改工作开展以来,海东市乐都区把整

村民送水给施工人员。收边。运输混凝土。施工现场。施工现场。农村道路