2014年,计算机视觉圈子里有一件让很多人心里不太舒服的事。
(相关资料图)
图像识别领域早就被深度学习攻占了。2012年AlexNet横空出世后,卷积神经网络在静态图片分类上一路狂飙,把传统的手工特征方法按在地上摩擦。可是换到视频动作识别这个赛道,情况完全反过来了。
卷积神经网络*:一种通过卷积层自动学习图像特征的深度学习模型,擅长处理图像和视频这类具有空间结构的数据。
当时最强的视频动作识别方法,是一种叫做密集轨迹的手工特征方法,在UCF101数据集上能做到87.9%的准确率。而深度学习方法呢?最好的成绩只有65.4%,差了整整22.5个百分点。
这个差距意味着什么?意味着每识别5个动作,深度学习方法就要比手工特征方法多犯错一个多。在图像分类领域已经被深度学习证明是过去时的手工特征,在视频领域却依然稳坐王座。这在当时是一件很打脸的事:难道深度学习真的只擅长图片,不擅长视频?
牛津大学的Karen Simonyan和Andrew Zisserman没有接受这个结论。他们后来在几个月内又发表了另一篇同样重量级的论文,就是VGGNet,那篇论文重新定义了"深度网络该有多深"。而在动作识别这篇论文里,他们要解决的问题是:视频比图片多了什么,而深度学习恰好没有利用上这个东西?
答案是运动。
问题出在哪:卷积网络不知道"动"是什么
一张静态图片能告诉你很多东西:这是不是一只猫,背景是不是草地,光线是不是充足。但它永远不会告诉你猫下一秒要往哪跑。
传统的卷积神经网络在处理视频时,通常的做法是把视频切成一帧一帧的图片,逐帧识别,然后把结果做个平均,或者简单粗暴地把多帧图像堆叠起来一起丢进网络。这种做法有个致命问题:网络看到的更多是"这一帧长什么样",而不是"从上一帧到这一帧发生了什么变化"。
这就好比你想判断一个人是在挥手还是在挠头,如果只给你看一张定格照片,你可能根本分不清,因为两个动作在某个瞬间的手部姿态可能长得很像。但如果给你看一段连续的动作轨迹,答案立刻就清楚了。如果不给网络提供运动信息,它就只能靠猜姿态相似的动作到底是哪一个,这正是当时深度学习方法卡在65%左右的根本原因。
Simonyan和Zisserman的洞察是:视频里其实藏着两种完全不同性质的信息,一种是外观,也就是画面里有什么东西,另一种是运动,也就是这些东西在往哪个方向、以多快的速度移动。这两种信息的性质差异很大,一个是空间上的静态模式,一个是时间上的动态模式,硬把它们塞进同一个网络里学习,网络很难同时把两件事都学好。
于是他们提出了一个听起来简单粗暴、但极其有效的方案:干脆用两个完全独立的卷积网络,一个专门学外观,一个专门学运动,最后再把两边的判断结果融合起来。这就是双流卷积网络的核心思路。
双流卷积网络*:Two-Stream Convolutional Networks,把视频动作识别拆分成空间流和时间流两个独立网络分别处理,再融合结果的深度学习架构。
空间流:认出画面里有什么
双流架构里的第一条流叫空间流,它的任务很单纯,就是常规的图像分类。
输入是视频里的某一帧静止画面,网络结构基本照搬当时ImageNet图像分类上表现优异的卷积网络架构。它要判断的是:这张画面本身看起来像哪种动作场景?比如画面里有游泳池,有个人在水里划水的姿态,那这一帧本身就带有很强的"游泳"信号。
空间流之所以有效,是因为很多动作确实和场景、道具、姿态强相关。你看到一个人手里拿着球拍站在网球场上,即便这一帧是定格的,你大概也能猜到这跟打网球有关。这一条流本质上是在利用视频里那些和静态图片识别没什么区别的线索。
但空间流单独作战的时候表现如何?论文里的实验数据给出了答案:仅用空间流,在UCF101上的准确率是72.6%。
这个数字比传统手工特征的87.9%还差了15个百分点还多。这说明单靠外观信息,深度学习依然打不过老方法。真正决定胜负的,是第二条流。
时间流:把运动本身变成一张"图片"
这是整篇论文最巧妙的一步。
研究者们意识到,卷积神经网络虽然擅长处理图片,但没有天然的机制去理解"运动"这种时序概念。那怎么办?他们没有去发明一种全新的网络结构来处理时序信息,而是想了一个更聪明的办法:把运动本身编码成一张图片的形式,然后依然用卷积网络去处理它。
这个编码运动的工具叫光流。
光流*:Optical Flow,描述视频中相邻两帧之间每个像素点移动方向和速度的向量场,通常用两张图分别表示水平方向和垂直方向的位移。
具体来说,对于视频里连续的两帧画面,可以计算出画面中每一个像素点从上一帧移动到下一帧的位移量,这个位移在水平方向和垂直方向各有一个分量,分别可以画成一张灰度图。把连续多帧的光流图堆叠起来,作为输入喂给另一个卷积网络,这个网络就是时间流。
这个操作等于是把"运动"这个抽象概念,翻译成了卷积网络最擅长处理的语言,也就是像素图案。网络不需要理解"运动"是什么哲学概念,它只需要在光流图上找出规律性的图案就行,因为不同动作在光流图上会呈现出完全不同的纹理和方向分布。
举个例子,如果一个人在做深蹲,光流图上会呈现出上下方向的强烈运动信号;如果一个人在挥高尔夫球杆,光流图会呈现出一个弧线状的方向变化模式。这些模式对人眼来说可能不直观,但对卷积网络来说恰恰是它最擅长识别的那种局部纹理特征。
这里必须停下来说一个类比,因为这一步的设计决策非常关键。
想象你想让一个只会看照片的助手去判断一群人是在跳舞还是在打架,但这个助手完全不会看视频。如果你直接把一整段视频甩给他,他会不知道该怎么处理,因为他的训练只让他看单张照片。但如果你把这段视频的每一处运动轨迹画成一张张箭头图,箭头的方向和长度代表运动的方向和快慢,再把这些箭头图当成普通照片给他看,他立刻就能用他原本的看图技能来判断了,因为箭头图本质上还是一张图片,只是内容变成了运动信息。如果没有这一步转换,你就得重新训练这个助手去理解"动态"这个全新的概念,成本高得多,效果也未必更好。光流图就是这样一种转换,它把网络不擅长的时序理解问题,转化成了网络擅长的图像模式识别问题。
时间流单独作战的效果如何?论文给出的数据是,仅用时间流,准确率能达到81%左右,这个数字已经非常接近手工特征方法的水准了,而且要知道,手工特征方法之前一直被认为难以撼动的原因,正是它擅长捕捉运动轨迹信息,比如密集轨迹方法的核心正是追踪像素点的运动轨迹。深度学习第一次单靠运动信息就摸到了这个门槛,这本身已经说明光流编码这个思路是走对了方向的。
两条流合并:1加1大于2
单独看空间流是72.6%,时间流大约81%,那两个加起来会怎样?
论文的答案是88%,超过了当时最好的手工特征方法87.9%。这是深度学习第一次在视频动作识别的标准评测上,正面击败了统治多年的手工特征方法。这句话放在2014年的分量,不亚于两年前AlexNet在图像分类上掀起的那场革命。
融合的方式其实很朴素,两个网络各自输出一个动作类别的概率分布,然后做加权平均,或者训练一个简单的分类器把两边的分数结合起来。没有什么特别复杂的机制,效果却出奇地好。
这说明一个很重要的道理:空间流和时间流学到的信息是互补的,而不是重复的。空间流知道画面里有什么东西,时间流知道东西是怎么动的,两者结合起来才是一个动作的完整描述。就像你判断一个人是在跑步还是在原地做拉伸,只看画面里的姿态可能会误判,只看运动轨迹的快慢也可能误判,但把姿态和运动结合起来看,判断的准确率立刻就上去了。
如果只用其中一条流会发生什么?前面已经给出了答案,准确率会跌到72.6%到81%之间,离88%的最终成绩有明显的差距。这也印证了当初把网络拆成两条独立分支的设计是正确的,如果硬把外观和运动塞进同一个网络里学,网络很可能会顾此失彼,学不好任何一边。
训练数据不够怎么办:用图片数据集来补运动网络的短板
这篇论文还有一个不那么起眼、但工程上很有价值的细节。
深度学习最缺的就是数据,而当时的视频动作识别数据集比起图像分类数据集要小得多。UCF101这样的数据集只有一万多个视频片段,相比ImageNet动辄百万张图片的规模,差距悬殊。数据不够,网络很容易过拟合,也就是在训练集上表现很好,但换到新数据上就不灵了。
过拟合*:模型在训练数据上表现很好,但在没见过的新数据上表现明显变差的现象,通常是因为模型记住了训练数据的细节而不是学到了通用规律。
研究者们采取了两个策略来缓解这个问题。第一个是用ImageNet上预训练好的图像分类网络参数来初始化空间流网络,这个思路在今天看起来是理所当然的迁移学习,但在当时算是比较超前的实践。因为空间流本质上就是在做图像分类,用已经在百万张图片上学过纹理和形状特征的网络作为起点,比从零开始训练要靠谱得多。
第二个策略更巧妙,是针对时间流的。既然缺视频数据,那能不能想办法用其他数据集的视频来一起训练?研究者们把两个不同的动作识别数据集,UCF101和HMDB51,放在一起联合训练时间流网络,通过增加训练样本的数量来缓解过拟合。实验证明这个多任务训练策略确实能提升准确率。
这里的道理其实和很多资源稀缺场景下的解决方案是共通的。假如你是一个刚开业的小餐馆,顾客数据不够多,很难总结出稳定的口味偏好规律,这时候如果能借用同城其他餐馆的顾客反馈数据一起分析,即便这些数据不完全针对你的餐馆,也能帮你更早发现一些普适性的规律,比如大部分人夏天更喜欢清淡口味。如果不这样做,只死磕自己那一点点数据,规律还没摸透,店可能已经关了。联合训练多个数据集,本质上就是在数据稀缺的情况下,尽可能榨取更多可用的信号。
数据说话:关键实验结果一览
论文在两个标准数据集UCF101和HMDB51上做了系统的对比实验。以下是核心结果的整理。
| 方法 | UCF101准确率 | 说明 |
| 密集轨迹(手工特征) | 87.9% | 2014年之前的最强方法 |
| 仅空间流网络 | 72.6% | 只用外观信息 |
| 仅时间流网络 | 81.0%左右 | 只用光流运动信息 |
| **双流网络融合** | **88.0%** | 首次超越手工特征方法 |
从这张表可以清楚看到,单独的任何一条流都打不过手工特征,只有把两者结合起来,深度学习才第一次实现了反超。这个反超的幅度不算夸张,只比87.9%高了大约0.1个百分点,但这个"第一次超越"的象征意义远大于数字本身。它证明了深度学习在视频理解上并非天生不擅长,只是之前的架构没有找到正确的方式去利用运动信息。
后来发生了什么
这篇论文提出的双流思路成为了此后几年视频动作识别领域的标准范式,后续大量工作都是在这个框架上做改进。
2016年,牛津团队自己发表了后续工作Temporal Segment Networks,由王利民等人提出,这篇论文指出双流网络原本只对视频里很短的片段做预测,容易忽略长时间跨度的动作模式,于是提出把一整段视频切成多个片段,分别跑双流网络再做融合,这样网络能看到动作在更长时间尺度上的变化规律,在多个数据集上进一步提升了准确率。
2017年,Carreira和Zisserman(同一个Zisserman)发表了I3D网络,论文名字是Quo Vadis, Action Recognition,这篇工作把双流网络里原本二维的卷积核直接膨胀成三维卷积核,让网络能够直接在时间维度上做卷积,而不再需要单独计算光流这一步,同时借助一个新建的大规模视频数据集Kinetics做预训练,这个思路后来成为视频理解领域另一条重要的技术路线,大幅推动了后续三维卷积网络的发展。
这两个后续工作分别从"如何看更长的时间跨度"和"如何让网络直接理解时序而不依赖手工计算的光流"这两个方向,把双流网络最初提出的问题继续往前推进了。
写在后面
读到这篇论文时最触动我的一点,是它解决问题的方式并不花哨。它没有发明一种全新的网络结构去"理解时间",而是想办法把时间信息转换成网络已经擅长处理的空间图案,这是一种很朴素的工程智慧,遇到新问题先想能不能套用旧工具,而不是急着造新轮子。
另一个值得琢磨的细节是,单独的时间流网络效果几乎追平了手工特征方法,这说明手工特征方法长期领先的真正秘密武器就是运动轨迹信息,而不是外观特征,这个发现某种程度上验证了此前手工特征研究者的直觉是对的,深度学习不是否定了这个直觉,而是用另一种方式实现了同样的洞察。
这篇论文没有解决的问题是,光流的计算本身依赖传统算法,速度慢,而且是提前算好再喂给网络的,并不是端到端可学习的一部分。后来的I3D网络正是冲着这个短板去改进的。技术的迭代往往就是这样,先证明一个思路可行,再有人回头把不优雅的那部分打磨掉。
Q&A
Q1:双流卷积网络是什么?
A:双流卷积网络是2014年由Simonyan和Zisserman提出的视频动作识别方法,它用两个独立的卷积网络分别处理视频的外观信息(空间流)和运动信息(时间流),再融合两者的判断结果,在UCF101数据集上首次让深度学习方法超越了传统手工特征方法。
Q2:双流网络里的时间流是怎么处理视频运动信息的?
A:时间流不是直接处理视频帧,而是先计算相邻帧之间的光流,也就是每个像素点的运动方向和速度,把光流转换成灰度图后再输入卷积网络,相当于把运动信息翻译成了网络擅长处理的图片形式。
Q3:双流网络之后有哪些重要的改进工作?
A:2016年的Temporal Segment Networks把视频切成多个片段分别处理再融合,解决了双流网络忽略长时间动作模式的问题;2017年的I3D网络把二维卷积核膨胀成三维卷积核,让网络直接在时间维度上做卷积,不再依赖单独计算光流。
-
高盛:若OPEC+继续延长减产 2024年底油价将冲击三位数!【附原油产量变化趋势】高盛大宗商品研究公司最新警告,如果俄罗斯和沙特阿拉伯持续大幅减产, -
广西北部湾港建设蹄疾步稳 两个15万吨级泊位主体完工中新网北海9月9日电 题:广西北部湾港建设蹄疾步稳 两个15万吨级 -
华为Mate X5折叠屏手机开售华为MateX5折叠屏手机今日正式开售,售价1000元起。这款手机采用圆润四 -
独家丨唐洪重返阿里云,继续担任首席架构师继王坚之后,又一名阿里云技术老将回归。雷峰网独家获悉,前阿里云首席 -
黑龙江省人事考试网:2023年经济师准考证打印系统黑龙江省人事考试网:2023年经济师准考证打印系统由经济师考试栏目提供
-
高盛:若OPEC+继续延长减产 2024年底油价将冲击三位数!【附原油产量变化趋势】
2023-09-09 15:40:19
-
广西北部湾港建设蹄疾步稳 两个15万吨级泊位主体完工
2023-09-09 15:25:47
-
华为Mate X5折叠屏手机开售
2023-09-09 15:12:58
-
独家丨唐洪重返阿里云,继续担任首席架构师
2023-09-09 14:37:06
-
黑龙江省人事考试网:2023年经济师准考证打印系统
2023-09-09 14:42:36





















营业执照公示信息