计算机视觉知识点复习大纲
说明:本大纲严格按照 PDF 文件顺序和页内知识脉络整理;每条复习点均标注到对应 PDF 与页码。页码按 PDF 阅读器显示的第几页计。
文件覆盖范围
CV_1计算机视觉概述.pdf:共 13 页,提取到知识点页 12 页。
CV_2视觉特征表达.pdf:共 44 页,提取到知识点页 43 页。
CV_3视觉特征提取.pdf:共 73 页,提取到知识点页 72 页。
CV_4视觉特征学习new.pdf:共 41 页,提取到知识点页 40 页。
CV_5图像分类.pdf:共 32 页,提取到知识点页 31 页。
CV_6语义分割.pdf:共 28 页,提取到知识点页 27 页。
CV_7目标检测.pdf:共 31 页,提取到知识点页 31 页。
CV_8物体跟踪.pdf:共 34 页,提取到知识点页 33 页。
CV_9多图拼接.pdf:共 25 页,提取到知识点页 24 页。
CV_10三维重建.pdf:共 28 页,提取到知识点页 28 页。
1. CV_1计算机视觉概述
- 课程内容:计算机视觉概述;视觉特征表达;视觉特征提取;视觉特征学习;图像分类;图像分割;目标检测;物体跟踪;多图拼接。出处:
CV_1计算机视觉概述.pdf,第 1 页。
- 计算机视觉概述:1.1 计算机视觉简介;1.1.1 计算机视觉的发展历史;1.1.2 主流学术会议和期刊;1.2 计算机视觉的应用;1.2.1 智能监控;1.2.2 医学影像智能分析;1.2.3 智能机器人;1.2.4 车载视觉系统;1.3 计算机视觉面临的挑战。出处:
CV_1计算机视觉概述.pdf,第 2 页。
- 人眼如何观看事物?:可能性1:;眼睛快速移动,不断扫描环视,补齐不清晰和看不到的区域。;可能性2:;大脑对不清晰的画面进行“脑补”补齐不清晰或看不到的区域;人类视觉(Human Vision);中心 vs. 周边:人眼并不是整个视网膜都能看到相同的东西。只有视网膜中心(黄斑/中央凹)负责;高分辨率、彩色的精细视觉(如阅读、认脸)。而视网膜周边主要负责感知运动、明暗和方位。。出处:
CV_1计算机视觉概述.pdf,第 3 页。
- 人眼如何看到事物?:可能性1:;眼睛快速移动,不断扫描环视,补齐不清晰和看不到的区域。;可能性2:;大脑对不清晰的画面进行“脑补”补齐不清晰或看不到的区域;人类视觉;相比看见,人类视觉系统更善于发现画面背后的故事;“视觉可以被理解为一个信息处理任务,将;数值图像转变为一种面向形状的符号表示” 图像 意义。出处:
CV_1计算机视觉概述.pdf,第 4 页。
- 人眼 vs. 照相机:特征 人眼 照相机;镜头 可变形的晶状体(物理变焦) 刚性的玻璃/塑料镜片(位移变焦);光圈 瞳孔(由虹膜控制,自动调节) 光圈叶片(可由相机或手动控制);对焦点 单次只能对准一个平面,但扫视极快 可全画面均匀(取决于镜头设计);感光元件 视网膜(中央凹高精度,周边低精度) 传感器(全局均匀像素);动态范围 极高,能适应极大亮度跨度 有限,宽容度逐年提升但仍有差;图像处理 大脑实时降噪、补盲点、自动白平衡 处理器运算;电源 生化能量(葡萄糖和氧气) 电池;计算机视觉(Computer Vision)。出处:
CV_1计算机视觉概述.pdf,第 5 页。
- 1.1.1 计算机视觉的发展历史:1. 早期阶段(1960s-1970s);劳伦斯·罗伯茨提出让计算机从一张二维照片中提取出简单的三维结构信息;简单的图像处理和分析上,如边缘检测、形状识别等;2. 理论发展阶段(1980s):;1980年代,理论基础逐渐形成(几何学和统计学方法的应用);图像分割、特征提取、立体视觉等技术得到了发展;3. 机器学习与统计方法(1990s-2000s):;机器学习方法开始应用于计算机视觉;特征提取方法(如SIFT、HOG)成为主流,人脸检测的快速发展。出处:
CV_1计算机视觉概述.pdf,第 6 页。
- 理论发展阶段(视觉计算理论):David Courtnay Marr(1945-1980)是计算神经科学领域的先驱之一。1973;年,他应Marvin Minsky与Seymour Papert的邀请加入MIT人工智能实验室,;从事视觉相关研究,并开创性地提出了三维表达思想,使计算机视觉进入了;一个新的时代。 MIT出版社在1982年出版了他的遗作《Vision: A;Computational Investigation into the Human Representation and Processing;of Visual Information》。;机器学习与统计方法;观念转变:从“重建”到“识别与学习”——让计算机能够识别和理;解图像中的内容。。出处:
CV_1计算机视觉概述.pdf,第 7 页。
- 深度学习时代:这个时代彻底改变了视觉问题的解决方式,将视觉识别的能力推;向了前所未有的高度。从2012年AlexNet的横空出世,到ResNet;等架构的不断深化,再到如今Transformer、多模态、世界模型等;新范式的百花齐放,视觉智能正以前所未有的速度演进。;1.1.2 主流学术会议和期刊;国际会议:;IEEE International Conference on;Computer Vision and Pattern;Recognition (CVPR)。出处:
CV_1计算机视觉概述.pdf,第 8 页。
- 1.1.2 主流学术会议和期刊:国际期刊:;IEEE Transactions on Pattern Analysis and;Machine Intelligence (PAMI);IEEE Transactions on Image Processing (TIP);International Journal of Computer Vision;IEEE Transactions on Circuits and Systems for;Video Technology;IEEE Transactions on System, Man and;Cybernetics, Part B。出处:
CV_1计算机视觉概述.pdf,第 9 页。
- 1.2.1 智能监控:1.2.2 医学影像智能分析。出处:
CV_1计算机视觉概述.pdf,第 10 页。
- 1.2.3 智能机器人:1.2.4 车载视觉系统。出处:
CV_1计算机视觉概述.pdf,第 11 页。
- 1.3计算机视觉面临的挑战:数据质量/数量;标注成本高;多样性不足;数据噪声;模型泛化能力;过拟合;跨域适应;计算资源;高计算需求。出处:
CV_1计算机视觉概述.pdf,第 12 页。
2. CV_2视觉特征表达
- 第2章 视觉特征表达:本章内容;2.1人眼视觉;人眼的构造;人眼视觉特性;2.2图像表达;数字图像;图像质量;2.3色彩空间;三基色原理。出处:
CV_2视觉特征表达.pdf,第 1 页。
- 2.1人眼视觉:◼电磁辐射成像;电磁辐射波包括无线电波、微波、红外线、可见光、紫外线、X;射线、γ射线。;电磁辐射波的波谱范围很广:波长最长的是无线电波为3×102m,;其波长是可见光波长的几十亿倍;波长最短的是γ射线,波长为;3×10-17m,其波长比可见光小几百万倍。;可见光的波长范围通常大约在 380纳米 到 750纳米 之间。;人眼成像过程:光线 → 角膜 → 瞳孔 → 晶状体 → 视网膜(感光) → 视神经 → 大脑(成像)。;人眼的构造。出处:
CV_2视觉特征表达.pdf,第 2 页。
- 2.1人眼视觉:整个电磁波谱是;一个连续的整体;可见光成像;太阳的电磁辐射波恰好主要占据整个可见光谱范围(大气光学窗口)。;可见光成像原理:反射成像。相机接收的是物体反射的太阳光。;特性:最符合人眼习惯,包含丰富的颜色(红绿蓝)和纹理信息。但受光照影响极大(夜晚、阴影下失效)。;大气 “过滤” 了太阳辐射的紫外和远红外部分,只让能;量最集中的可见光波段成为地表的主要辐射来源。。出处:
CV_2视觉特征表达.pdf,第 3 页。
- 红外成像:近红外:反射成像,但能反映植物叶绿素含量等可见光看不到的信息。;热红外:辐射成像。接收的是物体自身发出的热量。因此不需要外部光源,可在夜晚工作。;特性:图像反映的是温度分布(通常伪彩色显示)。温度高的物体亮,温度低的物体暗。;典型应用:夜间侦查、体温筛查、工业热故障检测。;短波红外下盐和糖呈现不同的色彩,因为矿;物质、人造物质及其他一些地物具有特殊的;成分,短波红外能够“看见”这种特有成分。;中波红外 长波红外;微波成像。出处:
CV_2视觉特征表达.pdf,第 4 页。
- X射线与γ射线成像:原理:穿透成像。X射线/γ射线穿透物;体时,会被不同密度的物质不同程度;地吸收。;特性:图像是物体的"密度投影"。密;度高的区域(如骨骼、金属)吸收射;线多,胶片/探测器上呈现为暗区(或;亮区,取决于显示方式)。;典型应用:医学CT、安检扫描、工业;探伤。。出处:
CV_2视觉特征表达.pdf,第 5 页。
- 视觉错误:人类视觉系统不是一台被动的摄像机,;而是一个主动的、会根据经验、预期和;上下文进行解读和推断的信息处理器。;物理现实 ≠ 主观感知;它们真的在动吗?;机器视觉与人类视觉的不同!。出处:
CV_2视觉特征表达.pdf,第 6 页。
- 长度与透视:长度与透视:线AB和线CD长度完全相等,虽然它们看起来相差很大。;曲线正方形:这些是完全的正方形吗?;【解析】正方形看起来是变形了,;但其实它们的边线都是笔直而彼;此平行的。比尔·切斯塞尔创作了;这个曲线幻觉的视觉艺术版本。。出处:
CV_2视觉特征表达.pdf,第 7 页。
- 讨论:眼见是否为实?:当我们的眼睛“欺骗”了我们,是该相信亲眼所见的事实,还是该;相信经过验证的科学解释?这种“错误”究竟是我们感官的缺陷,;还是大脑为了适应复杂世界而进化出的高效策略?;VR(虚拟现实)和AR(增强现实)技术的本质就是在主动“欺骗”我们的视觉。;在设计中(如网页UI、建筑空间、服装剪裁),设计师是应该极力避免产生视;觉错误,还是应该巧妙地利用视觉错误来达到特定目的(例如让房间看起来更;大、让人显瘦)?;2.2图像表达;定义:二维函数f(x,y),其中,x,y是空间坐标, f(x,y)是点(x,y)的幅值。。出处:
CV_2视觉特征表达.pdf,第 8 页。
- 2.2.1数字图像:数字图像是由二维像素组成,每一个像素具有一个特定的位置(x,y);和幅值f(x,y)。;数字图像在计算机中通常用矩阵来表达。;2.2.2 图像质量;主观评价:观察者是否觉得图像看起来舒服、清晰、;自然。这因人而异,不可靠。;客观指标:用数学公式对图像进行量化计算,得到;可重复、可比较的数值,但存在局限性。;主观感受 vs. 客观指标。出处:
CV_2视觉特征表达.pdf,第 9 页。
- 2.2.2 图像质量:图像采样:一个连续图像在每个采样点处被数字化。;每个采样点对应于数字化图像的一个像素。;确定水平和垂直方向上的像素个数N和M。;图像采样与图像质量的关系;采样决定了图像细节的上限,是图像质量的基石。;根据奈奎斯特采样定理,为了完整复原信号,;采样频率必须至少是信号最高频率的两倍。。出处:
CV_2视觉特征表达.pdf,第 10 页。
- 图像质量:摩尔纹;摩尔纹是一种高频信号与低频采样之间发生冲突而产生的光学干;涉现象。;拍摄电子屏幕: 比如拍;电脑显示器或电视。屏幕;本身有像素点阵,相机也;有像素点阵,两个点阵打;架,就会出现满屏的彩色;摩尔纹。。出处:
CV_2视觉特征表达.pdf,第 11 页。
- 图像量化:大部分数字图像处理设备都采用K个等间隔的量化方式。;对于灰度图像而言,每个像素的亮度用一个数值来表示,该数值范围;通常在0到255之间,0表示黑,255表示白,其它值表示处于黑白之间;的灰度。;彩色图像可以用红、绿、蓝(RGB)三元组二维矩阵来表示。通常三元;组的每个数值也是0到255之间,0表示相应的基色在该像素中没有,;而255表示相应的基色在该像素中取得最大值。;256×256×256种颜色;图像量化与图像质量的关系。出处:
CV_2视觉特征表达.pdf,第 12 页。
- 数字图像的质量:层次:灰度级:表示像素明暗程度的整数量。;像素的量化范围为0~255,就称该图像为256个灰度级的图像。;层次:表示图像实际拥有的灰度级的数量。;图像数据的实际层次越多,视觉效果就越好。;主观上会在边界附近感觉到两条额外的条带:;在亮区一侧感觉到一条更亮的线,在暗区一;侧感觉到一条更暗的线。;人眼的优化(增强边缘反差);马赫带效应。出处:
CV_2视觉特征表达.pdf,第 13 页。
- 数字图像的质量:对比度:对比度:是指一幅图像中灰度反差的大小;对比度=最大亮度/ 最小亮度;数字图像的质量:清晰度;与清晰度相关的因素:;亮度;对比度;尺寸大小;颜色饱和度。出处:
CV_2视觉特征表达.pdf,第 14 页。
- 2.3色彩空间:人类视觉可以辨别几千种颜色色调和亮度,相反,只能辨别几十种灰度层次。;描述彩色光的三个基本量:;1.辐射率 —— 纯粹的物理量:单位面积上、单位立体角内,光源在某个特定;方向上辐射出的功率。;2.光强 —— 与人眼的初步交集:为了把物理能量(瓦特)变成人眼看到的光,;用一个标准曲线对光谱进行加权。这个曲线就是 CIE 明视觉光度函数。;3.亮度 —— 人眼看到的那一下:人眼视觉感知的最终结果。描述一个表面看;起来有多亮。;光强是点光源的属性(比如一个发光的灯泡灯丝),而亮度是扩展光源或反射表面。出处:
CV_2视觉特征表达.pdf,第 15 页。
- 2.3.2 颜色空间:CIE色度图(第一个标准的色度系统);CIE是国际照明委员会的法语缩写。;设定每个颜色的三色系数之和为1。;色度图的中心区域有一个白点,表示标准白光。;三角形: 三角形的三个顶点分别是显示器红、绿、蓝三颗LED或;荧光粉发出的最纯颜色(色度坐标)。;范围: 三角形覆盖的马蹄形区域越大,显示器能显示的颜色越多。;CIE色度图是连接物理光(波长)、生物感知(人眼实验)和工程实践(显示器校准、色彩空间)的桥梁。;Y: 代表亮度; X 和 Z:代表色度信息。。出处:
CV_2视觉特征表达.pdf,第 16 页。
- RGB模型:RGB模型:是一个三维直角坐标空间,;每一维分别代表一种原色,即红(R)、;绿(G)和蓝(B) 。;灰度(强度)图像:I = (R +G + B) / 3;CMY模型;CMY分别是青色(cyan)、深红色(magenta)和黄色(yellow)的简称。这三种颜;色被称为二次色。;青色:从白光里吸收(即减去)红色光得到。;深红色:从白光里吸收(即减去)绿色光得到。。出处:
CV_2视觉特征表达.pdf,第 17 页。
- CMYK模型示例:HSI模型;HSI: 色调(Hue)、饱和度(Saturation)和亮度(Brightness) 。;色调:表示观察者接收的主要颜色,是混合光波中与主波长有关的属性。;饱和度:描述了色调被白光稀释(混合)的程度,即表达了色调被白光稀释;后的纯度。饱和度越高,说明混合的白光越少,即颜色越纯。;亮度:是一个主观描述子,用来描述对于颜色的感觉,其实它是不可测量的。;它体现了单色图像中,强度(Intensity)的概念。;HSI模型是面向人的。让我们能像画画一样去调色:先画素描(亮度I),再;决定涂什么颜色(色调H),最后决定颜料挤多少(饱和度S)。。出处:
CV_2视觉特征表达.pdf,第 18 页。
- HSI模型示例:RGB模型转换到HSI模型;给定一副RGB彩色图像,首先将R、G和B值归一化到[0,1]范围。;H组件由下式得到:;H值代表了在HSI空间,该颜色的色调与红色调之间的旋转角度。;S组件由下式得到:;I组件由下式得到:。出处:
CV_2视觉特征表达.pdf,第 19 页。
- RGB模型转换到HSI模型:示例:HSI模型转换到RGB模型:示例;改变上一示例中的HSI值,起到改变图像颜色特征的目的。出处:
CV_2视觉特征表达.pdf,第 20 页。
- CIE-XYZ模型:CIE在用红绿蓝三原色做颜色标定的时候,发现用红、绿、蓝三种光无法调;配出所有的颜色(有些颜色需要把其中一种光加到目标颜色上才能匹配,即;出现了负值)。;Y组件近似于指定光强信息,X和Z指定颜色信息。CIE-XYZ 是一种数学定义;的绝对标准。它完全不依赖于任何设备。只要是人眼(标准观察者)看到的;颜色,都能在XYZ色度图上找到一个唯一的坐标点。;RGB模型和CIE-XYZ模型的转换;给定RGB组件,XYZ组件可以由下式得到:;给定XYZ模型,RGB可以由上述矩阵的逆矩阵得到。。出处:
CV_2视觉特征表达.pdf,第 21 页。
- CIE-LUV模型:XYZ模型存在着很大的分布不均匀性,即相同比例的颜色差,在;CIE色图中表现为不同的长度。;因此,CIE做了改进,提出了LUV模型,实现均匀的颜色分布。;投票;背景:美术老师给同学们展示了一条裙子,它在普通的室内白光;下看起来是蓝色与黑色相间的。在学校的文艺汇演上,这条裙子;被搬上了舞台。为了营造氛围,舞台灯光师只打开了纯红色的灯;光(只有红色波长,无绿无蓝)。;投票问题:在全红光的照射下,这条裙子原本蓝色的部分和黑色。出处:
CV_2视觉特征表达.pdf,第 22 页。
- 2.4距离度量:像素间的一些基本关系;相邻像素:;4邻域;D邻域;8邻域;连通性;4联通;8联通;距离测量。出处:
CV_2视觉特征表达.pdf,第 23 页。
- 相邻像素:D邻域:D邻域:像素p=(x, y)的D邻域是其对角上的点:;(x+1, y+1); (x+1, y-1); (x-1, y+1); (x-1, y-1);相邻像素:8邻域;2.4.1 像素间的距离;像素间的距离的定义;对于像素p,q和r,如果测量D满足以下三条特性:;(1)同一性:D(p, q) ≥0,而且D(p, q)=0,当且仅当p=q。;(2)对称性:D(p, q) = D(q, p);(3)三角不等性:D(p, r) ≤ D(p, q) + D(q, r)。出处:
CV_2视觉特征表达.pdf,第 24 页。
- 像素间的距离:欧式距离:像素p=(x, y)和q=(s, t)间的欧式距离(Euclidean Distance) 定义如;下:;优点:直观。;缺点:平方根的计算费时,且数值不为整数。;像素间的距离:城市距离(D4距离);像素p=(x, y)和q=(s, t)间的城市距离定义如下:;含义:在数字栅格中,如果只允许横向和纵向移动,城市距离表;示从起点移动到终点所需的最少的步数。;到某像素的城市距离小于或者等于。出处:
CV_2视觉特征表达.pdf,第 25 页。
- 像素间的距离:棋盘距离(D8距离):像素p=(x, y)和q=(s, t)间的棋盘距离定义如下:;含义:在数字栅格中,如果允许横向、纵向和对角线移动,棋盘;距离表示从国王在棋盘上从一处移动到另一处所需的步数。;棋盘距离特性:到某像素的棋盘距离小于或者等于某个值的那些;像素形成了一个正方形。;向量的长度(范数)。出处:
CV_2视觉特征表达.pdf,第 26 页。
- 范数正则化:Frobenius 范数(F-范数);2.4.2 图像间的距离;1.物理距离: 图像像素矩阵的数值差异。;2.感知距离: 人类大脑处理视觉线索后感受到的差异。;3.语义距离: 图像在概念层面的相似度。。出处:
CV_2视觉特征表达.pdf,第 27 页。
- 降维:2.5 形状特征表达;形状特征:用来表达物体形状的一种描述。;构建形状特征的途径:;1. 基于边缘信息,构建关于物体轮廓的表达。;例如,形状上下文(Shape Context)描述,傅立叶算子描述等。;2. 基于区域内像素的统计信息,构建物体形状的整体表达,;例如,矩(Moments),凸包(Convex Hull)等。;形状特征描述的要求:;1. 具备一定的局部描述能力:适用于物体部分被遮挡的情况。。出处:
CV_2视觉特征表达.pdf,第 28 页。
- 2.5 形状特征表达:1. 形状概率表示vs符号距离函数;12个样本形状;形状概率表示;符号距离函数;2.5.1 形状定义。出处:
CV_2视觉特征表达.pdf,第 29 页。
- 形状上下文描述:形状上下文(shape context)描述包含了两个层次:;形状表达:物体的外部轮廓和内部轮廓上的一组离散的点。;形状上下文:描述了每一个点与其它点之间的关系。这些关系构;成了对于物体形状特征的描述。;2.5.2 形状距离;动机:如何度量两个二值图像中的目标相似性。出处:
CV_2视觉特征表达.pdf,第 30 页。
- 2.5.2 形状距离:提取二值图像中的物体轮廓,比较轮廓点的相似性,以及匹配关系;以某一个轮廓点为参考原点,统计其他轮廓点的分布。出处:
CV_2视觉特征表达.pdf,第 31 页。
- 2.5.2 形状距离:极坐标空间划分涉及两个变量𝑟和𝜃,轮廓点分布的直方图可以用;二维矩阵表示;对平移变换具有不变性;通过选择合适的半径,可对缩放变换;具有不变性;通过选择局部切向作为bin编号的参考;方向,可对旋转具有不变性;可容忍小的仿射畸变。出处:
CV_2视觉特征表达.pdf,第 32 页。
- 2.5.2 形状距离:混淆矩阵图;2.5.3 形状表达;水平集;用一个高一维的函数的某个“水平面”(通常是零平面)的截线,来隐式地表示;一个低一维的形状。;自然地处理拓扑结构变化;稳定的数值计算与亚像素精度。出处:
CV_2视觉特征表达.pdf,第 33 页。
- 水平集方法:偏微分方程:;2.6纹理特征表达;边缘特征的表达;以单个像素为单位,用图像函数在该像素邻域范围内的特性来计;算。每个边缘点由一个具有位置(x-y坐标)、幅值(magnitude)和方向;(direction)的向量来表达。;位置:表示边缘点的空间位置。位置的确定是一个边缘点定位的过程。;幅值:表示边缘点上亮度变化的程度。;方向:表示边缘点上边缘的方向。。出处:
CV_2视觉特征表达.pdf,第 34 页。
- 2.6.1纹理的概念:纹理(texture):是物体表面;的一种属性。它是由区域内;的一组元素构成,这些元素;在亮度、颜色、边缘方向、;形状、尺寸、空间联系(结;构)等属性上表现出一定的;内在关系,例如相似性、周;期性重复出现等。;这些元素被称为纹理基元。出处:
CV_2视觉特征表达.pdf,第 35 页。
- 2.6.2纹理的种类:精细纹理:如果纹理基元小、;并且相邻基元之间的色调等;特征相差很大,则产生精细;纹理。;粗糙纹理:如果纹理基元大,;包含了很多像素,则产生粗;糙纹理。;常数纹理:每一个或者每组;基元的集合在属性上呈现恒。出处:
CV_2视觉特征表达.pdf,第 36 页。
- 2.7多尺度表达:2.7.1 尺度的概念;尺度(scale):它是一种测量标准,该标准决定了一个测量单位所能代;表的信号尺寸。;对于图像信号而言,尺度决定了在一个观测方式下得到的图像中,一;个像素所代表的物体大小 。;尺度与分辨率的概念很接近。但是,尺度是针对人的观测方式而言,;是由观测者主动设定;而分辨率既包含了主观设定的概念,又包含了;客观决定的能力,即针对图像采集系统固有的采样能力而言。。出处:
CV_2视觉特征表达.pdf,第 37 页。
- 图像的多尺度表达:构建图像的多尺度表达的原因:;1. 物体在不同的观测尺度下会有不同的表现方式。因此,给定一;幅图像,构建它的多尺度表达,可以展现出该图像在不同尺度下;的特性,从而为选取一个合适的尺寸来提取具有尺度不变性的特;征提供基础。;2. 任意给定两幅图像,起初我们并不能确定这两幅图像之间的尺;度关系。因此,构建它们各自的多尺度表达,为提取各自的特征,;从而进行匹配,提供了基础。;构建一幅图像的多尺度表达的同时,也就构建了一个尺度空间。出处:
CV_2视觉特征表达.pdf,第 38 页。
- 图像多尺度表达的构建方法:高斯核作为的尺度空间生成器的原因:;1. 保持图像信息的完整性。当使用高斯核来平滑图像时,没有任何附;加的、人造的结构产生,即得到的粗糙尺度图像只是其细尺度图像的;简化表达。该特性被称为因果性(causality)。;2. Semi-group(半群)特性:高斯核的可叠加性、尺度空间的连续性。;连续n次使用小尺寸高斯滤波器平滑一幅图像,与使用一次大尺寸高;斯滤波器平滑的结果一样,它们的尺寸关系为:;给定一幅图像f(x, y),该图像构成第0层尺度(即最精细的尺度);;然后,高斯核与第0层图像卷积,得到第1层尺度图像;接着,第。出处:
CV_2视觉特征表达.pdf,第 39 页。
- 图像多尺度表达的构建方法:空间域二维高斯核的离散化;1. 高斯函数的可分离性。将二维高斯核与图像的卷积变为两个一;维高斯核分别与图像沿着x轴和y轴的卷积。;因此,只需要在空间域设计一维离散高斯核即可。;2. 根据高斯分布,计算高斯核的离散值,即高斯滤波器每一项系数。;下表是标准偏差σ=1的高斯分布函数值。为了保证图像的均匀灰度区;域不受影响,平滑滤波器要求所有系数之和为1.;因此,标准偏差为1的一维高斯核(大小为5)可以表达为:g(x)=[0.05,;0.25, 0.4, 0.25, 0.05]。出处:
CV_2视觉特征表达.pdf,第 40 页。
- 图像多尺度表达:示例:一副图像的多尺度表达:每幅图像代表了相应尺度下的表达。;该示例中,每一级尺度图像都是由二维高斯核与上一级尺度图像的卷积得到。;每一级所用的高斯核的标准偏差σ不同,这些标准偏差形成一个等比数列。;相对尺度的概念和尺度因子;相对尺度:给定一副原图像,它自身所在尺度为尺度坐标的零点。进行卷;积的高斯核的标准偏差σ则代表了所得到的每一幅粗尺度图像在该尺度空;间中的尺度坐标。;σ也代表了每一幅粗尺度图像的相对分辨率 。因为σ越大,滤波器的尺寸;就越大(通过比较σ分别为1和2的一维高斯核可以看出),卷积得到的图。出处:
CV_2视觉特征表达.pdf,第 41 页。
- 2.7.2 金字塔结构:为了加快处理速度,对粗糙尺度图像进行;子采样(sub-sampling),从而得到一种分;辨率和采样频率都在降低的多尺度表达,;称为高斯金字塔(Gaussian Pyramid)。;高斯金字塔的计算特点:;1. 每一级与其相邻级别的尺度因子相同。;2. 采样频率和尺度因子要保持一致,从而;避免在采样过程中产生混淆(aliasing)。;例如:如果相邻两级的尺度因子s=2(即。出处:
CV_2视觉特征表达.pdf,第 42 页。
- 拉普拉斯金字塔:两个相邻尺度图像之差,构成一个带通金字塔,称为拉普拉斯金字塔;(Laplacian Pyramid) 。;计算步骤:;1. 将粗尺度图像插值到相邻的细尺度。插值计算为一个相反的卷积计;算。它是通过在两个像素中间插入新像素,达到把低分辨率图像扩展;成高分辨率图像的效果。如果使用的高斯核的σ=1,尺度因子s=2,插;值的计算公式如下:;2. 计算差值:;拉普拉斯金字塔的计算过程,类似于DoG(Difference of Gaussians)高。出处:
CV_2视觉特征表达.pdf,第 43 页。
3. CV_3视觉特征提取
- 第3章 视觉特征提取:精密仪器零件尺寸测量;定子片精度要求为微米级别,;其大小均在25mm以内。出处:
CV_3视觉特征提取.pdf,第 1 页。
- 特征提取在视觉处理中的作用:视觉特征提取是完成图像理解的必经之路。;像素;图像块;整幅图像;视频;(序列图像);本章内容;边缘特征提取;角点提取。出处:
CV_3视觉特征提取.pdf,第 2 页。
- 3.1边缘特征提取:3.1.1 边缘表达;3.1.2 边缘检测原理;3.1.3 常见边缘检测算子;3.1.4 边缘提取实例;图像中突变的位置是人类视觉感;知中的一项重要内容。边缘特征;受光照和视角变化的影响较小。;实现了从“像素级”到“特征级”的飞跃。它丢弃了颜色、纹理等相对;冗余的信息,保留了物体最本质的结构信息(形状),极大地降。出处:
CV_3视觉特征提取.pdf,第 3 页。
- 3.1.1 边缘表达:边缘(edge):图像中的一组点,这些点各自与其相邻区域相比,;亮度发生了急剧变化。;边界(boundary):对于一个区域R,它的边界是一组点,这些点;各自的邻域内会有至少一个相邻点不在区域R内。;边缘是一个局部(local)的概念,它只是通过比较每一个点与其相;邻区域内的点的亮度变化得到。边缘点通常都是不连续的。;边界是一个较为全局(global)的概念,它是针对一个区域R而言的。;一个区域的边界通常是一个闭合的曲线。;边缘特征是提取边界特征的基础。通过边缘点连接(edgelinking)。出处:
CV_3视觉特征提取.pdf,第 4 页。
- 边缘特征提取的步骤:边缘特征提取包含了两个步骤:;1. 计算每个像素亮度变化的程度和方向;;2. 根据变化程度来定位相应的边缘点。;一阶偏导(first derivative):可以得到亮度;的变化程度。;二阶偏导(second derivative):可以得到亮;度变化的极值点(即二阶偏导数为0的;点)。;因此,边缘特征提取的第一步通常由计算。出处:
CV_3视觉特征提取.pdf,第 5 页。
- 边缘特征的幅值与方向:方法1:给定灰度图像函数f(x,y)沿着x轴和y轴方向一阶偏导:;边缘特征的幅值与方向可以由这两个一阶偏导确定:;边缘幅值 边缘方向:;方法2:给定灰度图像函数f(x,y)沿着既定方向(如x轴、Y轴和对角线)的一阶;偏导,例如以下所示,其中角度是与x轴正向的夹角:;边缘特征的方向可以近似为具有最大偏导的那个方向的垂直方向,边缘的幅值近似;为该方向的偏导值。;边缘方向: 边缘幅值;边缘特征。出处:
CV_3视觉特征提取.pdf,第 6 页。
- 3.1.3 常见边缘检测算子:一阶差分算子:Roberts算子;图像是离散函数,因此一阶偏导要用一阶差分来近似给出。;例如沿着x轴和y轴的一阶偏导为:;Roberts算子:对噪声非常敏感,因为它仅使用很少的像素。只能;估计两个方向的一阶差分,其实它估计的是沿着45⁰和-45⁰方向;的一阶差分。由于所用为2×2邻域,所以可以近似为沿着x轴和y;轴的一阶差分。;一阶差分算子:Prewitt算子;Prewitt算子:是一个可旋转的一阶差分算子,可以计算沿着8个。出处:
CV_3视觉特征提取.pdf,第 7 页。
- 一阶差分算子:Sobel算子:Sobel算子:也是一个可旋转的一阶差分算子,可以计算沿着8个;预定方向一阶差分。;它与Prewitt算子不同的之处在于:在方向线上两个点的系数为2,;而不是1。;一阶差分算子:Robinson算子;Robinson算子:也是一个可旋转的一阶差分算子,可以计算沿着;8个预定方向一阶差分。;它与Prewitt算子不同的之处在于:方向线垂直方向上所有点的系;数分别为1、-2和1,而不是0、0和0。它考虑了当前中心像素的。出处:
CV_3视觉特征提取.pdf,第 8 页。
- 一阶差分算子的结果:一阶差分的绝对值代表着是边缘的可能性,即某个像素的一阶差;分的绝对值越大,它是边缘的可能性就越大。。出处:
CV_3视觉特征提取.pdf,第 9 页。
- 二阶差分算子:拉普拉斯算子:拉普拉斯算子:标准的拉普拉斯算子是一个旋转不变的二阶差分;算子。;对边缘产生一明一暗的双重效应。;等于或者接近于0的区域或者是边缘的中心、或者是非边缘区域。;定位边缘点:阈值法;给定一阶差分,首先计算每一个像素的边缘幅度;;其次,将每个像素的边缘幅度与事先设定的阈值来比较,如果幅度;大于阈值,则该像素是边缘点;否则,不是边缘点。;阈值可以根据整个图像的平均亮度来设定。。出处:
CV_3视觉特征提取.pdf,第 10 页。
- 噪声对边缘提取的影响:由于边缘提取是基于导数计算,而导数;计算不仅对有较强亮度变化的边缘区域;有反应,同时对噪声也有强烈反应。随;着导数阶数的增加,噪声的方差会成指;数级别的增加。;第一列:图像亮度函数;第二列:一阶导数;第三列:二阶导数;第一行:无噪声。出处:
CV_3视觉特征提取.pdf,第 11 页。
- 加入高斯平滑滤波:高斯平滑滤波的优势;2. 高斯函数的可分离性(Separable);与一个二维可分离滤波器的卷积等于分别与其一维滤波器进行卷积,;即分别沿着x方向和y方向与对应的一维滤波器进行卷积。它也起到;提高计算效率的目的。;Laplacian of Gaussian (LoG);结合高斯平滑滤波和拉普拉斯算子,就构成了一种新的边缘提取;方法Gaussian 简称为LoG:Laplacian of Gaussian。;由于高斯滤波器的二阶偏导与图像无关,所以可以事先解析的计。出处:
CV_3视觉特征提取.pdf,第 12 页。
- Laplacian of Gaussian (LoG):离散LoG算子,得到一个5×5的滤波器:;LoG的缺点:;无方向性,导致在;角点位置的边缘很;难被提取出来。;LoG的过零点检测;由于二阶偏导在边缘中心和非边缘区域都会出现为0的现象,所;以直接通过判断滤波结果是否为0来定位边缘点是不现实的。;过零点检测:。出处:
CV_3视觉特征提取.pdf,第 13 页。
- Difference of Gaussian (DoG):两个具有明显不同方差的高斯平滑滤波器之差,可以用来近似表;达LoG算子。该算子称为DoG。;DoG算子的过零点检测方法与LoG算子相同。;DoG算子与人类视觉的神经节细胞的特性相符每个细胞对其接受;域(receptive field)内的光线刺激产生响应。接受域具有两个互补;类型的组织,称为较大尺寸的中心外(off-center)和较小尺寸的中;心上(on-center)。当出现一个光线刺激时,中心上的细胞活动增;加,而中心外的细胞活动被禁止。;3.1.4 边缘提取实例。出处:
CV_3视觉特征提取.pdf,第 14 页。
- Canny边缘提取:基于一阶偏导的边缘定位方法:阈值法。缺点:简单的阈值判断;决定边缘点,可能导致提取的边缘过粗(即产生单个边界领域内;的多个响应)。;基于二阶拉普拉斯的边缘定位方法:过零点检测。缺点:由于高;斯平滑滤波的使用,会丢失部分角点;同时,该过零点技术会产;生环形虚假边缘(由于没有使用一阶偏导、从而无法去除非边缘;区域)。;Canny边缘提取方法试图细化边缘、消除虚假边缘。;Canny算法的核心思想:边缘应该位于图像与高斯卷积在边缘法。出处:
CV_3视觉特征提取.pdf,第 15 页。
- 非最大抑制算法:非最大抑制(Non-maximum suppression)算法;1. 根据8邻域将边缘方向量化为8个方向。;2. 对于每个非0幅值的像素,考察其边缘方向之处的两个邻接像素。;3. 如果两个邻接像素的幅值有一个超过当前考察像素的幅值,则;将当前考察像素标记为非候选边缘点。否则标记为候选边缘点。;边缘计算带有的方向信息为实;现该算法提供了基础。;滞后阈值处理算法;滞后阈值处理(Thresholding with hysteresis)算法。出处:
CV_3视觉特征提取.pdf,第 16 页。
- Canny边缘提取示例:边界特征提取;给定了边缘特征信息,可以通过连接这些边缘点,来实现边界特;征提取。;边缘连接(edge linking)算法:分析每一个边缘点的邻域内(3×3;或者5×5)是否有与它相似的点存在。如果有,则将这两个点连接;起来。;相似性判别:;1. 边缘幅值相似;2. 边缘方向相似。出处:
CV_3视觉特征提取.pdf,第 17 页。
- 微小零件尺寸测量:手表定子片微小零件实拍图;手表定子片CAD模板;头脑风暴:跨模态边缘感知;假设未来出现一种革命性的多模态仿生相机,它不仅能拍摄传统;的光学图像,还能同时感知深度(ToF)、热红外辐射、偏振信;息、多光谱,甚至超声波反射。这台相机"看"到的不是单一图像,;而是一个包含多种物理属性的多维数据立方体。;任务:;在传统光学图像中,边缘定义为灰度/颜色的剧烈变化。但在多。出处:
CV_3视觉特征提取.pdf,第 18 页。
- 3.2角点提取:3.2.1 角点特征;3.2.2 角点检测原理;3.2.2 Harris角点提取;3.2.3 角点提取实例;什么是角点(corner) :在角点处,边缘方向出现了不连续,即出现;了两个不同的主边缘方向,图像(灰度)内容在两个方向都存在较;大变化。;角点的种类:线段的交汇点、线段的端点、曲线弯曲部分的突变点、;局部的最大值或者最小值的孤立点等。。出处:
CV_3视觉特征提取.pdf,第 19 页。
- 3.2.2 Harris角点提取:从图像局部的小窗口观察角点与非角点在特性上的不同。;角点的Harris定义: 窗口向任意方向的移动,在角点位置都导致图;像灰度的明显变化。;平坦区域:;任意方向移动无灰;度变化;边缘区域:沿着边缘方;向移动无灰度变化;;,但沿着边缘法向移动,。出处:
CV_3视觉特征提取.pdf,第 20 页。
- Harris角点提取算法:为了避免精确的矩阵特征值计算,定义一个响应函数R(A)作为判别;是否是角点的依据:;k是可调参数,范围在0.04到0.15之间。;Harris角点提取算法:;1. 对图像进行高斯滤波。;2. 对每个像素,估计其沿着x轴和y轴的一阶差分(可以运用一阶差分算子实现)。;3. 对于每个像素和给定的邻域窗口,计算矩阵A(x,y),并计算响应函数R[A(x,y)]。;4. 设置一个R(A)的阈值,以此来选择最佳候选角点。;5. 用非最大化抑制来确定最终角点。。出处:
CV_3视觉特征提取.pdf,第 21 页。
- Harris角点提取:示例。出处:
CV_3视觉特征提取.pdf,第 22 页。
- Harris角点提取:缺点:Harris角点检测的缺点:;1. 响应函数R(A)的变化范围太大,不同图像的,可能跨越好几个数;量级,因此很难设定一个固定的阈值来实现角点的定位。;改进的办法:设置一个新的响应函数R’(A):;2 特征表达只有位置信息,没有其它描述信息直接用来进行物体识;别、图像匹配等任务的效果有限。;改进思路:根据角点所在邻域内的图像内容,构建一个局部描述;(local description)。;3. 鲁棒性:如果内容相近的两幅图像,存在较大范围的几何变换时,。出处:
CV_3视觉特征提取.pdf,第 23 页。
- 3.3 兴趣点提取:3.3.1 兴趣点特征;3.3.2 尺度不变性;3.3.3 SIFT特征提取;3.3.4 兴趣点提取实例;兴趣点(Interest Point)特征:是一种局部的图像结构,由一组在;灰度上存在较大变化、不连续的像素组成。它们是局部特征;(Local Features)的一种。;提取兴趣点(interest points)的意义:对两幅图像进行匹配时,如;果对所有像素都做匹配,则计算是非常耗时的,计算复杂度为。出处:
CV_3视觉特征提取.pdf,第 24 页。
- 兴趣点特征:作用:兴趣点的作用:;1. 内容相似的两幅图像之间的几何转换估计:通过两幅图像之间相;似兴趣点的匹配,建立点与点之间的响应,从而估计几何转换的参;数。该应用还可以扩展到运动分析、立体视觉、摄像机标定、图像;拼接等领域。;2. 物体识别:通过匹配测试图像中物体的兴趣点和数据库中所有物;体的兴趣点,建立点与点之间的响应,从而积累可信度,最终识别;出该测试物体是数据库中的哪种物体。;提取兴趣点的影响因素。出处:
CV_3视觉特征提取.pdf,第 25 页。
- 兴趣点的特性:兴趣点特征应该具备的特性:;1. 对于旋转、平移、透视扭曲(distortion)等变换的不变性,称为;affine invariance。;2. 对于尺度变化的不变性,称为scale invariance。;3. 对于光照等变化的不变性。;4. 对于噪声干扰的不变性。;不变性:给定两幅内容相似的图像,虽然它们之间存在着放射变换、;尺度变化、光照变化等,但是两幅图像中提取出来的一些特征点应;该具备一定相似性,即在一幅图像中提取出来的部分特征点可以和。出处:
CV_3视觉特征提取.pdf,第 26 页。
- 3.3.2 尺度不变性:由于兴趣点等局部特征是一组在灰度值有较大变化的点,这些局部特;征的检测要基于每幅尺度图像的偏导或者偏导的组合 。;例如用一阶偏导的极大、极小值,二阶偏导的过零点。但是,多尺度;图像的空间偏导有一个特性:随着尺度的变化,偏导的幅值;(Amplitude)会逐渐降低。;形成该特性的原因:高斯低通滤波器的平滑作用,使得灰度的最大值;不可能随着尺度变化再增加、反而通常会逐渐减小;灰度的最小值也;不可能随着尺度变化再减小,反而通常会逐渐增加。;该特性的负面效应:对于两幅图像,由于尺度差异等因素,会造成一。出处:
CV_3视觉特征提取.pdf,第 27 页。
- 尺度不变的兴趣点提取:基于归一化偏导得到的尺度不变性,可以用来提取具有尺度不变;性的兴趣点特征。;提取步骤:;1. 给定一幅图像,首先用高斯核卷积来逐级构建该图像的多尺度表;达;;2. 求每个尺度下图像的归一化偏导;由于第一步使用了高斯平滑滤;波,所以这两步可以改变顺序,即可以先求高斯核的归一化偏导,;然后再与相应的尺度图像进行卷积。;LoG算子:高斯核的拉普拉斯算子(高斯核的二阶偏导之和),。出处:
CV_3视觉特征提取.pdf,第 28 页。
- 3.3.3 SIFT特征提取:SIFT是Scale Invariant Feature Transform的缩写,是由UBC教授David Lowe提出。;它是一个提取兴趣点特征的算法,提取出的特征具有高匹配率,目前广泛应用于;物体识别和图像匹配等领域。;SIFT算法包含四个连续过程:;1. 尺度空间极值检测:首先构建一幅图像的多尺度表达,然后搜索所有尺度和像素,;从中选取一些具有尺度不变性的极值点,即确定这些极值点的空间坐标和尺度坐标。;2. 定位关键点(keypoint localization):对每一个极值点进行稳定性评估,从中选取;具有稳定性能的点作为关键点。;3. 方向分配(orientation assignment):在每一个关键点的相关邻域内,确定该邻域。出处:
CV_3视觉特征提取.pdf,第 29 页。
- SIFT算法:多尺度图像表达的偏导:此式表明:尺度因子为常量k的两个不同尺度图像的DoG,可以近;似等于归一化的拉普拉斯算子。;在构建多尺度图像表达时,如果使用尺度因子为常量k的高斯核,;我们就可以用DoG来代替归一化的LoG算子。;当k=2时,DoG和归一化LoG算子之间的误差接近0。不过实验证;实,当k取2附近的数值时,不会影响寻找极值点的效果。;SIFT算法取:;SIFT算法:多尺度表达和DoG构建;Octave指对同一张图像进行一系列连续降采样和模糊处理后,得到的分辨率相同、但模糊程度不同的图像集合。出处:
CV_3视觉特征提取.pdf,第 30 页。
- SIFT算法:多尺度表达和DoG构建:多尺度表达的构建步骤:;1. 用高斯核g(x,y;σ)与细一级尺度的图像进行卷积,得到粗一级尺;度的图像。每一级高斯核的标准偏差的倍数为k,从而达到尺度;因子为常量的目的,即;2. 相邻两尺度级的图像相减,得到每个尺度级别的DoG图像。;3. 为了达到降低计算量的目的,当粗一级尺度图像的分辨率降低2;倍时,对该图像进行子采样。所有大小相同的一组多尺度图像,构;成了一个倍频(octave)。;由于 ,所以每一个倍频段将包含3个不同尺度的图像。同时,。出处:
CV_3视觉特征提取.pdf,第 31 页。
- SIFT算法:关键点定位:由于检测到的极值点并不是全局最优,而是局部极值,因此要删;除掉一部分不稳定的点。这些点包括:;1. 极值的绝对值不是很大的点;这些点可能是噪声引起的。;2. DoG算子会在边缘区域有很大的响应,从而产生较多极值点。;但是,这些极值点中存在一些很难定位的点,即不靠近边缘起;始位置或者终止位置的边缘点。;关键点定位就是通过解决上述两个问题,淘汰一些不稳定的点,;保留下来的极值点即为关键点。;1. 淘汰DoG极值较小的点。通过对DoG极值设置一个阈值,从而滤。出处:
CV_3视觉特征提取.pdf,第 32 页。
- SIFT算法:关键点定位:2. 淘汰不易定位的边缘点。;为了避免计算Hessian矩阵的特征值(计算量比较大),可以通过比较;Hessian矩阵的行列式和trace,达到比较两个特征值相差程度的目的。;阈值的设定:;假设r代表两个特征值a和b的比值,即r=a/b,可以得到:;当a=b时,即r=1时,(r+1)2/r最小。因此,可以设置一个关于r的阈值Tr,;判断如下:;SIFT算法:方向分配;方向分配:在每一个关键点的邻域内计算每个像素的梯度方向。。出处:
CV_3视觉特征提取.pdf,第 33 页。
- SIFT算法:关键点描述:关键点描述(keypoint descriptor):使用方向直方图(Orientation;histogram)来构建。;为了简化,图中所示邻域为2×2区域,实际使用的是4×4区域。;1. 方向直方图由8个项组成,即将360度方向范围分为8份。;2. 因为与关键点越近的像素就越重要,在关键点的邻域内使用一个;高斯低通滤波器来加权平均每个像素的梯度幅值,该高斯滤波器的;标准偏差为邻域宽度的一半。;3. 关键点邻域内每个像素根据其相对梯度方向,分配到直方图相应;的项中,其加权平均后的梯度幅值作为权重。。出处:
CV_3视觉特征提取.pdf,第 34 页。
- 3.3.4 兴趣点提取实例:SIFT特征:关键点提取示例;SIFT特征:关键点。出处:
CV_3视觉特征提取.pdf,第 35 页。
- SIFT特征:关键点之间的匹配:SIFT特征:物体检测与识别;在有遮挡的情况下,SIFT特征也能将物体从复杂环境中检测与识;别出来。出处:
CV_3视觉特征提取.pdf,第 36 页。
- SIFT特征总结:1. 由于SIFT特征基于DoG算子来定位关键点,DoG算子近似于归一;化拉普拉斯算子,因此,SIFT算法得到的关键点具有尺度不变性。;2. 由于关键点的描述是基于相邻像素相对于关键点的相对梯度方向,;所有该描述保证了旋转不变性。;3. 由于关键点描述的直方图经过了归一化,同时DoG算子本身就是;一种基于灰度值的差值操作,所以SIFT特征具有一定的光照不变性。;缺点:特征提取的计算量比较大,后续进行特征匹配时,计算量更;大。;3.4 形状提取。出处:
CV_3视觉特征提取.pdf,第 37 页。
- 3.4.1 直线检测:很多目标的表面特征包含直线;思考:为什么不直接做边缘检测呢?;直线拟合难点;通常包含很多多余的边缘点,这;些点有可能属于多个模型,比如;点附近有多条线,哪一条合适?;只有部分的点被检测到,一部分;的点没有检测到,如何连接这些;可能相关的点呢?。出处:
CV_3视觉特征提取.pdf,第 38 页。
- 拟合直线: Hough transform:是否有直线?哪些点属于同一条直线?;有多少条线?;哪些点属于哪些线?;Hough Transform;主要思想:;1.记录每个边缘点所在的每一条可能的线的投票结果。;2.寻找获得很多选票的线。;图像中的直线: Hough 空间;图像(x,y) 空间和Hough (m,b) 空间。出处:
CV_3视觉特征提取.pdf,第 39 页。
- 图像中的直线: Hough 空间:图像(x,y) 空间和Hough (m,b) 空间;图像中的一条直线对应于Hough 空间的一个点。;给定一组点集合(x, y), 寻找所有 (m,b) 使得满足y = mx + b。;思考:图像上一个像素点(x0, y0) 对应Hough空间上?;image 空间 Hough (parameter) 空间;– 是这个方程的解:b = -x0m + y0;– 在Hough 空间上的一条直线。;图像上两点确定一条直线:(x0, y0) 和(x1, y1);在Hough空间上两条直线的交集:。出处:
CV_3视觉特征提取.pdf,第 40 页。
- 图像中的直线: Hough 空间:对于图像上多个点,如何寻找到最优可能的直线参数(m,b) ?;投票法:;让图像空间中的每个像素点在Hough空间中投票选择一组可能的参数。;在离散的Bin集合中累积选票;投票数最多的参数表示图像空间中的线条。;image 空间 Hough (parameter) 空间;直线的极坐标表示;: 直线到原点的垂直距离;: 垂直线与x轴的夹角;图像空间的点→ Hough空间中的正弦段。出处:
CV_3视觉特征提取.pdf,第 41 页。
- 实例:https://gmarty.github.io/hough-transform-js/;Hough transform 算法;极坐标参数表示:;1. 初始化 H[d, ]=0;2. 对于图像中每个边缘点 I[x,y];for = [min to max ] // some quantization;H[d, ] += 1;3. 找到 (d, ) 在H[d, ] 中最大值;4. 在图像空间的直线就可以表示为:。出处:
CV_3视觉特征提取.pdf,第 42 页。
- 比较:噪声对Hough的影响;图像空间中的边缘坐标 投票;这给实现带来了什么困难?。出处:
CV_3视觉特征提取.pdf,第 43 页。
- 噪声对Hough的影响:图像空间中的边缘坐标 投票;一切似乎都是“噪音”,或随机边缘点,但我们仍然可以看到投票空间中的峰值。;扩展;扩展1: 使用图像梯度;2. 对于图像中每个边缘点I[x,y]; = gradient at (x,y);H[d, ] += 1;(降低自由度);扩展2:对更强的边进行更多投票(使用梯度的幅值)。出处:
CV_3视觉特征提取.pdf,第 44 页。
- 3.4.2 圆形检测:对于一个固定的半径r;圆: 中心点(a,b) 和半径r;222 )()( rbyax ii =−+−;Image 空间;Hough 空间;圆的方程?;是否也类似直线通过;一个点?;圆形Hough 变换。出处:
CV_3视觉特征提取.pdf,第 45 页。
- 圆形Hough 变换:对于一个未知的半径r;圆: 中心点(a,b) 和半径r;222 )()( rbyax ii =−+−;Hough 空间Image 空间。出处:
CV_3视觉特征提取.pdf,第 46 页。
- 圆形Hough 变换:对于一个未知的半径r, 已知梯度方向;圆: 中心点(a,b) 和半径r;222 )()( rbyax ii =−+−;Hough 空间Image 空间;For every edge pixel (x,y) :;For each possible radius value r:;For each possible gradient direction θ:;// or use estimated gradient at (x,y);a = x – r cos(θ) // column。出处:
CV_3视觉特征提取.pdf,第 47 页。
- 实例: 利用Hough检测圆形:Original Edges;Votes: Penny;对每个圆半径(quarters vs. penny),使用不同的Hough变换;(分开累加)。;Hough 检测;Original Edges Votes: Quarter。出处:
CV_3视觉特征提取.pdf,第 48 页。
- 实例: 虹膜检测:Hemerson Pistori and Eduardo Rocha Costa http://rsbweb.nih.gov/ij/plugins/hough-circles.html;Gradient+threshold;Hough space;(fixed radius);Max detections;An Iris Detection Method Using the Hough Transform and Its Evaluation for Facial and Eye Movement, by Hideki;Kashima, Hitoshi Hongo, Kunihito Kato, Kazuhiko Yamamoto, ACCV 2002.。出处:
CV_3视觉特征提取.pdf,第 49 页。
- 3.4.3 任意形状检测:Model image Vote spaceNovel image;现在假设这些颜色编码梯度方向 …;如何检测任意形状?;Ref. point;Displacement;通过边界点和参考点定义一个形状模板;[Dana H. Ballard, Generalizing the Hough Transform to Detect Arbitrary Shapes, 1980];在每个边界点,计算位;移向量 : r = a – pi.。出处:
CV_3视觉特征提取.pdf,第 50 页。
- θ θ:对于每一个边缘点:;使用它的梯度方向θ 索引至相;应存储表;使用检索到的r向量为参考点;投票;检测过程:;假设这里只有位移变换,旋转和缩放固定。;Novel image;推广 Hough 变换。出处:
CV_3视觉特征提取.pdf,第 51 页。
- 不是通过梯度方向索引位移,而是通过“visual codeword”索引。:B. Leibe, A. Leonardis, and B. Schiele, Combined Object Categorization and Segmentation with an;Implicit Shape Model, ECCV Workshop on Statistical Learning in Computer Vision 2004;test image;Source: L. Lazebnik;推广至目标检测;3.5 区域特征提取;3.5.1 区域统计特征;3.5.2 HOG特征;3.5.3 HOG特征提取实例。出处:
CV_3视觉特征提取.pdf,第 52 页。
- 3.5.1 区域统计特征:矩: 给定一个形状区域,将区域内的灰度值归一化或者二值化,;基于这些值,可以计算区域内的统计量。;二值化的方法:自适应的设置阈值,例如使用均值.;(p+q)阶矩的计算公式:;(p+q)阶中心矩的计算公式:具有平移不变性;4个具有仿射变换不变性的二阶和三阶矩:。出处:
CV_3视觉特征提取.pdf,第 53 页。
- 3.5.2 HOG特征:3.5.2 HOG特征(第一步);HOG全称:方向梯度直方图(Histogram of;Oriented Gradient,HOG)。它描述了一个;区域内梯度方向的分布情况,因此可以用;来用来描述一个物体的整体形状特征。;第一步:计算每个像素的梯度。假设图像;中一块窗口的大小为m×n像素,计算每个;像素的梯度:使用[-1,0,1]一维滤波器分别;计算每个像素沿着x方向和y方向的偏导,。出处:
CV_3视觉特征提取.pdf,第 54 页。
- HOG特征特征提取:第二步:第二步:计算每个cell的直方图。将整个窗口划分为一组基本单元(cell),;每个cell的大小为8×8像素。为每个cell构建一个直方图,该直方图依据梯;度方向来划分bins,每20度占据一个bin。如果梯度方向采用0~180度的;范围(即无符号方向),则直方图有9个bins;如果梯度方向采用0~360;度的范围(即有符号方向),则直方图有18个bins。将每个cell内的64个;像素按照梯度的方向、根据二线差值法分配到相应的bin,梯度的幅值作;为权重。;假设一个像素的梯度方向为a°,属于bin 0的范;围,同时最相邻的bin是bin 1,幅值为M,则该。出处:
CV_3视觉特征提取.pdf,第 55 页。
- HOG特征特征提取:第三步:第三步:归一化每个cell的直方图。每;2×2个cells组成一个block。每个block;之间的间隔为一个cell,即block之间是;交错重叠的。因此,除了最边缘的cells;以外,其余的每个cell都分别被4个;blocks包含。;对于一个大小为m×n的窗口,则形成;[(m-16)/8+1]*[(n-16)/8+1]个blocks。;在每一个block范围内,归一化该block。出处:
CV_3视觉特征提取.pdf,第 56 页。
- 3.5.3 区域特征提取实例:3.5.4 纹理特征提取;共生矩阵(co-occurrence matrix)描述:主要用来刻画基元在灰度属性上周;期性重复出现的频率。该描述属于一种统计描述方法。;它描述了纹理内部相似基元之间反复出现的空间频率。该空间频率是由基;元的大小、基元之间的空间排列等因素决定的。;计算原理:;1. 在M×N窗口区域内,统计具有灰度级a和b的两个像素、在方向θ上间隔距;离为d的这种情况在该区域出现的频率,频率记作:;2.所有的灰度级构成一个矩阵的行和列,在每个方向和每个距离d都可以得。出处:
CV_3视觉特征提取.pdf,第 57 页。
- 共生矩阵描述算子:所有可能的像素值:0,1,2,3;给定4个方向(0,45,90,135)和N个不同的距离d,可以构建4N个共生矩阵。;这些共生矩阵可以直接作为纹理描述。;共生矩阵的一些统计值可以进一步作为纹理描述量。;1. 能量:它给出了区域在某个方向和某个距离间隔内的均匀性。图像越;均匀,其值越大。;2. 熵(entropy):它给出了区域在某个方向和某个距离间隔分布的不确定;性。随机性越大,其值就越大。;3.最大概率:给出了纹理在某个方向和某个距离间隔分布的可能性。。出处:
CV_3视觉特征提取.pdf,第 58 页。
- 3.6频域特征提取:3.6.1傅里叶变换;3.6.2频域性质;3.6.3低频特征;3.6.4高频特征;3.6.5 频域特征提取实例;法国数学家傅立叶:任何一个;周期性函数都可以表达为多个;不同频率的sine或者cosine函数;的加权之和。每一个sine或者。出处:
CV_3视觉特征提取.pdf,第 59 页。
- 3.6.1傅里叶变换:特性:对于任何一个函数,给定;它的傅立叶变换,经过反变换,;可以重建该函数。;意义:允许我们在傅立叶频率域;对函数进行操作,然后毫无信息;损失的回到该函数的原始域。;一维连续傅立叶变换;给定一个单变量连续函数f(x),其傅立叶变换F(u)可以定义为:;其中,。出处:
CV_3视觉特征提取.pdf,第 60 页。
- 3.6.2频域性质:傅立叶变换:将函数f(x)分解为各个频率组件,;即它是一个函数在频率域上的分解过程。;F(u)代表了函数f(x)在频率u上所占据的成分。;与棱镜原理近似。;一维连续傅立叶反变换;给定F(u),通过傅立叶反变换可以得到f(x):;傅立叶反变换:将各个频率组件F(u)组合为原函数f(x),即重构原;函数的过程。。出处:
CV_3视觉特征提取.pdf,第 61 页。
- 傅里叶变换的意义:一维离散傅立叶变换;将x的取值范围和u的取值范围离散化为;一维离散傅立叶变换定义为:。出处:
CV_3视觉特征提取.pdf,第 62 页。
- 一维傅立叶变换的幅度和相位角:傅立叶变换的频率谱(Spectrum):;傅立叶变换的功率谱(Power Spectrum):;傅立叶变换的相位角(Phase Angle):;一维离散傅立叶反变换;给定F(u),通过傅立叶反变换可以得到f(x):。出处:
CV_3视觉特征提取.pdf,第 63 页。
- 傅立叶变换的性质:卷积理论:大小为M×N的两个函数f(x,y)和h(x,y)的离散卷积可以定义为:;卷积定理:;意义:卷积是空间域滤波和频率域滤波之间连接的纽带。;卷积理论应用:匹配;卷积理论的主要作用就是用;于两幅图像之间的匹配。;假设图像f(x,y)含有多个物体,;图像h(x,y)含有一个特定的;目标物体(即模板)。如果。出处:
CV_3视觉特征提取.pdf,第 64 页。
- 傅里叶频率分量和图像空间特征的关系:傅里叶变换的频率分量和图像空间特征之间的关系:;1.频率代表了在空间域图像灰度值的变化率。;2.变化最慢的频率成分(u=v=0)对应一幅图像的平均灰度值,即;3.当从频率域的原点移开时,低频对应着图像中变化较慢的分量如图;像中较为平滑部分。;4.当进一步离开原点时,较高的频率对应图像中变化越来越快的分量,;如边缘和噪声等尖锐部分。;3.6.3低频特征;离散傅里叶变换的-频谱示例。出处:
CV_3视觉特征提取.pdf,第 65 页。
- 频域滤波和空间滤波之间的关系:根据傅立叶变换的卷积性质得到如下结论:可以在频率域设计滤波;器H(u,v),然后对其做反变换得到h(x,y),利用h(x,y)作为相应的空;间滤波器的原型。;由于h(x,y)的大小为M×N,如果直接用h(x,y)做空间滤波器,滤波的;计算量很大。因此,为了减小计算量,通常我们根据h(x,y),在空;间域设计一个尺寸较小的空间滤波器。;相反,空间滤波器的尺寸越大,其效果越接近于相应的频域滤波器。;结论:频率域便于直观的设计滤波器,空间域便于快速的计算滤波。;理想低通滤波器。出处:
CV_3视觉特征提取.pdf,第 66 页。
- 理想低通滤波器:说明:在半径为D的圆内,所有频率没有任何衰减的通过滤波器;而在此圆;之外的所有频率完全被衰减掉。;问题:如何确定截止频率?;可以根据截止频率为半径的圆内所包含的功率值,来选择相应的截止频率。。出处:
CV_3视觉特征提取.pdf,第 67 页。
- 理想低通滤波器:结论:半径D0越小,滤掉的高频成分越多,模糊就越多;半径D0越;大,滤掉的高频成分越少,模糊就越小。;688×688原图;半径为10的理想低通滤波;结果,它滤除掉13%的总;功率。结果如此模糊,说;明大部分图像尖锐细节在;这13%的功率之内。;半径为30的理想低通。出处:
CV_3视觉特征提取.pdf,第 68 页。
- 巴特沃思低通滤波器:阶数的影响:二阶BLPF可以很好的兼顾低;通滤波的有效性和降低振铃效果。;低通滤波器的应用:人脸图像处理;减少脸部细纹。。出处:
CV_3视觉特征提取.pdf,第 69 页。
- 3.6.4高频特征:锐化滤波器(Sharpening Filters):高通滤波器(Highpass Filters),;通过抑制F(u,v)中的低频成分来实现锐化滤波。;应用:增强边缘信息,可用于边缘提取。;设计思路:如果给定一类低通滤波器,可以得到相应的高通滤波;器:;理想高通滤波器。出处:
CV_3视觉特征提取.pdf,第 70 页。
- 理想高通滤波器:巴特沃思高通滤波器。出处:
CV_3视觉特征提取.pdf,第 71 页。
- 巴特沃思高通滤波器:3.6.5 频域特征提取实例。出处:
CV_3视觉特征提取.pdf,第 72 页。
4. CV_4视觉特征学习new
- 第4章 视觉特征学习:视觉特征学习;1. 从特征工程到特征学习;2. 泛化与迁移;3. 特征空间的度量学习。出处:
CV_4视觉特征学习new.pdf,第 1 页。
- 本章内容:监督式特征学习;无监督特征学习;半监督特征学习;自监督特征学习;4.1监督式特征学习;监督学习:有标签数据、直接反馈、预测结果/未来;带标签的;训练样本;监督学习。出处:
CV_4视觉特征学习new.pdf,第 2 页。
- 监督式特征学习:优化问题:;基于距离的识别;基于距离的识别:把测试模式和已有模式之间的距离作;为判断准则。该技术是最常见的模式识别技术,是其它;高级识别技术的基础。;判别公式;类的表达:最基于距离的识别中,使用最简单的一种关;于类的知识表达,即所有训练模式的集合。。出处:
CV_4视觉特征学习new.pdf,第 3 页。
- 点对点的距离测量:MED分类器;MED分类器:最小欧式距离分类器(Minimum Euclidean Distance;Classifier);对于2个类而言,MED分类器的决策边界是一个超平面,该平面;垂直且二分连接两个类原型的线。。出处:
CV_4视觉特征学习new.pdf,第 4 页。
- 点对概率分布的距离测量:如果把一个类中含有的所有模式看作一个概率分布,则可以计算;该类所含模式的统计量,依据该类的统计量来计算距离。;Mahalanobis(马哈拉诺比斯)距离:;该距离不仅考虑了类的均值对于距离测量的影响,;还加入了类的方差对于距离测量的影响。;自动归一化:内部包含了每个维;度的方差信息,自动将不同尺度的;特征拉到同一量级比较。;去相关性:通过协方差矩阵的逆,。出处:
CV_4视觉特征学习new.pdf,第 5 页。
- 点对统计分布的距离测量:Mahalanobis距离的属性;当S是任意值时:等距图是一个有方向的超椭圆面点;1.中心化:将数据点平移到原点。;2.旋转(由特征向量决定):消除特征之间的相关性。;3.缩放(由特征值决定):让不同方向上的方差变得相同(归一化)。;MICD分类器;MICD分类器:Minimum Intra-class Distance Classifier,基于;Mahalanobis距离的分类器。;对于2个类而言,如果S是任意值,则MICD决策边界是一个超抛。出处:
CV_4视觉特征学习new.pdf,第 6 页。
- MICD分类器:缺点:如下情况,可以看出MICD分类器的一个缺陷。;同样偏离均值的距离,在方差大;的类别中,马氏距离会被“打折”;得更厉害。;方差大的类别更容易被选中;类别A:数据分布紧凑,协方差很小(类内紧密);类别B:数据分布分散,协方差很大(类内松散);结果:虽然3离类别A的中心(0)更近(绝对距离3),离类别B的中心(5)更远(绝对距离2),;但由于类别B的方差极大,马氏距离仅为0.2,分类器判定它属于类别B。。出处:
CV_4视觉特征学习new.pdf,第 7 页。
- MAP分类器:MAP分类器(Maximum A Posterior Classifier):如果把一个类;看作是一个概率分布,则判断准则可以设计如下:;给定一个测试模式,如果某一个类对于该测试模式的后验概率;(posterior)最大,则表示该模式属于这个类。;根据贝叶斯规则(Bayes’ rule),后验概率是由先验概率(prior)和;观测似然(observation likelihood)计算得到。;MAP分类器可以进一步表达为:;对于2个类而言,决策边界位于:;使用MAP分类器时,需要事先知道每个类的先验概率和每个类的。出处:
CV_4视觉特征学习new.pdf,第 8 页。
- MAP分类器:如果观测似然函数是高斯函数:(以单变量为例);判断准则公式两端取对数:;在其它条件相同时,MAP分类器偏向于先验概率大的类。;在其它条件相同时,MAP分类器偏向于方差小的类,即紧密的类。;决策边界:。出处:
CV_4视觉特征学习new.pdf,第 9 页。
- MAP分类器:两个类方差相同时:;两个类方差相同时,MAP分;类器决策边界向具有较小先;验概率的类偏移。;两个类方差不相同时:;决策边界有两个解。;在其它条件相同时,MAP;分类器偏向于方差小的类。。出处:
CV_4视觉特征学习new.pdf,第 10 页。
- MAP分类器:虽然样本在绝对距离上离B中心更近( 2 2 到 5 5 欧氏距离约4.24),但MAP选择了紧凑的A。;k近邻算法;工作原理:存在一个样本数据集合,;并且样本集中每个数据都存在标签,;输入没有标签的新数据后,将新的数;据的每个特征与样本集中数据对应的;特征进行比较;然后算法提取样本最相似数据(最近;邻)的分类标签。(只选择样本数据。出处:
CV_4视觉特征学习new.pdf,第 11 页。
- k-近邻算法步骤:1.计算已知类别数据集中的点与当前;点之间的距离;;2.按照距离递增次序排序;;3.选取与当前点距离最小的k个点;;4.确定前k个点所在类别的出现频率;;5.返回前k个点所出现频率最高的类别;作为当前点的预测分类。;k近邻(k-nearest neighbor, k-NN);如果K=3,绿色圆点的最近的3个邻居。出处:
CV_4视觉特征学习new.pdf,第 12 页。
- k近邻方法:k近邻:图像分割。出处:
CV_4视觉特征学习new.pdf,第 13 页。
- 4.2无监督视觉特征学习:无监督学习:无标签/目标、无反馈、寻找数据中隐藏的结构;无标记的;样本;无监督学;习过程 分类结果;摆脱标注依赖:人工标注成本高昂,且难以覆盖长尾、开放世界的概念。;利用海量数据:互联网上的图像和视频几乎是无限的,无监督学习是挖掘这些数据;的有效手段。;提升泛化能力:通过无监督预训练,模型往往能学到更鲁棒的特征,在下游任务。出处:
CV_4视觉特征学习new.pdf,第 14 页。
- K-means算法:基于划分的聚类算法,它以 k 为参数,把 n 个数据对象分成;k 个簇,使簇内具有较高的相似度,而簇间的相似度较低。;K-means 图像分割。出处:
CV_4视觉特征学习new.pdf,第 15 页。
- 高斯混合模型(GMM):混合模型是一个可以用来表示在总体分布(distribution)中含有;K 个子分布的概率模型,换句话说,混合模型表示了观测数据在;总体中的概率分布,它是一个由 K 个子分布组成的混合分布。混;合模型不要求观测数据提供关于子分布的信息,来计算观测数据;在总体分布中的概率。;单高斯模型;当样本数据 X 是一维数据(Univariate)时,高斯分布遵从下方概率密;度函数(Probability Density Function):;当样本数据 X 是多维数据(Multivariate)时,高斯分布遵从下方概率。出处:
CV_4视觉特征学习new.pdf,第 16 页。
- 高斯混合模型:高斯混合模型可以看作是;由 K 个单高斯模型组合而;成的模型,这 K 个子模型;是混合模型的隐变量;(Hidden variable)。;一般来说,一个混合模型;可以使用任何概率分布,;这里使用高斯混合模型是;因为高斯分布具备很好的。出处:
CV_4视觉特征学习new.pdf,第 17 页。
- 模型参数学习:对于单高斯模型,我们可以用最大似然法(Maximum likelihood)估;算参数 的值,;这里我们假设了每个数据点都是独立的(Independent),似然函数;由概率密度函数(PDF)给出。;由于每个点发生的概率都很小,乘积会变得极其小,不利于计算和;观察,因此通常我们用 Maximum Log-Likelihood 来计算(因为 Log 函;数具备单调性,不会改变极值的位置,同时在 0-1 之间输入值很小的;变化可以引起输出值相对较大的变动):;对于高斯混合模型,Log-Likelihood 函数是:。出处:
CV_4视觉特征学习new.pdf,第 18 页。
- EM 算法:EM 算法是一种迭代算法,1977 年由 Dempster 等人总结提出,用;于含有隐变量(Hidden variable)的概率模型参数的最大似然估计。;每次迭代包含两个步骤:;这里不具体介绍一般性的 EM 算法(通过 Jensen 不等式得出似然;函数的下界 Lower bound,通过极大化下界做到极大化似然函;数),只介绍怎么在高斯混合模型里应用从来推算出模型参数。。出处:
CV_4视觉特征学习new.pdf,第 19 页。
- 自然图像块学习:从学习得到的高斯混合模型;(GMM)中随机选取的6个协;方差矩阵的特征向量,按特;征值从大到小排序。;注意其结构的丰富性——有些;特征向量看起来像PCA(主成;分分析)的分量,而另一些;则建模了纹理边界、边缘以;及其他不同方向的结构。。出处:
CV_4视觉特征学习new.pdf,第 20 页。
- 基于自然图像块学习的图像去噪:Chen, F., Zhang, L., & Yu, H. (2015). External Patch Prior Guided Internal Clustering for Image Denoising. ICCV, 2015.。出处:
CV_4视觉特征学习new.pdf,第 21 页。
- 基于自然图像块学习的图像去噪:核密度估计;密度估计(Density Estimation):如果概率分布形式未知,可以通;过无参数(non-parametric)技术来实现概率密度估计。;直方图技术:将特征空间分为一系列的格子(bins),根据训练模;式的特征值,累积相应的格子,最终得到所有训练模式的统计值。;直方图技术的问题:;1. 如何确定格子的数目。;2. 如何划分特征空间。;这两个问题是相互关联的,通过解决了一个问题,另一个问题也随。出处:
CV_4视觉特征学习new.pdf,第 22 页。
- 概率密度估计:核(kernel)技术:给定一个核函数(kernel function),给定训练模;式的概率密度可以估计如下:;核函数,必须是对称的函数;带宽,决定了特征空间分割的细化程度;核函数可以是均匀分布函数、三角分布函数、高斯分布函数等该;技术也称为Parzen Windows。;核技术和直方图技术的对比:核技术的估计结果更加平滑。。出处:
CV_4视觉特征学习new.pdf,第 23 页。
- 概率密度估计:核技术中的带宽选取原则:;Generalization (泛化能力):因为给定的训练模式对于实际的概率;分布而言,数量是很少的、是稀疏的,所以要求根据这些训练模;式估计出来的概率分布既能够符合这些训练模式之间的关系,同;时也要有一定预测能力,即也能估计未看见的模式。;形状先验:目标分割。出处:
CV_4视觉特征学习new.pdf,第 24 页。
- 自编码器(Auto-encoder):AE 与 VAE 隐空间对比;语义相似的数据点彼此相邻,而语义不同的点彼此远离;变分自编码器(Variational Auto-encoder, VAE);VAE 的核心目标不是压缩数据,而是学习数据的潜在概率分布,从而生成新样本。。出处:
CV_4视觉特征学习new.pdf,第 25 页。
- 变分自编码器(Variational Auto-encoder, VAE):自编码器 VAE;输出 固定编码向量 编码向量的分布;隐空间 可能不连续、不规则 连续、平滑,可采样;生成能力 不能生成新样本 能从先验采样生成新样本;损失 重构误差 重构误差 + KL 正则;适用性 降维、特征提取 生成模型、隐空间操控;生成对抗网络。出处:
CV_4视觉特征学习new.pdf,第 26 页。
- 生成对抗网络:无监督图像分割。出处:
CV_4视觉特征学习new.pdf,第 27 页。
- 讨论:题目:有人认为“无监督学习是人工智能的‘暗物质’,虽然难以评;估,但蕴含着真正的智能”;也有人认为“没有标签数据的监督学;习只是‘花架子’,无法落地产生精确的商业价值”。请围绕以下争;议展开辩论:;“在解决实际工业问题时,无监督学习是否只是监督学习的‘辅助;工具’(如用于降维、数据预处理),还是具备独立解决核心业务;问题的‘主力军’地位?”。出处:
CV_4视觉特征学习new.pdf,第 28 页。
- 4.3半监督特征学习:生成模型中的半监督学习;基于平滑的半监督方法;伪标签”(Pseudo-label);Noisy Student;一致性正则化;例如,大量医学影像,医生把每张片子上的每个;病灶都标注出来再进行学习,是不可能的,能否;只标注一部分,并且还能利用未标注的部分?;半监督学习。出处:
CV_4视觉特征学习new.pdf,第 29 页。
- 生成模型中的半监督学习:在监督学习中,概率生成模型用;来分类的方法:假设数据集服从;高斯分布,然后利用最大似然估;计估算出样本分布的参数,然后;对未知样本进行分类。;那么在半监督学习中,我们不仅;有带有标签的数据,还会有大量;的没有标签的数据,如图所示:;图中绿色的点是无标签数据,那么这些无标签的数据。出处:
CV_4视觉特征学习new.pdf,第 30 页。
- 基于平滑的半监督方法:基于平滑的假设的思想就是:当x1和x2通过一个高密度区域相连,;那么x1和x2就是相似的。;x1和x2从距离计算上来看相聚较;远,而x2和x3相聚更近,然而x1;和x2中间有一块高密度区域相连,;那么就认为x1和x2更相似,而x2;和x3则不相似。;聚类后再分类;这种方法比较直观,就是将所有的数据进行聚类,然后根据。出处:
CV_4视觉特征学习new.pdf,第 31 页。
- 图方法:首先定义xi和xj之间的相似度;边的连接可以采用K-nearest neighbor或者e-neighborhood:;图拉普拉斯正则;S的值越小,表示图越光滑,越好,如下两个图,来计算一下哪;一个图更光滑:;图的边就是通过RBF计算得到的;权重的大小,y即为分类结果,;那么显然左边的比右边的分类结;果更合理,因为S更小。。出处:
CV_4视觉特征学习new.pdf,第 32 页。
- 图拉普拉斯正则:图拉普拉斯矩阵;那么在进行训练时,由原本的labeled data使得损失最小,;还要使得越smooth越好,即S越小越好,即损失函数变成;了:;伪标签”(Pseudo-label);在有标签图像上使用交叉熵损失训练一个模型,利用该模型对无标签图像进行预测,并使用最;大置信度类别作为伪标签,然后通过计算预测结果和伪标签之间的交叉熵损失来训练模型。;Amit Chaudhary. “Semi-Supervised Learning in Computer Vision.” https://amitness.com/2020/07/semi-supervised;learning (2020)。出处:
CV_4视觉特征学习new.pdf,第 33 页。
- Noisy Student:训练两个独立的模型,即“教师模型”和“学;生模型”。;在有标签图像上训练一个教师模型,用来;给无标签图像打伪标签。;将有标签图像和伪标签图像混在一起,使;用RandAugment、Dropout、;Stochastic Depth添加噪声,训练一个学生;模型。;学生模型训练好以后,将其作为新的教师。出处:
CV_4视觉特征学习new.pdf,第 34 页。
- 对同一个未标注样本施加两次不同的随机数据增强(或噪声扰动),:强迫模型对这两个增强版本的预测结果保持一致。;This model was proposed by Laine et al. in a conference paper at ICLR 2017.;高度依赖于数据增强的质量。;增强太弱 → 模型学不到有;意义的不变性;增强太强 → 破坏语义,强;制一致性反而有害;跨领域泛化差;4.4自监督特征学习。出处:
CV_4视觉特征学习new.pdf,第 35 页。
- 自监督学习方法:1.根据所有待预测部分之外的信息预测任意一部分信息。;2.根据过去预测未来。;3.根据过去最近的情况预测未来。;4.根据现在预测过去。;5.根据底层信息预测顶层信息。;6.根据可见的信息预测不可见的信息。;7.假设有一部分输入数据未知,并且对其进行预测。;SimCLR(Simple Framework for Contrastive Learning of Visual Representations)是谷歌大;脑在2020年提出的自监督对比学习框架。它通过拉近同一图片的不同增强视图、推远不。出处:
CV_4视觉特征学习new.pdf,第 36 页。
- 图像着色:图像超分辨。出处:
CV_4视觉特征学习new.pdf,第 37 页。
- 图像修补:Cross-Channel 预测。出处:
CV_4视觉特征学习new.pdf,第 38 页。
- 几何变换识别:图像聚类。出处:
CV_4视觉特征学习new.pdf,第 39 页。
- 视频帧序:讨论;假设你是一家初创公司的首席数据科学家,公司刚拿到以下三个;业务需求,预算只够先启动一个。你会选择先做哪一个?请说明;理由,并阐述该任务属于监督学习还是无监督学习,以及具体的;算法选型。;A需求(电商): 想把用户分成不同的群体,以便针对不同群体;发放不同风格的优惠券,但目前没有任何用户的标签数据。;B需求(银行): 希望建立一个系统,能在信用卡交易发生的瞬;间,判断出该笔交易是否为“盗刷”。。出处:
CV_4视觉特征学习new.pdf,第 40 页。
5. CV_5图像分类
- 第5章 图像分类:本章内容;图像分类任务;评价指标;ILSVRC竞赛;神经网络;卷积神经网络;样本增强;AlexNet网络;ResNet残差网络。出处:
CV_5图像分类.pdf,第 1 页。
- 5.1图像分类任务:图像分类任务是计算机视觉中的核心任务,其目标是根据图像信;息中所反映的不同特征,把不同类别的图像区分开来。;图像分类:从已知的类别标签集合中为给定的输入图片选定一个;类别标签。;语义特征;跨越“语义鸿沟”建立像素到语义的映射。出处:
CV_5图像分类.pdf,第 2 页。
- 分类器设计:训练阶段 测试阶段;5.2图像分类任务的评价指标;正确率(accuracy)= 分对的样本数/全部样本数;错误率(error rate) = 1 – 正确率;Top1指标与Top5指标。出处:
CV_5图像分类.pdf,第 3 页。
- 混淆矩阵:准确率(Accuracy) 精确度(Precision) 召回率(Recall);5.3 数据集;CIFAR-10 由多伦多大学计算机科学系的Alex;Krizhevsky、Vinod Nair和Geoffrey Hinton于;2009年创建。;规模适中:总共包含 60,000 张 32×32 像素的彩色;RGB图像。;类别均衡:共分为 10 个类别,包括:飞机、汽车、;鸟、猫、鹿、狗、青蛙、马、船、卡车。每个类别。出处:
CV_5图像分类.pdf,第 4 页。
- 5.3 ILSVRC竞赛:ImageNet数据集——由斯坦福大学李飞飞教授主导制作,包含128万张训练图像、1000个物体类别的数据集;ILSVRC竞赛;从2010年到2017年,不仅是计算;机视觉领域最重要的标杆,更直;接推动了深度学习时代的到来。。出处:
CV_5图像分类.pdf,第 5 页。
- WebVision数据集是由瑞士苏黎世联邦理工学院的计算机视觉实验室创建的;:WebVision 1.0(2017年)包含1000个类别、240万张图像;;WebVision 2.0(2018年),包含5000个类别,超过1600万张;;从互联网爬取,包含大量错误标注、“噪声”数据,且各类别图像数量极不均衡;;“弱监督学习”和“噪声标签学习”领域的基准数据集。;投票:AI 招聘系统中的“图像分类器”;某科技公司开发了一款用于“初;筛面试者”的图像分类系统。该;系统仅通过分析面试者的证件;照(面部特征、穿着、表情。出处:
CV_5图像分类.pdf,第 6 页。
- 5.4神经网络:神经网络是深度学习的核心算;法架构,其设计灵感来源于人;脑神经元的工作方式。它是一;种通过多层非线性变换,从数;据中自动学习层次化特征的数;学模型。;神经元细胞——工作机理及其;数学模型;感受机制——神经网络。出处:
CV_5图像分类.pdf,第 7 页。
- 线性不可分:异或(XOR)问题;你无法画出任何一条直线,能将O和X完美地分在两边。;激活函数;激活函数通过在每层的输出上施加一个非线性变换,使得多层;网络可以拟合复杂的、非线性的函数关系,从而具备更强大的;学习和表达能力。;Sigmoid 函数 Tanh 函数。出处:
CV_5图像分类.pdf,第 8 页。
- 激活函数:ReLU Leaky ReLU ELU;SELU Swish;引入非线性,使神经网络能够拟合任意复杂函数。;数学简洁性、计算效率与梯度稳定性三方博弈后收敛出的;数学简洁性、计算效率与梯度稳定性三方博弈后收敛出的.。出处:
CV_5图像分类.pdf,第 9 页。
- 全连接神经网络:神经网络是由大量神经元节点按一定体系架构连接成的;网状结构,一般都有输入层,隐含层和输出层。;传统的浅层网络,一般有3~5层。;参数爆炸!;目标函数;目标函数(Objective Function),又称损失函数(Loss Function)或代价函数(Cost Function),是衡;量模型预测值与真实值之间差距的函数。。出处:
CV_5图像分类.pdf,第 10 页。
- 梯度下降:梯度下降法是神经网络训练的核心优化算法,通过迭;代更新参数,使目标函数值不断减小。;Softmax层的作用是突出“最大值”并转换成概率的形式。。出处:
CV_5图像分类.pdf,第 11 页。
- 全连接神经网络的瓶颈:5.5卷积神经网络;卷积核:;不仅具有宽和高,还具有深度,常写成:宽度 x 高度 x 深度;卷积核参数不仅包括核中存储的权值,还包括一个偏置值。出处:
CV_5图像分类.pdf,第 12 页。
- 卷积网络中的卷积操作:特征响应图中每个位置上的值反 映了图像上对应位置是否;存在卷 积核所记录的基元结构信息。。出处:
CV_5图像分类.pdf,第 13 页。
- 卷积层:不同的特征响应图反映了输入图像对不同卷积核的响应结;卷积步长(stride);卷积神经网络中,卷积核可以按照指定的间隔进行卷积操作, 这;个间隔就是卷积步长。。出处:
CV_5图像分类.pdf,第 14 页。
- 边界填充:卷积神经网络中最常用的填充方式是零值填充。;作用:保持输入、输出尺寸的一致!;池化操作;池化的作用:对每一个特征响应图独立进行,降低特征响应图组中每个特征;响应图的宽度和高度,减少后续卷积层的参数的数量,降低计算资源耗费,;进而控制过拟合。;池化操作:对特征响应图某个区域进行池化就是在该区域上指定一个值来代;表整个区域。;常见的池化操作:。出处:
CV_5图像分类.pdf,第 15 页。
- 池化操作示例:池化操作对每一个特征响应图独立进行;;对特征响应图某个区域进行池化就是在该区域上指定一个值来代;表整个区域。;卷积神经网络。出处:
CV_5图像分类.pdf,第 16 页。
- 5.6样本增强:存在的问题:过拟合的原因是学习样本太少,导致无法训练出;能够泛化到新数 据的模型。;数据增强:是从现有的训练样本中生成更多的训练数据,其方;法是利用多种能 够生成可信图像的随机变换来增加样本。;数据增强的目标:模型在训练时不会两次查看完全相同的图像。;这让模型能够 观察到数据的更多内容,从而具有更好的泛化能力;样本增强;翻转;随机缩放&抠图。出处:
CV_5图像分类.pdf,第 17 页。
- 卷积神经网络进化:5.7 AlexNet网络;精度提升超过10个百分点!。出处:
CV_5图像分类.pdf,第 18 页。
- AlexNet网络:结构:;第一层 (CONV1): 96 个11x11 卷积核,步长为;4,没有零填充;问题:输入:227x227x3 大小的图像,输出特征;图个数及尺寸为多少?;尺寸:(227-11)/4+1 = 55;个数:96;问题:这层有多少个参数?;参数: (11*11*3+1)*96 = 35K。出处:
CV_5图像分类.pdf,第 19 页。
- AlexNet网络:Max POOL1: 窗口大小3x3,步长为 2;(重叠有助于 对抗过拟合);作用:降低特征图尺寸,对抗轻微的目标偏移带;来的影响;输出尺寸: (55-3)/2+1 = 27;特征图个数:96;参数个数:0;结构:;局部相应归一化层(NORM1)作用:。出处:
CV_5图像分类.pdf,第 20 页。
- AlexNet网络:第二层 (CONV2): 256 个5x5 卷积核,步长为 1,;使用零填充p=2;问题:输入: 27x27x256 大小的特征图组,输出;特征图个数及尺寸为多少?;尺寸:(27 - 5 + 2*2)/1+1 = 27;个数:256;结构:;第三、四层 (CONV3、CONV4): 384 个3x3 卷积;核,步长为 1,使用零填充 p=1。出处:
CV_5图像分类.pdf,第 21 页。
- AlexNet网络:结构:。出处:
CV_5图像分类.pdf,第 22 页。
- 思 考:问题1:小卷积核有哪些优势?;回答:多个小尺寸卷积核串联可以得到与大尺寸卷积核相同的感;受野; 使用小卷积核串联构建的网络深度更深、非线性更强、参;数也更少。;3个3x3卷积核串联,感受野为7x7;小卷积核优势;假设卷积层输入和输出的特征图个数均为C:;三个3 × 3的卷积串联参数个数;(3 × 3 × C) × C × 3 = 27𝐶2。出处:
CV_5图像分类.pdf,第 23 页。
- 1x1卷积:利用1x1卷积进行压缩会损失信息吗?;这种压缩是否会损失信息呢?;位置A的这个64维向量是一个非常稀疏向量;利用1x1卷积进行非线性压缩通常不会损失信息。。出处:
CV_5图像分类.pdf,第 24 页。
- AlexNet的贡献:AlexNet——验证了深度卷积神经网络的高效性;主体贡献;1. 提出了一种卷积层加全连接层的卷积神经网络结构;2. 首次使用ReLU函数做为神经网络的激活函数;3. 首次提出Dropout正则化来控制过拟合;4. 使用加入动量的小批量梯度下降算法加速了训练过程的收敛;;5. 使用数据增强策略极大地抑制了训练过程的过拟合;;6. 利用了GPU的并行计算能力,加速了网络的训练与推断。;5.8 GoogLeNet。出处:
CV_5图像分类.pdf,第 25 页。
- 5.9 ResNet残差网络:实验:持续向一个“基础”的卷积神经网络上面叠加更深的层数会;发生什么?;猜测:加深网络层数引起过拟合,;导致错误率上升;原因:训练过程中网络的正、反向信息流;动不顺畅, 网络没有被充分训练。;退化问题;梯度消失;ResNet残差网络。出处:
CV_5图像分类.pdf,第 26 页。
- 典型CNN的参数与效果对比:为什么残差网络性能这么好?;一种典型的解释:残差网络可以看作是一种集成模型!;残差网络直接在模块的输出与输入之间构建起;一个恒等映射的通路,使得信息在前向传播和;后向传播均非常有效。出处:
CV_5图像分类.pdf,第 27 页。
- 5.10 Vision Transformer(ViT):Swin Transformer;步骤 ViT Swin Transformer;分块方式 使用较大 Patch (16x16),数量少 使用较小 Patch (4x4),数量多;位置编码 需要添加可学习/正弦位置编码 不需要位置编码(通过层级结构隐;含位置信息);特征聚合 使用额外的“类别令牌” 使用全局平均池化;注意力范围 全局自注意力(计算量大) 窗口 + 滑动窗口(计算量小);输出特征 单一尺度 多尺度(4 种分辨率);1.图像分块。出处:
CV_5图像分类.pdf,第 28 页。
- 讨论:模型究竟在看什么?:在训练一个区分“鸡”和“公鸡”的二分类图像分类器时,我们发现;了一个奇怪的现象:训练出来的模型在测试集上准确率很高,但;在实际应用(如农场监控)中,它把很多背景里有“太阳”的“鸡”;都错误地识别成了“公鸡”。;讨论任务:;诊断问题: 你认为导致这个模型“失效”的根本原因是什么?;解决方案: 如果你是这个项目的工程师,你会如何修正这个模型?;案例1:鲜花分类;使用数据增强提升鲜花分类。出处:
CV_5图像分类.pdf,第 29 页。
- 案例:鲜花分类。出处:
CV_5图像分类.pdf,第 30 页。
- 案例2:毒蘑菇识别:实验背景;全世界已知有2000多种野生食用菌的种类,云南占全国的80%、全世界;的40%以上,全省境内有126个县城出产野生菌,每年吃菌的时间长达;半年。 据说,每个云南人都有一个因吃菌中过毒的朋友。了解蘑菇种类,;能帮助食客们分别毒蘑菇与可食用蘑菇。 本实验将使用蘑菇数据集,训;练一个能分辨蘑菇种类的模型。;实验内容;本实验将使用kaggle的蘑;菇数据集,采用MindSpore框架。出处:
CV_5图像分类.pdf,第 31 页。
6. CV_6语义分割
- 第6章 语义分割:图像分割任务;像素 边缘 区域;特征 找不同 找相同;边缘 围起来 → 构成区域;区域 的边界 → 就是边缘;1. 语义分割;2. 实例分割;3. 全景分割。出处:
CV_6语义分割.pdf,第 1 页。
- 讨论:题目: 在图像分割中,模型应;该“认识物体”还是“看清边界”?;当前技术更擅长哪一个,哪一;个才是真正的瓶颈?;本章内容;图像分割概述;语义分割;语义分割思路;语义分割发展。出处:
CV_6语义分割.pdf,第 2 页。
- 6.1图像分割概述:单阈值分割图像。出处:
CV_6语义分割.pdf,第 3 页。
- 实例:生成电子签名:多阈值分割图像。出处:
CV_6语义分割.pdf,第 4 页。
- 最优阈值的选取Otsu’s 方法:假设图像像素可分为两类,选择分割阈值,使得类内方差最小。;Otsu’s 方法。出处:
CV_6语义分割.pdf,第 5 页。
- 光照不均匀对分割的影响:变化阈值法;1. 将整幅图像分成一系列互相之间有50%;重叠的子图像;;2. 做出每个子图像的直方图;;3. 检测各个子图像的直方图是否为双峰的。;如是,则采用 最优阈值法确定一个阈值;;否则,不进行处理;;4. 根据对直方图为双峰的子图像得到 的阈;值通过插值得到所有子图像的阈值;。出处:
CV_6语义分割.pdf,第 6 页。
- 分块取阈值:分水岭分割算法;分水岭(watershed,也称分水线/水线);把图象看成3-D地形的表示,即2-D的地基(对应图像 空间)加上第;3维的高度(对应图像灰度);图像的梯度图也可以视为3D地形(图像梯度图3D地形中的峰岭对;应目标的边界)。出处:
CV_6语义分割.pdf,第 7 页。
- 分水岭分割算法:分水岭算法原理(建立不同目标间的分水岭 );区域内部灰度值接近,区域间灰度值差别较大,所以一般使用 梯;度图的分水岭;基本原理和步骤。出处:
CV_6语义分割.pdf,第 8 页。
- 分水岭分割算法实例:过分割 (over-segmentation);分水岭对于图像的变化非常敏感;分得太细、切得太碎。出处:
CV_6语义分割.pdf,第 9 页。
- Meanshift分割:均值漂移(Mean Shift)分割是一种基于密度聚类的非参数图像分割算法。它的核;心思想是:将图像中的每个像素看作一个多维空间(包含空间坐标和颜色信息)中;的点,通过迭代地“漂移”到数据密度最大的区域(即模式),最终将收敛到同一模;式的像素归为一类,实现分割。;对于每一个点,算法会定义一个以该点为中心、半径为固定;值(即带宽)的“窗口”。;然后,计算这个窗口内所有点的“均值”(即窗口的中心)。;接着,将窗口中心移动到新计算出的均值点位置。;重复这个过程,直到窗口的中心不再移动或移动距离小于设。出处:
CV_6语义分割.pdf,第 10 页。
- 传统的图像分割方法存在的问题:基于阈值的分割:难以选择合适的阈值;边缘检测:边缘没有闭合,难以得到完整目标区域;基于主动轮廓模型的图像分割;基本思想:通过在图像中演化一组动态曲线,自适应地控制曲 线;的演化速度,使得其停驻在物体边缘处,从而检测出图像中 感兴;趣的物体。出处:
CV_6语义分割.pdf,第 11 页。
- 水平集描述:符号距离函数 (Signed distance function)。出处:
CV_6语义分割.pdf,第 12 页。
- 特殊的演化方程(了解):水平集分割实例。出处:
CV_6语义分割.pdf,第 13 页。
- 6.2语义分割概述:给每个像素分配类别标签;不区分实例,只考虑像素类别;自动驾驶汽车;在自动驾驶汽车;中,环境感知是;一项至关重要的;技术,它赋予汽;车实时分析和理;解周围道路场景。出处:
CV_6语义分割.pdf,第 14 页。
- 6.3语义分割思路:滑动窗口:问题: 效率太低!重叠区域;的特 征反复被计算;6.3语义分割思路:全卷积;解决方案:让整个网络只包含卷积层, 一次性输出所有像素的类别预测。;问题:处理过程中一直保持原始分辨率,对于显存的需求会 非常庞大…。出处:
CV_6语义分割.pdf,第 15 页。
- 6.3语义分割思路:全卷积:解决方案:让整个网络只包含卷积层, 并在网络中嵌入下采样与上采样过程。;下采样 Pooling, strided convolution 上采样 ???;反池化操作: “Unpooling”。出处:
CV_6语义分割.pdf,第 16 页。
- 反池化操作: “Max Unpooling”:转置卷积;可学习的上采样: 转置卷积(Transpose Convolution);回顾: 3 x 3 卷积, 步长(stride) 1 ,零填充(pad) 1。出处:
CV_6语义分割.pdf,第 17 页。
- 转置卷积:回顾: 3 x 3 卷积, 步长(stride) 2 ,零填充(pad) 1;可学习的上采样: 转置卷积(Transpose Convolution);3 x 3 转置卷积(transpose convolution), stride 2 pad 1。出处:
CV_6语义分割.pdf,第 18 页。
- 可学习的上采样: 一维例子:卷积与矩阵相乘 (一维例子);将卷积写为矩阵乘法;Convolution transpose multiplies by the transpose of;the same matrix:;例子: 1D 卷积, 卷积核尺寸=3, 步长=1, 零填充=1。出处:
CV_6语义分割.pdf,第 19 页。
- 卷积与矩阵相乘 (一维例子):将卷积写为矩阵乘法;Convolution transpose multiplies by the transpose of the same matrix:;例子: 1D 卷积, 卷积核尺寸=3, 步长=2, 零填充=1;语义分割思路:全卷积;解决方案:让整个网络只包含卷积层, 并在网络中嵌入下采样与上采样过程。;下采样 Pooling, strided convolution 上采样 Unpooling or;strided transpose convolution。出处:
CV_6语义分割.pdf,第 20 页。
- Unet 属于 FCN:的一种变体。。出处:
CV_6语义分割.pdf,第 21 页。
- 6.4语义分割发展 SegNet:主要贡献:将最大池化指数转移至解码器中,改善了分割分辨率。;在FCN网络中,通过上卷积层和一些跳跃连接产生了粗糙的分割图,为了提升效果;而引入了更多的跳跃连接。然而,FCN网络仅仅复制了编码器特征,而Segnet网络;复制了最大池化指数。这使得在内存使用上,SegNet比FCN更为高效。;SegNet: A Deep Convolutional Encoder-Decoder Architecture for Image Segmentation(2015/11/2)。出处:
CV_6语义分割.pdf,第 22 页。
- 包含一个能通过对较:低分辨率特征进行上;采样来融合多分辨率;特征的组件,以及一;个能基于步幅为1及;5×5大小的重复池化层;来获取背景信息的组;件。;遵循恒等映射的思想;使用空洞卷积。出处:
CV_6语义分割.pdf,第 23 页。
- DeeplabV3+:采用 Encoder-Decoder架构 。;Encoder使用类似 Xception;的结构作为 backbone,使;用空洞卷积空间金字塔池;化,来实现不同尺度的特;征融合。;Decoder 再 次 使 用 跨 层 级;的concat操作进行高低层;次的特征融合。。出处:
CV_6语义分割.pdf,第 24 页。
- Mask2Former:首次使用同一个模型、同一套参数和损;失函数,在语义、实例和全景三大主流;分割任务上均超越了当时专门为各个任;务设计的顶尖模型。;1. 特征提取(Backbone + Pixel Decoder);2. 初始化查询(Query 初始化);3. Transformer 解码器迭代优化(核心);4. 分类与掩码输出;SAM(Segment Anything Model)。出处:
CV_6语义分割.pdf,第 25 页。
- 投票:题目: 当分割“一切”时,我们是否也应该分割“隐私”?;技术中;立性;隐私边;责任归;防御与;规范;匿名投票:你认为SAM应该开源吗?;6.5常用数据集。出处:
CV_6语义分割.pdf,第 26 页。
- 6.6评价指标:IOU:用于评估语义分割算法性能的标准指标是平均 IOU(Intersection Over;Union,交并比);mIOU:基于类进行计算的IoU就是将每一类的IoU计算之后累加,再进行平均,;得到的就是基于全局的评价,也就是均交并比(mean IoU);pixcal-accuracy (PA,像素精度):基于像素的精度计算是评估指标中最为;基本也最为简单的指标,指预测正确的像素占总像素的比例.;案例;https://fzu.eduplus.net/home/index。出处:
CV_6语义分割.pdf,第 27 页。
7. CV_7目标检测
- 第7章 目标检测:本章内容;目标检测概述;经典目标检测算法;目标检测的发展;常用数据集;评价标准。出处:
CV_7目标检测.pdf,第 1 页。
- 7.1目标检测概述:检测图片中物体的;类别标签;位置坐标(矩形框);问题1:人类看一眼就能在图片里找;到物体目标,似乎毫不费力。但如果;把这个问题交给机器,它该怎么做?;人脸检测;问题2:有些人脸;没有检测到,难点。出处:
CV_7目标检测.pdf,第 2 页。
- 人眼检测vs.机器检测:人眼检测 AI检测;支持非可见且;可复制;一致性与;可重复性;精确量化;高速;不间断运行;低能耗。出处:
CV_7目标检测.pdf,第 3 页。
- 经典的滑动窗口检测法:问题3:;1. 窗口大小如何确定?;2. 窗口图像如何表达?;3. 多类别目标如何处理?;4. 很多重叠相似框如何筛选?;窗口大小如何确定?;图像高斯金字塔;多尺度。出处:
CV_7目标检测.pdf,第 4 页。
- 图像块(窗口)特征提取:颜色特征;边缘、边界特征;兴趣点特征;纹理特征;形状特征;窗口图像如何表达;图像块(窗口)分类;基于距离的分类器;贝叶斯分类器。出处:
CV_7目标检测.pdf,第 5 页。
- 很多重叠相似框如何筛选:非极大值抑制;Non-Maximum Suppression;搜素局部区域,抑制非极大值;选取多个矩形框的交集;选取多个矩形框的并集;选取置信度最高的一个;交并比;交并比(Intersection over Union, IoU);;物体检测需定位物体Bounding Box。出处:
CV_7目标检测.pdf,第 6 页。
- 输入图片:图像金字塔;滑动窗口;区域扫描;特征提取;滑动窗口分类;物体定位;包含物体的矩形框;离线训练过程;训练样本。出处:
CV_7目标检测.pdf,第 7 页。
- 1.选择阈值t和水平方向步长dx,垂直方向步长dy;:2.建立图像金字塔;;3.For 金字塔中的每一层;;对窗口使用分类器,得到分类概率c;将该窗口放入候选列表L中;以步长dx和dy滑动窗口;4.将L中的候选框按分类概率c从大到小排序;;5.For 候选列表中的每一个候选窗口w;;去除L中所有与w重叠超过一定阈值的候选窗口;;6.L中剩余的窗口即为物体检测的结果。。出处:
CV_7目标检测.pdf,第 8 页。
- 支持向量机(SVM):1) SVM适用小样本学习; 2) 计算的复杂性取决于支持向量的数目;;3)少数支持向量决定了最终结果; 4) 可以表示为凸优化问题;部分实验结果。出处:
CV_7目标检测.pdf,第 9 页。
- “滑动窗口”的问题:计算量大;例如:482x348图像,所有可能的窗口数目约为70亿个。;需要分类的窗口数目过多,导致无法使用复杂的特征和分类器。;解决方法:;选择候选区域(缩小搜索空间);使用复杂的特征和分类器;基于区域提名的物体检测方法;选择性搜索;找出所有潜在可能包含目标的区域。出处:
CV_7目标检测.pdf,第 10 页。
- 选择性搜索算法:层次化的分组算法;过分割,超像素;相似度比较,合并区域;多样性的合并策略;相似性度量(基于不同特征);目标可能性(Objectness);Alexe, et al. 2010;多尺度显著性;颜色对比度。出处:
CV_7目标检测.pdf,第 11 页。
- 多尺度显著性:颜色对比度;(a)正常型 (b)折齿型 (c)绝壁型 (d)孤岛型 (e)双峰型。出处:
CV_7目标检测.pdf,第 12 页。
- 边缘密度:框(EdgeBox);Zitnick, et al. 2014。出处:
CV_7目标检测.pdf,第 13 页。
- 7.3目标检测的发展:模型进化;区域卷积神经网络(R-CNN);传统方法→R-CNN;区域提名 + 手工特征 + 分类器;选择性搜索;(Selective Search) CNN特征;支持向量机(SVM);边界框回归;(Bounding box regression)。出处:
CV_7目标检测.pdf,第 14 页。
- 选择性搜索:采样过分割,将图像分割成小区域 (1K~2K个);按照合并规则合并可能性最高的相邻两个区域。;合并策略:;1. 颜色(颜色直方图)相近的;2. 纹理(梯度直方图)相近的;3. 合并后总面积小的;4. 合并后,总面积在其BBOX中所占比例大的;变形(Warp);候选框都需要缩放到固定的大小(CNN)。出处:
CV_7目标检测.pdf,第 15 页。
- R-CNN架构:微调(Fine-tuning);在ImageNet上对CNN模型进行预训练;(1000类);在所有候选区域上对CNN进行微调;(PASCAL VOC:20类);N类→N+1类( 采用参数随机初始化 );N类(正样本): 跟Ground-truth重合IOU>=0.5;1类(负样本): 背景类别 IOU<0.5;候选区 缩放 卷积层 卷积层 全连接层 类别分值图像。出处:
CV_7目标检测.pdf,第 16 页。
- 样本数据量相对较小,运用深度卷积网络容易出现严重的过拟合现象;:用Alexnet,VGG等网络在ImageNet等上预训练模型,然后对网络最后面的几层;进行重新训练。;大数据集上的基础特征的提取,对于小数据同样适用,降低计算量;微调(Fine-tuning);R-CNN:分类部分;在全连接最后一层特征上训练线性SVMs分类器;;每个类别(N类)对应一个SVM分类器;;正样本:所有Ground-truth区域;;负样本:跟重合IOU<0.3的候选区域。出处:
CV_7目标检测.pdf,第 17 页。
- R-CNN:回归部分:在全连接最后层特征上训练Bounding box回归模型;;提升定位性能:每个类别(N类)训练一个回归模型;将候选区的BBox做重新映射P→G;训练输入;Squared Loss:;中心(x,y),宽高(w,h);CNN的Conv5特征;R-CNN:测试;选择性搜索提取2000候选区域;。出处:
CV_7目标检测.pdf,第 18 页。
- R-CNN:性能:mAP:数据集中所有类的平均精度的平均值。;mAP大幅提升;;问题:;训练时间很长(84小时);;测试阶段很慢;;复杂的多阶段训练;Fast R-CNN;[1] Girshick, “Fast R CNN”, ICCV 2015.。出处:
CV_7目标检测.pdf,第 19 页。
- Faster R-CNN:利用卷积网络产生候选区域!;四种首损失联合训练:;RPN分类损失(目标/非目标);RPN边界框坐标回归损失;候选区域分类损失;最终边界框坐标回归损失;[1]Ren et al, “Faster R CNN: Towards Real Time Object Detection;with Region Proposal Networks”, NIPS 2015.;Faster R-CNN是一个两阶段目标检测器。出处:
CV_7目标检测.pdf,第 20 页。
- 实例分割: Mask R-CNN:He et al, “Mask R-CNN”, ICCV, 2017.;MASK R-CNN。出处:
CV_7目标检测.pdf,第 21 页。
- MASK R-CNN:Mask R-CNN训练阶段使用的Mask样例;Mask R-CNN实例分割结果。出处:
CV_7目标检测.pdf,第 22 页。
- 一阶段目标检测 YOLO / SSD /RetinaNet:YOLO v1 (2016);7×7网格划分过粗,小目标检;测能力薄弱;;无锚框设计依赖原始回归,;定位精度偏低;;每个网格仅预测2个边界框,;难以应对密集目标场景。出处:
CV_7目标检测.pdf,第 23 页。
- YOLO v3 (2018):(4+1+80)×3=255;围绕“特征金字塔+残差;网络+类别预测优化”展;彻底解决v1、v2的小目;标漏检问题;YOLO v5 (2020);YOLOv5提供Nano(n)、Small(s)、Medium(m)、;Large(l)、Xtra-Large(x)五种型号;;参数规模从1.9M到89M;。出处:
CV_7目标检测.pdf,第 24 页。
- YOLO v8 (2023):彻底摒弃锚框,采用“中心坐标;+宽高直接回归”。;主干网络升级为改进型;CSPDarknet8,优化残差连接与;通道配比。;YOLO v12 (2025);构建注意力中心框架突破传统 YOLO 依赖 CNN 架构的局限。出处:
CV_7目标检测.pdf,第 25 页。
- 如何设计网络结构?:通用三段式骨架(所有检测器的底层逻辑);Backbone(骨干网络):负责特征提取。提取高、中、低不同;层次的语义特征。;常见部件:ResNet, DarkNet, EfficientNet, CSPNet。;Neck(颈部网络):负责特征融合。;常见部件:FPN(特征金字塔)、PANet(双向融合)、BiFPN;(加权融合)、NAS-FPN(搜索出来的)。;Head(检测头):负责最终预测。输入融合后的特征,输出框、;类别、置信度。。出处:
CV_7目标检测.pdf,第 26 页。
- 7.4常用数据集:PASCAL VOC 07/12:VOC2007 有5k个训练图像,超过12k的标注;目标;VOC2012有11k个训练图像,超过27k个标注目标;ILSVRC:ImageNet Large Scale Visual Recognition Challenge包含;1000个类别、超过100万个图像。;MS-COCO:包含了超过200万个实例,且平均每张图像中有3.5个;类别、7.7个实例,也包括了多种视角的图像。;Open Image:谷歌提供的数据集,包含190万张图像上的600个;类别,每张图像有8.3个对象类别。;labelme 是一款开源的图。出处:
CV_7目标检测.pdf,第 27 页。
- LabelImg是一个图形化:的图像注释工具。它;是用Python编写的,使;用Qt作为其图形界面。;注释被保存为PASCAL;VOC格式的XML文件,;该格式被ImageNet使用。;此外,它还支持YOLO;和Create ML格式。;7.5 评价指标。出处:
CV_7目标检测.pdf,第 28 页。
- 案例:大作业;问题 1. 建立基于先验信息的手目标分割。;问题2. 建立手目标协同分割模型。。出处:
CV_7目标检测.pdf,第 29 页。
- 瑕疵检测任务:一维条码中可能存在的断码、白点、黑点等影响条;码外观的瑕疵,检测这些瑕疵,并用红色矩形框将;其标出。;思路提示:;1. 将原图二值化后,提取连通体,根据联通体;的特征(如长度、宽度等),筛选出条码线条;;2. 再根据条码线条的角度,对图像进行旋转矫;正;;3. 然后对条码线条进行膨胀,提取出条码区域。出处:
CV_7目标检测.pdf,第 30 页。
- 期末笔试考试时间。出处:
CV_7目标检测.pdf,第 31 页。
8. CV_8物体跟踪
- 第8章 物体跟踪:本章内容;物体跟踪概述;经典物体跟踪算法;物体跟踪的发展;常用数据集;评价标准。出处:
CV_8物体跟踪.pdf,第 1 页。
- 8.1物体跟踪概述:目标跟踪是计算机视觉领域的一个重要问题,目前广泛应用在体;育赛事转播、安防监控和无人机、无人车、机器人等领域.;目标跟踪任务;单目标跟踪:给定一个目标,追踪这个目标的位置。;多目标跟踪:追踪多个目标的位置;Person Re-ID:行人重识别,是利用计算机视觉技术判断图像或;者视频序列中是否存在特定行人的技术。广泛被认为是一个图像;检索的子问题。给定一个监控行人图像,检索跨设备下的该行人;图像。旨在弥补固定的摄像头的视觉局限,并可与行人检测/行。出处:
CV_8物体跟踪.pdf,第 2 页。
- 目标跟踪任务:按照任务计算类型又可以分为:;在线跟踪 :在线跟踪需要实时处理任务,通过过去和现在帧来跟;踪未来帧中物体的位置。;离线跟踪 :离线跟踪是离线处理任务,可以通过过去、现在和未;来的帧来推断物体的位置,因此准确率会比在线跟踪高。;目标跟踪的困难点;形态变化:运动目标发生姿态变化时, 会导致它的特征以及外观;模型发生改变, 容易导致跟踪失败。;尺度变化:当目标尺度缩小时, 由于跟踪框不能自适应跟踪, 会将。出处:
CV_8物体跟踪.pdf,第 3 页。
- 8.2经典物体跟踪算法:基于目标模型建模的方法:通过对目标外观模型进行建模, 然后;在之后的帧中找到目标.例如:区域匹配、特征点跟踪、基于主动;轮廓的跟踪算法、光流法等.最常用的是特征匹配法, 首先提取目;标特征, 然后在后续的帧中找到最相似的特征进行目标定位, 常用;的特征有: SIFT特征、Harris角点等。;早期的目标跟踪算法;基于搜索的方法:将预测算法加入跟踪中, 在预测值附近进行目;标搜索, 减少了搜索的范围.常见一类的预测算法有Kalman滤波、;粒子滤波方法.另一种减小搜索范围的方法是内核方法:运用最速。出处:
CV_8物体跟踪.pdf,第 4 页。
- Meanshift目标跟踪算法:Meanshift算法是一种在一组数据的密度分布;中寻找局部极值的稳定的方法。就是找局部;密度最大的位置,或者说找局部“重心”位置。;算法步骤如下:;1)选择搜索窗口。;窗口的初始位置;;窗口的类型(均匀、多项式、指数或者高斯类型);;窗口的形状(对称的或歪斜的,可能旋转的,圆形或矩形);;窗口的大小(超出窗口大小则被截去)。。出处:
CV_8物体跟踪.pdf,第 5 页。
- 光流法:H(x,y) - I(x+u,v+y) = 0;采用5x5 窗口, 每个像素25个方程。出处:
CV_8物体跟踪.pdf,第 6 页。
- Lukas-Kanade Flow:方程数量 > 未知数个数;最小二乘法;光流法;假设运动足够小,但是实际情况运动可能较大。;Gaussian pyramid of image H Gaussian pyramid of image I;image Iimage H。出处:
CV_8物体跟踪.pdf,第 7 页。
- 降低分辨率:粒子滤波;粒子滤波(Particle Filter)是一种基于粒子分布统计;的方法。以跟踪为例,在目标搜索的过程中,它会按;照一定的分布(比如均匀分布或高斯分布)撒一些粒;子,统计这些粒子的相似度,确定目标可能的位置。;在这些位置上,下一帧加入更多新的粒子,确保在更;大概率上跟踪上目标。Kalman Filter 常被用于描述;目标的运动模型,它不对目标的特征建模,而是对目;标的运动模型进行了建模,常用于估计目标在下一帧。出处:
CV_8物体跟踪.pdf,第 8 页。
- 基于判别的跟踪算法:判别模型:将目标模型和背景信息同时考虑在内, 通过对比目标;模型和背景信息的差异, 将目标模型提取出来, 从而得到当前帧中;的目标位置. 使用机器学习/深度学习方法训练分类器。;基于核相关滤波的跟踪算法;将通信领域的相关滤波(衡量两个信号的相似程度)引入到了目标跟踪中。一;些基于相关滤波的跟踪算法(CSK、KCF、BACF、SAMF)等, 也随之产生,;速度可以达到数百帧每秒, 可以广泛地应用于实时跟踪系统中.。出处:
CV_8物体跟踪.pdf,第 9 页。
- 基于核相关滤波的跟踪算法:相关滤波器(CF),也称为判别相关滤波器(DCF),其原理是两个相关;信号f和g的卷积响应大于不相关信号的卷积响应。;Henriques J F, Caseiro R, Martins P , et al.Exploiting the circulant structure of tracking-by-detection with kernels [C]// ECCV, 2012;讨论:生成式模型 vs. 判别式模型;比较生成式跟踪器(如均值漂移、卡尔曼滤波)与判别式跟踪器;(如相关滤波、Siamese网络)在遮挡、形变、光照变化下的优;缺点,并举例说明各自的最佳适用场景。;生成式模型:学习目标自身的表观特征,然后在图像中寻找与该模型最匹配;的区域。。出处:
CV_8物体跟踪.pdf,第 10 页。
- 8.3物体跟踪的发展:用深度学习建立全新的跟踪框架, 进行目标跟踪。在大数据背景;下,利用深度学习训练网络模型,得到的卷积特征输出表达能;力更强,但同时也带来了计算量的增加。;物体跟踪的发展;A Deep Dive into Generic Object Tracking: A Survey;判别方法;Transformer;孪生网络。出处:
CV_8物体跟踪.pdf,第 11 页。
- 物体跟踪的发展:A Deep Dive into Generic Object Tracking: A Survey;SiamFC孪生网络跟踪模型;孪生网络结构通常具有俩个输入分支:;模板分支和搜索区域分支 。;①模板是在初始时刻确定的跟踪对象。;②搜索区域分支是后续时刻对应的图像帧;孪生网络的目标是在后续图像帧中;通过 相似度计算确定与模板最相似的候选区域 。;特点:( 1)基于参数共享的原理,网络整体参数规模得到优化。( 2)。出处:
CV_8物体跟踪.pdf,第 12 页。
- 孪生网络:在计算机视觉领域的应用中,通常利用卷积;神经网络提取图像特征,采用相似性度量函;数进行双分支特征信息的相似性计算;基本的计算方法包括 欧式距离法 和余弦距离;法,在后续的发展过程中也提出 互相关操作;的概念,即将一分支的输出结果作为卷积核;在另一分支输出结果上进行卷积操作从而生;成对应的互相关响应图;SA-Siam = SiamFC(外观分支)+ 语义分支 + 注意力机制。出处:
CV_8物体跟踪.pdf,第 13 页。
- 孪生网络:SiamFC(基础孪生网络)与;Faster R-CNN中的RPN(区域;建议网络)的创造性结合;证明了“检测”与“跟踪”在本质上高;度统一——都是“定位+分类”;Transformer网络;B. Cheng, X. Wang, W . Zhang, C. Zhang, H. Li, J. Sun, P . Luo, Transtrack: Multiple object tracking with transformer, arXiv preprint arXiv:2012.15460 (2020).;如何让跟踪器像人类一样,理解目标与周围环境全域的、长距离的依赖关系,而不仅仅是局部的相似性.。出处:
CV_8物体跟踪.pdf,第 14 页。
- 多目标跟踪:跟踪的本质是关联视频前后帧中的同一物体(目标),并赋予唯一;Tracking By Detecting;目标关联;1、如何处理中途出现的新目标;2、如何处理中途消失的目标;3、正确目标关联。出处:
CV_8物体跟踪.pdf,第 15 页。
- 基于坐标的目标关联:因为目标密集,相邻目标的坐标(left、top、width、height)重合度比较高。;基于特征的目标关联;前后两帧中挨得近的物体且外观长得比较像的物体为同一目标。。出处:
CV_8物体跟踪.pdf,第 16 页。
- 计算两个图像特征的相似度:视觉目标跟踪与重识别统一技术发展;2016年DeepSORT(Simple Online and Realtime Tracking)首次将;深度外观特征引入跟踪关联;;2020年FairMOT实现了检测与ReID的公平联合学习;;2021年ByteTrack用极简策略刷新了MOT基准;;2022年BoT-SORT融合运动与外观达到新高度;;2023年MOTR系列推动端到端Transformer跟踪;;2024年SAM 2将分割与视频跟踪统一;;2025年SAM 3引入概念级跟踪;。出处:
CV_8物体跟踪.pdf,第 17 页。
- 视觉目标跟踪与重识别统一技术发展:SORT与DeepSORT:经典跟踪范式的奠基;2016年,SORT(Simple Online and Realtime Tracking),确立了"检;测-关联"(Tracking-by-Detection)的经典范式。;用卡尔曼滤波预测目标在下一帧的位置,用匈牙利算法将预测框与检测框进;行最优匹配,匹配代价仅使用IoU(交并比)距离。;SORT的弱点:身份切换(ID Switch)频繁——当目标被遮挡或检测丢;失时,重新出现后会被分配新的ID。;2017年,DeepSORT引入深度外观特征。训练轻量级CNN,为每个检;测框提取128维外观描述子,并维护每个轨迹最近100帧的外观特征。出处:
CV_8物体跟踪.pdf,第 18 页。
- SORT与DeepSORT架构对比:JDE与FairMOT:联合检测与跟踪的统一;DeepSORT(先检测再提取外观特征)在速度上存在瓶颈。;2020年,JDE(Joint Detection and Embedding),首次在单个网;络中同时输出检测框和外观嵌入。JDE基于YOLOv3骨干网络,在;检测头旁边并行添加了一个嵌入头,共享特征提取的计算。速度;达到22.2 FPS,比DeepSORT快近一倍。;问题:检测和ReID之间存在竞争。检测需要学习类别无关的特征;来定位目标,而ReID需要学习实例级的判别特征来区分不同个体。;2021年,提出FairMOT(A Simple Baseline for Multi-Object。出处:
CV_8物体跟踪.pdf,第 19 页。
- JDE与FairMOT联合检测跟踪框架对比:ByteTrack与OC-SORT:简洁高效的关联策略;2022年ByteTrack:不要丢弃任何检测框,包括低置信度的。;BYTE关联算法——第一轮用高置信度检测框与现有轨迹匹配;(基于IoU),第二轮用剩余的低置信度检测框与未匹配的轨;迹。反思:在检测器足够强大的情况下,复杂的外观模型是否;真的必要?;2022,OC-SORT(Observation-Centric SORT),引入三个关键;技术:(1)观测中心的重更新(OCR),在目标重新出现时用观;测值修正累积的预测误差;(2)观测中心的动量(OCM),利用。出处:
CV_8物体跟踪.pdf,第 20 页。
- ByteTrack与OC-SORT关联策略:BoT-SORT与StrongSORT:运动与外观的深度融合;2022年,BoT-SORT(Robust Associations Multi-Pedestrian;Tracking),将运动和外观信息进行了更精细的融合。创新包括:;(1)相机运动补偿(CMC),使用稀疏光流估计相机运动并补偿卡;尔曼滤波的预测;(2)改进的卡尔曼滤波状态向量,加入宽高比变;化率;(3)IoU与外观余弦距离的加权融合作为匹配代价。;2023,Deep OC-SORT加入深度外观特征和动态外观模型更新;2024,Hybrid-SORT提出了混合关联策略,根据场景复杂度自适;应地调整运动和外观线索的权重。。出处:
CV_8物体跟踪.pdf,第 21 页。
- BoT-SORT 与 StrongSORT架构比较:外观与运动融合:行人重识别(Person re-identification);行人重识别Person ReID;1)利用计算机视觉技术判断图像或者视频序列中是否存在特定行人;的技术;;2)行人重识别是指在已有的可能来源与非重叠摄像机视域的视频序;列中识别出目标行人。。出处:
CV_8物体跟踪.pdf,第 22 页。
- 存在的问题:存在着无正脸照、配饰、服装搭配、穿衣风格以及由于不同的数据集之间存在着域;的偏移问题,使得在源数据集下训练的模型在目标数据集下很难取得好的性能,泛;化性能不强。;类内差异增大,类间差异减少;思考:如何解决?;1. 能不能用人脸识别做重识别?;2. 有些人靠衣服的颜色就可以判断出来了,还需要行人重识别么?;3. 使用图像检索的指标来衡量行人重识别的结果是否合适?。出处:
CV_8物体跟踪.pdf,第 23 页。
- 行人重识别ReID:从手工特征到深度学习:手工特征:LOMO(Local Maximal Occurrence, 2015)提取多尺度局部;最大出现特征,结合XQDA度量学习;ELF(Ensemble of Localized;Features)使用颜色直方图和纹理特征的组合。这些方法在小规模数;据集上有效,但泛化能力有限。;2017年,深度ReID框架,使用ResNet-50提取全局特征,通过三元组;损失拉近同一身份、推远不同身份的特征距离。PCB(Part-based;Convolutional Baseline, 2018)将特征图水平切分为多个条带,分别提;取局部特征再拼接。MGN(Multiple Granularity Network, 2018)同时;学习全局和多粒度局部特征。。出处:
CV_8物体跟踪.pdf,第 24 页。
- 行人重识别目前所采用的方法:1. 基于表征学习的ReID方法:;分类(Classification/Identification)问题或者验证(Verification)问题:;(1)分类问题是指利用行人的ID或者属性等作为训练标签来训练模型;;(2)验证问题是指输入一对(两张)行人图片,让网络来学习这两张图片是否属于;同一个行人。;基于度量学习的ReID方法;度量学习旨在通过网络学习出两张图片的相似度。在行人重识别;问题上,具体为同一行人的不同图片相似度大于不同行人的不同;图片。最后网络的损失函数使得相同行人图片(正样本对)的距。出处:
CV_8物体跟踪.pdf,第 25 页。
- 对比损失(Contrastive loss):对比损失用于训练孪生网络(Siamese;network),其结构图如上图6所示。孪生;网络的输入为一对(两张)图片,这两;张图片可以为同一行人,也可以为不同;行人。每一对训练图片都有一个标签y,;其中y = 1,表示两张图片属于同一个行;人(正样本对),反之y = 0表示它们属;于不同行人(负样本对)。;三元组损失(Triplet loss)。出处:
CV_8物体跟踪.pdf,第 26 页。
- 基于局部特征的ReID方法:一个行人通常被分为14个关键点,这14个关键点把人体结;果分为若干个区域。为了提取不同尺度上的局部特征,作;者设定了三个不同的PoseBox组合。;切块是一种很常见的提取局部特征方式。;跨摄像头跟踪与车辆重识别;CityFlow(2019)提供了首个大规模城市交通场景的MTMCT基准,;包含40个摄像头、超过200个车辆身份。;同一型号的车辆外观高度相似,不同视角下同一车辆的外观变化;巨大。VeRi-776(2016)和VehicleID(2016)是两个经典基准数。出处:
CV_8物体跟踪.pdf,第 27 页。
- 跨摄像头跟踪与车辆重识别:Transformer跟踪器:从TransTrack到MOTRv3;2021年,TransTrack首次将Transformer应用于MOT,使用两组;query——检测query负责发现新目标,跟踪query负责关联已有;轨迹。;TrackFormer(2022, CVPR),在DETR框架中引入track query,;每个track query编码一个被跟踪目标的时空信息,通过自注意力;与其他query交互,通过交叉注意力从当前帧提取特征。;MOTR(2022, ECCV)由旷视提出,引入了track query的时序聚;合机制。。出处:
CV_8物体跟踪.pdf,第 28 页。
- Transformer端到端跟踪(TransTrack, TrackFormer, MOTR):SAM 2视频跟踪与SAM 3概念跟踪;2024,Meta发布SAM 2(Segment Anything Model 2),将图像;分割基础模型扩展到视频领域,实现了分割与跟踪的统一。;SAM 2在SA-V(Segment Anything Video)数据集上训练,该数据;集包含50.9K视频和642.6K掩码序列,是当时最大的视频分割数;据集。;2025年底,Meta发布SAM 3,引入"概念提示"。与SAM 2需要在;特定帧上点击指定目标不同,SAM 3允许用户用自然语言描述目;标类别(如"黄色校车"、"行走的行人"),模型自动在视频中发。出处:
CV_8物体跟踪.pdf,第 29 页。
- SAM 2与SAM 3视频跟踪架构演进:开放世界跟踪与TAO;2020年,T AO(Tracking Any Object)数据集,包含2907个视频、833个类别、;17287条轨迹,首次将MOT扩展到大规模开放类别场景。TAO的评估协议要求;跟踪器能够处理长尾分布的类别,包括训练时从未见过的目标。;OVTrack(2023)利用CLIP的开放词汇能力,将文本描述作为类别提示来指导;跟踪。;MASA(Matching Anything by Segmenting Anything, 2024)基于SAM的分割能;力,先分割出所有可能的目标,再通过学习到的匹配模型进行帧间关联。;Grounding DINO + SAM 2的组合方案在2024年成为开放世界跟踪的强基线 :。出处:
CV_8物体跟踪.pdf,第 30 页。
- 开放世界跟踪技术演进与主要方法:8.4常用数据集。出处:
CV_8物体跟踪.pdf,第 31 页。
- 目标跟踪任务中常用数据集对比:8.5评价标准;MOTA (Multiple Object Tracking Accuracy):;MOT A衡量的是跟踪算法在多目标跟踪任务中的准确性。计算MOTA;时,主要考虑的因素是误报(false positives, FP)、漏报(false negatives,;FN)和身份切换次数(ID switches, IDsw)。;MOTA = 1 - (FN + FP + IDS) / GT;FN(False Negatives):表示实际存在但未检测到的目标数。;FP(False Positives):表示实际不存在但错误检测为目标的目标数。;IDS(Identity Switches):表示跟踪过程中目标身份的错误切换次。出处:
CV_8物体跟踪.pdf,第 32 页。
- 8.5评价标准:IDF1 (ID F1 Score):;IDF1用于衡量跟踪算法在识别目标身份方面的性能。计算IDF1时,;主要考虑的是真正例(true positives, TP)、假正例(false positives, FP);和假反例(false negatives, FN)。;IDF1 = 2 * IDTP / (2 * IDTP + IDFP + IDFN);IDTP(Identified True Positives):表示正确识别的目标检测数。;IDFP(Identified False Positives):表示错误识别的目标检测数。;IDFN(Identified False Negatives):表示未正确识别的目标检测数。;IDF1的取值范围为[0, 1],值越接近1表示目标身份识别性能越好。。出处:
CV_8物体跟踪.pdf,第 33 页。
9. CV_9多图拼接
- 第9章 多图拼接:本章内容;图像拼接概念;仿射变换;透视变换;图像拼接相关方法;图像拼接难点;图像拼接发展现状。出处:
CV_9多图拼接.pdf,第 1 页。
- 9.1图像拼接概念:图像拼接是将多张具有重叠区域(可能是不同时间,不同视角,不同传感器采集)的;图片拼接成一张无缝的视野更广的全景图。 常常被运用到虚拟现实 VR ,地质勘测,军事;侦查,医学微创手术,航空航天以及视频会议等领域发挥着重要的作用。;在实际的科研以及工程中,经常会遇到超过人眼视角的场景,在近距离无法捕捉到;这些广视野的场景,虽然通过增加相机和物体的距离可以捕捉到该场景,但是捕捉到的;物体经过放大之后会出现马赛克。因此,进行图像拼接领域的研究是非常必要的。;人类视觉系统的视野大约为 135 ×200 (垂直 *水平)度,而典型的照相机只有 35x50 度的视野。;在医学图像处理方面,图像拼接常常被用来 辅助诊断 ,通过显微镜 、;超声波 、CT 等技术获得的图像一般视野都很小,在诊断时,医师需要。出处:
CV_9多图拼接.pdf,第 2 页。
- 线性的变换(保持平行),仿射变换的基本内容:平移;放缩;旋转 错切;9.2仿射变换;平移 Translate;横坐标加上对应的横坐标差;纵坐标加上对应的纵坐标差;仿射变换。出处:
CV_9多图拼接.pdf,第 3 页。
- 放缩 Scale:横坐标乘上对应的横坐标倍数;纵坐标乘上对应的纵坐标倍数;仿射变换;错切 Shear;x轴发生改变(取与y轴夹角为 );y轴发生改变 (取与y轴夹角为 )。出处:
CV_9多图拼接.pdf,第 4 页。
- 旋转 Rotate:逆时针旋转; −;; siny-cos 001 xx =; osx cysiny 001 +=;仿射变换。出处:
CV_9多图拼接.pdf,第 5 页。
- Affine 矩阵:Perspective;透视变换;9.3透视变换。出处:
CV_9多图拼接.pdf,第 6 页。
- Perspective:透视变换;透视 变换;无法看出旋转了多少,放缩了多少(非线性);暴力求解;线性变换 平移矩阵。出处:
CV_9多图拼接.pdf,第 7 页。
- 透视变换:至少四对点(即8个已知参数);可得到8个齐次方程;求解8个未知参数;传统计算方法:RANSAC。出处:
CV_9多图拼接.pdf,第 8 页。
- 1.特征点检测:2.特征点匹配;3.根据特征点进行H估计以及内点的筛选(随机4对种;子匹配点);图像拼接中的透视变换;REW +PERCEPTION SEAM 梯度融合方式替换成线性融合;1.lanmark based TPS;2.加强局部显著性避免接缝经过或者尽可能进行相似变换。出处:
CV_9多图拼接.pdf,第 9 页。
- 传统的图像拼接算法流程如下::特征点 检测;特征点 匹配 及筛选;计算特征点的 变换 关系(计算 H);将目标图像 对齐 到参考图像上;融合 变换后的全景图;9.4图像拼接相关方法;2003 ,Autostich :采用一个 (全局)单应性对齐, muti -band 融合方法;在很长时间内满足大部分场景,;但是新的问题出现了:视差。出处:
CV_9多图拼接.pdf,第 10 页。
- 图像拼接:2013 ,APAP As -Projective -As -Possible Image Stitching with Moving DLT :将参考图;像和目标图像网格化并进行网格的 局部单应性 对齐;过程:;提取特征点 +消除外点;计算全局单应性;划分网格单元;根据权值计算每个网格的单应性。出处:
CV_9多图拼接.pdf,第 11 页。
- 2014 ,Shape -Preserving Half -Projective Warps for Image Stitching:过程:;检测特征点 消除外点计算最佳单应性;利用相似变换约束最佳单应性;利用内容保持进行优化: 局部对齐项 +全局对齐项 +平滑项;局部对齐项 :划分网格,衡量网格对齐:;全局对齐项 :衡量预对齐结果与内容保持后的结果的对齐:;平滑项 :相似变换约束:;图像拼接;2014 ,Parallax -tolerant Image Stitching。出处:
CV_9多图拼接.pdf,第 12 页。
- 2015 ,AANAP Adaptive As -Natural -As -Possible Image Stitching :APAP 基础上的优化:过程:;特征点提取, RANSAC 筛选外点,匹配;计算网格单应性;从重叠区域到非重叠区域:;重叠区域 单应性线性化 (以此来减少非投影区域投影失真);计算全局相似性 (分组匹配特征点 ,独立计算多组相似变换,选取旋转角度最小的作为相似变换);目标图像的变换约束 : 使用局部单应性 和全局相似变换 约束:;参考图像的变换约束(由于目标图像引入了全局相似变换,会造成两张 图像 的不对齐):;图像拼接。出处:
CV_9多图拼接.pdf,第 13 页。
- 国内外研究现状:方法 全局单应性 局部单应性(数目) 网格化 全局相似性 局部相似性 s eam - cut Blend 方式;Autostich √ Multi -band;DHW √(2) √ √;APAP √(10000 ) √ Linear;Parallax √ √ √ Multi -band;SPHP √ √ Linear;AANAP √(10000 ) √ √ Linear;商用的拼接软件的诞生,如 Autostitch ,微软公司的 Image Composite Editor;1. 特征点匹配不准确:传统的算法大都采用SIFT特征点及匹配,但是筛选的算法还不能完美的解决。出处:
CV_9多图拼接.pdf,第 14 页。
- 根据上述提到的难点,可以针对性的提出相应的解决方案::1. 特征点匹配不准确:特征点的检测及匹配是图像拼接的第一步,如果该步骤出现大的误差,便;会影响到后续的拼接操作。;方案:在医疗图像处理中,医院经常采用标记点进行一些配准操作,考虑使用类似该操作进行关键;点的采集,或者对原始检测及筛选后的关键点集进行交互筛选。;拼接难点;2. 重叠区域对齐性能不佳:对齐效果取决于特征点的匹配,然而即使特征点匹配十分完美,也会由;于视差的原因,导致简单使用单应性变换无法完美的对齐。;方案:薄板样条插值(Thin Plate Spline,TPS)是插值方法的一种,是常用的2D插值方法。假如给定;两张图片中一些相互对应的控制点,如何将其中一个图片进行特定的形变,使得其控制点可以与另一。出处:
CV_9多图拼接.pdf,第 15 页。
- 2. 非重叠区域透视失真严重:为了让重叠区域完美对齐,非重叠区域常常会做出牺牲,导致不自然的:透视失真。传统方案采用在对齐的基础上进行全局相似性的约束,但是全局相似最佳不能代表局部;相似最佳,并且通过约束全局相似,往往会牺牲重叠区域的对齐性能。;方案:以多个局部相似进行约束,可以有效减少非重叠区域的透视失真。;拼接难点;3. 融合问题:上述提到由于光线或者物体运动以及视差导致的伪影问题。传统graph-cut只是简单;计算全局的能量项,但是还是会造成接缝线经过物体,导致结果不好的问题。(如下图交通信;号灯出现两盏);方案:使用graph-cut算法进行后处理,对接缝能量项进行优化,采用类似文献Perception-based;seam cutting for image stitching 采用的基于视觉感知的接缝算法避免接缝经过高显著性目标物。。出处:
CV_9多图拼接.pdf,第 16 页。
- 9.6基于标记点的薄板样条配准:受医学图像配准任务的启发,结合人机交互进行标记特征点,使用薄板样条算法进行配准任务。;其优点一方面可以提供更加准确的特征信息,即使在特征点不足情况下依然可以完成配准任务。;另一方面,采用非刚性变换,提供更加高效和 灵活的对齐性能,使得拼接结果对齐性能更加强大。;定义薄板的总能量函数为:;其中, 为薄板的总能量, 为对齐成本, 为平滑成本,;是平滑成本的权重系数,;用于衡量经过薄板变换前后所有标记点的距离的总;误差:;平滑成本 用于测量薄板的扭曲程度,当薄板的扭曲程度最小时,变换后的目标图像越接近于一个平。出处:
CV_9多图拼接.pdf,第 17 页。
- 交互切缝算法(伪影处理)针对重叠区域:问题:在视差较大的环境下,由于目标图像和参考图像很可能是从不同光照条件,不同时间,不同;角度捕捉的,在这种条件下极可能造成拼接结果中的重叠区域无法完美的重合,甚至会产生糟糕的模;糊。;对于切缝的寻找问题通常表示为切缝能量的标签问题,通过最小化该能量函数得到最佳切缝,一条;由像素集合组成的切缝的能量由组成该切缝的像素标签的数据成本以及像素之间的平滑成本组成 :;数据成本:;平滑成本:;= ( , ) ( , , , )d p S p q;E E p l E p q l l 。出处:
CV_9多图拼接.pdf,第 18 页。
- 实验与结果。出处:
CV_9多图拼接.pdf,第 19 页。
- 表3-1 不同方法生成结果的平均梯度(单位:%):算法 Autostitch APAP SPHP AANAP OURS;平均梯度 3.238 3.955 3.437 4.315 5.190;鲁棒性测试:第一行为精确标记点生成的结果,第二行为部分不精确标记点生成的结果;20%高斯噪声拼接结果;实验与结果;9.7基于语义分割的特征点分类;将级联分割模块集成到DilatedNet网络中,其使用的编码器为“resnet101dilated”,译码器为;“ppm_deepsup”,训练的数据集为“ADE20K”数据集。;将由SIFT检测出来的特征点根据语义分割的。出处:
CV_9多图拼接.pdf,第 20 页。
- 图像拼接模型(对类别的单应性变换):主要思想:使用这些不同类别的特征点组,得到每个组对应的单应性变换,并选取对齐性能最佳的作;为全局单应性变换。;对于一对匹配的特征点对应的单应性变换需要满足:;因此,一组点对应的单应性变换可表示为:;则,不同类别的特征点对应的单应性变换可表示为:;计算不同类别对应的单应性变换的误差:;选择误差最小的对齐整张图像。;arg min arg min;h h h 。出处:
CV_9多图拼接.pdf,第 21 页。
- 语义分割感知的切缝融合(针对融合):主要思想:为了进一步提高融合效果,将切缝的掩码上任意像素的坐标设为 。 在所有0像素值点;中,设离 拟欧式距离最短的0像素值点的坐标为 。根据拟欧几里得距离对切缝二值掩码;进行羽化处理:;为切缝掩码上像素 的新值。因此,可以得到新的羽化切缝掩码。;使用泊松融合算法对羽化后的切缝进行融合:;(尽可能平滑,切缝上的像素值要一致);i j i j i j i j;x x y y if x x y y;x x y y otherwise。出处:
CV_9多图拼接.pdf,第 22 页。
- 实验与结果:表4-1 不同方法生成结果的平均梯度(单位:%);算法 Autostitch APAP SPHP AANAP REW OURS;平均梯度 2.692 1.751 1.602 1.672 2.452 2.882;20%高斯噪声拼接结果。出处:
CV_9多图拼接.pdf,第 23 页。
- Pixel-wise Deep Image Stitching:2021,彻底抛弃了传统方法依赖的“单应性矩阵”,转而利用深度学习模;型为图像中的每一个像素都计算出一个独立的移动路径(即像素级扭曲;场)。;阶段一:;像素级精准定位 (PWM模块);解决“怎么移动像素才对”的问题;阶段二:;智能图像融合 (SIGMo模块);解决“如何融合才能天衣无缝”的问题。。出处:
CV_9多图拼接.pdf,第 24 页。
10. CV_10三维重建
- 第10章 三维重建:本章内容;三维重建概述;摄像机几何;摄像机标定;双视图与三角化;双目立体视觉;多视图几何。出处:
CV_10三维重建.pdf,第 1 页。
- 三维重建概述:三维重建是指对三维物体建立适合计算机表示和处理的数学模型,;是在计算机环境下对其进行处理、操作和分析其性质的基础,也是;在计算机中建立表达客观世界的虚拟现实的关键技术。;物体三维重建是计算机辅助几何设计(CAGD)、计算机图形学(CG)、;计算机动画、计算机视觉、医学图像处理、科学计算和虚拟现实、;数字媒体创作等领域的共性科学问题和核心技术。。出处:
CV_10三维重建.pdf,第 2 页。
- 摄像机几何:小孔成像原理;当将胶片直接放置在物体前方时,3D物体上的;同一点会在胶片的多个位置产生成像;;光通过一个小孔后,会在后面的屏幕上形成一个倒立的实像。;在物体和胶片之间放置一个带有针孔的隔板时,假设针孔大小只;允许穿过一条光线,那么3D物体上的同一点只能有一条光线穿过;小孔并在胶片上成像;;此处的小孔相当于就是光圈,;光圈的尺寸越大,会有更多的。出处:
CV_10三维重建.pdf,第 3 页。
- 针孔相机数学模型:描述如何将三维世界中的点(3D)投影到二维图像平面(2D)的理想化几何模型。;P为空间3D点,P ′ 为成像后的像平面的2D点;将上面的三维示意图投影到二维平面(k − j平面,垂直于i轴)后,会产生一对相似三角形:;同理,若将将上面的三维示意图投影到二维平面(k − i 平面,垂直于j轴)后,会产生另一对相似三角形:。出处:
CV_10三维重建.pdf,第 4 页。
- 摄像机坐标系 - 像素坐标系:3D摄像机坐标系 - 2D CCD坐标系;2D CCD坐标系 - 2D像素坐标系;CCD坐标系和像素坐标系存在两个不同之处:;坐标系原点不一致:CCD坐标系的远点在图像中心,像素坐标系的原点在左上角,cx和cy 就是原点的平移量;;度量单位不一致:CCD坐标系的单位为m,像素坐标系的单位为pixel,k , l 分别为 x , y 方向的度量单位变换量,单;位为 pixel/m.;齐次坐标变换:。出处:
CV_10三维重建.pdf,第 5 页。
- 摄像机坐标系 - 像素坐标系:摄像机偏斜;内参数矩阵K;其中,K是摄像机内参数矩阵,内;参数矩阵决定了摄像机坐标系下3D;空间点到2D图像点的映射;K有个5;自由度DOF;;像素坐标系-世界坐标系;投影矩阵。出处:
CV_10三维重建.pdf,第 6 页。
- 像素坐标系-世界坐标系:投影矩阵有11个自由度,其中包含5个摄像机内参数+6个摄像机外参数。;投影矩阵性质定理;Faugeras定理:;在给定足够多的视图和;相应的摄像机参数的情;况下,我们可以唯一地;重建出场景的三维结构。。出处:
CV_10三维重建.pdf,第 7 页。
- 最小二乘解。出处:
CV_10三维重建.pdf,第 8 页。
- 线性方程组:最小二乘解。出处:
CV_10三维重建.pdf,第 9 页。
- 非线性方程组的最小二乘解:摄像机标定;摄像机标定:求解摄像机内、外参数矩阵 K [R T];;因为摄像机内外参数矩阵描述了三维世界到二维像素的映射关系;。出处:
CV_10三维重建.pdf,第 10 页。
- 摄像机标定:投影矩阵M求解;摄像机内外参数共同构成了投影矩阵,投影矩阵共有11个未知量;;每对点可以列出两个方程,因此,最少需要6对对应点;;实际操作中通常使用多于6对点来获得更加鲁棒的结果;;方程个数 2 n 个,且 n > 6;未知参数11个;这是一个超定齐次线性方程组;。出处:
CV_10三维重建.pdf,第 11 页。
- 投影矩阵M求解:提取摄像机内参数。出处:
CV_10三维重建.pdf,第 12 页。
- 提取摄像机内参数:摄像机标定结果。出处:
CV_10三维重建.pdf,第 13 页。
- 双视图与三角化:只要已知直线l 和l' ,则三维点P就是两条;直线的交点。因此,只要将直线l 和 l'映射;到同一坐标系下,就可以通过P = l × l ′ 求;出点P 的三维坐标。;此时,问题演变成了:已知二维像素;坐标 p 和 p' ,K 和 K' ,以及两视图之;间的变换矩阵R、T,求解P点的三维坐;标?;线性解。出处:
CV_10三维重建.pdf,第 14 页。
- 非线性解:实际情况中的问题定义;在实际情况中,由于噪声的存在,两条直线通常不相交;;且上述的线性解和非线性解都需要已知K 和 K' ,R、T;;然而,实际情况中,摄像机的内参K和 K' 和两视图之间的变换矩;阵R、T通常不可知,那么实际情况就变成了如下的问题:;问题1:已知p和p',摄像机内参数K和K’,;求解:摄像机的R、T以及P点的三维坐标?;问题2:已知p和p’;求解:摄像机内参数K和K',摄像机的R、T以及P点的三维坐标?。出处:
CV_10三维重建.pdf,第 15 页。
- 极几何:极几何描述了同一场景或者物体的两个视点图像间的几何关系;极几何可以将对应点搜索范围;缩小到对应的极线上;。出处:
CV_10三维重建.pdf,第 16 页。
- 极几何特例——平行视图:极几何特例——前向平移(无旋转)。出处:
CV_10三维重建.pdf,第 17 页。
- 本质矩阵:本质矩阵对规范化摄像机拍摄的两个视点图像间的极几何关系进;行代数描述;;基础矩阵;基础矩阵F为:。出处:
CV_10三维重建.pdf,第 18 页。
- 基础矩阵估计:八点法;F有7个自由度,;理论上7点可以解出F,;但计算比较复杂;;单点方程矩阵形式展开:;选取八个点,列出齐次线性方程:。出处:
CV_10三维重建.pdf,第 19 页。
- 最小二乘求解::通常N > 8,为超定方程组,采用最小二乘求解:;满秩矩阵分解:;上述经过最小二乘估计得到的通常秩为3,为满秩矩阵,但基础;矩阵F FF的秩为2。。出处:
CV_10三维重建.pdf,第 20 页。
- 八点法求解总结:基于平行视图的双目立体视觉。出处:
CV_10三维重建.pdf,第 21 页。
- 平行视图三角测量:由此可得:视差与深度Z成反比!;也就是说,物体离人眼越远,左右眼观察到的图像越相似;;“视差与深度Z成反比”这个结论;可以方便我们从视差图中推导;得到深度图。(视差图颜色越;暗,距离双目摄像机越远)。出处:
CV_10三维重建.pdf,第 22 页。
- 图像校正:在平行视图中,可以很方便利用视差获取深度图,但是,实际构;建的双目立体视觉系统中,如何保证两个视图是完全平行的呢,;这就需要进行图像校正。;多视图几何。出处:
CV_10三维重建.pdf,第 23 页。
- 多视图几何:欧式结构恢复问题定义。出处:
CV_10三维重建.pdf,第 24 页。
- 两视图欧式结构恢复:PnP问题。出处:
CV_10三维重建.pdf,第 25 页。
- 多视图几何。出处:
CV_10三维重建.pdf,第 26 页。
- 人脸重建:三维重建算法发展;NeRF:隐式神经辐射场(2020-2024);把场景建模为连续 5D 函数:;通过体渲染积分得到像素颜色:。出处:
CV_10三维重建.pdf,第 27 页。
- 3DGS:三维高斯溅射(2023-2025):将场景表示为 3D 高斯集合:;投影到图像平面后按深度排序,做 α-混合。出处:
CV_10三维重建.pdf,第 28 页。