机器学习知识点复习大纲
说明:本大纲严格按照 PDF 文件顺序和页内知识脉络整理;每条复习点均标注到对应 PDF 与页码。页码按 PDF 阅读器显示的第几页计。
文件覆盖范围
机器学习zdh-1.pdf:共 125 页,提取到知识点页 112 页。
机器学习zdh-2.pdf:共 53 页,提取到知识点页 52 页。
机器学习zdh-3.1.pdf:共 72 页,提取到知识点页 71 页。
机器学习zdh-3.2.pdf:共 32 页,提取到知识点页 32 页。
机器学习zdh-4.pdf:共 52 页,提取到知识点页 50 页。
机器学习zdh-5.pdf:共 56 页,提取到知识点页 56 页。
机器学习zdh-6_3.pdf:共 62 页,提取到知识点页 62 页。
1. 机器学习zdh-1
- 于元隆、朱丹红。出处:
机器学习zdh-1.pdf,第 1 页。
- 参考书目:Pattern Recognition and Machine Learning,Christopher M. Bishop,;Introduction to Machine Learning (3rd version) Ethern Alpaydin, MIT Press;Pattern Recognition (4th version), Sergios Theodoridis and Konstantinos;Koutroumbas.。出处:
机器学习zdh-1.pdf,第 2 页。
- 参考资料:重要的国际期刊:;IEEE Transactions on Pattern Analysis and Machine Intelligence (PAMI);Journal of Machine Learning Research;Machine Learning;IEEE Computational Intelligence Magazine;Pattern Recognition;IEEE Transactions on Neural Networks and Learning Systems;IEEE Transactions on Cybernetics;IEEE Transactions on System and Man and Cybernetics: Systems。出处:
机器学习zdh-1.pdf,第 3 页。
- 线上学习管理:中国大学MOOC,《模式识别与机器学习》,于元隆教授;SPOC模式——我的学校云;课程实践——华为云+Harmony OS系统。出处:
机器学习zdh-1.pdf,第 4 页。
- 基础理论+科研创新::期末笔试;文献阅读+科研实训;雨课堂、上机实践。出处:
机器学习zdh-1.pdf,第 5 页。
- HarmonyOS体系架构与:AI开发接口 机器学习算法 昇腾全栈AI技术;MindSpore框架;训练模型;HAIWEI DevEco Studio工具;OpenHarmony软件;移植部署工具;小目标检测;异常检测;目标跟踪。出处:
机器学习zdh-1.pdf,第 6 页。
- 棋谱,九段数据:五段水平;九段水平;2016年战胜李世石。出处:
机器学习zdh-1.pdf,第 7 页。
- 两个九段互下,基于谷歌公司的TPU的计算能力,战胜柯洁。出处:
机器学习zdh-1.pdf,第 8 页。
- 3天战胜1.0版(1.0打败李世石),21天战胜2.0(2.0打败柯洁)。:但Zero调用了谷歌公司所有的算力。。出处:
机器学习zdh-1.pdf,第 9 页。
- 人工智能发展中的主流方法(1):符号主义人工智能(Symbolic AI)为核心的逻辑推理。出处:
机器学习zdh-1.pdf,第 10 页。
- 人工智能发展中的主流方法(2):数据驱动(Data-Driven)为核心的机器学习。出处:
机器学习zdh-1.pdf,第 11 页。
- https://www.tesla.cn/videos/autopilot-self-driving-hardware-neighborhood-long:特斯拉无人驾驶视频。出处:
机器学习zdh-1.pdf,第 12 页。
- 人工智能发展中的主流方法(3):探索与利用(Exploration and exploitation)为核心的强化学习。出处:
机器学习zdh-1.pdf,第 13 页。
- 人工智能三种主流方法区别:学习模式 优势 不足;用规则教 与人类逻辑推理相似,;解释性强 难以构建完备的知识规则库;用数据学 直接从数据中学 以深度学习为例:依赖于数据、;解释性不强;用问题引导 从经验中进行能力的;持续学习 非穷举式搜索而需更好策略;从数据到知识与能力,能力增强是最终目标;三种学习方法的综合利用值得关注!。出处:
机器学习zdh-1.pdf,第 14 页。
- 第一讲 模式识别基本概念。出处:
机器学习zdh-1.pdf,第 17 页。
- 1.1.1 模式识别的概念:1.1.2 模式识别的发展简史;1.1.3 模式识别的应用。出处:
机器学习zdh-1.pdf,第 18 页。
- 模式识别 – 直观,无所不在:人的识别:张三、李四;周围物体的认知:符号、标志、桌子、椅子;声音的辨别:人语、狗叫、汽车、火车;气味的分辨:煎、炸、闷、炒、卤、炖;人和动物的模式识别能力是极其平常的,但对计算机来说却是;非常困难的。。出处:
机器学习zdh-1.pdf,第 19 页。
- 1929年 G. Tauschek发明阅读机 ,能够阅读0-9的数字。:30年代 Fisher提出统计分类理论,奠定了统计模式识别的基础。;50年代 Noam Chemsky 提出形式语言理论——傅京荪 提出句法结构模;式识别。;60年代 L.A.Zadeh提出了模糊集理论,模糊模式识别方法得以发展和应用。;80年代以Hopfield网、BP网为代表的神经网络模型导致人工神经元网络复;活,并在模式识别得到较广泛的应用。;90年代小样本学习理论,支持向量机也受到了很大的重视。。出处:
机器学习zdh-1.pdf,第 20 页。
- 手写体字符识别:OCR:任务类型:多类分类;输入:单个或者多个字符的图像;输出:该字符的类别(字符语义)。出处:
机器学习zdh-1.pdf,第 21 页。
- 交通标志识别:辅助/无人驾驶:输入:交通标志的图像;输出:该标志的类别(标志语义);任务类型:多类分类;限速20公里/小时。出处:
机器学习zdh-1.pdf,第 22 页。
- 动作识别:任务类型:多类分类(时序数据);输入:一段视频(连续多帧图像);输出:动作所属的类型(动作语义)。出处:
机器学习zdh-1.pdf,第 23 页。
- 语音识别:任务类型:多类分类(音频时序数据);输入:一段语音;输出:语音中的词语语义。出处:
机器学习zdh-1.pdf,第 24 页。
- 心跳异位搏动识别:任务类型:二类分类(心电图时序信号);输入:心电图(ECG)信号;输出:心跳正常/有异位搏动(心跳状态语义);异位;搏动。出处:
机器学习zdh-1.pdf,第 27 页。
- 应用程序识别(基于TCP/IP流量):任务类型:多类分类;输入:流量数据;输出:应用程序/协议类别。出处:
机器学习zdh-1.pdf,第 28 页。
- 银行信贷识别:任务类型:二类分类(数值数据);输入:用户信息(个人的收入、存款、;年龄、职业、过去的还贷款记录等);输出:贷款(低风险)/不贷 (高风险);收入=5000;存款=1000 高风险。出处:
机器学习zdh-1.pdf,第 29 页。
- 股票价格预测:任务类型:回归(预测);输入:股票历史数据(开盘价、收盘;价、最高价、交易量等);输出:(明日)股价;4.98模式识别。出处:
机器学习zdh-1.pdf,第 30 页。
- 机械手目标抓取点位姿:功能:回归(决定怎么抓);输入:一幅图像(待抓取目标);输出:每个机械手指抓取点的位置;坐标。出处:
机器学习zdh-1.pdf,第 31 页。
- 无人驾驶:功能:回归(决定车辆当前的控制量);输入:图像、激光雷达等;输出:车体速度和方向控制量。出处:
机器学习zdh-1.pdf,第 32 页。
- 1.2 模式识别。出处:
机器学习zdh-1.pdf,第 33 页。
- 分类(Classification):根据任务,模式识别可以划分为“分类”和“回归”两种形式。;输出量是离散的类别表达,即输出待识别模式所属的类别。;二类/多类分类;回归(Regression);输出量是连续的信号表达(回归值);输出量维度:单个/多个维度;回归是分类的基础:离散的类别值是由回归值做判别决策得到的。。出处:
机器学习zdh-1.pdf,第 34 页。
- 模式识别:根据已有知识的表达,针对待识别模式,判别决策其所属:的类别或者预测其对应的回归值。;由此可见,模式识别本质上是一种推理(inference)过程。;式已有知识;的表达。出处:
机器学习zdh-1.pdf,第 35 页。
- 数学解释:模式识别可以看做一种 函数映射𝑓(𝒙),将待识别模式𝒙:从输入空间映射到输出空间。函数𝑓(𝒙)是关于已有知识的表达。;函数𝑓(𝒙)的形式:可解析表达的、难以解析表达的。;函数𝑓(𝒙)的输出:确定值、概率值。;式已有知识的表达。出处:
机器学习zdh-1.pdf,第 36 页。
- 输入空间:原始输入数据𝒙所在的空间。:空间维度:输入数据的维度。;输出空间:输出的类别/回归值𝒚所在的空间。;空间维度:1维、类别的个数(>2)、回归值的维度。;输入与输出空间;已有知识的表达。出处:
机器学习zdh-1.pdf,第 37 页。
- 模型::特征提取回归器;模型;特征提取回归器判别函数;分类器;用于回归;用于分类。出处:
机器学习zdh-1.pdf,第 38 页。
- 使用sign函数:判断回归值大于0还是小于0。:判别器:二类分类;使用max函数:取最大的回归值所在维度对应的类别。;判别器:多类分类;判别函数使用一些特定的非线性函数来实现,记作函数 。;可见,由于判别函数通常固定已知,所以不把它当做模型的一部分。。出处:
机器学习zdh-1.pdf,第 39 页。
- 判别公式:决策边界;决策;边界;以二类分类为例:。出处:
机器学习zdh-1.pdf,第 40 页。
- 1.3 特征与特征空间。出处:
机器学习zdh-1.pdf,第 41 页。
- 特征(Feature):可以用于区分不同类别模式的、可测量的量。;例子:针对橙子和苹果两个类,形状or颜色?;输入数据也可以看做是一种原始特征表达。。出处:
机器学习zdh-1.pdf,第 42 页。
- 特征的特性:具有辨别能力:提升不同类别之间的识别性能。;基于统计学规律、而非个例。;例子:三文鱼和海鲈鱼。;三文鱼 海鲈鱼。出处:
机器学习zdh-1.pdf,第 43 页。
- 特征的特性:鲁棒性:针对不同的观测条件,仍能够有效表达类别之间的差异性。;以交通标志识别为例:噪声、光照变化、视角变化(尺度、形状、;旋转等)、遮挡……。出处:
机器学习zdh-1.pdf,第 44 页。
- 如何得到特征?特征提取技术:手动设计;自动学习;以图像信号为例:;边缘特征;点特征;纹理特征;形状特征。出处:
机器学习zdh-1.pdf,第 45 页。
- 特征向量(feature vector): 多个特征构成的(列)向量:特征向量的长度(模):;特征向量的方向(单位向量):;特征向量还可以表达为:模长(标量)× 方向(单位向量);特征向量的定义&性质。出处:
机器学习zdh-1.pdf,第 46 页。
- :; ;;用实数表示特征时,模式通常表示成特征向量:; 1 2 1024, , ,x f f f; ;1,1024 ,1024; ;。出处:
机器学习zdh-1.pdf,第 47 页。
- 每个坐标轴代表一维特征:空间中的每个点代表一个模式(样本);从坐标原点到任意一点(模式)之间的向量即为该模式的特征向量。;特征空间。出处:
机器学习zdh-1.pdf,第 48 页。
- 1.4 特征的相似度度量。出处:
机器学习zdh-1.pdf,第 49 页。
- 由于每个特征向量代表一个模式,所以度量特征向量两两之间:的相关性是识别模式之间是否相似的基础。;点积结果是一个标量表达。;点积具备对称性。;点积是一个线性变换。;点积(dot product)的代数定义。出处:
机器学习zdh-1.pdf,第 50 页。
- 证明:。出处:
机器学习zdh-1.pdf,第 51 页。
- 点积的几何定义:可见,点积可以表征两个特征向量的共线性,即方向上的相似程度。;点积为0,说明两个向量是正交的(orthogonal)。;两个向量的夹角:反映两个向量在方向上的差异性。。出处:
机器学习zdh-1.pdf,第 52 页。
- 向量𝒙到𝒚的投影(projection):将向量𝒙垂直投射到向量𝒚方向上的:长度(标量)。;投影。出处:
机器学习zdh-1.pdf,第 53 页。
- 投影的含义:向量𝒙分解到向量𝒚方向上的程度。能够分解的:越多,说明两个向量方向上越相似。;当𝜃 = 0°时,完全等同;当𝜃 = 90°时,分解量为0;投影的含义;向量投影不具备对称性。;投影向量:。出处:
机器学习zdh-1.pdf,第 54 页。
- 向量点积还可以通过投影来表达::向量𝒙和𝒚的点积=向量𝒙 → 𝒚的投影×向量𝒚的模长。。出处:
机器学习zdh-1.pdf,第 55 页。
- 残差向量(residual vector):向量𝒙分解到向量𝒚方向上得到的投影向量:与原向量𝒙的误差。;残差向量。出处:
机器学习zdh-1.pdf,第 56 页。
- 两个特征向量之间的欧式距离:表征两个向量之间的相似程度:(综合考虑方向和模长)。;欧式距离。出处:
机器学习zdh-1.pdf,第 57 页。
- 1.5.1 分类决策:1.5.2 回归问题;1.5.3 描述问题。出处:
机器学习zdh-1.pdf,第 58 页。
- 考虑采用颜色和形状作为特征,:建立二维的特征空间,即:;x=[x1 x2]T=[颜色 形状]T;分类决策。出处:
机器学习zdh-1.pdf,第 59 页。
- 产生错分的原因: 使用的特征不恰当或者不充分; 用来训练分类器的样本不够全面和具有代表性; 类别之间存在交集; 分类器的效率不够高。出处:
机器学习zdh-1.pdf,第 61 页。
- 回归问题。出处:
机器学习zdh-1.pdf,第 62 页。
- 实例::19名男女同学进行体检,测量了身高和体重,但事后发现其中有4人;忘记填写性别,试问(在最小错误的条件下)这4人是男是女?体检;数值如下:。出处:
机器学习zdh-1.pdf,第 64 页。
- 分析:: 待识别的模式:性别(男或女); 测量的特征:身高和体重; 训练样本:15名已知性别的样本特征; 目标:希望借助于训练样本的特征建立判别函数(即数学模型)。出处:
机器学习zdh-1.pdf,第 65 页。
- 解:: 第一步:由训练样本得到的特征空间分布图。出处:
机器学习zdh-1.pdf,第 66 页。
- 第二步:训练过程:从图中训练样本的分布情况,找出男、女两类特征各自的聚类特点,;从而求取一个判别函数(直线或曲线)。;第三步:识别过程;只要给出待分类的模式特征的数值,看它在特征平面上落在判别函;数的哪一侧,就可以判别是男还是女了。。出处:
机器学习zdh-1.pdf,第 67 页。
- 1.6 机器学习。出处:
机器学习zdh-1.pdf,第 68 页。
- 使用机器学习技术!:模型如何得到?。出处:
机器学习zdh-1.pdf,第 69 页。
- 训练样本:一组训练样本(数据),记作;每个训练样本𝒙𝑛 ∈ 𝑅𝑝,都是通过采样得到的一个模式,即输入特;征空间中的一个向量;通常是高维度(即 𝑝 很大),例如一幅图像。;训练样本可以认为是尚未加工的原始知识,模型则是经过学习(即;加工整理归纳等)后的真正知识表达。;所有训练样本假设满足independent and identical distribution (iid) 。;如果想学得好,这组训练样本要覆盖模型所有可能的分布空间。;拿什么学。出处:
机器学习zdh-1.pdf,第 70 页。
- 模型的参数和结构:模型的参数:;模型的结构:函数𝑓的形式。;可见,模型结构决定了模型有哪些参数。;通常情况下,模型的结构是设计人员事先给定的。;如何学习模型结构是当前和未来机器学习领域的研究内容之一。;学什么。出处:
机器学习zdh-1.pdf,第 71 页。
- 线性模型。出处:
机器学习zdh-1.pdf,第 72 页。
- 模型结构是线性的(直线、面、超平面)::其中,𝐰, 𝑤0就是模型参数。;适用于数据是线性可分/线性表达的数据。。出处:
机器学习zdh-1.pdf,第 73 页。
- 非线性模型:(1,1);(0,1);(0,0);(1,0)。出处:
机器学习zdh-1.pdf,第 75 页。
- 训练样本个数=模型参数个数(𝑁 = 𝑀):参数有唯一的解。:训练样本个数≫模型参数个数(𝑁 ≫ 𝑀,Over-determined):没有准确的解。;训练样本个数 ≤ 模型参数个数( 𝑁 ≪ 𝑀 , Under-determined):无数个解/无解。;样本量vs模型参数量。出处:
机器学习zdh-1.pdf,第 77 页。
- 目标函数:对于over-determined的情况,需要额外添加一个标准,通过优化该标准;来确定一个近似解。该标准就叫目标函数(Objective function),也称;作代价函数(cost function)或损失函数(loss function)。;目标函数以待学习的模型参数作为自变量、以训练样本作为给定量:;对于under-determined的情况,还需要在目标函数中加入能够体现对于;参数解的约束条件,据此从无数个解中选出最优的一个解。。出处:
机器学习zdh-1.pdf,第 78 页。
- 优化算法:优化算法:最小化或最大化目标函数的技术。;通过优化算法,最终得到模型参数 𝜃1, … , 𝜃𝑀 的最优解:。出处:
机器学习zdh-1.pdf,第 79 页。
- 训练样本:优化算法;目标函数;模型;模式识别阶段;(测试阶段);机器学习阶段;(训练阶段)。出处:
机器学习zdh-1.pdf,第 80 页。
- 真值(标签)& 标注:真值(ground truth):针对每个训练样本𝒙𝑛,其对应的真实正确的输出;值,记作𝒕𝑛。;标签(label):对于分类任务,真值又称作标签。;通常,每个真值是一个向量𝒕𝑛 。二类分类:真值是一个标量𝑡𝑛 (比如大;于或小于0,正负1)。;标注(labeling):给每个训练样本标出真值的过程 。目前,主要由人工;完成。;标注的样本(labeled samples):有提供真值的样本。;未标注的样本(unlabeled samples):没有提供真值的样本。。出处:
机器学习zdh-1.pdf,第 81 页。
- 监督学习:依靠已知所属类别的的训练样本集,按它们特征向量的分布来确定:判别函数。只有在判别函数确定之后才能用它对未知的模式进行分类。;监督式学习(Supervised Learning);定义:训练样本及其输出真值都给定情况下的机器学习算法。;问题描述:;监督式学习是机器学习中最常见的学习方式。;通常使用最小化训练误差作为目标函数进行优化。。出处:
机器学习zdh-1.pdf,第 82 页。
- 无监督式学习(Unsupervised Learning):定义:只给定训练样本、没有给输出真值情况下的机器学习算法。;问题描述:;无监督式学习算法的难度远高于监督式算法。;根据训练样本之间的相似程度来进行决策。;如何衡量模式(样本)之间的相似程度;如何设计目标函数; 无监督学习:在没有先验知识的情况下,通常采用聚类方法。; 基于“物以类聚”的观点,用数学方法分析各特征向量之间的距离及分散情况。; 如果特征向量集合聚集若干个群,可按群间距离远近把它们划分成类。这种按各类。出处:
机器学习zdh-1.pdf,第 83 页。
- 半监督式学习:定义:既有标注的训练样本 、又有未标注的训练样本情况下的学习;算法。;问题描述:;看做有约束条件的无监督式学习问题:标注过的训练样本用作约束;条件。;典型应用:网络流数据。。出处:
机器学习zdh-1.pdf,第 87 页。
- 有些任务需要先后累积多次决策动作才能知道最终结果好坏,很难:针对单次决策给出对应的真值,例如,棋类游戏。;强化学习:机器自行探索决策、真值滞后反馈的过程。;定义从输入状态到动作决策为一个策略(policy);使用该策略进行决策探索时,给予每次决策一个奖励(reward);累积多次奖励获得回报值(return);回报的期望值作为该策略的价值函数(value function);通过最大化回报的期望值,解出策略的参数。;强化学习(Reinforcement Learning)。出处:
机器学习zdh-1.pdf,第 88 页。
- Value network: CNN:输入:棋局;输出:value;and , solve。出处:
机器学习zdh-1.pdf,第 89 页。
- 1.7 模型的泛化能力。出处:
机器学习zdh-1.pdf,第 90 页。
- 模型到底学的如何?:泛化能力:;学习算法对新模式的决策能力。出处:
机器学习zdh-1.pdf,第 91 页。
- 训练集&测试集:训练集(training set):模型训练所用的样本数据。集合中的每个样本;称作训练样本。;测试集(test set):测试模型性能所用的样本数据。集合中的每个样;本称作测试样本。;测试样本也是假设从样本真实分布中独立同分布(iid)采样得到的。;测试集和训练集是互斥的,但假设是同分布的。。出处:
机器学习zdh-1.pdf,第 92 页。
- 误差(error):模型(机器)给出的预测/决策输出与真值输出之间的差:异。;训练误差(training error):模型在训练集上的误差。;测试误差(test error):模型在测试集上的误差。它反映了模型的泛化能;力,也称作泛化误差。;训练误差&测试误差。出处:
机器学习zdh-1.pdf,第 93 页。
- 泛化能力(Generalization):训练样本存在的问题:;训练样本稀疏:给定的训练样本数量是有限的(即有限采样),;很难完整表达样本真实分布。;训练样本采样过程可能不均匀:有些区域采样密一些,有些区域;采样稀疏一些。;一些训练样本可能带有噪声。;泛化能力:训练得到的模型不仅要对训练样本具有决策能力,也要对;新的(训练过程中未看见)的模式具有决策能力。。出处:
机器学习zdh-1.pdf,第 94 页。
- 过拟合(over-fitting)::模型训练阶段表现很好,但是在测试阶段表现很差。;模型过于拟合训练数据。;泛化能力低的表现;过拟合。出处:
机器学习zdh-1.pdf,第 95 页。
- 思路:不要过度训练。:方法:;选择复杂度适合的模型(tradeoff):模型选择。;正则化(regularization) :在目标函数中加入正则项。;如何提高泛化能力。出处:
机器学习zdh-1.pdf,第 96 页。
- 多项式拟合,求解参数𝐰的最优值:目标函数:;多项式拟合与超参数;超参数(super-parameters):;超参数1:𝑀,即多项式的阶数,决定了模型的复杂度。;超参数2:𝑁,训练样本的个数。。出处:
机器学习zdh-1.pdf,第 97 页。
- 多项式拟合,求解参数𝐰的最优值:目标函数:;多项式拟合与超参数;超参数(super-parameters):;超参数1:𝑀,即多项式的阶数,决定了模型的复杂度。;超参数2:𝑁,训练样本的个数。。出处:
机器学习zdh-1.pdf,第 98 页。
- 超参数:超参数(super-parameters):;在机器学习的上下文中,超参数是在开始学习过程之前;设置值的参数,而不是通过训练得到的参数数据。;通常情况下,需要对超参数进行优化。;给模型选择一组最优超参数,以提高学习的性能和效果。。出处:
机器学习zdh-1.pdf,第 99 页。
- 固定训练样本个数: 𝑁 = 15:模型选择:选择合适的的多项式阶数𝑀;提高泛化能力:模型选择。出处:
机器学习zdh-1.pdf,第 100 页。
- 固定多项式的阶数𝑀 = 9 及训练样本个数𝑁 = 15:在目标函数中加入关于参数的正则项;超参数:正则系数𝜆;提高泛化能力:正则化。出处:
机器学习zdh-1.pdf,第 101 页。
- 通过调节正则系数,降低过拟合的程度:𝑙𝑜𝑔2𝜆 = −23;𝑙𝑜𝑔2𝜆 = −8;提高泛化能力:正则化。出处:
机器学习zdh-1.pdf,第 102 页。
- 通过调节正则系数,降低过拟合的程度:提高泛化能力:正则化;𝑙𝑜𝑔2𝜆。出处:
机器学习zdh-1.pdf,第 103 页。
- 几乎每个机器学习算法都有超参数。:涉及到泛化能力、可调整的超参数主要有: 𝑀, 𝜆。;如何选取合适的超参数?;需要依据泛化误差,但又不能基于测试集。;所以,从训练集中划分出一个验证集(validation set),;基于验证集调整选择超参数。;调参。出处:
机器学习zdh-1.pdf,第 104 页。
- 1.8 评估方法与性能指标。出处:
机器学习zdh-1.pdf,第 105 页。
- 测试集训练集:所有数据;随机划分:将数据集随机分为两组:训练集和测试集。利用训练集训;练模型,然后利用测试集评估模型的量化指标。;取统计值:为了克服单次随机划分带来的偏差,将上述随机划分进行;若干次,取量化指标的平均值(以及方差、最大值等)作为最终的性能;量化评估结果。;留出法(Hold-out)。出处:
机器学习zdh-1.pdf,第 106 页。
- 将数据集分割成𝐾个子集,从其中选取单个子集作为测试集,其他:𝐾 − 1个子集作为训练集。;交叉验证重复𝐾次,使得每个子集都被测试一次;将𝐾次的评估值;取平均,作为最终的量化评估结果。;K折交叉验证( K-Folds Cross Validation )。出处:
机器学习zdh-1.pdf,第 107 页。
- 每次只取数据集中的一个样本做测试集,剩余的做训练集。:每个样本测试一次,取所有评估值的平均值作为最终评估结果。;等同于K折交叉验证,K为数据集样本总数。;留一验证( leave-one-out cross-validation);所有数据样本。出处:
机器学习zdh-1.pdf,第 108 页。
- 预测为正/阳性 预测为负/阴性:真值为正/;阳性 True Positive(TP) False Negative(FN);真值为负/;阴性 False Positive(FP) True Negative(TN);对于回归任务:测试误差。;二类分类:真阳性(TP),假阳性(FP),真阴性(TN),假阴性(FN);多类分类:依次以单个类作为正类,其余为负类。。出处:
机器学习zdh-1.pdf,第 109 页。
- 预测为正/阳性 预测为负/阴性:真值为正/;阳性 True Positive(TP) False Negative(FN);真值为负/;阴性 False Positive(FP) True Negative(TN);TP+TN+FP+FN;准确度(Accuracy):将阳性和阴性综合起来度量识别正确的程度。;如果阳性和阴性样本数量比例失衡,该指标很难度量识别性能。;例子:阳性/阴性=5/95,模型把所有样本都判断为阴性。。出处:
机器学习zdh-1.pdf,第 110 页。
- 预测为正/阳性 预测为负/阴性 指标:真值为正/;阳性 True Positive(TP) False Negative(FN) Recall=;真值为负/;阴性 False Positive(FP) True Negative(TN) Specificity=;TP+TN+FP+FN;Precision=;2∗Reca𝑙𝑙∗Precision;Recal+Precision;精度(Precision):预测为阳性样本的准确程度。在信息检索领域,。出处:
机器学习zdh-1.pdf,第 111 页。
- 预测为正/阳性 预测为负/阴性 指标:真值为正/;阳性 True Positive(TP) False Negative(FN) Recall=;真值为负/;阴性 False Positive(FP) True Negative(TN) Specificity=;TP+TN+FP+FN;Precision=;2∗Reca𝑙𝑙∗Precision;Recal+Precision;精度高、同时召回率也高,说明模型性能越好。。出处:
机器学习zdh-1.pdf,第 112 页。
- 通过加权平均,综合precision和recall::设置𝑎 = 1,得到F1-score:。出处:
机器学习zdh-1.pdf,第 113 页。
- 矩阵的列代表预测值,行代表真值。:矩阵中每个元素的值是根据每个测试样本;的预测值和真值得到的计数统计值。;对角线元素的值越大,表示模型性能越好。;定义。出处:
机器学习zdh-1.pdf,第 114 页。
- 样本序号 真值 分类器输出:结果。出处:
机器学习zdh-1.pdf,第 115 页。
- 上述性能指标都是基于分类器输出,是一个确定的离散标签。:因此,在指标空间,性能评估只是一个点。;有些分类器在输出端会以数值形式表达:概率值、score值。;因此,可以设置若干个关于输出值的阈值,不同的阈值可以代表不同;的应用任务,得到多个评估值,从而可以在指标空间画出一条曲线,;从而得到评估指标的期望表征。;曲线度量。出处:
机器学习zdh-1.pdf,第 118 页。
- 横轴:召回率(recall):纵轴:精度(precision);理想性能:右上角(1,1)处。;PR(Precision-Recall Curve)曲线越;往右上凸,说明模型的性能越好。;PR曲线定义。出处:
机器学习zdh-1.pdf,第 119 页。
- 根据模型的预测数值,对样本进行从:高到低排序,排在前面的样本是正例;的可能性更高。;按此顺序逐个样本作为正例进行预测;(或设置阈值截断正例和负例),则;每次可以计算一个召回率和精度。;将这些值连成(拟合)一条曲线。;PR曲线绘制方法。出处:
机器学习zdh-1.pdf,第 120 页。
- 真值为负/:阴性 False Positive(FP) True Negative(TN) Specificity=;横轴:False positive rate (FPR),度量所有阴性样本中被错误识别为阳性;的比率。FPR=1-specificity。;纵轴:True positive rate (TPR),即recall。度量所有阳性样本被识别为阳;性的比例。;ROC曲线(Receiver-operating-characteristic curve)。出处:
机器学习zdh-1.pdf,第 121 页。
- 理想性能:左上角(0,1)处。:ROC曲线越往左上凸,说明模型的性能越好。;对角线:随机识别的ROC曲线。;绘制方法:与PR曲线相似。;ROC曲线。出处:
机器学习zdh-1.pdf,第 122 页。
- ROC曲线 PR曲线:ROC曲线:对于各类别之间样本;分布比例不敏感,因为FPR和TPR;各自只跟真值为负或真值为正的;样本相关。;PR曲线:对于各类别样本分布比;例敏感,因为precision同时和真值;正负的样本都相关。;PR与ROC曲线。出处:
机器学习zdh-1.pdf,第 123 页。
- 曲线下方面积(Area under the Curve, AUC):将曲线度量所表达的信息:浓缩到一个标量表达。;AUC = 1:是完美分类器,;0.5 < AUC < 1:优于随机猜测。这个模型妥善设定阈值的话,能;有预测价值。;AUC = 0.5:跟随机猜测一样,模型没有预测价值。;AUC < 0.5:比随机猜测还差。;AUC曲线定义与特性。出处:
机器学习zdh-1.pdf,第 124 页。
- AUC曲线。出处:
机器学习zdh-1.pdf,第 125 页。
2. 机器学习zdh-2
- 于元隆、朱丹红。出处:
机器学习zdh-2.pdf,第 1 页。
- 第二讲 基于距离的分类器。出处:
机器学习zdh-2.pdf,第 2 页。
- 基于距离的分类:基于距离的分类:把测试样本到每个类之间的距离作为判断准则。;该技术是最常见的模式识别技术,是其它高级识别技术的基础。;判别公式:;基于距离分类的两个关键因素:;类的表达(原型);距离的衡量。出处:
机器学习zdh-2.pdf,第 3 页。
- 类的原型:类的原型(prototype):用来代表这个类的一个模式或者一组量,方;便计算该原型和测试样本之间的距离。;如果使用类的原型,则基于距离的判别公式可以写为:;如何学习类的原型?;统计值(参数化);概率密度估计(无参数)。出处:
机器学习zdh-2.pdf,第 4 页。
- 类的原型:均值:原型的种类:;均值:该类中所有训练样本的均值作为类的原型。;一阶统计;均值是对类中所有训练样本代表误差最小的一种表达方式;为了最小化误差,令其梯度为0,即:。出处:
机器学习zdh-2.pdf,第 5 页。
- 类的原型:概率密度估计:在只给定𝑁个训练样本,不知道概率分布形式的条件下,在特征空间;内学习每个任意取值(模式)𝒙的概率密度;;也就是估计以𝒙为中心、在极小的区域𝑅=(𝒙,𝒙+𝛿𝒙) 内的概率密度;函数𝑝(𝒙) 。;无参数概率密度估计的任务描述。出处:
机器学习zdh-2.pdf,第 6 页。
- 对于任意一个模式𝒙 ,其落入区域𝑅的概率𝑃可以表达为::一个模式𝒙 落入区域𝑅的概率;如果区域𝑅足够小,𝑃是𝑝(𝒙)的平滑版本,可以用来估计𝑝(𝒙) 。;类的原型:概率密度估计。出处:
机器学习zdh-2.pdf,第 7 页。
- 但是,由于𝑁非常大,区域𝑅内可能不止落入𝒙一个模式!:因此,𝑘个样本落在区域𝑅的概率密度可以用二项分布来表达:;𝑘个样本落在区域𝑅;注意:二项分布p(𝑘)是关于𝑘为自变量的分;布,描述的是𝑘取各种值的可能性。;类的原型:概率密度估计。出处:
机器学习zdh-2.pdf,第 8 页。
- 类的原型:概率密度估计:从二项分布的曲线可以看出,当𝑁很大时,𝑘的分布非常尖锐且集中;在均值𝜇𝑘附近。;二项分布的均值𝜇𝑘 :;𝑘个样本落在区域𝑅的概率密度。出处:
机器学习zdh-2.pdf,第 9 页。
- 因此,当𝑁非常大时,我们可以用二项分布的均值来近似表达:𝑘的分布:𝑘→𝜇𝑘;以此得到𝑃的近似估计:;𝑝(𝒙)的近似估计;对照刚才对𝑃的定义,并假设在极小的区域𝑅内概率密度𝑝(𝒙)相同。;给定区域𝑅的体积记作𝑉。可以得到𝑝(𝒙)的近似估计:;类的原型:概率密度估计。出处:
机器学习zdh-2.pdf,第 10 页。
- 如何确定V?:思路:把V当做训练样本的函数。区域R以𝒙为中心,并不断扩张到可以;囊括𝑘个训练样本,即𝑘是训练样本个数𝑁的函数。;如果概率密度在𝒙附近很高,则会有较多的训练样本落在𝒙附近,则𝑘;较小;;如果概率密度在𝒙附近很低,则会有较少的训练样本落在𝒙附近,则𝑘;较大。;8个训练样本,k=3、k=5;类的原型:概率密度估计。出处:
机器学习zdh-2.pdf,第 11 页。
- K近邻(k-nearest neighbor, KNN)估计::给定𝑁个训练样本和𝑘值。;以任意模式𝒙为中心,找到区域𝑅使其包含𝑘个训练样本。;第𝑘个样本与𝒙的距离记作𝑑𝑘𝒙 ,则体积𝑉=2𝑑𝑘𝒙 。;概率密度估计表达为:;KNN估计。出处:
机器学习zdh-2.pdf,第 12 页。
- 类的原型:最近相邻点:最近相邻点(nearest neighbor):基于KNN估计,设置k=1。;从一类的训练样本中,选取与测试样本距离最近的一个训练样本,作;为该类的原型。类的原型取决于测试样本。;表达类的误差较大。;对噪声和异常样本比较敏感。;实际识别过程:;(1)选取与测试样本最相邻的训练样本;;(2)该训练样本所属的类别,就是测试样本所属的类别。。出处:
机器学习zdh-2.pdf,第 13 页。
- 类的原型:K个最近相邻点:k个最近相邻点(k-nearest neighbor):基于KNN估计,设置k>1。;从一类的模式中,选取k个与测试模式距离最近的模式,作为该类的原型。;在这k个样本中,投票选出哪个类别的样本最多,测试样本就属于这个类。;特点:部分去除噪声的影响,但计算量较大。。出处:
机器学习zdh-2.pdf,第 14 页。
- 距离测量:距离度量标准(Distance Metric):;1. 同一性:;2. 非负性:;3. 对称性:;4. 三角不等式:;欧式距离:; ;mimii zxzxzxd ,),(;Manhattan距离:。出处:
机器学习zdh-2.pdf,第 15 页。
- 加权欧式距离:加权欧式距离:对每个维度特征分别设置不同的权重wj。出处:
机器学习zdh-2.pdf,第 16 页。
- MED分类器::最小欧式距离分类器(Minimum Euclidean Distance Classifier);给定两个类C1和C2,以及两个类各自的原型z1和z2,分类器判别规则;如下:;类的原型:通常使用均值,也可以使用KNN。;距离衡量:欧式距离;MED分类器也可以用于多类分类。;MED分类器。出处:
机器学习zdh-2.pdf,第 17 页。
- MED分类器例子:以均值为类的原型:MED分类器。出处:
机器学习zdh-2.pdf,第 18 页。
- MED分类器:决策边界(分类边界):通过训练,由分类器判别方程决定的边界。;对于2个类而言,MED分类器的决策边界是一个超平面,该平面垂直且;二分连接两个类原型的线。;MED决策边界方程:。出处:
机器学习zdh-2.pdf,第 19 页。
- 对于2个类而言,MED分类器的决策边界方程为::关于x的一次函数;MED分类器。出处:
机器学习zdh-2.pdf,第 20 页。
- 在高维空间中,该决策边界是一个超平面。:且该平面垂直且二分连接两个类原型的线。;MED分类器。出处:
机器学习zdh-2.pdf,第 21 页。
- MED分类器:例题:。出处:
机器学习zdh-2.pdf,第 22 页。
- 上页的例题说明,如果使用均值作为类的原型,MED分类器有时候并不:能给出满意的分类性能。;如何解决这个问题?尝试一下不同的类原型:;最近相邻点:(4,2),所以判断属于C2类;K个最近相邻点:;K=2: (4,2)和(4,1),分别属于C2和C1类,无法做出判断。;K=3: (4,2)、(4,1)、(8,3)或者(4,-1),第三个最近相邻点有两个,;而且分属于不同的类,无法做出判断。;K=4: (4,2)、(4,1)、(8,3)或者(4,-1),(8,1):无法判断。;K=5: (4,2)、(4,1)、(8,3)或者(4,-1),(8,1),(8,0)或者。出处:
机器学习zdh-2.pdf,第 24 页。
- 上页的例题,为什么使用基于均值的MED分类器不能给出正确的分类呢?:看一下两个类各自的特征协方差矩阵:;MED分类器。出处:
机器学习zdh-2.pdf,第 25 页。
- 对角线元素不相等:每维特征的变化不同。:非对角元素不为0:特征之间存在相关性。;解决方法:去除特征变化的不同及特征之间的相关性。;MED分类器。出处:
机器学习zdh-2.pdf,第 26 页。
- 将原始特征映射到一个新的特征空间,使得在新空间:中特征的协方差矩阵为单位矩阵,从而去除特征变化;的不同及特征之间的相关性。;目的;特征正交白化。出处:
机器学习zdh-2.pdf,第 27 页。
- 假设映射矩阵为::其中𝒘𝑖;𝑇表示新的特征空间的第𝑖个坐标轴。;转换后的特征𝒚为:。出处:
机器学习zdh-2.pdf,第 28 页。
- 转换后的特征协方差矩阵为::目标:。出处:
机器学习zdh-2.pdf,第 29 页。
- 将特征转换分为两步:先去除特征之间的相关性(解耦, Decoupling),:然后再对特征进行尺度变换(白化, Whitening),使每维特征的方差;相等。;令𝑊=𝑊2𝑊1;解耦:通过𝑊1实现协方差矩阵对角化,去除特征之间的相关性。;白化:通过𝑊2对上一步变换后的特征再进行尺度变换,实现所有;特征具有相同方差。。出处:
机器学习zdh-2.pdf,第 30 页。
- 任务:求解转换矩阵𝑊1,将原始特征构成的协方差矩阵Σ𝑥对角化。;即𝑊1Σ𝑥𝑊1;𝑇=Λ,Λ为对角矩阵。;协方差矩阵Σ𝑥的对角化;特征解耦任务。出处:
机器学习zdh-2.pdf,第 31 页。
- 如何得到转换矩阵𝑊1?:第一步:求解协方差矩阵Σ𝑥的特征值和特征向量。;第二步:由特征向量构建转换矩阵𝑊1。;𝐴 是𝑝×𝑝的矩阵,∅ 是𝑅𝑝空间的非零向量:;λ 是∅ 对应的特征值。;若𝐴∅=λ∅,则称∅ 是𝐴的特征向量;;特征向量与特征值。出处:
机器学习zdh-2.pdf,第 32 页。
- 特征向量实例::是𝐴的特征向量,其对应的特征值为3。。出处:
机器学习zdh-2.pdf,第 33 页。
- 关于特征向量的几点说明::矩阵𝐴是(𝑝∗𝑝)方阵。若不是方阵,则需做奇异值分解。;每个特征向量的维数:𝑝维。;如果𝐴是实数对称矩阵,则有𝑝个特征向量和对应的特征值。;(𝑗=1,…𝑝)。出处:
机器学习zdh-2.pdf,第 34 页。
- 原始特征协方差矩阵Σ𝑥的特征向量:𝒗1,𝒗2,…,𝒗𝑝:原始特征协方差矩阵Σ𝑥的特征值:𝜆1,𝜆2,…,𝜆𝑝;单位化特征向量:;将所有单位化的特征向量组成矩阵𝛷:;(𝑗=1,…𝑝);特征解耦。出处:
机器学习zdh-2.pdf,第 35 页。
- 由所有特征值组成一个对角矩阵::考虑所有特征向量矩阵和所有特征值矩阵相乘:;考虑所有特征向量矩阵和协方差矩阵相乘:;因此得到:;协方差矩阵;对角化。出处:
机器学习zdh-2.pdf,第 36 页。
- 问题:协方差矩阵的不同特征值对应的特征向量间一定正交吗?:对两个不同的特征向量进行如下点积运算:;两式相减;由于等式中每项都是一个标量:。出处:
机器学习zdh-2.pdf,第 37 页。
- 上式左边等于0,且𝝀𝒊≠𝝀𝒋⟹𝝓𝒋:𝑻𝝓𝒊=𝟎;协方差矩阵是实对称的,即𝜮𝒙𝑻=𝜮𝒙 :;因此不同特征值对应的特征向量正交。。出处:
机器学习zdh-2.pdf,第 38 页。
- 协方差矩阵能够通过矩阵𝛷 转换为对角阵,即Σ𝑥 矩阵被成功对角化了。:𝑾𝟏:𝜮𝒙的正交单位化的特征向量组成的矩阵。。出处:
机器学习zdh-2.pdf,第 39 页。
- 转换矩阵𝑊1的特性:将原始特征投影到协方差矩阵对应的特征向量上,每一个特征;向量构成一个坐标轴。;新特征的协方差是对角阵,对角线上的元素由原协方差矩阵的;特征值构成。;转换前后欧氏距离保持一致,说明𝑊1只是起到旋转的作用。。出处:
机器学习zdh-2.pdf,第 40 页。
- 证明:原始特征经𝑊1转换后欧式距离不变。:令𝒛=𝑊1𝒙=Φ𝑇𝒙。出处:
机器学习zdh-2.pdf,第 41 页。
- 𝑊2的求解::𝑊的求解:。出处:
机器学习zdh-2.pdf,第 42 页。
- 𝑊转换后的欧式距离::称为马氏距离(Mahalanobis Distance)。。出处:
机器学习zdh-2.pdf,第 43 页。
- 概念:判别公式;最小类内距离分类器(Minimum Intra-class Distance Classifier),;基于马氏距离的分类器。;距离度量:马氏距离;类的原型:均值;该距离不仅考虑了类的均值对于距离测量的影响,还加入了类的;方差对于距离测量的影响。;MICD距离度量。出处:
机器学习zdh-2.pdf,第 44 页。
- 当Σ=𝐼时:等于欧式距离:马氏距离的属性;𝑑𝑀(𝒙,𝐶𝑖)=(𝒙−𝝁𝑖)𝛴𝑖;−1𝒙−𝝁𝑖;=(𝒙−𝝁𝑖)𝑇(𝒙−𝝁𝑖);等距面方程:;(𝒙−𝝁𝑖)𝑇(𝒙−𝝁𝑖)=𝑐2;半径为𝑐的球面。;等距图是一个球面。出处:
机器学习zdh-2.pdf,第 45 页。
- 马氏距离的属性:等距图是一个超椭圆面;𝑑𝑀(𝒙,𝐶𝑖)=(𝒙−𝝁𝑖)𝛴𝑖;−1𝒙−𝝁𝑖;=(𝒙−𝝁𝑖)𝑇;𝜎12 ⋯ 0;⋮ ⋯ ⋮;𝜎𝑝2;(𝒙−𝝁𝑖);𝑥𝑖−𝜇𝑖𝑗。出处:
机器学习zdh-2.pdf,第 46 页。
- 马氏距离的属性:当Σ是任意值时:等距图是一个有方向的超椭圆面。。出处:
机器学习zdh-2.pdf,第 47 页。
- MICD分类器的决策边界:对于二类分类而言,;MICD分类器的决策边界位于到两个类的距离相等的面上,即:;当𝛴1≠𝛴2时,关于𝒙的二次函数。出处:
机器学习zdh-2.pdf,第 48 页。
- MICD分类器的决策边界:当𝛴1=𝛴2时,决策边界函数可化简为:;此时决策边界为经过;𝝁1+𝝁2;2 的超平面。;超平面。出处:
机器学习zdh-2.pdf,第 49 页。
- MICD分类器的决策边界:当𝛴1=c1𝐼,𝛴2=c2𝐼 时,决策边界为超球面。。出处:
机器学习zdh-2.pdf,第 50 页。
- MICD分类器的决策边界:当𝛴1=c𝛴2时,决策边界为超椭球面。;超椭球面。出处:
机器学习zdh-2.pdf,第 51 页。
- MICD分类器的决策边界:当𝛴1 、𝛴2是任意值,决策边界是一个超抛物面或者超双曲面。。出处:
机器学习zdh-2.pdf,第 52 页。
- MICD分类器的缺陷:如下情况,可以看出MICD分类器的一个缺陷。;MICD分类器会选择方差较大的类;𝝁1=𝝁2,𝛴1<𝛴2→𝑑𝑀𝒚,𝐶1 >𝑑𝑀𝒚,𝐶2。出处:
机器学习zdh-2.pdf,第 53 页。
3. 机器学习zdh-3.1
- 于元隆、朱丹红。出处:
机器学习zdh-3.1.pdf,第 1 页。
- MICD分类器的问题:MICD分类器会选择方差较大的类。。出处:
机器学习zdh-3.1.pdf,第 2 页。
- 基于距离的决策::仅考虑每个类别各自观测到的训练样本的分布情况。例如,均值;(MED分类器)和协方差(MICD分类器)。;没有考虑类的分布等先验知识。例如,类别之间样本数量的比例,;类别之间的相互关系。;概率:通常用来表达事物处于每种取值状态的可能性。。出处:
机器学习zdh-3.1.pdf,第 3 页。
- 推理可分为确定性(Certainty)推理和概率推理。所谓确定性推理是指:类似如下的推理过程:;如条件B存在,就一定会有结果A。现在已知条件B存在,可以得出结论是结果A一;定也存在。;“如果考试作弊,该科成绩就一定是0分。”这就是一条确定性推理。;而概率推理(Probabilistic Reasoning)是不确定性推理,它的推理形式;可以表示为:;如条件B存在,则结果A发生的概率为P(A|B)。P(A|B)也称为结果A发生的条件概率;(Conditional Probability)。;“如果考前未复习,该科成绩有50%的可能性不及格。”这就是一条概率。出处:
机器学习zdh-3.1.pdf,第 4 页。
- 通常情况下,条件概率从大量实践中得来,它是一种经验数据的总结,但:对于我们判别事物和预测未来没有太大的直接作用。;我们更关注的是如果我们发现了某个结果(或者某种现象),那么造成这;种结果的原因有多大可能存在呢?这就是逆概率推理的含义。;即:已知条件B存在,则结果A存在的概率为P(A|B)。如果发现结果A出现;了,求条件B存在的概率P(B|A)?;例如:已知某位人物如果是罪犯,他留下某些线索的概率;那么如果发现了;一些线索,他是罪犯的概率是多少?;再如:已知患有某种疾病,会出现某种症状的概率;那么如果医生发现某位;患者出现了某种症状,他患有该种疾病的概率是多少?。出处:
机器学习zdh-3.1.pdf,第 5 页。
- 贝叶斯公式是由托马斯·贝叶斯于1763年提出的,它的数学表述为::解决逆概率推理问题:贝叶斯公式。出处:
机器学习zdh-3.1.pdf,第 6 页。
- 𝑃(𝐵𝑖|𝐴):称为后验概率(Posterior Probability),表示事件A(结果A )出现后,;各不相容的条件Bi存在的概率,它是在结果出现后才能计算得到的,因此称;为“后验”。;𝑃(𝐴|𝐵𝑗);称为类条件概率(Class-conditional Probability),表示在各条件Bi;存在时,结果事件A发生的概率。也称观测似然。;𝑃(𝐵𝑗);称为先验概率(Priori Probability),表示各不相容的条件Bi出现的概;率,它与结果A是否出现无关,仅表示根据先验知识或主观推断,认为总体。出处:
机器学习zdh-3.1.pdf,第 7 页。
- 因此,当我们把贝叶斯公式应用于不确定统计分类时,我们就得到了根据:样本的特征值来进行类别划分的一种不确定分类器。;它可以计算出该样本属于每一个类别的概率是多少。;需要计算:后验概率P(男性|长发)和P(女性|长发)。;假设类条件概率(观测似然);即男性留长发的概率P(长发|男性)=5%,;女性留长发的概率P(长发|女性)= 70%。。出处:
机器学习zdh-3.1.pdf,第 8 页。
- 如果我们在一个特殊的环境中,男性女性的先验概率并不相同,例如在福州:大学,男性大约占总人群的75%,女性大约占25%。;此时我们如果遇到一个背影是长发的人,他是男性或女性的后验概率为:;P(长发|男性) =0.05,P(长发|女性) =0.7,设 P(男性) =75%,P(女性) =25%,则:;P(男性|长发)=(0.05*0.75)/(0.05*0.75+0.7*0.25)=3/17=0.176。;可以看到:在各类别先验概率不均等时,后验概率也会发生很大的变化。。出处:
机器学习zdh-3.1.pdf,第 9 页。
- 贝叶斯分类的特点::1、先验概率必须是已知的。在没有获得任何信息的时候,如果要进行分类;判别,只能依据各类存在的先验概率,将样本划分到先验概率大的一类中,风;险会比较小。;2、以新获得的信息对先验概率进行修正。获得了更多关于样本特征的信;息后,即得到观测概率后,可以依照贝叶斯公式对先验概率进行修正,得到后;验概率。;3、分类决策存在错误率。由于贝叶斯分类是在样本取得某特征值时对它属;于各类的概率进行推测,并无法获知样本真实的类别归属情况,所以分类决策;一定存在错误率,即使错误率很低。。出处:
机器学习zdh-3.1.pdf,第 10 页。
- 某地发生了一起交通事故肇事逃逸事件,现场有一位目击者,他非常肯:定地说,他看见肇事车的车标是右侧的车标,而不是左侧的车标。如果;这个目击者的可信度达到99%,就是说只有1%的可能性他会在两个车标;中认错。;请问:肇事车的车标是右侧车标的可能性有多大?。出处:
机器学习zdh-3.1.pdf,第 11 页。
- 根据我们的直觉,我们会相信这个可信度非常高的目击者,会认为接受他的:证词错误率会比较小。;P(认成右标|实为左标) =0.01,;P(认成右标|实为右标) =0.99,;设P(左标) =P(右标) =50%,;则P(实为右标|认成右标) =(0.99*0.5)/(0.99*0.5+0.01*0.5)=0.99;结果显示,我们的直觉是正确的,肇事车的车标确实是右侧车标的概率达到;了99%。;我们接纳目击者的证词,认定肇事车是右侧的车型错误率很低。。出处:
机器学习zdh-3.1.pdf,第 12 页。
- P(实为右标|认成右标)=?。出处:
机器学习zdh-3.1.pdf,第 13 页。
- 对于不确定的统计分类,已知的是每个类别的样本取得不同特征向量的概率:(也就是该类样本的统计分布),现在需要实现的是如何依据某个待识别样;本的特征向量,计算出该样本属于每一个类的概率?;1、先验概率:每一类的样本的整体出现概率。;2、类条件概率:把每个类中样本取得某个具体特征向量值的概率。;3、后验概率:把待计算的样本取得某一个具体特征向量值时属于每一类的概率。;使用贝叶斯公式可以解决分类问题。。出处:
机器学习zdh-3.1.pdf,第 14 页。
- 例:2019年以来,人感染某类流感的病例开始出现,并造成了一定的社会恐慌。根:据目前数据统计,该病的总体发病率大约为1000万分之一,对照普通流感的发;病率可高达30%。研究发现,易感人群中99%的人感染某类流感病例曾出现过发;热、咳嗽等急性呼吸道感染症状,而同样的易感人群中80%的普通流感患者也出;现过同样症状。;(1)现有一位患者属于易感人群,并出现了发热、咳嗽等急性呼吸道感染症状,请;问是否应当按照人某类流感疑似病例对待?;计算该患者实为某类流感感染的后验概率:;P(H7N9) =0.0000001/(0.0000001+0.3);P(流感) =0.3/(0.0000001+0.3)。出处:
机器学习zdh-3.1.pdf,第 15 页。
- 但是,某类流感致死率高,又有强烈的传染性,万一我们误诊了,后果:会比较严重。当然,如果我们是把普通流感患者误诊为某类流感患者,;他可能就是受到些惊吓,或者被隔离后生活不便,没有太大的社会风险。;如果我们是把一名某类流感患者误诊为普通流感患者,而没有采取合理;有效的措施对他进行隔离和治疗的话,可能就会给患者本人和整个社会;带来巨大的损失。;这个例子提示我们,当我们使用贝叶斯分类器时,仅仅考虑识别错误率;低是不够的,还应当把我们所采取的分类决策所带来的后果考虑进去,;这就是“最小风险贝叶斯分类器”的由来。。出处:
机器学习zdh-3.1.pdf,第 16 页。
- 于元隆、朱丹红。出处:
机器学习zdh-3.1.pdf,第 17 页。
- 贝叶斯分类器。出处:
机器学习zdh-3.1.pdf,第 18 页。
- 随机性:每个样本是一次随机采样,样本个体具有随机性。:例如,鲈鱼和三文鱼的分类:即使是属于同一类的鱼,长度和亮度等特征;在不同的个体样本上也是有变化的。;机器学习所要做的是:反复观测采样,找出数据蕴含的概率分布规律。;推理决策:根据学习出来的概率分布规律来做决定。;概率的观点。出处:
机器学习zdh-3.1.pdf,第 19 页。
- 概率:通常用来表达事物处于每种取值状态的可能性。:每维特征构成一个随机变量,其概率分布由两个元素组成:;1)该特征的取值空间(连续或者离散)。;2)在该特征维度上,样本处于各个取值状态的可能性。;从概率的观点看,给定一个测试模式𝒙,决策其属于哪个类别需要依赖于;如下条件概率:P (C|𝒙)。出处:
机器学习zdh-3.1.pdf,第 20 页。
- 输入模式𝒙 :随机变量(单维特征)或向量(高维特征)。:类别输出𝑪:随机变量,取值是所有类别标签{𝐶𝑖}。;针对每个类别𝐶𝑖,该条件概率可以写作: P(𝐶𝑖|𝒙);该条件概率也称作后验概率(posterior probability) ,表达给定模式𝒙;属于类𝐶𝑖可能性。。出处:
机器学习zdh-3.1.pdf,第 21 页。
- 理想情况下,对于给定的一个测试样本,我们希望选择它属于拥有最高:概率的那个类。;这里的概率是指经过观测以后,测试样本𝑥属于𝐶1 或者𝐶2 类的后验概率。。出处:
机器学习zdh-3.1.pdf,第 22 页。
- 若用某种方法检测是否患有某病,假设 𝑋 表示“试验反应呈阳性”。则::例如:一个2类问题,C1诊断为患有某病,C2诊断为无病,;P(C2)表示该地区人无此病的概率。;则:P(C1)表示某地区的人患有此病的概率。 通过统计;资料得到。出处:
机器学习zdh-3.1.pdf,第 23 页。
- P(C2| 𝑋) 表示试验呈阳性的人中,实际没有病的人的概率。:P(𝑋 |C2) 表示无病的人群做该试验时反应呈阳性(显示有病)的概率。;值低 / 高;√ P(𝑋 |C1) 表示患病人群做该试验时反应呈阳性的概率。;P(C1| 𝑋) 表示试验呈阳性的人中,实际确实有病的人的概率。。出处:
机器学习zdh-3.1.pdf,第 24 页。
- 如何得到后验概率:使用贝叶斯规则:先验概率、观测似然、后验概率;后验概率计算。出处:
机器学习zdh-3.1.pdf,第 25 页。
- 例 假定在细胞识别中,病变细胞的先验概率和正常细胞的先验概率分别为::95.0)(,05.0)( 21 PP;5.0)|( 1 Xp;2.0)|( 2 Xp;试对细胞X进行分类。;现有一待识别细胞,其观察值为X,观测似然取值:。出处:
机器学习zdh-3.1.pdf,第 26 页。
- :;;16.02.095.05.005.0;05.05.0 ;;884.02.095.05.005.0;95.02.0)|( 2 ;XP;)|()|( 12 XX PP 。出处:
机器学习zdh-3.1.pdf,第 27 页。
- [方法2]:利用先验概率和类概率密度计算。: 025.005.05.0)|( 11 Pp X; 19.095.02.0)|( 22 Pp X; )()|()|( 1122 PpPp XX ;2 X;,是正常细胞。。出处:
机器学习zdh-3.1.pdf,第 28 页。
- 如何得到后验概率:使用贝叶斯规则:先验概率:P(C1)=2/3,P(C2)=1/3;观测似然、后验概率。出处:
机器学习zdh-3.1.pdf,第 29 页。
- Maximum a posterior (MAP)分类器::将测试样本分给后验概率最大的那个类。;最大后验概率(MAP)分类器。出处:
机器学习zdh-3.1.pdf,第 30 页。
- MAP分类器的决策边界方程::在一维空间,通常有两条分类边界。;在n维空间,分类边界非常复杂。;实际的分类边界取决于先验概率和观测似然所用的形式。;MAP分类器的决策边界。出处:
机器学习zdh-3.1.pdf,第 31 页。
- 许多实际的数据集::均值附近分布较多样本;;距均值点越远,样本分布越少。;此时正态分布(高斯分布)是;一种合理的近似。;正态分布概率模型的优点:;物理上的合理性。;数学上的简单性。;图中为某大学男大学生的身高数据,红线是拟合的密度曲线。;可见,其身高应服从正态分布。。出处:
机器学习zdh-3.1.pdf,第 32 页。
- 概率密度函数定义为:: ;22 21 1 1( ) exp ( ) 222;; ; ;曲线如图示:;①μ= -1,σ=0.5 ; ②μ= 0,σ=1 ; ③μ= 1,σ=2 .;单变量(一维)的正态分布。出处:
机器学习zdh-3.1.pdf,第 33 页。
- 一维正态曲线的性质::(2)曲线关于直线 x =μ 对称。;(3)当x =μ 时,曲线位于最高点。;(4)当x<μ 时,曲线上升;当x>μ 时,曲线下降.并且当曲线向左、右;两边无限延伸时,以x轴为渐近线,向它无限靠近。;(1)曲线在 x 轴的上方,与x轴不相交。;(5)μ 一定时,曲线的形状由σ 确定。;Σ 越大,曲线越“矮胖”,表示总体;的分布越分散;σ 越小。曲线越“瘦;高”,表示总体的分布越集中。。出处:
机器学习zdh-3.1.pdf,第 34 页。
- :;;;时当;kxkP ;3σ 规则;即:绝大部分样本都落在了均值μ附近;±3σ的范围内,因此正态密度曲线完全;可由均值和方差来确定,常简记为:。出处:
机器学习zdh-3.1.pdf,第 35 页。
- :;;; ;多变量(n维)正态随机向量;密度函数定义为:;式中: ; 为均值向量;; ;1 ,, nxx X。出处:
机器学习zdh-3.1.pdf,第 36 页。
- 以二维正态密度函数为例::等高线(等密度线)投影到x1ox2面上为椭圆,从原点O 到点M 的向量为均值M。;椭圆的位置:由均值向量M 决定;椭圆的形状:由协方差矩阵C 决定。;(a);(b)。出处:
机器学习zdh-3.1.pdf,第 37 页。
- 虽然它的MAP分类决策规则很简单,但是由于观测似然分布的形式不确定,:所以,我们很难找到一个形式简单的分类决策边界。;如果各类样本特征向量取值的类条件概率(观测似然)满足正态分布,决策;规则会不会更简化?。出处:
机器学习zdh-3.1.pdf,第 38 页。
- 观测似然:单变量高斯分布:假设观测似然是单变量高斯分布:;带入MAP分类器,两边都取log:。出处:
机器学习zdh-3.1.pdf,第 39 页。
- 练习题::设一维两类模式满足正态分布,它们的均值和方差分别为,m1=0,s1=2,;m2=2,s2=2,p(x) ~N(m,s), P(ω1)= P(ω2)。试算出判决边界点,并;绘出它们的概率密度函数曲线(示意图);试确定样本-3,-2,1,3,5;各属哪一类。。出处:
机器学习zdh-3.1.pdf,第 40 页。
- 高斯观测似然时的决策边界:为了得到决策边界,决策方程两边设置相等,从而解得x:;如果𝝈𝒊 = 𝝈𝒋 ,只有一条分类边界:;从而解出x,得到该条分类边界𝜃的方程表达:。出处:
机器学习zdh-3.1.pdf,第 41 页。
- 假设𝜇𝑗 > 𝜇𝑖,如果𝑃 𝐶𝑗 > 𝑃 𝐶𝑖 ,则第二项为负值,且得到分类边界::比较MED分类边界,在方差相同的情况下,MAP分类边界偏向于先验可能;性较小的类。;假设 𝜇𝑗 < 𝜇𝑖,也可以得到相同结论。。出处:
机器学习zdh-3.1.pdf,第 42 页。
- 通常情况下, 𝝈𝒊 ≠ 𝝈𝒋 ,此时分类边界有两个解::𝜃1和𝜃2是假设 𝜇𝑖, 𝜇𝑗 , 𝜎𝑖, 𝜎𝑗, 𝑃(𝐶𝑖), 𝑃(𝐶𝑗) 的函数。;和MICD分类器决策边界比较:;当𝜎𝑖>𝜎𝑗且先验概率相等时,𝛿>0,MAP分类器倾向选择𝜎𝑗类,即方差较;小(紧致)的类。。出处:
机器学习zdh-3.1.pdf,第 43 页。
- 高斯观测似然时的分类器比较:比较MAP和MICD分类器:;MAP分类器决策时,偏向于先验较大可能性的类、分布较为紧致的类。。出处:
机器学习zdh-3.1.pdf,第 44 页。
- 观测似然:多变量高斯分布:假设观测似然是多变量高斯分布,即特征是多维度。。出处:
机器学习zdh-3.1.pdf,第 45 页。
- 观测似然:多变量高斯分布:假设观测似然是多变量高斯分布,即特征是多维度。;代入MAP分类器,两边都取log:;决策边界是一个超二次型,但始终是偏移MICD决策边界如下距离:。出处:
机器学习zdh-3.1.pdf,第 46 页。
- 例:设在三维特征空间里,有两类正态分布模式,每类各有4个样本,分别为:: ;其均值向量和协方差矩阵可用下式估计:;N MMXXC ;式中,Ni 为类别ωi 中模式的数目,Xij 代表在第i 类中的第j 个模式。;两类的先验概率:;试确定两类之间的决策边界。;21)()( 21 PP。出处:
机器学习zdh-3.1.pdf,第 48 页。
- :;;;;解:;;;;经计算有:。出处:
机器学习zdh-3.1.pdf,第 49 页。
- 图中画出判别平面的一部分。:(1,0,0) (1,1,0);(0,1,1) (0,0,1)。出处:
机器学习zdh-3.1.pdf,第 50 页。
- 最大似然(ML)分类器:如果没有先验概率,或者不考虑先验概率,则MAP分类器变为最大似然;分类器,即Maximum Likelihood(ML)分类器。;ijCxpCxpCx jii ),|()|( if ,;如果观测似然是高斯分布,则ML分类器为:。出处:
机器学习zdh-3.1.pdf,第 51 页。
- 损失函数:通常情况下,基于分类的决策机制是与决策损失(loss)相连的。同时,;针对各个类,决策损失也是不一样的。;例如,测试样本本来属于类2,但是分类器把它错误的分类为属于类1,则;该项决策导致的损失有可能会大于相反的情况导致的损失。;尤其是当一个类非常稀少、但错误决策又会产生很大代价的情况,例如,;银行卡盗刷行为。;假设C2类非常稀少,会导致𝑃 𝐶1 ≫ 𝑃 𝐶2 。对于分类器而言,如果把测;试样本都判断为属于C1类,可以获得最低的整体错误率。但是,这是正;确的分类决策吗?。出处:
机器学习zdh-3.1.pdf,第 52 页。
- 条件风险:如何解决该问题?;提高特征选择的性能,针对某些x的取值空间,使得观测似然𝑃 𝑥|𝐶2 ≫;𝑃 𝑥|𝐶1 ,以此对冲先验概率的巨大差异。但是,在具体实施时,如何选择特征;才能获得上述结果是较为困难的。;另一个方法就是给错误分类分配一个损失系数。;将分类的动作表示为: {𝛼1, 𝛼2, … , 𝛼𝑁𝐶};真值是𝐶𝑗,但是决策动作是𝛼2的损失表达为: 𝜆(𝛼𝑖|𝐶𝑗) 。;给定一个测试模式x,可以定义采取某个分类动作𝛼𝑖的条件风险为:。出处:
机器学习zdh-3.1.pdf,第 53 页。
- 针对所有决策动作和候选类别,可以用一个矩阵来表示对应的损失值。:以信用卡盗刷为例,损失矩阵可以表示如下:;损失𝜆𝑖𝑗具体数值可以手动设计、也可以通过机器学习训练。。出处:
机器学习zdh-3.1.pdf,第 54 页。
- 风险贝叶斯分类决策:决策策略:最小化整体风险。针对一个测试样本 𝑥 ,选择条件风险最低的类。。出处:
机器学习zdh-3.1.pdf,第 55 页。
- 风险贝叶斯分类决策:两类的情况:如果假设错误分类到C1和错误分类到C2的损失是相同的,则为MAP分类。。出处:
机器学习zdh-3.1.pdf,第 56 页。
- 如果假设错误分类到C1和错误分类到C2的损失是不同的::如果𝜆12 > 𝜆21,意味着错误分类到C2的损失大于错误分类到C1的损失。;结论:针对该情况,通过使用风险贝叶斯决策,将有更多可能性选择C2类。。出处:
机器学习zdh-3.1.pdf,第 57 页。
- 风险贝叶斯分类决策:例子1:信用卡盗刷行为分类:根据用户的信用卡使用特征,实时监测每一笔交易;是合法还是非法盗刷。;特征:交易地点、交易类型、速度等。。出处:
机器学习zdh-3.1.pdf,第 58 页。
- 如果两种错误分类的损失都是一样的话,相当于是MAP分类器。:如果要判断属于盗刷类(C1)类,该类观测似然要至少比C2类高99倍,;从而导致特征只有在很小的范围才能达到目标。;观测似然分布。出处:
机器学习zdh-3.1.pdf,第 59 页。
- 风险贝叶斯分类决策:损失的设置:所以,不同的错误决策对应的损失系数不应该一样。;如果把盗刷错误判断为合法,则会遭受财产损失,损失程度会很重。;如果过多的把合法刷卡错误判断为盗刷,也会一定程度影响客户对银行的;反感,但是损失程度没有那么重。;因此,两种错误分类决策对应的损失系数可以设置为:。出处:
机器学习zdh-3.1.pdf,第 60 页。
- 风险贝叶斯分类决策:例子2:信用卡盗刷行为分类:使用不同程度的损失系数。;使用不同程度的损失系数,分类边界还是产生了较大变化。。出处:
机器学习zdh-3.1.pdf,第 61 页。
- 95.0)(,05.0)( 21 PP:2.0)|(,5.0)|( 21 XX pp;例 在细胞识别中,病变细胞和正常细胞的先验概率分别为:;现有一待识别细胞,观察值为X, 观测似然取值:;损失函数分别为L11=0,L21=10, L22=0,L12=1。按最小风险贝叶斯决策分类。。出处:
机器学习zdh-3.1.pdf,第 62 页。
- )(|)(|)( 222211212 PpLPpLr XXX : )(|)(|)( 221211111 PpLPpLr XXX ;对样本 X:;121 )()( XXX 则若 rr;当X 被判为ω1类时:;当X 被判为ω2类时:;决策规则:;221 )()( XXX 则若 rr。出处:
机器学习zdh-3.1.pdf,第 63 页。
- 11 1 1 12 2 2 21 1 1 22 2 2| ( ) | ( ) | ( ) | ( )L p P L p P L p P L p P X X X X: )(|)(| 111121222212 PpLLPpLL XX ;11 12 22 2;22 21 11 1;( | ) ( ) ( );; ; ;即:。出处:
机器学习zdh-3.1.pdf,第 64 页。
- 令::pl ,称似然比;; PLL;;,为阈值。;② 计算 。;③ 计算 。; X12l;① 定义损失函数Lij 。;判别步骤:。出处:
机器学习zdh-3.1.pdf,第 65 页。
- 最大后验概率(MAP)分类器:最大后验概率(MAP)分类器:将测试样本分给后验概率最大的那个类。。出处:
机器学习zdh-3.1.pdf,第 66 页。
- MAP分类器:平均概率误差最小:给定一个样本x,MAP分类决策产生的误差可以用概率误差表达。;概率误差等于选错类所对应的后验概率。;给定所有样本,MAP分类器选择后验概率最大的类,等于最小化平均概率;误差:因为针对每个x,MAP分类器都选择一个概率误差最小的,则对所有样本而;言,平均概率误差也是最小的。;给定所有样本(N为样本个数),分类决策产生的平均概率误差为:样本;的概率误差的均值。。出处:
机器学习zdh-3.1.pdf,第 67 页。
- MAP分类器:分类误差最小化:概率误差最小化:就是分类误差最小化。;Other decision boundary;MAP boundary;目标:最小化红色、绿色和蓝色区域总和(贝叶斯误;差,Bayes Errors) 。绿色和蓝色区域(两个类概率;分布的重合区域)大小不会随着决策边界的移动而;变化,只有红色区域会随着决策边界的移动而变化。;选择后验概率最大的类,虽然不能保;证其他类的后验概率为0,但能够保证。出处:
机器学习zdh-3.1.pdf,第 68 页。
- XX dPpeP j:j iR j ;设共有M 类,当判决 时:;iX;当X 判为任何一类时,都存在这样一个可能的错误,故;XX dPpcP i;i iR i )()|()(;; cPeP 1;总错误率为:。出处:
机器学习zdh-3.1.pdf,第 69 页。
- 贝叶斯分类器:贝叶斯分类器:将测试样本分给风险最小的那个类。决策就是选取的类别。;针对每个样本x,决策属于𝐶𝑖类的动作对应的风险评估计算如下:;𝜆(𝛼𝑖|𝐶𝑘) :真值是 𝐶𝑘 ,但是决策动作是 𝛼𝑖 的损失。;因此,针对一个样本x,贝叶斯决策选择风险最小的类,其决策公式为:;Loss matrix:表征机器决策与其他可能正确决策选项之间的损失关系。;风险评估的含义:对于属于 𝐶𝑖类 这个决策,;机器并不知道正确类是什么,所以需要通;过计算该决策与所有其他可能的正确决策;选项相比的损失之和,作为评估该决策风。出处:
机器学习zdh-3.1.pdf,第 70 页。
- 贝叶斯分类器:期望损失最小化:给定所有样本,贝叶斯分类决策目标函数是:最小化期望损失。;如何实现期望损失最小化?通过针对每个样本选择风险最小所属的类,使得决策;判断属于类Ci的所有样本,贝叶斯决策保证平均风险最小。;给定所有样本(N为样本个数),贝叶斯分类决策的期望损失(expected loss)为:;所有样本决策到每一个类的风险损失的平均值。;x is decided to be Ci。出处:
机器学习zdh-3.1.pdf,第 71 页。
- 拒绝选项:拒绝选项也可用到贝叶斯分类器:当最小;的风险仍然大于阈值时,选择拒绝。;以MAP分类器为例,针对每个测试样本,分类器通过比较所有类的后验概率,选;择最大的后验概率所属的类。;但是,有可能最大后验概率的绝对值比较小,即属于该类的决策有很大的不确定性。;为了避免出现错误决策,分类器可以选择决绝。;如何拒绝?引入阈值𝜃:;当𝜃 =1,所有样本的任何决策都会被拒绝。;当𝜃 < 1/𝐾,所有样本的决策都不会被拒绝,。出处:
机器学习zdh-3.1.pdf,第 72 页。
4. 机器学习zdh-3.2
- 于元隆、朱丹红。出处:
机器学习zdh-3.2.pdf,第 1 页。
- 贝叶斯分类器的训练。出处:
机器学习zdh-3.2.pdf,第 2 页。
- 贝叶斯分类器学习方式:给定带标签的训练样本,可以采用监督式学习技术训练先验概率和观测似然:;注意:贝叶斯分类器所需学习的先验概率和观测似然都是针对单独的每个类;而言。;参数化方法:给定概率分布的解析表达(例如,高斯),学习(估计);这些解析表达式中的参数(例如,高斯分布的均值和协方差)。该类;方法也称为参数估计。;非参数化方法:概率分布形式未知,基于概率密度估计技术,估计非;参数化的概率分密度表达。。出处:
机器学习zdh-3.2.pdf,第 3 页。
- 参数化方法:假设观测似然是高斯分布,需要估计的参数为:;假设是二分类,训练样本有N1+N2=N个,先验概率需要估计的参数为P:;常用的两种参数估计方法(监督式):;最大似然估计(Maximum Likelihood Estimation);贝叶斯估计(Bayesian Estimation)。出处:
机器学习zdh-3.2.pdf,第 4 页。
- 设:ωi 类的观测似然函数具有某种确定的函数形式;:θ 是该函数的一个未知参数或参数集。;最大似然估计把θ 当作确定的未知量进行估计。;从ωi 类中独立地抽取N 个样本,;},,,{ 21 N;NX XXX ;1、似然函数;称在参数θ 下观测到的样本集X N 的联合概率密度函数,;,为相对于样本集X N 的θ 的似然函数。;。出处:
机器学习zdh-3.2.pdf,第 5 页。
- 根据已经抽取的N个样本估计这组样本“最可能”来自哪个密度函数。:(“最似”哪个密度函数);也即:要找到一个θ,它能使似然函数 极大化。;θ 的最大似然估计 就是使似然函数达到最大的估计量。;θˆ;ˆ;θ 为一维时的最大似然估计示意图;2、最大似然估计;d θ。出处:
机器学习zdh-3.2.pdf,第 6 页。
- 为便于分析,定义似然函数的对数为::)|(ln)( θθ NXpH ;θ 的最大似然估计是下面微分方程的解:;0)( θ;设ωi 类的概率密度函数有p个未知参数,记为p 维向量:;21 ],,,[ p θ;;)|(ln)|(ln)( θθθ;此时;解以上微分方程即可得到θ 的最大似然估计值。。出处:
机器学习zdh-3.2.pdf,第 7 页。
- 最大似然估计:先验概率估计:先验概率的估计;先验概率的似然函数:给定N个训练样本和𝐶1 类的先验概率P,选取到𝑁1个属;于𝐶1类样本的概率即为先验概率的似然函数,即Binomial分布。;𝑁1是自变量,N是已知的样本个数,P是待学习的参数。;最大似然估计的基本思想:基于所有训练样本构建似然函数作为目标函;数,目标函数以待训练参数为参数。通过最大化似然函数,求解最优的;训练参数。。出处:
机器学习zdh-3.2.pdf,第 8 页。
- Binomial分布:Bernoulli分布:一个事件有两个状态,成功(1)和失败(0),即随机变量x取值是1或;者0。P表示该事件执行一次取值是1的概率。则该事件执行一次、成功的次数𝑥的;分布概率即为Bernouli分布:;Binomial分布:一个事件有两个状态,成功(1)和失败(0)。如果该事件独立的执行;N次,成功次数𝑥的分布概率即为Binomial分布。;N和P是该分布的参数。;P是该分布的参数。。出处:
机器学习zdh-3.2.pdf,第 9 页。
- 最大似然估计:先验概率估计:先验概率估计:给定N 个样本及其标签,最大化先验概率的似然函数,从;而求解得到P 的估计值 𝑃𝑀𝐿。;为了最大化似然函数,首先求似然函数关于参数P 的偏导,并设偏导为0。;最终得到,先验概率的最大似然估计是该类训练样本出现的频率。。出处:
机器学习zdh-3.2.pdf,第 10 页。
- 最大似然估计:高斯分布参数估计:高斯分布参数估计;高斯分布的似然函数:给定一个类高斯分布的两个参数μ和Σ ,可以把属于该类;的所有训练样本的高斯联合分布作为似然函数。;假设该类的各个训练样本之间相互独立;;对于该似然函数, 属于该类的训练样本 𝒙1,…,𝒙𝑁 是自变量,N 是该类的训练;样本个数, 𝜇和𝛴是待学习的参数。。出处:
机器学习zdh-3.2.pdf,第 11 页。
- 最大似然估计:高斯分布参数估计:高斯分布参数估计;分别求似然函数关于两个参数𝜇和𝛴 的偏导,设置偏导等于0。。出处:
机器学习zdh-3.2.pdf,第 12 页。
- 高斯分布参数估计:似然函数关于参数μ的偏导,设置偏导等于0.;可见,高斯分布均值的最大似然估计等于样本的均值。。出处:
机器学习zdh-3.2.pdf,第 13 页。
- 最大似然估计:高斯分布参数估计:似然函数关于参数Σ 的偏导。;可见,高斯分布协方差的最大;似然估计等于样本的协方差。。出处:
机器学习zdh-3.2.pdf,第 14 页。
- 估计偏差与无偏估计:基于高斯观测似然的最大似然估计,通过最大化训练样本的观测似然乘积,;得到对应的均值和协方差的估计值,结果是样本的均值和协方差。;但是,这些参数估计与该高斯分布的真实情况有偏差(bias)吗?。出处:
机器学习zdh-3.2.pdf,第 15 页。
- 定义:如果一个参数估计的期望值是其真值,则该估计称作无偏差估计:(unbiased estimates)。;无偏差估计意味着只要训练样本个数足够多,该估计值就是参数的真实值。;均值的最大似然估计:是无偏差估计!;因为期望值是关于样本 Xi 而言,所以 μ 相当于常数项。。出处:
机器学习zdh-3.2.pdf,第 16 页。
- 补充:期望的定义与运算:针对一个随机变量(或向量)X,其期望(expectation, expected value or;mean)是指 X 在大量实验情况下得到的平均值(average value)。;期望计算属性:;加权平均,权重是X取每个值;时对应的概率。;自变量是随机量的函数g(X)期望:;假设所有样本𝑥𝑖是iid in𝑑𝑒𝑝𝑒𝑛𝑑𝑒𝑛𝑡 𝑎𝑛𝑑 𝑖𝑑𝑒𝑛𝑡𝑖𝑎𝑙𝑑𝑖𝑠𝑡𝑟𝑖𝑏𝑢𝑡𝑖𝑜𝑛𝑠 :。出处:
机器学习zdh-3.2.pdf,第 17 页。
- 估计偏差与无偏估计:协方差的最大似然估计是无偏差吗?;协方差的最大似然估计:有偏差估计!。出处:
机器学习zdh-3.2.pdf,第 18 页。
- 协方差的最大似然估计:偏差是多少?:假设样本之间是独立分布的。。出处:
机器学习zdh-3.2.pdf,第 19 页。
- 协方差的最大似然估计:对于单个维度的偏差值:协方差的最大似然估计略小于实际的协方差。当N足够大时,可以看到做是;一个较好的估计。;协方差的无偏差估计可以修正为:训练样本的协方差*N/(N-1)。出处:
机器学习zdh-3.2.pdf,第 20 页。
- 最大似然估计:总结。出处:
机器学习zdh-3.2.pdf,第 21 页。
- 贝叶斯估计:最大似然估计:将待估计的参数θ当做固定的未知值。;贝叶斯估计:将待估计的参数θ当做概率分布,给定其分布的先验概率和;训练样本,估计参数θ分布的后验概率。;参数估计的目的是估计先验概率和观测似然分布,从而可以计算后验概率。;参数估计是针对如下情况:先验概率或观测似然的分布形式已知,但其中;的参数未知。以观测似然为例,参数估计本质是估计如下条件概率:;假设各个类可以单独估计概率密度,则上述基于参数的观测似然写为:。出处:
机器学习zdh-3.2.pdf,第 22 页。
- 贝叶斯估计:问题描述:假设θ 自己服从一个概率分布:;该概率分布的先验概率已知:;这个先验概率反映了基于现有知识关于该参数θ最初猜测以及关于该参数的;不确定信息。;基于𝐶𝑖类的训练样本,针对θ应用贝叶斯理论,得到其后验概率:;可见分母的归一化因子跟θ无关。;由于样本之间相互独立,可以得到:;两个假设:;针对每个类各自单独估计其概率分布。。出处:
机器学习zdh-3.2.pdf,第 23 页。
- 假设每类的观测似然分布是单维高斯分布,:且方差𝜎2已知,则θ就只是未知参数均值𝜇。;假设θ的先验概率分布也服从单维高斯;分布,猜测该分布的均值𝜇0和方差𝜎0 :;贝叶斯估计:单维高斯参数分布。出处:
机器学习zdh-3.2.pdf,第 24 页。
- 基于θ的先验概率和该类的训练样本,计算后验概率密度::省略与θ无关的项:;贝叶斯估计:单维高斯参数分布。出处:
机器学习zdh-3.2.pdf,第 25 页。
- 贝叶斯估计:单维高斯参数分布:可见,该公式是二次exp函数,可以把θ的后验概率写作高斯分布的形式:;对比上述两个公式,可以得到:;m是样本均值。出处:
机器学习zdh-3.2.pdf,第 26 页。
- 贝叶斯估计:单维高斯参数分布:由上述两个公式解出𝜇𝑁 和𝜎𝑁 :;m是样本均值;可见,给定该类的N个样本,参数θ概率分布的均值等于样本均值和该参数先验;概率均值的加权和。;给定该类的N个样本,参数θ概率分布的方差是由该类观测似然分布的方差、该;参数的先验概率方差、样本个数共同决定。。出处:
机器学习zdh-3.2.pdf,第 27 页。
- 贝叶斯估计:单维高斯参数分布:当该类的训练样本个数N非常大时,会发生什么?;当N足够大时,样本均值就是均值参数θ的无偏估计。。出处:
机器学习zdh-3.2.pdf,第 28 页。
- 贝叶斯估计:单维高斯参数分布:贝叶斯学习:贝叶斯估计具备不断学习的能力,它允许最初的、基于少量训练样;本的、不太准的估计,随着训练样本的不断增加,可以串行的不断修正参数的估;计值,从而达到该参数的期望真值。;极值情况:;如果参数的先验方差𝜎0 = 0,则𝜇𝑁 → 𝜇0 ,意味着先验的确定性会强大,使得;后续训练样本的不断进入也不太可能对参数估计有太多改变。;如果参数的先验方差𝜎0 ≫ 𝜎,则𝜇𝑁 → 𝑚,意味着先验的确定性会非常小,使;得刚开始的参数估计不准,因为训练样本个数太少。。出处:
机器学习zdh-3.2.pdf,第 29 页。
- 贝叶斯估计:Class-conditional Density:最后,根据贝叶斯估计得到的参数后验概率分布,计算该类的class-conditional;density,即观测似然与参数联合分布的边际(marginal)概率:;可见,观测似然的边缘(marginal)概率可以看做是高斯分布:。出处:
机器学习zdh-3.2.pdf,第 30 页。
- 贝叶斯估计:观测似然分布的最终估计:贝叶斯估计是估计观测似然的边缘概率,即考虑观测似然分布和其参数分;布的联合概率,把参数看做参数空间的一个概率分布:;最大似然估计只是估计给定参数情况下的观测似然的分布,不考虑参数的;分布情况,只是把参数看做参数空间的一个固定的点:;𝜇𝑁随着样本个数的逐渐增大,趋近与真实均值;在已知的方差𝜎上加入𝜎𝑁 ,;代表对于未知均值𝜇的不确定性。;样本个数逐渐增大时,贝叶斯估计越来越能代表真实的观测似然分布:。出处:
机器学习zdh-3.2.pdf,第 31 页。
- 贝叶斯估计:总结:贝叶斯估计(学习):不仅仅只是估计参数的分布,最终估计是的观测;似然和参数的联合分布的边缘概率。;给定量:观测似然分布的形式、参数的先验概率、训练样本。;贝叶斯估计的步骤:;1.估计参数的后验概率:;2.估计观测似然的边缘概率:。出处:
机器学习zdh-3.2.pdf,第 32 页。
5. 机器学习zdh-4
- 线性判据。出处:
机器学习zdh-4.pdf,第 1 页。
- 如果有一个样本集,它的各个类别样:本的分布区域相交,那么肯定是线性;不可分的;如果各个类别样本的分布;区域互不相交,并且都是凸集,那么;它一定是线性可分的。;如果虽然各个类别样本的分布区域不;相交,但是有的区域是凹集,我们还;无法直接判定样本集是否线性可分。。出处:
机器学习zdh-4.pdf,第 3 页。
- 如果同一类别样本的分布区域是由不连通的子区域组成的,也会带来:线性不可分的问题。;典型案例:异或问题。。出处:
机器学习zdh-4.pdf,第 4 页。
- 有判别函数G1(x),当G1(x)>0时,样本属于w1类,当G1(x)<0时,样本不属:于w1类。就是说,G1(x)=0这条线性分类决策边界,可以划分对于w1类的正;样本和负样本。;对于w2类和w3类,也同样有对应的线性判别函数G2(x)和G3(x)。;但该方法带来的不可识别区域很多,整体分类器的性能并不好。。出处:
机器学习zdh-4.pdf,第 5 页。
- 例 已知di(X)的位置和正负侧,分析三类模式的分布区域。:— 0)(1 =Xd。出处:
机器学习zdh-4.pdf,第 6 页。
- G12(x)>0,G31(x)<0时,我们可以唯一地判定样本属于w1类。此时与:w1类无关的两两判别函数G23(x)的值不会影响我们的分类决策结果。;两两可分的多分类线性判别,不可识别区域比绝对可分的情况大大减少。;k个类别需要 k(k-1)/2 个判别函数。。出处:
机器学习zdh-4.pdf,第 7 页。
- 例 已知 dij(X) 的位置和正负侧,分析三类模式的分布区域 。。出处:
机器学习zdh-4.pdf,第 8 页。
- 在“最大值可分”中,样本集中的每个类别对应有一个判别函数,:而一个样本将被划分到取值最大的那个判别函数所对应的类别中。。出处:
机器学习zdh-4.pdf,第 9 页。
- ( ) 0)( 21 = XX dd:( ) 0)( 31 = XX dd;( ) 0)( 32 = XX dd;例 已知判决界面的位置和正负侧,分析三类模式的分布区域。。出处:
机器学习zdh-4.pdf,第 10 页。
- =:=;例 一个三类模式(M=3)分类器,其判决函数为:;试判断X0=[1,1]T属于哪一类,且分别给出三类的判决界面。;解:①;w;;;;==。出处:
机器学习zdh-4.pdf,第 11 页。
- 012)()( 121 == xdd XX:02)()( 2131 == xxdd XX;==;)()( 1331 XX dd =;)()( 2332 XX dd =;类的判决函数:;判决界面如图所示。;( ) 0)( 21 = XdXd;( ) 0)( 31 = XdXd;( ) 0)( 32 = XdXd。出处:
机器学习zdh-4.pdf,第 12 页。
- 线性判据:概述:判别模型:;线性判据(linear discriminants):如果两个类之间的边界可以由一个线性函;数表达,则该线性函数就是这两个类的线性判据。;学习过程:已知labeled训练样本,估计线性判据函数参数𝜔, 𝜔0 。;分类过程:将测试模式𝑥带入线性判据函数,判断函数值。;对于二分类情况的判别:;注意:线性判据不仅限于二类分类,也可以用于多类分类。。出处:
机器学习zdh-4.pdf,第 13 页。
- 线性判据的几何示意::线性判据的学习方法:;1)Trial and error:;枚举所有的可能性;Guess with learning:猜测与学习结合;2)优化一个目标函数;线性判据的优势:;计算量少:在学习和分类过程中,线性判据方法都比基于概率分布的;生成模型方法的计算量少。;适用于训练模式较少的情况。此时很难准确估计概率分布。。出处:
机器学习zdh-4.pdf,第 14 页。
- 线性判据:几何解释:𝑤垂直于分类边界上的任何向量:在决策(分类)边界上找两个点𝑥1和𝑥2 可得;可见,𝒘垂直于决策边界上的任何向量,;即𝒘垂直于决策边界H,是H的法向量。;𝒘的作用:决定了决策边界H的方向。。出处:
机器学习zdh-4.pdf,第 15 页。
- 线性判据:几何解释:根据点积和投影的关系:;给定任意一对𝐶1和𝐶2类样本𝒙1和𝒙2。;则可以看出:𝒙1在𝒘上的投影总是大于;𝒙2在𝒘上的投影:;𝐰𝑇𝒙1 > 𝐰𝑇𝒙2,;∀𝒙1 ∈ 𝐶1, 𝒙2 ∈ 𝐶2;需要找到一个合适的𝑤0,使得:;𝑔 𝒙1 > 0, 𝑔 𝒙2 < 0;𝑤0决定了决策边界的偏移量,使其能够满足两个类输出值分别为正负。。出处:
机器学习zdh-4.pdf,第 16 页。
- 线性判据:几何解释:给定𝑥𝑝表示任意样本𝑥投影到决策边界的点, 𝑟表示从𝑥到𝑥𝑝(即到决策;边界)的距离(有正负),则𝑥可以重新表达为:;距离𝑟的绝对值可以作为confidence;score:值越大,这个点属于正类或者负类的;程度越大。;g(𝒙)是样本𝒙到决策面𝐻的代数距离度量。。出处:
机器学习zdh-4.pdf,第 17 页。
- 如果𝑟0 表示从𝑥𝑝(分类边界)到坐标原点𝑥0 = 0的距离,则𝑟0等于::可见,𝑤0决定分类边界相对于坐标原点的位置,𝑤决定分类边界的方向。。出处:
机器学习zdh-4.pdf,第 18 页。
- 线性判据的学习:解区域。出处:
机器学习zdh-4.pdf,第 19 页。
- 线性判据的学习:概述:线性判据的参数不是只有一个解,学习算法就是要从求解区域中找到一个最优解。;参数的每个可能解相当于是参数空间的一个点(向量)。;解域(solution region):在参数空间内,参数的所有可能解所处的范围。;如果是两类(正负类)分类,将负类的输出值取反,则得到:;每个训练样本𝑦𝑖在参数空间定义了一个通过原点、且垂直于𝑦𝑖的超平面。;给定N个训练样本,参数向量𝑎的解域位于N个超平面正半部分的交集。;Four training;samples (black;for 𝐶1, red for 𝐶2)。出处:
机器学习zdh-4.pdf,第 20 页。
- 线性判据的学习:目标函数:线性判据的学习过程:;线性判据的参数不是只有一个解,学习算法就是要从求解区域中找到;一个最优解。;设计目标函数:目标函数反映如何实现有效决策(分类)的核心思想。;常见的目标函数:训练误差、交叉熵……;加入正则项(约束条件),提高泛化能力。出处:
机器学习zdh-4.pdf,第 21 页。
- 线性判据的学习:目标函数:求解目标函数:最小化/最大化目标函数;解析求解:求关于训练参数的偏导(梯度),并设置偏导为0.;梯度下降法:先猜测参数初始值,然后不断的根据当前梯度迭代更新参数。;拉格朗日乘数法:约束优化问题(带约束条件);矩阵特征值/奇异值分解法。。。。。。;常见的线性判据学习算法:;感知机、Fisher判据、Logistic判据、支持向量机。出处:
机器学习zdh-4.pdf,第 22 页。
- 线性判据的学习:约束条件:此外,可以在学习算法中加入约束条件,提高泛化能力。;例如,在两类线性判据中,加入边缘(margin)约束𝑏,得到如下约束条件:;加入约束后,使得解域范围收缩。;沿着每个样本向量𝒙𝑖方向的收缩距离为:;| 𝒙𝑖 |。出处:
机器学习zdh-4.pdf,第 23 页。
- 感知机算法:感知机算法(perceptron algorithm);0)( wxwxd T =;wa T=;;=;= )( ,1 ,;则设;将线性判据函数表达为:;要根据labeled训练样本,来估计(学习)函数参数:。出处:
机器学习zdh-4.pdf,第 24 页。
- 预处理的几何解释:在几何上,通过在特征空间上增加一个维度,使得决策边界可以通过;原点(𝑤0项)。;两个类之间;的超平面;翻转𝐶2类的样本:得到一个平面使得所有样本位于该平面同一侧。。出处:
机器学习zdh-4.pdf,第 25 页。
- 感知机:解域:满足𝒂𝑇𝒚 > 0的参数𝒂不止一个。如何从解域里找到最优解?;域 𝑎1𝑎2;𝐽(𝒂)。出处:
机器学习zdh-4.pdf,第 26 页。
- 并行感知机:并行感知机算法:定义一个目标函数,通过优化该目标函数来求解a。;我们知道学习后的感知机应该满足:;偏导不含有a,所以不能简单的通过设置偏导为0来求解a。; 0| ,)( == ;yayYyaaJ T;=;取目标函数关于a的偏导:;意味着两个类的输出值都应为正数。;目标函数:被错误分类的训练样本输出值之和取反。(根据几何意义,输出。出处:
机器学习zdh-4.pdf,第 27 页。
- 并行感知机:梯度下降法:使用梯度下降法:使用当前梯度值迭代更新参数。;注意:通常参数a是多维向量,梯度也是多维向量。梯度下降法的更新操作;是每个维度各自独立进行的。;更新的方向(正负):在当前参数取值𝑎𝑘下,每个维度的梯度反方向就是该;维度往目标函数最小值收敛的最速下降方向(steepest descent)。;更新的大小:每个维度的梯度幅值代表参数在该维度上的更新程度。;通常加入步长(𝜂𝑘)来调整更新的幅度。每次迭代可以用不同的步长。。出处:
机器学习zdh-4.pdf,第 28 页。
- 并行感知机算法:如果设步长为1,可以得到:;= )(; 0|)( ,;1 == yayaYyaa T;其中:;使用最速下降(steepest descent)算法。;在ak点下降;最快的方向;步长。出处:
机器学习zdh-4.pdf,第 29 页。
- 并行感知机:梯度下降法算法流程:并行感知机算法流程:;初始化参数:𝑎0, 𝜂(∙),𝜃;迭代更新:基于当前梯度更新参数a,然后基于新参数更新训练误差(同时也是;更新了错误分类样本集合𝑌𝑘 )。;判断停止条件:所有训练样本的输出值都大于0,或者更新值小于阈值𝜃。;假设我们取初始权向量为0 向量,;显然所有的样本都将被错分。若取;调整步长为1 ,下一步的w(1),就;等于0 向量加上所有样本的向量和。。出处:
机器学习zdh-4.pdf,第 30 页。
- 串行感知机:串行感知机:训练样本是一个个串行给出的,称作fix-increment感知机。;目标函数:如果当前样本是错误分类了,则以它的输出值取反作为目标函数。否则,;目标函数是0.;最小化目标函数:取关于参数向量a的偏导;梯度下降法:给定当前训练样本𝑦𝑘,就用当前梯度值更新一次参数。直至所有;训练样本都被正确分类。。出处:
机器学习zdh-4.pdf,第 31 页。
- 串行感知机:参数更新过程图示:取初始权向量为0向量,依次;处理a、b、c三个样本。。出处:
机器学习zdh-4.pdf,第 32 页。
- (1)选择N个分属于ω1和 ω2类的模式样本构成训练样本集{ X1, …, XN },:构成增广向量形式,并进行规范化处理。任取权向量初始值W(1),开始;迭代。迭代次数k=1 。;(2)用全部训练样本进行一轮迭代,计算WT(k)Xi 的值,并修正权向量。;分两种情况,更新权向量的值:;分类正确时,对权向量“赏”——即“不罚”,即权向量不变;;分类错误时,对权向量“罚”——即修改,向正确的方向转换。;感知机算法是一种赏罚过程:。出处:
机器学习zdh-4.pdf,第 33 页。
- c:正的校正增量。:分类器对第i个模式做了错误分类,;( ) ,若 0≤T;( ) ( ) ickk XWW +=1+;权向量校正为:;( ) ( )kk WW =1+;统一写为:;分类正确,权向量不变:;( ) ,若 0>T;( ) ick XW +。出处:
机器学习zdh-4.pdf,第 34 页。
- 收敛:经过算法的有限次迭代运算后,求出了一个使所有样本都能正确:分类的W,则称算法是收敛的。;收敛条件:模式类别线性可分。;例 已知两类训练样本;解:所有样本写成增广向量形式;;进行规范化处理,属于ω2的样本乘以(-1)。; ;3 1,0,1 =X;4 1,1,1 =X;用感知器算法求出将模式分为两类的权向量解和判别函数。。出处:
机器学习zdh-4.pdf,第 35 页。
- 任取W(1)=0,取c=1,迭代过程为::第一轮:; 0,;0,0,0)1( 1; ;1 1,0,0)1()2(,0 == XWW故; 1,;1,0,0)2( 2;1,0,0)2()3(,0 == WW故; -1,。出处:
机器学习zdh-4.pdf,第 36 页。
- :T 1,0,1-)5()6(,00)5( === XWWXW 故;T 1,0,1-(6))7(,01)6( === WWXW 故;T 0,0,2-)7()8(,00)7( === XWWXW 故;T 0,0,2-)8()9(,02)8( === WWXW 故;第二轮:;T 1,0,2-)9()10(,00)9( === XWWXW 故;(10))11(,01)10( 2;T WWXW == 故;)11()12(,01)11( 3。出处:
机器学习zdh-4.pdf,第 37 页。
- :该轮迭代的分类结果全部正确,故解向量;12-)( 1 = xd X;相应的判别函数为:;当c、W(1)取其他值时,结果;可能不一样,所以感知器算法;的解不是单值的。;判别界面d(X)=0如图示。;( ) 012 1 == xd X。出处:
机器学习zdh-4.pdf,第 38 页。
- 感知机算法:感知机是由Frank Rosenblatt在1957年提出,是人工神经网络的创立者。;感知机是单个神经元的雏形。;当两个类是线性可分时,可以保证算法收敛性。。出处:
机器学习zdh-4.pdf,第 39 页。
- Frank Rosenblatt vs. Minsky:Hebb在1949年出版的《行为的组织》中提出了其神经心理学理论。Hebb认为神经网络;的学习过程最终是发生在神经元之间的突触部位,突触的联结强度随着突触前后神经元的;活动而变化,变化的量与两个神经元的活性之和成正比;康奈尔航空实验室心理学家Frank Rosenblatt 受到这种思想的启发,提出了感知机,并;认为其足以创造一个可以学会识别物体、能够识别出人并叫出他们的名字,立即把演讲内;容翻译成另一种语言并写下来的机器。;但是1969年,Minsky 和Papert所著的《Perceptron》一书出版,该书从数学角度证明;了关于单层感知器的计算具有根本的局限性,甚至连XOR这样的问题也不能解决,神经网;络进入了萧条期。。出处:
机器学习zdh-4.pdf,第 40 页。
- 感知机算法是首个采用误差反馈学习规则来是实现的机器学习算法。:它模拟人类学习的试错过程,不是希望计算机能够一次学会复杂的逻辑推;理,而是通过一个形式确定但是参数不确定的模型来逐步逼近真实存在的;客观规律,所以对后世产生了深远的影响。;一直到现在热门的深度学习,从根本上仍然是以有监督的误差反馈学习为;核心,当然,其分类器的模型和学习信号的设计,又比感知器有了更多的;进步。;感知机算法。出处:
机器学习zdh-4.pdf,第 41 页。
- Fisher线性判据:线性判据的模型可以看做是把原空间;各点𝑥投影到新的一维空间𝑦 。;𝑤 的方向不同,对应不同的投影结果。;怎么 样学习𝑤 ,使得二类可以有效分开。。出处:
机器学习zdh-4.pdf,第 43 页。
- Fisher线性判据:目标函数:理想情况下,线性判据函数应该能够最大化类之间;(inter-class)的变化,而同时最小化类内部(intra;class)的变化。;该目标函数不仅提供最佳分类,同时保证类的紧凑性。;类间样本的差异程度:用两类样本分布的均值;之差度量。;类内样本的离散程度:用每类样本分布的协方;差矩阵表征。。出处:
机器学习zdh-4.pdf,第 44 页。
- 给定如下线性判据函数::目标函数定义如下:在投影轴w上。出处:
机器学习zdh-4.pdf,第 45 页。
- 最大化该目标函数::首先计算目标函数中的每一项:;带入目标函数,可以得到目标函数的新表达:;wmmmmwwJ TT;=。出处:
机器学习zdh-4.pdf,第 46 页。
- Fisher线性判据:求解:作如下定义:;:scatter) class(within;))((:scatter) class(between;=;类内散度;类间散度;目标函数写为:;==;=。出处:
机器学习zdh-4.pdf,第 47 页。
- Fisher线性判据:求解:=;210 mxSmmwxwxd W;FLD == ;求解最优的w:不需求解特征值。;最终得到Fisher线性判据:;选取w0:;是所有样本的均值mmww T ,0 =;(将所有样本的均值;投影到坐标原点)。出处:
机器学习zdh-4.pdf,第 48 页。
- Fisher线性判据:协方差𝑆𝑤的作用:决策边界为过点𝑚,斜率为((𝑚1−𝑚2)𝐒𝑤−1的超平面。;没有过点;𝑚1+𝑚2;协方差𝐒𝑤的作用:在几何上,𝐒𝑤−1旋转向量(𝑚1−𝑚2),以考虑类分布的形状。。出处:
机器学习zdh-4.pdf,第 49 页。
- Fisher线性判据:几何解释:根据两个向量点积的几何含义,线性判据是将样本𝑥投影到𝑤,并判断投影;值是否大于−𝑤0 实现分类。;所以,Fisher判据可以看做监督式学习的降维计算,降维的目的是提高分;类性能。;所以,Fisher判据首先希望两个类的均值在𝑤上的投影距离越大越好。。出处:
机器学习zdh-4.pdf,第 50 页。
- 但是,原先在多维特征空间可分的两个类的样本,投影到一维轴w上后,会:出现两类样本重叠。;这是由于两类样本分布形状(通过协方差矩阵非对角线体现)决定的。;所以,Fisher判据希望两个类的类内方差尽量的小,从而降低重叠度。;Fisher线性判据:几何解释。出处:
机器学习zdh-4.pdf,第 51 页。
- 对W求偏导:Fisher线性判据:多类分类;可以基于前述的三种多类分类思想实现。也可以重新设计针对多类的目标函数实现。;要实现多类(K个类)的分类,就需要多个线性判据。假设需要M个线性判据,即把训练样本;分别投影到M条w轴上:𝑤1, 𝑤2,…, 𝑤𝑀。;新目标函数中的类内散度𝑆𝑤在投影空间的定义为:;新目标函数定义:最大化类间散度,同时最小化类内散度。;新目标函数中的类间散度𝑆𝐵在投影空间的定义为:;由于有多个投影轴,;在投影空间的类间散。出处:
机器学习zdh-4.pdf,第 52 页。
6. 机器学习zdh-5
- 于元隆、朱丹红。出处:
机器学习zdh-5.pdf,第 1 页。
- 线性判据:——支持向量机。出处:
机器学习zdh-5.pdf,第 2 页。
- 支持向量机:设计动机:如果两个类是线性可分的,则存在着多个线性决策平面用作决策边界。;感知机从最小化分类误差角度来设计。;Fisher线性判据首先降维到一维空间,从最大化类间距离同时最小化类内;散度的角度来设计。;如何拥有更好的泛化性能?。出处:
机器学习zdh-5.pdf,第 3 页。
- 支持向量机:设计动机:如果两个类是线性可分的,则存在着多个线性决策平面用作决策边界。;感知机从最小化分类误差角度来设计。;Fisher线性判据首先降维到一维空间,从最大化类间距离同时最小化类内;散度的角度来设计。;如何拥有更好的泛化性能?。出处:
机器学习zdh-5.pdf,第 4 页。
- 假设:有N个训练样本和标签::𝑥𝑖属于𝐶1 𝑥𝑖属于𝐶2。出处:
机器学习zdh-5.pdf,第 5 页。
- 线性可分的向量形式定义::如果一个数据集是线性可分的,存在多少个超平面将各个类别分开?。出处:
机器学习zdh-5.pdf,第 6 页。
- 假设训练样本的位置在特征空间上有测量误差::2号线更能抵御训练样本位置的测量误差。。出处:
机器学习zdh-5.pdf,第 7 页。
- 怎样画出2号线?基于最优化理论。:间隔(𝑀𝑎𝑟𝑔𝑖𝑛)最大的是2号线。;Vladimir Vapnik。出处:
机器学习zdh-5.pdf,第 8 页。
- 哪种方式得到的间隔最大?。出处:
机器学习zdh-5.pdf,第 9 页。
- 使用𝑀𝑎𝑟𝑔𝑖𝑛最大还不能唯一确定一条直线。:这条线应在平行线的中间。。出处:
机器学习zdh-5.pdf,第 10 页。
- 支持向量机:设计思想:支持向量机寻找的最优分类直线(决策边界)应满足:;(1)该直线分开了两类;;(2)该直线最大号间隔;;(3)该直线处于间隔的中间,两个类中与决策边界最近的训练样本;到决策边界之间的间隔最大。;高维空间中,直线==超平面;寻找最优分类超平面==最优化问题。出处:
机器学习zdh-5.pdf,第 11 页。
- 间隔的数学定义::在两个类的训练样本中,分别找到与决策边界最近的两个训练样本,;记作𝒙+和𝒙− 。;𝒙+和𝒙−到决策边界的垂直距离叫作间隔,记作𝑑+和𝑑− 。;间隔的数学定义。出处:
机器学习zdh-5.pdf,第 12 页。
- 决策边界记作,平行于且分别通过𝒙+和𝒙−的两个超平面记作+和-,称:为间隔边界。;没有任何训练样本落在这两个超平面中间的间隔区域。;位于超平面+和-上的样本被称为支持向量(Support vector)。;支持向量在确定决策边界中起到核心作用。;支持向量的概念;支持向量;类 1间隔;总间隔。出处:
机器学习zdh-5.pdf,第 13 页。
- 在支持向量机中,正负类训练样本输出真值分别用+1和-1来表达。:给定标记过的训练样本 (𝒙𝑛, 𝑡𝑛) ,线性分类器可以表达为:;加入间隔的概念,引入一个正常数Δ,分类器进一步表达为:;意味着没有训练样本;落在±Δ间隔范围内。;分类器重新表达。出处:
机器学习zdh-5.pdf,第 14 页。
- 分类器新的表达中,什么时候等式成立呢?:支持向量机:支持向量;当𝒙𝑛是支持向量时,等式成立,例如, 𝒙+和𝒙−。;支持向量;类 1间隔;总间隔。出处:
机器学习zdh-5.pdf,第 15 页。
- 根据线性判据的几何含义,点𝒙+到决策边界的距离为::支持向量机:间隔计算;所以,总间隔为:;支持向量;类 1间隔;总间隔;由于𝒙+和𝒙−是位于间隔边界的支持向量,可以得到:。出处:
机器学习zdh-5.pdf,第 16 页。
- 支持向量机(support vector machine, SVM)的目标:最大化总间隔。:支持向量机:目标函数;最大化间隔,等价于最小化| 𝒘 |,所以目标函数设计为:;同时满足如下约束条件:;当xn位于超平面+和-上时,该约束条件等于0,其余情况都为大于0。;该目标函数是条件优化问题(Constrained Optimization)。;目标函数自变量为𝒘,是关于𝒘的二次型函数。约束条件是关于𝒘的;仿射函数(线性函数)。。出处:
机器学习zdh-5.pdf,第 17 页。
- 拉格朗日乘数法。出处:
机器学习zdh-5.pdf,第 18 页。
- 条件优化问题:支持向量机的目标函数是一个条件优化问题(Constrained Optimization)。;拉格朗日乘数法(Lagrange Multiplier)是常用的解决该类问题的方法。;不等式约束优化问题;可行域(Feasible region):;𝑔 𝑥 ≤ 0的区域。;等式约束优化问题;可行域:𝑔 𝑥 = 0的区域。;𝑓(𝒙)的等高线(contour);条件优化求解。出处:
机器学习zdh-5.pdf,第 19 页。
- 拉格朗日乘数法:等式约束:等式约束优化求解思路;函数在等高面上任意一点的梯度方向与其;等高面(切线方向)正交,且朝向(即正;方向)函数值较高方向。;𝑓(𝒙)的极值点𝒙∗必须位于曲线𝑔 𝒙 = 0上。;搜寻极值点𝒙∗:沿着𝑔 𝒙 = 0的切线方向、;向着𝑓 𝒙 负梯度方向移动。当出现沿着切;线方向、无法再向𝑓 𝒙 负梯度方向移动时;停止。。出处:
机器学习zdh-5.pdf,第 20 页。
- 等式约束:拉格朗日函数:拉格朗日函数;因此,存在一个𝜆 ≠ 0,使得:𝑓(𝒙)与𝑔(𝒙)的梯度记作𝛻𝑓(𝒙)和𝛻𝑔(𝒙) 。;𝜆:拉格朗日乘子(可正可负),无符号限制。;由此,可以定义一个拉格朗日函数:;拉格朗日函数满足驻点(stationary point)条件和约束条件:。出处:
机器学习zdh-5.pdf,第 21 页。
- 等式约束:等价优化问题:等价优化问题;因此,因等式约束问题可以转换为等价的不带约束的优化问题:。出处:
机器学习zdh-5.pdf,第 22 页。
- 拉格朗日乘数法:不等式约束:可行域;情况1:极值点落在可行域内;假设极值点𝒙∗落在了可行域内(不含边界),即;极值点位于区域𝑔 𝒙 < 0范围内。;这种情况下,约束条件不起作用。;直接通过𝛻𝑓 𝒙 = 0获得极值点。;此时,在极值点𝒙∗上:;这种情况相当于在拉格朗日函数中设置𝜆 = 0 :;从而满足驻点条件且𝜆 = 0 :。出处:
机器学习zdh-5.pdf,第 23 页。
- 拉格朗日乘数法:不等式约束:情况2:极值点落在可行域边界;假设极值点落在了可行域边界,即极值点位于;区域𝑔 𝒙 = 0区域。;搜寻极值点𝒙∗:当出现沿着𝑔 𝒙 = 0切线方向;、无法再向𝑓 𝒙 负梯度方向移动时停止。在该;点, 𝑓(𝒙)等高线与𝑔 𝒙 = 0相切,该点为𝑓(𝒙);的极值点𝒙∗ 。;对于不等式约束,在极值点𝒙∗,𝑓 𝒙 与𝑔 𝒙 的;负梯度方向平行且相反。。出处:
机器学习zdh-5.pdf,第 24 页。
- 拉格朗日乘数法:不等式约束:综合两种情况;无论是𝑔 𝒙 < 0(𝜆 = 0)还是𝑔 𝒙 = 0(𝜆 >;0)的约束情况,始终存在一个𝜆 ≥ 0(对偶可;行性),满足:;同时,始终存在一个𝜆 ≥ 0,满足驻点条件:。出处:
机器学习zdh-5.pdf,第 25 页。
- 不等式约束:KKT条件:KKT条件&等价优化问题;在𝑔 𝒙 ≤ 0约束条件下最小化𝑓(𝒙)的问题,可以转化为如下约束条件;(KKT条件)下的拉格朗日函数优化问题:;Karush-Kuhn-Tucker;(KKT) 条件。出处:
机器学习zdh-5.pdf,第 26 页。
- 拉格朗日乘数法:多个约束:KKT条件&等价优化问题;在多个约束条件下最小化𝑓(𝑥)的问题,转化为KKT条件下的拉格朗日;函数优化问题:。出处:
机器学习zdh-5.pdf,第 27 页。
- 拉格朗日对偶问题。出处:
机器学习zdh-5.pdf,第 28 页。
- 拉格朗日乘数法:主问题:主问题(Primal Problem);根据原问题的约束条件 ,对于𝛾𝑗的任意取值,拉格朗日函数;第三项都可以消去。;根据原问题的约束条件 ,对于𝜆𝑖>0的任意取值,使得;可见,拉格朗日函数𝐿(𝒙, 𝚲, 𝚪)关于𝚲, 𝚪的最大值就是𝑓(𝒙)。;主问题:带约束的原问题等价于如下(关于𝒙的)无约束问题。;注意: 𝝀 的约束依然存在。;𝜆𝑖 ≥ 0。出处:
机器学习zdh-5.pdf,第 29 页。
- 主问题如何求解?:针对不等式约束,主问题难以求解;𝜆𝑖求𝐿偏导并设偏导等于0:;偏导中不含有𝜆𝑖,无法解析得到最优的𝜆𝑖;根据KKT条件,如果要求𝑔𝑖 𝑥 = 0,则𝜆𝑖 > 0,但无法确定最优值。。出处:
机器学习zdh-5.pdf,第 30 页。
- 主问题难以求解或者是NP难问题,如何解决?:拉格朗日对偶函数;取拉格朗日函数关于𝒙在其可行域内的最小值,记作𝐿𝐷:;对偶函数𝐿𝐷是关于𝚲 > 0和𝚪的函数,与𝒙无关。;对偶变量: 𝚲和𝚪。;主变量:𝒙 。。出处:
机器学习zdh-5.pdf,第 31 页。
- 主问题最优值的下界:对偶函数是主问题的最优值下界;针对可行域𝑅内的任意𝒙,对任意𝚲 > 0和𝚪,都存在;因此可以得到:;设主问题的最小值是𝑝∗ = 𝑓(𝒙∗),则得到;可见,对偶函数𝐿𝐷给出了主问题最优值的下界。;该下界只跟对偶变量𝚲和𝚪有关,与𝒙无关。。出处:
机器学习zdh-5.pdf,第 32 页。
- 主问题最优值的下界:实线:目标函数𝑓(𝑥)。;虚线:约束函数𝑔(𝑥),𝑥的可行域为[-0.46,0.46],最优点为𝑥∗=-0.46, 𝑝∗=1.54;点线:取不同𝜆值(𝜆 = 0.1,0.2, … , 1.0)的拉格朗日函数𝐿(𝑥, 𝜆)。由于𝐿(𝑥, 𝜆) ≤ 𝑓(𝑥∗),;每条曲线都有一个最小值小于𝑝∗。。出处:
机器学习zdh-5.pdf,第 33 页。
- 对偶问题:对偶问题(Dual Problem);针对𝚲 > 0和𝚪,最大化对偶函数𝐿𝐷,得到主问题的对偶问题:;首先求取𝐿关于𝒙的最小值(下界),再求取下界关于𝚲, 𝚪的最大值。;主问题。出处:
机器学习zdh-5.pdf,第 34 页。
- 对偶函数的凹凸性:对偶函数:分析;为什么要建立对偶问题?;对偶函数是以𝚲和𝚪为自变量的、与𝒙无关。;因此,里面的拉格朗日函数𝐿看做关于对偶变量𝚲和𝚪的仿射组合。;对偶函数𝐿𝐷则是拉格朗日函数𝐿的逐点(pointwise)最小值函数。。出处:
机器学习zdh-5.pdf,第 35 页。
- 对偶函数的凹凸性:最小值函数的凹凸性;可见,逐点(pointwise)最小值函数min是凹函数。。出处:
机器学习zdh-5.pdf,第 36 页。
- 对偶函数的凹凸性:对偶函数是凹函数;由于逐点最大化函数是凹函数,且拉格朗日函数可以看做;关于对偶变量的仿射组合,所以对偶函数𝐿𝐷是凹函数。。出处:
机器学习zdh-5.pdf,第 37 页。
- 对偶函数是凹函数:实线:对偶函数𝐿𝐷(𝜆)是凹函数。由前图可知,𝑓(𝑥)和𝑔(𝑥)都是非凸的。;虚线:最优点𝑝∗=1.54。。出处:
机器学习zdh-5.pdf,第 38 页。
- 对偶问题:凸优化:对偶问题是凸还是非凸?;由于目标函数𝐿𝐷是凹函数,约束条件是凸函数,所以对偶问题是凸优化;问题。;无论主问题的凸性如何,对偶问题始终是一个凸优化问题。;凸优化的性质:局部极值点就是全局极值点。;所以,对偶问题的极值是唯一的全局极值点。;因此,对于难以求解的主问题(例如,非凸问题或者NP难问题),可以;通过求解其对偶问题,得到原问题的一个下界估计。。出处:
机器学习zdh-5.pdf,第 39 页。
- 对偶问题与主问题的差异?:弱对偶性(weak duality);设对偶问题的最优值为𝑑∗、主问题的最优值为𝑝∗无论主问题的凸性如何;,对偶问题始终是一个凸优化问题。;对于所有的优化问题都存在:;强对偶性(strong duality);强对偶性:;如果强对偶性成立,则对偶问题获得主问题的最优下界。。出处:
机器学习zdh-5.pdf,第 40 页。
- 强对偶性成立的条件(Slater条件):如果强对偶性成立,则对偶问题获得主问题的最优下界。;在可行域至少有;一点使得不等式;约束严格成立。;如何使用拉格朗日对偶法求解支持向量机呢?。出处:
机器学习zdh-5.pdf,第 41 页。
- 支持向量机学习算法。出处:
机器学习zdh-5.pdf,第 42 页。
- 支持向量机:目标函数如何求解;带不等式约束的优化问题,使用拉格朗日对偶法求解。;线性判据;支持向量机目标函数;给定标记过的训练样本 (𝒙𝑛, 𝑡𝑛) 𝑛=1,…,𝑁:。出处:
机器学习zdh-5.pdf,第 43 页。
- 构建拉格朗日函数:拉格朗日函数;拉格朗日乘数向量:;KKT条件:。出处:
机器学习zdh-5.pdf,第 44 页。
- 构建对偶函数:对偶函数;𝐿对参数𝑤和𝑤0求导,并设偏导等于0:。出处:
机器学习zdh-5.pdf,第 45 页。
- 构建对偶函数:在极值点计算| 𝑤 |2。出处:
机器学习zdh-5.pdf,第 46 页。
- 构建对偶函数:在极值点计算| 𝑤 |2。出处:
机器学习zdh-5.pdf,第 47 页。
- 构建对偶函数:在极值点得到𝐿𝐷;将上述偏导等于0的结果带入拉格朗日函数,消去𝒘和𝑤0:。出处:
机器学习zdh-5.pdf,第 48 页。
- 构建对偶函数:对偶函数的约束条件;对偶函数是关于𝚲的函数,所以约束条件只需考虑𝚲的相关项。;对偶可行性:对于不等式;约束,构建拉格朗日函数;必须满足对偶可行性条件。;极值点上关于𝝀的约束项:。出处:
机器学习zdh-5.pdf,第 49 页。
- 对偶问题:对偶函数是关于𝚲的函数,所以约束条件只需考虑𝚲的相关项。;得到最优的𝜦。即可得到最优的参数𝒘和𝑤0。。出处:
机器学习zdh-5.pdf,第 50 页。
- 对偶问题的求解:求解对偶问题;这是标准的关于𝜆的二次规划(quadratic programming)问题。;可以调用Matlab提供的quadprog函数来求解。;quadprog函数。出处:
机器学习zdh-5.pdf,第 51 页。
- 支持向量:求解支持向量;用二次规划求解得到最优的𝜦∗,包含𝑁个最优的拉格朗日乘数。;根据KKT条件可知:;该样本位于超平面+和-之外 该样本位于超平面+或-上。出处:
机器学习zdh-5.pdf,第 52 页。
- 参数最优解:𝒘:𝑤最优解;根据找到的支持向量𝒙𝑛以及对应的拉格朗日乘子𝜆𝑛∗ 构建𝒘∗:;其中,𝑁𝑠表示支持向量的个数。。出处:
机器学习zdh-5.pdf,第 53 页。
- 参数最优解:𝒘:𝑤最优解;根据找到的支持向量𝒙𝑛以及对应的拉格朗日乘子𝜆𝑛∗ 构建𝒘∗:;其中,𝑁𝑠表示支持向量的个数。。出处:
机器学习zdh-5.pdf,第 54 页。
- 参数最优解:𝑤0:𝑤0最优解;根据支持向量机定义的约束条件,针对任意一个支持向量𝒙𝑠:;由此得到:;𝑤0通常由所有支持向量取均值得到:。出处:
机器学习zdh-5.pdf,第 55 页。
- 支持向量机:决策过程:如何用于识别决策过程?;给定一个测试模式𝒙𝑡𝑒𝑠𝑡,支持向量机分类器可表达为:;𝒘和𝑤0的学习过程实际上是从训练样本中选择一组支持向量,;并将这些支持向量存储下来,用作线性分类器。。出处:
机器学习zdh-5.pdf,第 56 页。
7. 机器学习zdh-6_3
- 逻辑回归的概念。出处:
机器学习zdh-6_3.pdf,第 1 页。
- 课前线上预习:逻辑回归:;线性和非线性模型之间的桥梁;逻辑回归的概念 -p2。出处:
机器学习zdh-6_3.pdf,第 2 页。
- 课堂练习:逻辑回归的概念 -p3;给定如下数据,用课前编好的程序,训练模型并画出分类决策边界。;4个样本数据:实心是属于类1的样本,空心是属于类2的样本。;任务:异或问题。出处:
机器学习zdh-6_3.pdf,第 3 页。
- 模式识别 逻辑回归的概念 -p4:感知机小故事。出处:
机器学习zdh-6_3.pdf,第 4 页。
- 非线性模型设计思路:假设你是算法设计者,你的思路?;模式识别 逻辑回归的概念 -p5。出处:
机器学习zdh-6_3.pdf,第 5 页。
- 非线性模型设计思路:线性判据;贝叶斯分类器;线性;非线性;模式识别 逻辑回归的概念 -p6。出处:
机器学习zdh-6_3.pdf,第 6 页。
- 课堂练习:按顺序给出图片对应的均值和方差取值。:[填空1] [填空2] [填空3] [填空4] 。;(1) (2) (3) (4);填空题 4分。出处:
机器学习zdh-6_3.pdf,第 7 页。
- 如果观测似然(即每个类的数据分布𝑝(𝒙|𝐶𝑖))是高斯分布:𝒩(𝒙;𝝁𝑖,𝜮𝑖),MAP分类器决策方程为:;非线性的情况;因此,如果两个类别数据分布的协方差矩阵不同 (即Σ𝑖≠Σ𝑗),;则MAP分类器的决策边界是一个超二次型曲面,即非线性。;逻辑回归的概念 -p8;贝叶斯分类器。出处:
机器学习zdh-6_3.pdf,第 8 页。
- 线性的情况:如果两个类别数据分布的协方差矩阵相同(即Σ𝑖=Σ𝑗 ),则;MAP分类器的决策边界是一个超平面,即线性。;逻辑回归的概念 -p9;贝叶斯分类器。出处:
机器学习zdh-6_3.pdf,第 9 页。
- 非线性模型设计思路:贝叶斯分类器可以在线性和非线性之间切换;逻辑回归的概念 -p10。出处:
机器学习zdh-6_3.pdf,第 10 页。
- MAP分类器输出:后验概率:线性判据输出:样本到决策边界的距离;两者之间有什么联系呢?;逻辑回归的概念 -p11。出处:
机器学习zdh-6_3.pdf,第 11 页。
- Logit变换:通过定义Logit变换来建立起;线性判据和贝叶斯分类器之间的联系;逻辑回归的概念 -p12。出处:
机器学习zdh-6_3.pdf,第 12 页。
- Logit变换:对于二类分类,MAP分类器通过比较后验概率的大小来决策。;也可以通过比较两个后验概率的比率来做决策。;后验概率的比率;逻辑回归的概念 -p13。出处:
机器学习zdh-6_3.pdf,第 13 页。
- Logit变换:后验概率比率取log;观测是高斯分布;𝜮1=𝜮2=𝚺;逻辑回归的概念 -p14。出处:
机器学习zdh-6_3.pdf,第 14 页。
- Logit变换:后验概率对数比率 = 线性判据输出;逻辑回归的概念 -p15;得到。出处:
机器学习zdh-6_3.pdf,第 15 页。
- 后验概率是否可以直接由线性判据表达?:逻辑回归的概念 -p16。出处:
机器学习zdh-6_3.pdf,第 16 页。
- Sigmoid函数:设𝑦=𝑓𝒙 =𝒘𝑇𝒙+𝑤0,根据上式可以定义Sigmoid函数:;线性判据𝑓𝒙 放入Sigmoid函数,可得到x属于𝐶1类的后验概率:;逻辑回归的概念 -p17。出处:
机器学习zdh-6_3.pdf,第 17 页。
- 关于Sigmoid函数,如下哪个描述是正确的::是一个以x为自变量、输出范围为[0,1]的函数。;是一个以x为自变量、输出范围为[-1,1]的函数。;是一个以y为自变量、输出范围为[0,1]的函数。;是一个以y为自变量、输出范围为[-1,1]的函数。。出处:
机器学习zdh-6_3.pdf,第 18 页。
- Sigmoid函数:Sigmoid函数:波形;输出值范围:[0,1];函数的自变量:𝑦;逻辑回归的概念 -p19。出处:
机器学习zdh-6_3.pdf,第 19 页。
- Sigmoid函数:小结:Sigmoid函数:连接线性模型和后验概率的桥梁;线性模型𝑓(𝒙) + Sigmoid函数 = 后验概率;逻辑回归的概念 -p20;[1] A. Krizhevsky, I. Sutskever, G. E. Hinton, “ImageNet classification with deep convolutional neural networks”,;in Proceedings of Advances in Neural Information Processing Systems, vol. 60, no.2, pp. 1097-1105, 2012.;[2] K. He, X. Zhang, S. Ren, and J. Sun, “Delving deep into rectifiers: Surpassing human-level performance on。出处:
机器学习zdh-6_3.pdf,第 20 页。
- 逻辑回归:定义;逻辑回归(Logistic Regression):线性模型𝑓(𝒙) + sigmoid函数。;给定测试样本𝒙,Logistic回归输出其属于𝐶1类的后验概率。;逻辑回归的概念 -p21。出处:
机器学习zdh-6_3.pdf,第 21 页。
- 逻辑回归:分类:决策边界;给定两个类,逻辑回归的决策边界仍然是线性的超平面。;逻辑回归的概念 -p22;单个逻辑回归可以用于二类分类,其决策过程如下:。出处:
机器学习zdh-6_3.pdf,第 22 页。
- 分组讨论:逻辑回归分类决策边界是线性,;逻辑回归如何用于非线性分类?;逻辑回归的概念 -p23。出处:
机器学习zdh-6_3.pdf,第 23 页。
- 逻辑回归与非线性:逻辑回归的概念 -p24;分类边界。出处:
机器学习zdh-6_3.pdf,第 24 页。
- 逻辑回归:逻辑回归与神经元;单个逻辑回归就是一个神经元模型:;多层逻辑回归嵌套可应用于非线性分类。;𝒙 𝑔𝒘𝑻𝒙+𝑤0𝒘;其中,函数𝑔是sigmoid函数。;逻辑回归的概念 -p25。出处:
机器学习zdh-6_3.pdf,第 25 页。
- 逻辑回归:逻辑回归本身是一个非线性模型。;逻辑回归用于分类:仍然只能处理两个类别线性可分的情况。但;是,sigmoid函数输出了后验概率,使得逻辑回归成为一个非线性;模型。因此,逻辑回归比线性模型向前迈进了一步。;逻辑回归用于拟合:可以拟合有限的非线性曲线。;总结;逻辑回归的概念 -p26。出处:
机器学习zdh-6_3.pdf,第 26 页。
- 逻辑回归如何学习?:逻辑回归的概念 -p27。出处:
机器学习zdh-6_3.pdf,第 27 页。
- 课后预习与作业:预习MOOC第4.14节课:Logistic学习;编程:基于梯度下降法的Logistic学习算法;逻辑回归的概念 -p28。出处:
机器学习zdh-6_3.pdf,第 28 页。
- 科研实训作业:逻辑回归的概念 -p29;设计逻辑回归模型,实现心脏的心;音分段(正常/异常)。;数据集:;https://www.physionet.org/challenge/2016;编程;[1] D. B. Springer, L. T arassenko, and G. D. Clifford, “Logistic Regression-HSMM-Based Heart Sound;Segmentation”, IEEE Transactions on Biomedical Engineering, vol. 33, no. 4, pp. 822-832, 2016.;[2] E. Adeli, X. Li, D. Kwon, Y. Zhang, and K. M. Pohl, “Logistic Regression Confined by Cardinality-Constrained。出处:
机器学习zdh-6_3.pdf,第 29 页。
- 逻辑回归的学习。出处:
机器学习zdh-6_3.pdf,第 30 页。
- 待学习参数:学什么;给定训练样本,学习参数𝒘和𝑤0。;逻辑回归的学习 -p31。出处:
机器学习zdh-6_3.pdf,第 31 页。
- 针对Logistic学习算法,有关真值设置的描述,如下哪个是正确的::正类的输出真值是1,负类的输出真值是0。;正类的输出真值是1,负类的输出真值是-1。;正类的输出真值可以是任意正数,负类的输出真值可以是任意负数。;正类的输出真值可以是任意正数,负类的输出真值是0。;训练样本真值设置。出处:
机器学习zdh-6_3.pdf,第 32 页。
- 目标函数设计:逻辑回归的学习 -p33;由于输出是概率,如何表达真值的分布?。出处:
机器学习zdh-6_3.pdf,第 33 页。
- 输出真值的概率表达:输出真值:伯努利分布;给定单个输入样本𝒙,模型输出的真值标签𝑙可以看做一个随机变量。;单个训练样本𝒙𝑛放入模型,相当于对随机变量𝑙的一次采样试验(trial),输;出真值标签𝑡𝑛相当于指定此次试验的结果。;该随机变量只有两个取值:1(正类)或0(负类),符合伯努利分布。;伯努利分布(Bernoulli);随机变量𝑥 只有两个取值:成功(1)或失败(0),成功的概率为𝑝 ,失败的概率则为1−𝑝 。;该随机变量𝑥的概率分布即为伯努利分布,可以表达为:;逻辑回归的学习 -p34。出处:
机器学习zdh-6_3.pdf,第 34 页。
- 输出真值的概率表达:逻辑回归的学习 -p35;在逻辑回归中,伯努利分布的参数𝑝怎么设置?。出处:
机器学习zdh-6_3.pdf,第 35 页。
- 输出真值的概率表达:伯努利的参数𝑝的设置;真值𝑙可以看做是伯努利分布。;逻辑回归的学习 -p36;为什么使用模型实际输出的后验概率𝑧来设置参数𝑝 ?。出处:
机器学习zdh-6_3.pdf,第 36 页。
- 例子:逻辑回归的学习 -p37;例1:;输出真值的概率表达;针对样本输入,如果模型输出概率较低,说明模型参数不是最优的。。出处:
机器学习zdh-6_3.pdf,第 37 页。
- 概率𝑧是由模型参数决定的,是待学习的。:输出真值的概率表达;输出真值的概率分布;给定单个输入样本𝒙,模型输出真值𝑙符合伯努利分布。;分布参数𝑝:模型输出的属于正类(𝐶1类)的后验概率𝑧。;逻辑回归的学习 -p38。出处:
机器学习zdh-6_3.pdf,第 38 页。
- 目标函数设计:逻辑回归的学习 -p39;如何设计目标函数?。出处:
机器学习zdh-6_3.pdf,第 39 页。
- 最大似然估计法:似然函数;因此,使用最大似然估计:针对所有训练样本𝒳,最大化输出;标签分布的似然函数,以此求得参数𝒘和𝑤0的最优值。;似然函数为所有训练样本输出概率的乘积,表达为:;如果参数𝒘和𝑤0是最优的,意味着对大部分样本(𝒙𝑛,𝑡𝑛)而言,;𝑝(𝑡𝑛|𝒙𝑛) 应该是较大的(无论𝑡𝑛取值是1还是0)。;逻辑回归的学习 -p40。出处:
机器学习zdh-6_3.pdf,第 40 页。
- 最大似然估计法:目标函数;对似然函数求取log:;逻辑回归的学习 -p41。出处:
机器学习zdh-6_3.pdf,第 41 页。
- 最大似然估计法:目标函数;由于log是凹函数,所以对目标函数取反。相应的,最大化变;为最小化。;因此,基于最大似然估计策略,最终得到的目标函数为:;逻辑回归的学习 -p42。出处:
机器学习zdh-6_3.pdf,第 42 页。
- 既然知道了真值和模型实际输出的概率,:是否可以使用概率分布相似度衡量方法?;逻辑回归的学习 –p15。出处:
机器学习zdh-6_3.pdf,第 43 页。
- 交叉熵表达:训练目标;𝑝(𝑙𝑛|𝒙𝑛)和𝑞(𝑙𝑛|𝒙𝑛)的分布情况如下表:;给定样本𝒙𝑛;模型预测输出的概率值;𝑝(𝑙𝑛|𝒙𝑛);输出真值的概率值;𝑞(𝑙𝑛|𝒙𝑛);属于正类(1)的概率 𝑧𝑛 𝑡𝑛;属于负类(0)的概率 1−𝑧𝑛 1−𝑡𝑛。出处:
机器学习zdh-6_3.pdf,第 44 页。
- 交叉熵(Cross Entropy):给定两个概率分布𝑝(𝑥)和𝑞(𝑥) ,两个分布之间的交叉熵计算如下:;离散随机变量𝑥:有𝑀个取值状态;连续随机变量𝑥:;课堂练习;给定单个样本𝒙𝑛,模型预测输出的概率分布𝑝(𝑙𝑛|𝒙𝑛)与输出真值的概率;分布𝑞(𝑙𝑛|𝒙𝑛)之间的交叉熵为:;题目;逻辑回归的学习 –p17。出处:
机器学习zdh-6_3.pdf,第 45 页。
- 给定单个样本𝒙𝑛,模型预测输出的概率分布𝑝(𝑙𝑛|𝒙𝑛)与输出:真值的概率分布𝑞(𝑙𝑛|𝒙𝑛)之间的交叉熵为:;𝐻𝑝,𝑞 =;𝑡𝑛ln𝑧𝑛+(1−𝑡𝑛)ln(1−𝑧𝑛);𝐻𝑝,𝑞 =𝑡𝑛ln𝑧𝑛+(1−𝑡𝑛)ln(1−𝑧𝑛);𝐻𝑝,𝑞 =𝑡𝑛ln𝑧𝑛−(1−𝑡𝑛)ln(1−𝑧𝑛);𝐻𝑝,𝑞 =𝑡𝑛ln(1−𝑧𝑛)−(1−𝑡𝑛)ln𝑧𝑛。出处:
机器学习zdh-6_3.pdf,第 46 页。
- 交叉熵表达:针对N个训练样本:目标函数;给定𝑁个训练样本,把每个训练样本的交叉熵求和,得到最终;的目标函数:;逻辑回归的学习 -p47;为什么不用乘积?。出处:
机器学习zdh-6_3.pdf,第 47 页。
- 如何优化目标函数?:逻辑回归的学习 -p48。出处:
机器学习zdh-6_3.pdf,第 48 页。
- 目标函数优化:梯度下降法:目标函数对𝒘求偏导:;对参数𝒘求偏导;小贴士;逻辑回归的学习 -p49。出处:
机器学习zdh-6_3.pdf,第 49 页。
- 目标函数优化:梯度下降法:目标函数对𝑤0求偏导:;对参数𝑤0求偏导;逻辑回归的学习 -p50。出处:
机器学习zdh-6_3.pdf,第 50 页。
- 目标函数优化:梯度下降法:采用梯度下降法更新𝒘和𝑤0 :;设当前时刻为𝑘,下一个时刻为𝑘+1;𝜂为更新步长。;参数更新;逻辑回归的学习 -p51。出处:
机器学习zdh-6_3.pdf,第 51 页。
- 前沿文献阅读:逻辑回归的学习;[1] X. Shen and Y. Gu, “Nonconvex Sparse Logistic Regression with Weakly Convex;Regularization”, IEEE Transactions on Signal Processing, vol. 66, no. 12, pp. 3199-3211, 2018.;[2] R. Wang, N. Xiu, and C. Zhang, “Greedy Projected Gradient-Newton Method for Sparse;Logistic Regression”, IEEE Transactions on Neural Networks and Learning Systems, vol. 31,;no.2, pp. 527-538, 2020.。出处:
机器学习zdh-6_3.pdf,第 52 页。
- 课堂练习:逻辑回归的学习 –p24;给定数据集,用课前编好的逻辑回归学习算法程序,实现如下功能:;训练逻辑回归模型;观察每个迭代周期,梯度的变化情况;任务。出处:
机器学习zdh-6_3.pdf,第 53 页。
- 上传程序运行结果图。:主观题 10分。出处:
机器学习zdh-6_3.pdf,第 54 页。
- 梯度消失问题:当𝑦=𝒘𝑇𝒙+𝑤0 较大时 ,sigmoid函数;输出𝑧会出现饱和:输入变化量∆𝑦很大;时, 输出变化量∆z很小。;在 饱 和 区, 输 出 量𝑧 接 近 于1 , 导致;sigmoid函数梯度值接近于 0,出现梯度;消失问题。;逻辑回归的学习 –p26。出处:
机器学习zdh-6_3.pdf,第 55 页。
- 参数的初始化:在迭代训练过程中 ,如果参数𝒘选择较大的初始值 ,输出𝑧𝑛很快会;进入sigmoid饱和区(即𝑧𝑛的值接近于1),梯度 𝜕𝑧𝑛𝜕𝑦𝑛接近于0,;出现梯度消失 。根据链式法则 ,导致目标函数关于参数的梯度;𝜕𝐽𝜕𝒘接近于0,使得后续迭代更新不起作用。;因此,参数𝒘尽量选择较小的初始值,避免出现梯度消失问题。;参数初始化;逻辑回归的学习 –p27。出处:
机器学习zdh-6_3.pdf,第 56 页。
- 迭代什么时候停止?:逻辑回归的学习 –p28。出处:
机器学习zdh-6_3.pdf,第 57 页。
- 如果迭代停止条件设为训练误差为0,或者所有训练样本都:正确分类的时候才停止,则会出现过拟合问题。;所以,在达到一定训练精度后,提前停止迭代,可以避免;过拟合。;Stop Early;逻辑回归的学习 –p29。出处:
机器学习zdh-6_3.pdf,第 58 页。
- 训练迭代过程示意:迭代次数要达到一定程度,训练性;能较好。;逻辑回归输出的非线性形式就是;sigmoid函数的非线性形式。;:正类样本。;╳:负类样本。;分别迭代训练10次、100次和;1000次的结果。;直线:决策边界𝒘𝑇𝒙+𝑤0=0 ;。出处:
机器学习zdh-6_3.pdf,第 59 页。
- 单个逻辑回归只能处理二类分类:如何实现单个模型处理多类分类?;逻辑回归的学习 –p31。出处:
机器学习zdh-6_3.pdf,第 60 页。
- 科研实训作业:编写一个多层嵌套的逻辑回;归模型,并在Cifar10数据;集测试分类性能;逻辑回归的学习 –p32;编程;[1] K. Kayabol, “Approximate Sparse Multinomial Logistic Regression for Classification”, IEEE Transactions on;Pattern Analysis and Machine Intelligence, vol. 42, no. 2, pp. 490-493, 2020.。出处:
机器学习zdh-6_3.pdf,第 61 页。
- 课后预习:预习MOOC第4.15节课:Softmax判据;逻辑回归的学习 –p33。出处:
机器学习zdh-6_3.pdf,第 62 页。