一. 详解机器学习中的熵、条件熵、相对熵、交叉熵


二. 机器学习——先验概率、后验概率、全概率公式、贝叶斯公式

先验概率(prior probability)是指根据以往经验和分析得到的概率,如全概率公式,它往往作为"由因求果"问题中的"因"出现的概率。——百度百科

后验概率是指在得到“结果”的信息后重新修正的概率,是“执果寻因”问题中的"果"。——百度百科

在这里插入图片描述


在这里插入图片描述


三. 图像生成中常用的量化评估指标

  1. Inception Score (IS)

在这里插入图片描述
目标是最大化IS分数,即
最大化H(y): 也就是对于输入的样本,通过inception_v3模型后的类别要均衡,衡量模式坍塌,理想情况下每个类别生成的概率均等,此时H(y)达到最大。
最小化H(y|x); 说明对于输入的样本,通过inception_v3模型后预测某类别的置信度要高,衡量图片生成的质量,理想情况下,生成的图片在inception_v3模型看来,某个类别的置信度为1.0,其它都为0,此时的H(y|x)最小。

  1. Fréchet Inception Distance (FID)

Inception Score 是在分类器 InceptionV3 最后的输出结果上进行计算,而Fréchet Inception Distance (FID) 则是计算了真实图片和假图片在 feature 层面的距离,因此显得更有道理一点。FID 的公式如下:
在这里插入图片描述在这里插入图片描述
在这里插入图片描述

  1. Wasserstein Distance

Wasserstein距离也被称为推土机距离(Earth Mover’s Distance,EMD),用来表示两个分布的相似程度。Wasserstein距离衡量了把数据从分布p移动成”分布q时所需要移动的平均距离的最小值。Wasserstein距离是2000年IJCV期刊文章《The Earth Mover’s Distance as a Metric for Image Retrieval》提出的一种直方图相似度量。如果两个分布pq离得很远,完全没有重叠的时候,那么KL散度值是没有意义的,而JS散度值是一个常数。这在学习算法中是比较致命的,这就意味这这一点的梯度为0,即梯度消失,而Wasserstein距离可以解决这个问题。

我们将两个分布pq看成两堆土,如下图所示,希望把其中的一堆土移成另一堆土的位置和形状,有很多种可能的方案。推土代价被定义为移动土的量乘以土移动的距离,在所有的方案中,存在一种推土代价最小的方案,这个代价就称为两个分布的Wasserstein距离。
在这里插入图片描述

Inception Score (IS) 与 Fréchet Inception Distance (FID)

GAN的量化评估方法——IS和FID,及其pytorch代码

GAN 的六种衡量方法

机器学习中的数学——距离定义(二十六):Wasserstein距离(Wasserstei Distance)/EM距离(Earth-Mover Distance)

【数学】Wasserstein Distance


四、神经网络学到的训练数据的分布到底是什么?

什么是训练数据的分布呢?我想通俗一点来说,那就是给你的这一大批训练数据,他总体是个什么样的、平均水平在哪里、最好的有多好、最差的有多差、每个个体离着这个平均水平分别能强多少、能弱多少、个体水平波动情况如何……

在这里插入图片描述
如何理解神经网络学习到的是训练数据的分布?

深度学习中的数据分布到底是指的什么?有没有准确和严谨的定义,或者比较直观的理解?

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐