作家
登录

深度神经网络的数学基础,对你来说会不会太难?

作者: 来源: 2017-07-18 15:01:00 阅读 我要评论

参数 a(k)、b(k)、c(k) 和 d(k) 只取决于不合层级滤波器的设定,而不取决于特定的元素 i,j。固然该束缚前提在广义定义下并不须要,但在一些如机械视觉之类的应用上照样很合理的。除了有利于参数的共享,这种类型的收集因为函数 h 的定义而天然出现出一种稀少的优良特点。

卷积神经收集中的另一个通用的部分是池化操作。在履行完卷积并在矩阵索引函数上应用了 g 之后,我们可以用四周函数的均值或最大年夜值替代当前的函数。即设定:

这一技巧同时可以应用到降维操作中。

模型和优化

下面我们须要懂得若何求得神经收集参数,即到底我们该采取什么样的 θ 和怎么样评估θ。对此,我们平日应用概率建模的办法。即神经收集的参数θ决定了一个概率分布 P(θ),而我们欲望求得 θ 而使前提概率 Pθ(y|x) 达到极大年夜值。即等价于极小化函数:

那么如今我们该如何最优化损掉函数 J 以取得最优良的机能。起首我们要知道最优化的艰苦重要有四个方面:

  • 过高的数据和特点维度
  • 数据集太大年夜
  • 损掉函数 J 长短凸函数
  • 参数的数量太多(过拟合)

面对这些挑衅,天然的筹划是采取梯度降低。而对于我们的深度神经收集,比较好的办法是采取基于链式求导轨则的反向传播办法,该办法动态筹划地求偏导数以降误差反向传播以更新权重。

别的还有一个十分重要的技巧,即正则化。正则化能解决模型过拟呵9依υ?题,即平日我们对每一个特点采取一个罚项而防止模型过拟合。卷积神经收集经由过程参数共享供给了一个筹划以解决过拟合问题。而正则化供给了另一个解决筹划,我们不再最优化 J(θ),而是最优化 J(θ)=J(θ)+Ω(θ)。

个中Ω是「复杂度度量」。本质上Ω对「复杂特点」或「巨量参数」惹人了罚项。一些Ω正则项可以应用 L2 或 L1,也可以应用为凸函数的 L0。在深度进修中,还有其他一些办法解决过拟合问题。其一是数据加强,即应用现有的数据生成更多的数据。例如给定一张相片,我们可以对这张相片进行剪裁、变形和扭转等操作生成更多的数据。别的就是噪声,即对数据或参数添加一些噪声而生成新的数据。

生成模型:深度玻尔兹曼机

深度进修应用了很多概率模型。我们第一个描述的是一种图模型。图模型是一种用加权的图表示概率分布的模型,每条边用概率度量结点间的相干性或因不雅性。因为这种深度收集是在每条边加权了概率的图,所以我们很天然地表达为图模型。深度玻尔兹曼机是一种结合分布用指数函数表达的图模型:

个中设备的能量 E 由以下表达式给出:

一般来说,中心层级为实数值向量,而顶部和底部层级为离散值或实数值。

波尔兹曼机的图模型是典范的二分图,对应于每一层的顶点只连接直接在其顶部和底部的层级。

其他前提概率也是雷同的事理。

不幸的是,我们并不知道如安在图模型中抽样或优化,这也就极大年夜地限制了玻尔兹曼机在深度进修中的应用。

深度信念收集

深度信念统??计算上更为简洁,尽管它的定义比较复杂。这些「混淆」的统??本质上是一个具有 d 层的有向图模型,然则它的前两层是无向的:P(h(d−1),h(d)) 定义为

对于其它层,

留意到这里与之前的偏向相反。然则,该隐变量知足以下前提:如不雅

由公式(1)定义,则它们也知足公式(2)。

我们知道如何经由过程膳绫擎的公式直接对基于其它前提层的底层进行抽样;然则要进行揣摸,我们还须要给定输入下输出的前提分布。

最后,我们强调,尽管深度玻尔兹曼机的第 k 层取决于 k+1 层和 k-1 层,在深度信念收集,如不雅我们只前提基于 k+1 层,我们可以精确地生成第 k 层(不须要前提基于其它层)。

课程筹划

在本课程中,我们重要的评论辩论主题为:

  • 深度的表示力
  • 计算问题
  • 简单可分析的生成模型

第一个主题强调神经收集的表示力:可以被收集近似的函数类型有哪些?我们筹划评论辩论的论文有:

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)