作家
登录

深度神经网络的数学基础,对你来说会不会太难?

作者: 来源: 2017-07-18 15:01:00 阅读 我要评论

  • Telgarsky 的「深度向前收集的表征优势」(15)。
  • Safran 和 Shamir 的「Relu 收集的深度分别」(16)。
  • Cohen、Or 和 Shashua 的「关于深度进修的表示力:张量分析」(15)。
  • 前两篇论文(我们将在后面的课程中具体阐述)证清楚明了「你可以仅用单一层表达任何事物」的思惟。然则,后面几篇论文注解此单一层必须异常宽,我们将在后面侧面展示这种论点。

    关于第二个主题,我们在本课程中评论辩论的关于复杂度结不雅的内容可能包含:

    • Livni、Shalev Schwartz 和 Shamir 的「关于练习神经收集的枷⒚效力」(14)。
    • Danieli 和 Shalev-Schwartz 的「进修 DNF 的复杂度理论限制」(16)。
    • Shamir 的「特定分布的进修神经收集复杂度」(16)。

    原文链接:http://elmos.scripts.mit.edu/mathofdeeplearning/2017/03/09/mathematics-of-deep-learning-lecture-1/

    在算法方面:

    • Janzamin、Sedghi 和 Anandkumar 的「应用张量办法有效练习神经收集」(16)。
    • Hardt、Recht 和 Singer 的「练习更快,泛化更佳」(16)。
    • 最后,我们将浏览的关于生成模型的论文将包含:
    • Arora 等人(2014)的「进修一些深度表征的可证实束缚」。
    • Mossel(2016)的「深度进修和生成层次模型」。

    今天我们将开端研究关于第一个主题的前两篇论文:Cybenko 和 Hornik 的论文。

    Cybenko 和 Hornik 的理论

    在 1989 年的论文中,Cybenko 证清楚明了以下结论:

    [Cybenko (89)] 令 σ 为一个持续函数,且极限 limt→–∞σ(t)=0 和 limt→+∞σ(t)=1。(例如,σ 可认为激活函数且 σ(t)=1/(1+e−t))然后,f(x)=∑αjσ(wTjx+bj) 情势的函数族在 Cn([0,1]) 中是稠密的。

    个中,Cn([0,1])=C([0,1]n) 是大年夜 [0,1]n 到 [0,1] 的持续函数空间,它有 d(f,g)=sup|f(x)−g(x)|。

    Hornik 证清楚明了下面的 Cybenko 的衍生结论:

    [Hornik (91)] 推敲膳绫擎定理定义的函数族,然则 σ 没有前提限制。

    如不雅 σ 有界且非持续,那么函数族在 Lp(μ) 空间是稠密的,个中 μ 是随便率性在 Rk 上的有限测度。

    如不雅附加 σ∈Cm(Rk),则函数族在 Cm(Rk) 空间和 C^{m,p}(μ)是稠密的,对于随便率性有限 μ 知足有限开覆盖前提。

    如不雅附加 σ 至 m 阶导数有界,那么对于随便率性在 Rk 上的有限测度 μ,函数族在 C^{m,p}(μ) 是稠密的。

    在膳绫擎的理论中,Lp(μ) 空间是知足 ∫|f|pdμ<∞ 的函数 f 的空间,有 d(f,g)=(∫|f−g|pdμ)1/p。在开端证实之前,我们须要快速回想函数分析常识。

    Hahn-Banach 扩大定理

    如不雅 V 是具有线性质空间 U 和 z∈V∖U¯ 的标准向量空间,那么会出现持续的线性映射 L:V→K(L(x) = 0),与 L(z) = 1(对于所有 x∈U),和 ‖L‖≤d(U,z)。

    个中可以用期望代替对数似然函数。例如,如不雅我们将 y 拟合为一个高斯分布,其均值为 f(x;θ),且带有单位协方差矩阵。然后我们就能最小化平均误差:

    如今,函数分析中的经典结不雅注解,Lp(μ) 上的持续线性函数 L 可以表示为

    对于 g∈Lq(μ),个中 1/p + 1/q = 1。持续线性函数 L 在 C(X) 上可以表示为

    个中 μ 是 X 上的有限符号测度。

    我们可以在其它空寄┞芬到与 Cybenko 和 Hornik 定理中推敲的类似的线性函数表达式。

    在一般证实之前,推敲函数空间是 Lp(μ) 和 σ(x) = 1(x≥0)的(轻易)的例子。若何证实,如不雅定理所定义的集合中的所有 f 都知足 L(f) = 0,则与 L 相接洽关系的函数 g∈Lq(μ) 必须恒为零?经由过程转换,我们大年夜 σ 获得任何距离的指标,即,可以注解对于任何 a < b,∫bagdμ= 0。因为 μ 有限(σ 有限性知足前提),所以 g 必须为零。应用这个例子,我们如今推敲 Cybenko 定理的一般情况。我们想注解

    我们不雅察到

    此外,如不雅我们可以注解,对于随便率性 a,μa ≡ 0,那么 μ≡0(「一个测度由它的所有投影定义」),即

    为什么此定理有效?Cybenko 和 Hornik 的结不雅是应用 Hahn-Banach 扩大定理反证法证实的。我们推敲由 {Σαjσ(wTjx + bj)} 给出的子空间 U,并且我们假设反证 U¯ 不是全部函数空间。我们得出结论,在我们的函数空间上存在一个持续的线性映射 L,其在 U¯ 上限制为 0,但不是恒为零。换句话说,它足以注解在 U 上为零的任何持续线性映射 L 必须是零映射,即证清楚明了我们想要的结不雅。

    (留意,这里应用了 μ 的有限性)。将维度削减到 1 后,我们应用另一个异常有效的技能(也应用 μ 的有限性)——卷积技能。经由过程将 μ 与小高斯核进行卷积,我们获得一个具有密度的测度,即 Lebesgue 测度。我们如今进行剩下的证实。经由过程卷积技能,我们有


      推荐阅读

      从环境设置到内存分析:Python代码优化指南

    【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路!代码地址:https://github.com/apatrascu/hunting-python-performance 目次一、情况设置二、内存分析三、CPU 分析—>>>详细阅读


    本文标题:深度神经网络的数学基础,对你来说会不会太难?

    地址:http://www.17bianji.com/lsqh/36269.html

    关键词: 探索发现

    乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

    网友点评
    自媒体专栏

    评论

    热度

    精彩导读
    栏目ID=71的表不存在(操作类型=0)