统计学研究如何从随机现象中发现相对确定性,
它是理论数学走向工程实践的关键工具。
统计学假定,
现实世界不存在完全确定的事物,
区别仅在于事物的确定性程度。
与此同时,
在不确定性事物的各种现象背后,
一定存在着反映事物全体的相对确定性。
在这两个基本假定之下,
统计学的使命在于,
提供一套不专属于特定领域的工具,
围绕从混沌中发现确定性这一总目标,
提供从经验数据收集,
到服务于不同确定性推断目标的方法体系。
我早已承认且默认,
机器学习建立在统计学基础之上。
然而对它为什么建立在这个基础上,
我的认识一直是感性的,片面的,非本质的,
尽管我会流利地讲出这个结论,
但那实际是一个自欺欺人的掩饰。
直到与一位从事统计领域研究的朋友闲聊,
才发觉自己的认识相当浅薄,
远未达到理性阶段。
我的感性认识的感觉在于,
机器学习存在利用统计学的现象,
比如它使用了一些统计相关概念,
如各类别的概率输出,
分布内,分布外,归纳偏置等,
又一些损失函数,如交叉熵等。
这不是理性程度的理解,
这导致我并未在机器学习中,
真正地感受到统计学的作用,
而是把注意力聚焦于各种神经组件,
导致长久地陷入一叶障目,不见泰山。
诚如实践论所言,
只有理解了感受到的事物,
才能更深刻地感受到它。
实际上,
整个的机器学习,
同样建立在上面两个假设前提之下,
它相对于统计学的传统操作,
放宽了相对确实性部分的假定,
用具有强大非线性映射能力的神经网络组件,
取代了传统的线性的确定性假定,
随机部分遵循相同假设。
一个训练的样本,
本质上是随机过程的一次采样。
训练的目标,
本质上是使观测到样本概率最大化。
这就是整个的机器学习的统计学基础,
也是我对这一观点的理性认识,
这种认识仍然是一个动态的过程。
我的朋友还谈到,
高维统计推断,
异构数据的统计推断等等,
都还是开放性问题,
它们源于发展中的机器学习实践,
并将服务于机器学习实践,
这样一个过程,
连同对它的认识的过程,
一直在运动的变化中。