对统计学在机器学习领城基础地位的理性认识

统计学研究如何从随机现象中发现相对确定性,

它是理论数学走向工程实践的关键工具。

统计学假定,

现实世界不存在完全确定的事物,

区别仅在于事物的确定性程度。

与此同时,

在不确定性事物的各种现象背后,

一定存在着反映事物全体的相对确定性。

在这两个基本假定之下,

统计学的使命在于,

提供一套不专属于特定领域的工具,

围绕从混沌中发现确定性这一总目标,

提供从经验数据收集,

到服务于不同确定性推断目标的方法体系。

我早已承认且默认,

机器学习建立在统计学基础之上。

然而对它为什么建立在这个基础上,

我的认识一直是感性的,片面的,非本质的,

尽管我会流利地讲出这个结论,

但那实际是一个自欺欺人的掩饰。

直到与一位从事统计领域研究的朋友闲聊,

才发觉自己的认识相当浅薄,

远未达到理性阶段。

我的感性认识的感觉在于,

机器学习存在利用统计学的现象,

比如它使用了一些统计相关概念,

如各类别的概率输出,

分布内,分布外,归纳偏置等,

又一些损失函数,如交叉熵等。

这不是理性程度的理解,

这导致我并未在机器学习中,

真正地感受到统计学的作用,

而是把注意力聚焦于各种神经组件,

导致长久地陷入一叶障目,不见泰山。

诚如实践论所言,

只有理解了感受到的事物,

才能更深刻地感受到它。

实际上,

整个的机器学习,

同样建立在上面两个假设前提之下,

它相对于统计学的传统操作,

放宽了相对确实性部分的假定,

用具有强大非线性映射能力的神经网络组件,

取代了传统的线性的确定性假定,

随机部分遵循相同假设。

一个训练的样本,

本质上是随机过程的一次采样。

训练的目标,

本质上是使观测到样本概率最大化。

这就是整个的机器学习的统计学基础,

也是我对这一观点的理性认识,

这种认识仍然是一个动态的过程。

我的朋友还谈到,

高维统计推断,

异构数据的统计推断等等,

都还是开放性问题,

它们源于发展中的机器学习实践,

并将服务于机器学习实践,

这样一个过程,

连同对它的认识的过程,

一直在运动的变化中。

相关推荐
熊猫钓鱼>_>38 分钟前
开源鸿蒙平台 KMP 三方库 KStore 适配全流程:从 ohosArm64 target 到真机文件持久化验证
人工智能·华为·开源·ai编程·harmonyos·openharmony·kmp
阿明副业观察38 分钟前
AI视频生成工具:功能、特点与高效制作攻略
人工智能·音视频
humors22140 分钟前
AI模型的可为和不可为
人工智能·gpt·ai·大模型·豆包·deepseek
知几蜗牛40 分钟前
Python + Gemini JSON Schema 实现可校验的工单路由
人工智能
知几蜗牛41 分钟前
Python 标准库调用 Audio Transcriptions API 的超时与异常处理
人工智能
znx9391 小时前
因子分析:量化交易的底层核心与盈利逻辑基石
人工智能·python·机器学习·期魔方
沉默王二1 小时前
轻量开源版 Muse 来了!CopilotKit 开源 OpenMuse,Personal Agent 的工程细节全摊开了
人工智能·openai·agent
Dawson Zhu1 小时前
《Agentic Design Patterns》第 10 章导读:模型上下文协议(MCP)
人工智能·语言模型·架构·aigc·agi
IvorySQL1 小时前
VACUUM FULL 之后 ROWID 就废了? IvorySQL 兼容性实测
数据库·人工智能·ai·postgresql·开源