零基础学AI之机器学习原理

零基础学 AI:机器学习原理,一篇文章讲清楚

机器学习不是魔法,而是从历史数据里总结规律。这篇文章从"罗素的火鸡"讲起,用最通俗的语言,讲清监督学习、无监督学习、强化学习和自监督学习这四大门派。

本期导航

  • 机器学习的本质:罗素的火鸡
  • 演绎法 vs 归纳法
  • 四大门派
  • 监督学习:有标准答案的学习
  • 无监督学习:没有标签自己学
  • 强化学习:在试错中变强
  • 奖励函数与 RLHF
  • 自监督学习:GPT 的秘密
  • 一张图总结

01 机器学习的本质:罗素的火鸡

想理解机器学习的本质,没有比"罗素的火鸡"更合适的故事了。

农场里有一只火鸡,它发现了一个规律:每天早上 9 点,农场主就会带着食物出现。无论刮风下雨,无论周一还是周日,这个规律从未失效。

于是,这只火鸡用"统计学"训练出了一个完美的模型:早 9 点 = 有饭吃。它的置信度高达 99.99%。

直到感恩节的那个早晨 9 点,农场主带着刀出现了。

这就是机器学习的宿命。

机器学习基于归纳法(Induction),它的智慧全部来自"过去",也就是历史数据。它假设未来会重复过去,但一旦出现从未见过的"黑天鹅",再强大的 AI 也可能瞬间失灵。

核心:机器学习是归纳法,它从历史数据中找规律,并假设未来会重复过去。

02 演绎法 vs 归纳法

人类的推理方法有两种,对应了机器学习的两种实现方式:

演绎法(Deduction)

  • 从公理推导出结果。
  • 例子:所有人都会死,苏格拉底是人,所以苏格拉底会死。
  • 特点:基于规则,绝对正确,但很难发现新知识。

归纳法(Induction)

  • 从现象总结出规律。
  • 例子:看到 1000 只天鹅是白的,推测所有天鹅都是白的。
  • 特点:基于统计数据,可能出错,但能处理复杂世界。

所以,千万不要迷信 AI 的预测。AI 说股市会上涨,只是因为它找到了与当前相似的历史模式,不代表明天真的会涨。

03 四大门派

在归纳法的世界里,根据"有没有老师教",机器学习分成四个门派:

  • 监督学习:有数据 + 标签,照着标准答案学,最成熟、最常用。
  • 无监督学习:只有数据、没有标签,自己找结构。
  • 强化学习:在环境里试错,用奖励和惩罚信号学策略。
  • 自监督学习:做完形填空或文字接龙,用数据自己生成标签再学习。

04 监督学习:有标准答案的学习

监督学习(Supervised Learning)是目前 AI 领域最成熟、应用最广的技术。它的本质,就像一场填鸭式教育。

想象一个"虎妈"算法在教育孩子模型:

  1. 刷题:拿出照片,问"这是什么?"
  2. 回答:孩子猜"是猫。"
  3. 打分:虎妈看到标准答案,说"错!这是狗。"
  4. 修正:孩子记住这次教训。

在数据质量和训练流程可靠的前提下,重复足够多次,模型识别能力通常会显著提升。人脸识别、语音识别、垃圾邮件拦截等成熟应用,都建立在监督学习或其变体之上。

两种题型:选择题 vs 填空题

  • 分类问题(Classification):做选择题,答案是离散的有限选项。例如"这封邮件是垃圾邮件吗?A 是 / B 否"。
  • 回归问题(Regression):做填空题,答案是连续的数值。例如"明天的房价是多少?500 万还是 501 万"。

区分它们很简单:看输出结果是不是连续数值。

监督学习的代价:昂贵的答案

既然监督学习这么好用,为什么不能所有 AI 都这样做?因为"标准答案",也就是标签,太贵了。

数据标注成本,是阻碍监督学习发展的最大拦路虎。

工程提醒:监督学习不能只靠"预测-纠正",还要做数据划分、损失函数、优化算法和评估指标,才能防止模型"死记硬背",保证它具备举一反三的泛化能力。

05 无监督学习:没有标签自己学

如果说监督学习是"有老师辅导的应试教育",那无监督学习就是"把你丢在外星超市,让你自己分类"。

外星人不知道什么叫薯片、牛奶、洗衣液,但它可以观察:

  • 这些外包装长得差不多,都有油渍,大概是一类。
  • 这些是液体,装在瓶子里,大概是一类。

它不需要任何标签,靠自己就能把东西分堆。

无监督学习有三大法宝:

  • 聚类(Clustering):把相似的东西归到一起。电商平台把消费习惯相似的用户分成一组,再把同组人买过的东西推荐给你,这就是"猜你喜欢"背后的逻辑。
  • 降维(Dimensionality Reduction):把复杂的东西简化。一张照片有 100 万个像素,AI 发现只要记住"两条眉毛一张嘴"这类关键特征,就能认出这个人。
  • 异常检测(Anomaly Detection):从寻常中发现不寻常。银行不需要提前知道所有骗局的模样,只要发现一笔凌晨 3 点在境外的巨额消费,就会立刻报警。

06 强化学习:在试错中变强

强化学习(Reinforcement Learning)是最接近生物本能的学习方式。

巴甫洛夫的条件反射是个很好的直觉类比:摇铃铛,给肉,狗流口水;重复多次后,摇铃铛,狗流口水。狗并不懂铃铛原本的含义,它只学到了一件事:听到这个声音,会有奖励。

这就是 AlphaGo 打败李世石的秘密:

  • 动作:落下一颗棋子。
  • 环境:棋盘发生变化。
  • 反馈:赢了 +1 分,输了 -1 分。
  • 目标:为了拿到 +1 分,它自我对弈了几亿盘。

延迟满足:强化学习的难点

普通的条件反射很简单,但强化学习最难的地方在于"延迟满足"。

下围棋时,第一步下在天元,可能要到第 200 步才知道是好棋还是臭棋。这就像现在努力读书,是为了 20 年后过上好日子。

AI 能坚持下来,靠的是价值函数(Value Function):它能够预估当下这一步,在遥远的未来有多少价值。看得越远,智商越高。

07 奖励函数与 RLHF

奖励函数的陷阱

看起来很简单:赢了给 +1,输了给 -1。但在真实应用中,设计奖励函数是最大的挑战。

  • 自动驾驶:如果只奖励"快点到",AI 会学会闯红灯。
  • 推荐系统:如果只奖励点击率,AI 会推荐"标题党"内容。
  • 工业机器人:如果只奖励"离球近",机械臂可能高速冲向球并把它砸碎。

AI 会精确地优化你给的函数,包括你没想到的漏洞。这就是奖励函数黑客化(Reward Hacking)。

强化学习第一定律:如果你能想到的漏洞,AI 肯定能想到;如果你想不到的漏洞,AI 也能想到。

探索-利用权衡

强化学习里有个永恒困境:应该选择已知的好东西,还是冒险尝试新东西?

  • 纯利用:每次都去已知的粤菜馆,不会失望,但可能错过更喜欢的餐厅。
  • 纯探索:每次都去新餐厅,见多识广,但经常踩坑。
  • 理想策略:先用一部分次数建立"品味数据库",再逐渐提高"利用"比例。

常见算法是 ε-贪心(Epsilon-Greedy):90% 概率选已知最优,10% 概率随机探索。随着训练推进,可以逐步降低探索率。

更聪明的策略还有 UCB(Upper Confidence Bound)和汤普森采样(Thompson Sampling)。

RLHF:怎么教 AI 说人话

ChatGPT 本来是个"话痨",什么话都敢接。为了让它懂礼貌、不乱说脏话,OpenAI 引入了人类反馈强化学习(RLHF)。

常见流程是:

  1. 收集偏好数据:让标注员对多条候选回答做偏好排序。
  2. 训练奖励模型:用偏好数据训练一个"品味模型",给回答打分。
  3. 强化学习优化:用 PPO 等算法,让模型更倾向于生成高分回答。

RLHF 也有挑战:标注员偏好可能不一致、模型可能为了得分而"迎合"而不是"诚实"、多个目标之间可能冲突。

现代对齐技术也在进化,例如 DPO(Direct Preference Optimization)可以跳过训练奖励模型,直接把偏好数据转化为优化目标;Red Teaming 则主动寻找模型漏洞,再把漏洞加入奖励信号。

一句话:奖励函数决定 AI 学什么,人类偏好决定它怎么说。

08 自监督学习:GPT 的秘密

自监督学习(Self-Supervised Learning)介于监督学习和无监督学习之间,最巧妙的地方在于:数据本身就是标签。

它很像英语考试里的"完形填空":

The weather is very hot today, I want to eat an ice ____.

即使没有老师告诉你答案,你也能根据几十年积累的常识,猜出这里填 cream 的概率最大,而不是 hockeycar

以文本为例,自监督学习的工作流程通常是:

  1. 掩码 / 挖空:把完整文本随机盖住几个词,例如"北京是中国的MASK"。
  2. 预测 / 填空:让模型猜被盖住的词。
  3. 计算损失 / 对答案:因为原句是完整的,模型可以知道正确答案是"首都"。

互联网上有无穷无尽的原始文本,这些数据是免费的,但原本没有标签。自监督学习把这些"废料"变成了"金矿"。

  • BERT:利用完形填空,学会双向理解语言。
  • GPT:利用文字接龙,学会生成流畅文本。

小知识:GPT 的全称是 Generative Pre-trained Transformer,其中 Pre-trained 指的就是在超大规模数据集上进行自监督学习。

09 一张图总结

  • 机器学习本质上是一种归纳法,从历史数据中总结规律,但永远无法获得绝对真理。
  • 监督学习:用带标签数据训练,本质是"填鸭式教育",最大瓶颈是标签太贵。
  • 无监督学习:处理无标签数据,三大法宝是聚类、降维和异常检测。
  • 强化学习:通过与环境交互学习,难点是延迟满足和奖励函数设计。
  • 自监督学习:数据本身即标签,把海量互联网文本变成预训练"金矿"。

如果只能记住一句话:机器学习不是魔法,而是从历史数据里找规律,再把规律用到未来。

相关推荐
Aision_1 小时前
实习手记 Day:从 ELK 到 Agent 的“最后一公里”——告警消费与上下文富化
运维·人工智能·web安全·elk·网络安全·安全威胁分析
workbuddy小能手1 小时前
用 WorkBuddy 调混元 Hy3 做批量文档摘要:一个可运行的实战示例
人工智能·workbuddy
梦想的旅途21 小时前
企微私域 AI 创作:文案生成与 AI 配图自动化发布实战
人工智能·自动化·企业微信
Bruce_Liuxiaowei1 小时前
多模态AI在网络安全监控中的创新应用
人工智能·安全·web安全
java修仙传1 小时前
从网页禅道到 AI 能调用的工具:我的禅道 MCP 实现思路分享
java·人工智能·python·ai应用·mcp开发
乌恩大侠1 小时前
图解 AI-RAN开发需要哪些软硬件:O-RU、DGX Spark、Sionna与Aerial
人工智能·spark·o-ru·ai-ran
中电金信1 小时前
中电金信 :一站式企业智能体柔性生产全链路解决方案
大数据·人工智能
观远数据2 小时前
跨部门BI落地的核心:如何做好数据集权限治理消除数据孤岛
大数据·人工智能