特征工程与实践入门15 分钟kp-030#历史#流派#感知机

机器学习简史:从感知机到统计学习

进度

一句话定义

机器学习七十余年史是「符号推理、连接主义、统计学习」三大流派的起落与合流:从 Samuel 的跳棋程序与 Rosenblatt 感知机,经专家系统寒冬、统计学习(PAC/SVM)兴起、集成方法统治表格任务,到 2012 年后深度学习成为主流叙事。

为什么重要

知道「现在的方法从哪来」,才能判断哪些思想是基石(损失最小化、泛化、间隔)、哪些是时代产物(会过时的具体技巧);理解流派之争(符号 vs 连接 vs 统计)也能解释今天大模型时代「神经 + 符号回归」的复沓。对初学者,历史提供了把零散算法串成故事线的记忆骨架。

前置知识

什么是机器学习:定义、三种范式与术语地图 的基本范式概念即可,本节是全库的横向视野。

核心概念

  • 三大流派:符号主义(逻辑、规则、归纳逻辑程序设计)、连接主义(神经网络、表示学习)、统计学习(风险最小化、VC 维、SVM);另有贝叶斯派(概率图模型)与类比/进化等支线。
  • 跳棋程序(1959):Samuel 首次让程序「从对局经验中改进」,机器学习一词的公认起点。
  • 感知机(1958)与第一次寒冬(1969–1980s):Minsky 与 Papert 证明单层感知机连 XOR 都学不了,连接主义冷却十余年。
  • 统计学习学派(1980s–2000s):Valiant 提出 PAC 可学习性(1984),Vapnik 奠基 VC 理论与 SVM(1995),「泛化」第一次有了严谨数学。
  • 集成时代(1997–2016):AdaBoost(1997)、随机森林(2001)、GBDT(2001)、XGBoost(2016)——本库模块 03 的主角们。
  • 深度学习浪潮(2012– ):AlexNet 在 ImageNet 的碾压性胜利引爆 GPU + 大数据 + 深网络的合流;2020s 大语言模型把「预训练 + 微调」变成新范式。

直观类比

三个学派像三种看病思路:符号主义是「背下诊断手册、按规则推理」(可解释、难扩展);连接主义是「老医生凭百万病例练出的直觉」(能学、难解释);统计学习是「用统计学说清『凭什么这诊断可信』」(严谨、当时算力下模型偏小)。今天的大模型,像三派同堂会诊。

原理与机制

历史的主线索是「归纳偏置与数据量的博弈」:数据稀缺时代,手工规则与强结构先验(符号系统、浅模型 + 手工特征)占优;数据与算力指数增长后,弱先验、强容量的连接主义(深度网络)反超——因为「用数据换先验」变得划算。统计学派的贡献是把「为什么泛化」从经验上升为理论(VC 维、间隔界),其思想遗产(正则化、交叉验证、间隔)至今贯穿所有模型,包括深度学习。集成的成功则是统计视角的胜利:不做更大模型,而是用偏差-方差理论指导组合小模型(kp-011/013 的机制)。理解这条主线,就能解释「为什么 2012 年是分水岭:GPU 并行 × 互联网数据 × ReLU/Dropout 等工程创新三者同时到位」。

公式与推导

本节不适用:历史脉络的载体是人物、事件与思想变迁,没有单一公式可承载;各时期的代表性公式(感知机更新、VC 界、 boosting 误差界)已分别落在 kp-004、kp-002、kp-012 中。

图示

1950s──┬─ Samuel 跳棋(1959) / Rosenblatt 感知机(1958)
1969   │  Minsky《Perceptrons》→ 第一次寒冬
1980s  │  专家系统兴起→回落;PAC(1984)
1995   │  Cortes & Vapnik: SVM(统计学习巅峰)
1997-  │  AdaBoost → Random Forest(2001) → GBDT(2001)
2012   │  AlexNet: 深度学习引爆
2020s  │  GPT 类大模型:预训练+涌现
       └──────────────────────────▶
 符号主义━━━┓                      ┃
 连接主义━━━╋━━寒冬━━复兴━━━━━━━━━┫ 合流
 统计学习━━━┛(理论遗产贯穿至今)    ┃

实例或案例

把本库知识锚回历史坐标:kp-010 的 CART(1984)早于随机森林(2001);kp-015 的 SVM(1995)是统计学习学派的巅峰;kp-012/013 的 boosting 谱系横跨 1997–2016;kp-031 将接棒 2012 年之后的篇章。读算法时带上年份,能自然理解「为什么 XGBoost 对核 SVM 的胜利发生在表格数据:样本百万级时 O(n2) 的核矩阵扛不住,树集成的复杂度曲线更友好」。

常见误区

  • 把深度学习当机器学习的全部:2012 年之前机器学习已高度成熟,今天表格数据的首选仍是树集成而非深度网络。
  • 认为「寒冬证明神经网络没用」:1969 年的否定只针对单层感知机与当时的算力,反向传播(1986)之后连接主义从未真正离场。
  • 用「新 = 好」评判方法:无免费午餐定理(kp-002)提醒,方法好坏永远相对于问题与数据规模。

与其他知识点的关系

什么是机器学习:定义、三种范式与术语地图 的范式划分在历史中有清晰出处;最大间隔与线性 SVM/梯度提升树 GBDT 与 XGBoost 的算法各占流派巅峰;深度学习导览:边界与去向 承接 2012 年后的深度学习篇章;公平性、可复现性与机器学习伦理 的伦理议题是 2020s 的新主线。

自测题

  1. 三大流派各自的核心主张与代表方法?

- 要点:符号主义(规则推理;专家系统/ILP)、连接主义(神经元网络学习表示;感知机→深度学习)、统计学习(风险最小化与泛化理论;SVM、正则化)。

  1. 2012 年成为分水岭的三要素?

- 要点:GPU 大规模并行算力、互联网级标注数据、算法/工程创新(ReLU、Dropout、初始化)同时到位。

  1. 「数据换先验」如何解释深度学习的崛起?

- 要点:弱先验、高容量模型需要海量数据支撑;数据与算力指数增长使其成本下降,手工特征与强结构先验的优势被反超。

延伸阅读

周志华《机器学习》第 1 章前史部分;Nilsson《The Quest for Artificial Intelligence》(剑桥大学出版社, 2010,通史)。