特征工程与实践前沿10 分钟kp-031#深度学习#导览#前沿

深度学习导览:边界与去向

进度

一句话定义

深度学习用多层神经网络自动学习分层表示,把「特征工程」替换为「表示学习」;本页是概念桥接与学习去向的导览——本库不展开深度学习,其完整学习路径由独立站点承接。

为什么重要

很多学习者卡在「经典 ML 学到什么程度该转深度学习」与「手里的问题到底该用谁」上。本页给出决策框架与术语映射,让你带着经典 ML 的完整框架(损失、正则化、评估纪律)进入深度学习,而不是从零开始。

前置知识

什么是机器学习:定义、三种范式与术语地图 的范式概念;特征工程:编码、缩放与缺失值处理 的特征工程视角(深度学习正是它的自动化替代)。

核心概念

  • 神经元:z = σ(w^⊤ x + b),多层堆叠 + 非线性 → 万能逼近。
  • 表示学习:逐层把原始信号(像素/字)抽象为特征(边缘 → 部件 → 物体;字符 → 词 → 语义),替代人工特征工程。
  • 架构谱系一句话版:MLP(表格与通用基座)、CNN(局部平移不变性,图像)、RNN/LSTM(序列状态)、Transformer(自注意力全局建模,今天的大模型基座)。
  • 迁移学习/预训练:大模型先学通用表示,下游小数据微调——「数据换先验」的极致形态。
  • 经典 ML 与深度学习的分界线:数据规模(万级 vs 百万级)、特征类型(结构化 vs 感知信号)、可解释与算力预算约束。

直观类比

经典 ML 像请大厨(人)写好菜谱(特征),灶台(模型)照做;深度学习像把「写菜谱」这件事也交给灶台自己练——给足食材(数据)与火力(GPU),它自己摸索出中间步骤。食材少的时候,大厨的手艺仍是性价比之王;食材海量时,自学菜谱的天花板更高。

原理与机制

决策框架(什么时候不用深度学习):表格数据 + 样本 ≤ 百万 → 树集成仍是首选(强基线、少调参、可解释);需要解释与审计 → 线性/树模型;数据是图像、语音、长文本、多模态 → 深度学习是正确工具箱;标注稀缺但有大模型 → 预训练 + 微调/提示。概念桥接:深度学习中你已学过的概念原样适用——交叉熵与 softmax(kp-007/009)、L2 正则(kp-008)、梯度下降与动量(kp-004)、偏差-方差(kp-005)、数据泄漏纪律(kp-025)、评估协议(kp-022/023)。新增的核心课题只有:反向传播(自动求导的链式法则)、多层优化的初始化与归一化、架构归纳偏置(卷积/注意力)、表征的预训练-微调。

公式与推导

单个神经元(全连接层)的前向计算:

z(l) = W(l) a(l-1) + b(l),      a(l) = g(z(l))

g 为非线性激活(ReLU = max(0, z))。没有非线性时多层塌缩为一次线性变换(W2 W1 x 仍是线性),因此激活函数是「深度」有意义的唯一来源——这就是万能逼近定理陈述的场景:足够宽的单隐层网络可逼近紧集上的任意连续函数(逼近论保证存在性,不保证可学性与泛化,后者正是 kp-002 理论的用武之地)。

图示

  经典ML路线                  深度学习路线
 原始数据                     原始像素/文本/语音
   ↓ 人工特征工程(kp-027)         ↓
 手工特征向量                 逐层自动表示学习
   ↓                            ↓ 边缘→部件→物体
 线性/树/SVM 预测              末层 softmax(kp-009)
        ↘ 共同的底层: 损失 + 梯度下降 + 正则 + 评估纪律 ↙

实例或案例

用 scikit-learn 的 MLP 感受「深度学习最朴素形态」在表格数据上与 GBDT 的对照(通常打平或略逊,这正是「表格首选树集成」的实证):

from sklearn.datasets import load_breast_cancer
from sklearn.neural_network import MLPClassifier
from sklearn.ensemble import HistGradientBoostingClassifier
from sklearn.model_selection import cross_val_score
from sklearn.preprocessing import StandardScaler
from sklearn.pipeline import make_pipeline

X, y = load_breast_cancer(return_X_y=True)
mlp  = make_pipeline(StandardScaler(), MLPClassifier(hidden_layer_sizes=(64, 32),
                     max_iter=500, random_state=0))
gbdt = HistGradientBoostingClassifier(random_state=0)
print("MLP  CV:", cross_val_score(mlp, X, y, cv=5).mean().round(3))
print("GBDT CV:", cross_val_score(gbdt, X, y, cv=5).mean().round(3))

常见误区

  • 认为「深度学习已经全面取代经典 ML」:结构化表格任务的主流仍是树集成,深度学习的优势区在感知与序列信号。
  • 样本几千条就上深度网络:小数据高容量必然过拟合,经典 ML 的正则化与交叉验证纪律反而更重要。
  • 把深度学习当成「不需要特征工程」:仍需数据清洗、采样纪律与领域输入表示设计,只是特征从手工构造变为架构设计 + 数据供给。

与其他知识点的关系

机器学习简史:从感知机到统计学习 提供它登上历史舞台的脉络;特征工程:编码、缩放与缺失值处理 被它的「表示学习」所自动化;本库的损失/优化/评估知识(kp-003/004/022/023)在深度学习中逐字适用。去向:深度学习体系(MLP/CNN/RNN/Transformer、反向传播推导、训练工程、预训练与大模型)由独立的深度学习站点完整承接,本页仅作路标。

自测题

  1. 给定一个 8000 条样本的信贷评分表任务,选什么?为什么?

- 要点:树集成(GBDT/随机森林)——表格数据强基线、可解释、算力便宜;深度网络在此没有数据量红利。

  1. 为什么神经网络必须有非线性激活?

- 要点:无激活的多层线性复合仍是线性映射,表达力与单层相同;激活函数才解锁万能逼近。

  1. 经典 ML 的哪些知识可以直接迁移到深度学习?

- 要点:损失函数设计、梯度优化与学习率、正则化思想、交叉验证评估、防泄漏纪律、指标选择——全部原样适用。

延伸阅读

Goodfellow 等《Deep Learning》第 6 章(深度前馈网络);周志华《机器学习》第 5 章(神经网络,经典视角)。