术语表

42 条核心术语,按主题分组;首次学习遇到陌生词可在此回查。

数据与任务

样本 Sample
数据集中的一行观测,通常表示为特征向量加标签。
特征 Feature
描述样本的输入变量 $x$ 的某一维。
标签 Label
监督学习中要预测的目标 $y$。
训练集 / 验证集 / 测试集 Train / Validation / Test Set
分别用于拟合、调参与最终评估的三部分数据,信息只允许从训练流向其他。
泛化 Generalization
模型对未见过的数据表现良好的能力。
过拟合 / 欠拟合 Overfitting / Underfitting
训练误差远低于验证误差(记住噪声)/ 两类误差都高(容量不足)。
数据泄漏 Data Leakage
训练时不可见的信息提前进入学习过程,导致评估虚高。

优化与损失

假设空间 Hypothesis Space
算法可以从中挑选的候选函数集合。
损失函数 Loss Function
量化单样本预测误差的函数。
经验风险 / 结构风险 Empirical / Structural Risk
训练集平均损失 / 其加正则项的形式。
正则化 Regularization
对参数施加惩罚(L1/L2 等)以控制复杂度、改善泛化。
超参数 Hyperparameter
训练前人为设定的配置,如学习率、正则强度。
梯度 Gradient
目标函数对各参数的偏导向量,指向上升最快方向。
学习率 Learning Rate
梯度下降的步长系数。
凸函数 Convex Function
局部最优即全局最优的函数性质。
偏差 / 方差 Bias / Variance
期望预测偏离真函数的程度 / 预测随训练集波动的程度。

线性模型与 SVM

决策边界 Decision Boundary
预测类别发生翻转的等值面。
对数几率 Log-Odds
逻辑回归中线性打分等于的 log(p/(1−p))。
交叉熵 Cross-Entropy
概率分类的标准损失,等价于最大化似然。
岭回归 / Lasso Ridge / Lasso
L2 / L1 正则化的线性回归。
支持向量 Support Vector
决定 SVM 解的少数间隔边界样本。
间隔 Margin
样本到决策面的(归一化)距离,SVM 最大化它。
铰链损失 Hinge Loss
max(0, 1 − y·f(x)),软间隔 SVM 的损失。
核函数 Kernel Function
隐式高维内积 K(x, z) = φ(x)ᵀφ(z) 的相似度函数。

树与集成

信息熵 Entropy
节点标签混乱度 −∑ₖ pₖ·log pₖ。
基尼指数 Gini Index
从节点随机抽两样本异类的概率,CART 分裂准则。
决策树桩 Decision Stump
深度为 1 的决策树,常用弱学习器。
残差 / 伪残差 Residual / Pseudo-Residual
目标减当前预测 / 损失的负梯度,GBDT 逐轮拟合对象。
OOB 误差 Out-of-Bag Error
随机森林用袋外样本得到的免费泛化估计。

无监督

质心 Centroid
簇内样本均值,K-means 的簇代表。
轮廓系数 Silhouette Coefficient
综合簇内凝聚与簇间分离的聚类质量指标。
核心点 / 噪声点 Core / Noise Point
DBSCAN 中邻域密度达标的点 / 不属于任何簇的点。
责任 Responsibility
EM 中样本属于各分量的后验概率(软归属)。
主成分 Principal Component
数据方差最大的正交方向,由协方差矩阵特征向量给出。
解释方差比 Explained Variance Ratio
各主成分承载的方差占总方差的比例。

评估

交叉验证 Cross-Validation
k 折轮流验证以稳健估计泛化性能的协议。
混淆矩阵 Confusion Matrix
TP/FP/FN/TN 四格计数表。
精确率 / 召回率 Precision / Recall
报出的正类里真阳性占比 / 真实正类被抓住占比。
F1 分数 F1 Score
精确率与召回率的调和平均。
ROC 曲线 / AUC ROC Curve / AUC
阈值扫描的 TPR-FPR 轨迹 / 其下面积(= 正样本得分高于负样本的概率)。
独热编码 One-Hot Encoding
类别变量转二元向量的编码方式。
标准化 Standardization
(x − μ)/σ 变换,零均值单位方差。