跳至内容

Ch-1 绪论

  • 数据集:关于一些事件或对象的描述的集合
  • 样本、示例:关于一个事件或对象的描述,在属性空间中表现为 特征向量
  • 属性、特征:反映事件或对象在某方面的表现或性质的事项
  • 属性空间、样本空间、输入空间:属性张成的空间
  • 样例:拥有了标记信息的示例
  • 标记空间、输出空间:所有标记的集合
  • 测试样本:学得模型后使用模型被预测的样本

根据训练数据是否含有标记信息,学习任务可以大致分为 监督学习无监督学习

  • 学习任务根据预测的是 离散值 还是 连续值,分为 分类回归 两类
  • 聚类 将训练集中的示例分成若干组,使用的训练样本一般不拥有标记信息

独立同分布:通常假设样本空间中全体样本服从一个未知分布 \(\mathcal{D}\) ,我们获得的每个样本都是独立地从这个分布上采样获得的。

与演绎相对,从样例中学习是一个归纳的过程,因此称为 归纳学习。广义的归纳学习大体相当于从样例中学习;而狭义的归纳学习则要求从训练数据中学得概念,因此亦称为 概念学习概念形成,目前应用的比较少。

版本空间:由于学习过程是基于有限样本训练集进行的,因此可能有多个假设与训练集一致,与训练集一致的假设集合被称为版本空间。

归纳偏好:机器学习算法在学习过程中对某种类型假设的偏好(如更一般或更特殊)。常用奥卡姆提到原则,即"若有多个假设与观察一致,则选最简单的那个"。

FNL定理:假设样本空间 \(\mathcal{X}\) 和假设空间 \(\mathcal{H}\) 都是离散的, \(\mathfrak{L}_a\) 代表学习算法,\(f\) 代表希望学习的真实目标函数,\(P(h\mid X,\mathfrak{L}_a)\) 代表算法基于训练数据 \(X\) 产生假设 \(h\) 的概率,则 \(\mathfrak{L}_a\) 在训练集之外的所有样本上的误差为:

\[ E_{\mathrm{ote}}(\mathfrak{L}_a\mid X,f)=\sum_h \sum_{x\in\mathcal{X}-X} P(x)\mathbb{I}\left(h(x)\neq f(x)\right) P(h\mid X,\mathfrak{L}_a) \]

若所有可能的 \(f\) 按照均匀分布,则对于任意两个学习算法 \(\mathfrak{L}_a\) 和 \(\mathfrak{L}_b\) ,都有:

\[ E_{\mathrm{ote}}(\mathfrak{L}_a\mid X,f)= E_{\mathrm{ote}}(\mathfrak{L}_b\mid X,f) \]