跳至内容

Ch-2 评估方法

  • 留出法 直接将数据集 \(D\) 划分为两个互斥的集合,分别作为训练集 \(S\) 和测试集 \(T\) 。分层训练 是保留类别比例的采样方式,训练集和测试集的划分尽可能保持数据分布的一致性。通常将大约 \(2/3\sim 4/5\) 的样本用于训练,剩余样本用于测试,重复评估取平均值。
  • 交叉验证法 将数据集 \(D\) 划分为 \(k\) 个大小相似的互斥子集,每个子集 \(D_i\) 尽可能保持数据分布的一致性,每次用 \(k-1\) 个自己的并集作为训练集,余下的作为测试集,进行 \(k\) 次即可得到 \(k\) 个结果,还可以调整子集的划分方式,划分 \(p\) 次的最终结果是 \(p\) 次 \(k\) 折交叉验证结果的均值。若测试集大小为 \(m\) ,\(k=m\) 则为 留一法,常认为比较准确。
  • 自助法 每次随机从大小为 \(m\) 的数据集 \(D\) 中随机挑选一个样本放入数据集 \(D'\) 后放回,重复 \(m\) 次,将 \(D'\) 作为训练集,\(D\backslash D'\) 作为测试集。该方法可能会引入估计偏差。

学习算法和参数配置选定后,应使用完整数据集重新训练作为最终模型。