第五部分 学习曲线
陈曦,朱小栋
第二十八章 诊断偏差和方差:学习曲线
- 随着训练集的数量变大,其验证集误差随之减少,如下图所示:

- 我们通常有一个“理想错误率”(例如我们认为这个值是人类水平的表现)。那么加上这条线,如下图所示:

- 我们推算我们的验证集误差将会达到平稳阶段,即使你再加入更多的数据也没办法达到理想的表现:

第二十九章 画出训练集误差
随着训练集的数据越多,那么训练集上出现错误的可能性就越大,如下图所示:

第三十章 解释学习曲线:高方差

这个图表示的高偏差的情况:训练集的误差远大于理想情况(暗示着大的可避免偏差)并且验证集和训练集的间距很小意味着小的方差。之前我们讨论的情况就是这张图最右边的点的情况,如今把整条曲线随着不同的训练集数量画出来可以给我们更好的理解。
第三十一章 解释学习曲线:其他的情况
- 低偏差、高方差的情况:

- 高偏差、高方差的情况:

第三十二章 画出学习曲线
假如说你的样本量很小,并且画出来的学习曲线看上去噪声有点多(验证集和训练集误差可能随机浮动)。当你训练出来的分类器有倾向于某一类的情况,那么可能是因为你的训练集样本本身的分布不均匀。有两种办法解决问题:
- 采用有放回的随机采样(sampling with replacement)方式,例如一百个样品中多次抽取10个样品然后求平均。
- 如果你的训练集倾向于某一类,那么你可以按照原始训练集的整体分布情况选择一个“平衡的”子集来代替随机抽取的。
当你的样品量很大(超过10000个)的时候,你不需要这个技巧。或是你的训练集样本分布没有偏差的时候。
但最后,你需要考虑的是计算成本(computationally expensive)的问题。