吴恩达《机器学习训练秘籍》读书笔记(第33~35章)

第六部分 与人们的表现水平作比较

陈曦,朱小栋

第三十三章 为什么我们要比较人们的表现水平

1.很多的机器学习系统的目的是为了自动化一些人类可以做得好的事情(例如图像识别,语音识别和垃圾邮件分类)。那么对于这些人们可以做的好的事情来说,我们为什么要开发这些系统有以下几点原因:

  • 人们对于这些事情能够进行比较精确的标记
  • 利用人们的直觉可以做误差分析
  • 可以用人们的表现水平作为一个最优的误差分析率(理想的误差率),能帮我们判断可避免误差有多大从而可以尝试多种改进措施

2.对于人们都做不好的事(例如书的推荐,给客户推送广告或是预测股票市场),计算机能够做得更好一些,但仍然有以下几点问题:

  • 很难得到标签
  • 人们的直觉很难算数
  • 无从得知最理想的误差率

第三十四章 怎么去定义人们的表现水平

举一个例子:你要做一个自动的医学诊断图像的应用,那么对于没有医学背景的人来说可能达到15%的错误率,对一个初级医生来说达到10%的错误率,对于高级医生来说达到5%而对于医生团队来说则只有2%的错误率。那么我们将2%定义为“人们的表现水平”。在实际的开发过程中,我们可以让一个初级医生为我们进行大量的标记,因为医生团队太贵了。对于一些比较难的情况可以让高级医生或医生团队去做标记。

第三十五章 超越人们的表现水平

假设,总的来说,人类在识别语音时的表现错误率为10%而你的系统只有8%,那么我们如何利用之前的技巧来取得进步呢?

你可以细分你的数据中人的表现水平更好的情况并利用之前的技巧进行改进:例如你的系统在识别噪声的表现上比人更好,而人类在识别快速讲话中效果更好。那么对于快速讲话的数据子集来说:

  1. 你可以从人们那里获取更高精度的数据
  2. 你同样可以利用人们的直觉去判断为什么你的系统不能很好的识别快速讲话的数据
  3. 在这个子集中的精确度以人们的表现为目标

总的来说,对于系统的表现已经超过了人们的表现得地方,取得进步是比较慢的。而对于系统的表现没有达到人们的表现水平的地方可以取得更快的进步。