PRICAI 2018-08-28 日记

陈曦

今天参加了The 15th Pacific Rim International Conference on Artificial Intelligence (PRICAI 2018)会议,这里分三个部分进行汇总。

(会议地址链接:http://cse.seu.edu.cn/pricai18/

第一部分:10:30 ~ 12:10 AutoML Workshop

(细分为两场presentation)

第一场:A hands-on introduction to automatic machine learning

演讲者:来自美国怀俄明大学的Kotthoff

从下面这张图可以看出来,自动化机器学习主要要做的就是自动化挑选超参数。相当于一个黑盒,把数据放进去以后直接给出需要预测的结果。

常用的两种选择参数的方法是常用的Grid search和Random search,例如需要调整两个参数使算法达到最优效果时,用以上两种方法表示出来则如下图所示:

其中Grid search的方法非常昂贵,需要做比较时使用。而随机搜索的方法在现实情况下显得更加实用。

接下来,演讲者介绍了Local search(局部搜索法),首先是随机一个初始值,然后改变单一参数,如果朝着好的方向改变则继续进行相应的改变。反之则进行相反的改变,一直重复这个步骤直到所有的数据被用完。再重新随机选一个初始值。

举个例子,如下图所示,两次以后得到了不同的最好的值,那么此时再用acceptance criterion(验收准则)进一步选择。

最后一种搜索方法是Model-based search(基于模型的搜索),这个搜索方法看上去和上面一个类似,但我没有明白他给出的例子。这里不过多陈述了。

实际上,我们是无法知道我们能不能达到最好的调参效果的(除非是上帝视角了),而且这个调参过程中还包括了随机的因素影响,所以我们并不知道我们是否能够做得更好了。还有潜在的问题包括数据量不够大导致不能够将参数得range设置得足够大,等等。

解决的办法包括,更好理解的benchmarks(基准线),做更多的比较,尝试更多的随机种子。

演讲者给出了一个代码示例:http://www.cs.uwyo.edu/~larsko/mbo.py

示例中用了Grid search + SVM和随机森林(随机搜索)的两种方法。

第二场:AutoML challenges

这个部分的ppt内容很多,我觉得有点重复,内容比较无聊。这里节选部分记录一下。

首先,还是对AutoML概念的进一步解释。这个领域专注于使用自动化的方法解决一系列机器学习问题,其产生的原因包括现在大量随处可见的数据以及缺乏相关领域或者机器学习的专家来开发机器学习系统。演讲者他们的关注点仍在监督学习。

常规的设计流程如下图所示,

举一个更具体的分类例子来说明问题,你做完数据的预处理以后,要选取特征,然后要选分类器(例如选SVM)然后进一步选择核函数等等。这是个很复杂的过程,我们同时也可以看到前面一些步骤是重复的。

进一步总结这个过程中人可能出现的问题,比如缺乏特定领域的知识,或者机器学习方面的知识,实验中的出现错误等等。对于模式分类来说,光靠人是冒险的、昂贵的并且耗费时间。而现在的自动化方法局限于解决一类问题(无法同时解决特征选择和分类器选取两个问题),那么全自动机器学习有可能吗?

全自动full model selection的方法包括数据预处理,特征选择和分类器的选取并且能够最小化分类的失误。

进一步分析其优点和缺点,如下图所示:

那么演讲者他们的短期和长期目标是:

演讲者提到有许多gaint公司包括google,oracle, IBM都进行过相关的探索。另外,还有相关的比赛,参赛者利用(一套代码在)多种不同类型的数据进行实验。他们需要研究做的工作还有很多,甚至是AutoDL也是未来的一个研究方向。

第二部分:14:00 ~ 15:40 Diffusion Mechanism Design in Social Networks

Toturial:http://dengji-zhao.net/pricai18.html

演讲者是来自上海科技大学的赵老师,他在网上上传了他的ppt链接如下:

http://dengji-zhao.net/publications/PRICAI/PRICAITutorial_Zhao.pdf

这里简述这个presetation的内容,一开始赵老师便通过2009年美国的红气球比赛和拼多多两个案例来阐明共同应用到的一个原理:邀请更多的人参与就有更大的可能会赢/得到更便宜的物品(更高的效能)。进一步引出这场演讲中的重点案例,在买卖二手房的过程中,卖家直接认识的人可能并不是使其利益最大化的人(可能是卖家的朋友的朋友愿意出更多的价钱)。可以想象出一个由卖家出发的关系网络,但是卖家直接认识的人并不一定愿意将(房子出售的消息)传播给自己身边的人(除非他自己能够从中获利)。那么如何设置一个制度,是能够让这个关系网中的最终买家和卖家以及牵连其中的人都收益?

这里的机制设计(mechanism design)和经典的game theory博弈论是相反的,博弈论是参与者知道规则但不知收到结果。而机制设计是根据制定中间的规则,让参与者达到最终的结果。演讲者在此介绍了房屋拍卖时,利用的second price auction方法,即让所有拍卖方给出自己能够接受的价格并且最终将房子卖给出价最高的人(以第二高的价格出售)。如果采用价高者得的方式,那么房子的估值将被贬低(出价者都希望以更低廉的价格买到房子)。而采用second price auction可以避免这种(虚假报价的)情况,并且最终还是将房子给到了最需要的人(愿意出更多的钱买这个房子的人)。那么为了保障卖房者的利益,还可以采取保留价reserve price和促销的方式(让更多的人知道这个消息)。这里不考虑中介平台的情况。

基于上述种种,演讲者提出了他们的方法diffusion mechanism design传播机制设计,详见ppt第30页前后。但是他们设计出来的机制仍存在一些问题,这个传播中的花费?隐私的考虑?买家的策略(他们的方法时买家策略)?甚至还有传播过程中的虚报问题等等。进一步还可以研究的包括,多物品的买卖(这里是单一物品的二手买卖)。

第三部分: 16:00 ~ 17:40 Workshop on Advances in Deep Unsupervised Learning

这个部分又分成三场presentation,分别由北京师范大学的郭平老师,电子科技大学的徐老师和西安利物浦大学的黄老师给出的。

第一场:Insight into pseudoinverse(伪逆) learners : stacked autoencoder case

郭教授简单归纳总结介绍了DNN中面临的挑战(他提出自己算法的背景),包括调参的问题,神经网络的结构的设计问题。

同时也对自编码auto-encoders进行了简单的介绍,这是一种无监督的训练过程,数据先通过encoder进行压缩降维再decoder重新编码还原数据(可以是图像,那么这个过程会损失部分信息)。下图中左边便是一层的自编码器,而右边是多层堆叠stacked自编码器。

教授接下来介绍了PIL算法(我的理解是神经网络中的激活函数用tanh函数,具体的也没听明白)放在auto-encoders上使用进行堆叠的一个编码过程,最后可以得到一个降维的输出,如下图所示:

那么这里定义的loss function如下图中右图所示(要朝着loss越来越小的方向进行训练),左图是经典的损失函数的定义。

教授提到了他们做大数据实验时采用的原则是“分而治之”的方法,并且介绍了几种常用的model emsemble的方法(bagging, boosting, voting)。

 

总结下来,有以下的优点(下图中红色部分)以及存在的问题(下图中蓝色部分)。

第二场: Unsupervised deep domain adaptation

这个speech主要是讲迁移学习transfer learning中的领域适应domain adaptation但由于背景知识不太了解,所以大部分地方都不太懂。简单上一些ppt图片吧。

但毫无疑问,迁移学习是时下的一大热点。

第三场:Robust pattern recognition with manifold adversarial training

西交利物浦大学的老师一上来一口标准流利的英语让人很是佩服,尽管他研究的也是图像的模式识别问题,但是他的解释让人能够领悟到一点文章中最本质最精华的部分。首先,看下图,在图像中加入噪声数据(一般噪声是服从高斯分布的),那么加入噪声数据的图像被称为对抗样本adversarial examples。这样的样本普通的DNNs是没办法很好分类的,就连现在最先进的机器学习算法也无法识别。

那么如何设计算法生成一个更加稳健robust的对抗样本呢?使得分类器能够更好的进行分类实验,以下是教授提出的主要框架:

这里的Eplison是指噪声,改进的loss function利用的是最大最小化原理。换句话说,是木桶原理:补齐最短板。注意到改进后的公式中还有另一个参数pi,那么通过实验证明,当pi是2的时候得到的效果是最好的。pi是1或者无穷时都没有那么理想。(主要框架后面的数学推导公式略)

在不同参数下,可视化对抗扰动adversarial perturbation:

因而我们可以用这个框架生成对抗样本(和原始数据很像得样本),最后在半监督学习中实验结果与其他相比效果最好。在监督学习中效果也是很好的:

总结一下,最大最小化框架可以显性生成对抗样本。我们还可以可视化对抗扰动,生成的对抗样本与现有的benchmark样本相比更好,而且在大部分的NN应用中表现优良。