陈曦
今天的日记分成三个部分,第一部分是被邀请嘉宾做的presentation,第二部分是下午听的一场session。
第一部分:Causal Modeling and Machine Learning 因果建模和机器学习
关于嘉宾的信息可见以下链接:
http://cse.seu.edu.cn/pricai18/keynote_invited_speakers.html

因果关系和相关:






Simpson悖论:看左图(根据年龄划分)可知,多做运动可以降低胆固醇。而整体看,两者成正比。

“奇怪的”相关:可能女性学生更聪明。

以下游戏中,第一选择initial choice是随机选择的,但是第二次选择是存在新的已知条件的(B门后面没有钱),此时产生了新的因果关系。


预测、干扰或反事实的三种情况:

识别原因:随机控制所有实验(黄金法则),其他因素fixed只研究控制变量。


人为干扰判断是否存在因果关系,例如巴士到站的时间和小明出门的时间。


第一,确保条件独立限制。第二,因果马尔科夫链和可信的假设faithfulness assumption。

考古数据上的应用:

利用公式建模因果结构:

因果对称的结构(用线性表示,噪声是高斯分布或者规格一致的分布):

在香港股票市场上的应用:

后非线性因果模型(PNL模型):


定义两个变量的情况:


在时间序列中的情况:时间延长的因果和瞬时的关系,在下采样和临时采集数据中找到因果关系,从部分可观察的时间序列中。

下采样的方法:系统采样或者是求平均。

不平稳的时间序列,不同情况下的多种数据集。




有一些隐含的我们不知道的成因:


知道结果的化,可以得到更多的信息。比如看到人的影子可以推断出这个人的姿态,光源方向以及与人的远近。

已知结果推断该结果下,原因发生的概率:







第二部分: 14:00 ~ 15:40 Information retrieval and extraction
第一场:Social collaborative filtering ensemble 社会协同过滤集成

对于推荐系统的简单介绍以及常用的方法:collaborative filtering(CF)协同过滤。他们整合了多个协同过滤方法的优点,提出了协同过滤系统。

其中最常见的问题是数据稀疏性data sparsity和冷启动cold start的问题,因而解决这样的问题很重要。社交推荐是减轻数据稀疏性问题的一个很好的方法。总结了一下协同过滤和社交推荐的方法:


他们提出的方法:

重点是loss function的定义,如下图所示:

解决冷启动的问题:

多种经典方法和作者提出的方法进行对比实验:

这里的衡量标准是RMSE和MAE,证明他们的mapping方法可以很好地解决冷启动的问题:


第二场:HAVAE:Learning prosodic-enhanced representation of rap lyrics HAVEA:说唱歌词的学习韵律增强表现

说唱Rap的歌词比较没有规律,自由。本文提出的垂直注意力变化性自编码网络:

仔细看转成词向量的方法rhyme2vec:

特征聚合的方法:

做了两件事,第一件就是下一行歌词的预测:

第二,就是做分类:

总结:

第三场:Fusing semantic prior based deep hashing method for fuzzy image retrieval 基于先验的深度哈希情感融合方法的模糊图像检索

他们做了什么:

方法的框架:

objective function是什么:

实验结果:

