【deeplearing.ai】Week 15 Word Embeddings文本情感分析

【deeplearing.ai】Week 15 Word Embeddings文本情感分析 Word Embeddings文本情感分析1 摘要本周围绕这Word Embeddings展开。讲了它是什么有什么用其次是提到了它相关的两种训练算法最后应用到文本情感分类词性相似推理以及消除歧视问题上。Word EmbeddingsSentiment Classification我到现在还没理解为啥要叫这么不直观的名字可能是我理解的不到位。本周的留下了很多问题理解起来不是那么直观nlp的算法还是稍微复杂一些的。待之后深入。遗留问题如下t-SNE降维算法如何训练word embeddings包括负采样GloVeWord2Vec几种算法消除歧视的时候使用到的线性代数的投影公式。2 Word Embeddings是什么讲了半天我实在是没能理解它究竟是什么并且看的过程中老是喜欢把它翻译成单词嵌入这让我极其费解。作业实现的时候我总结了一下其实WE以下简称就是Word的特征向量但是它这些抽取出来的特征不是从它本身来的CNN中训练得到的特征是从它本身即图片本身得来的而是从上下文得来的。我感觉这是一件非常非常有意思的事情这是一个新的特征抽取思路可以解决上下文的问题。其次再次思考rnn的相关算法。cnn可以说是对空间特征的抽取rnn则是对时间序列的抽取。之所以能收敛前者应该是因为图片空间上有规律后者则因为文本在时间上有规律。我有种感觉这是一个接近深度学习本质的认知。3 应用一名词相似推理3.1 问题这是一个很有意思的问题。假设man对应king那么请问women对应什么很简单吧queen。同理man对应father那么请问women对应什么mothe很简单吧。可是仔细想想这样一件简单的事情计算机能做吗建立一个字典不算哈这件事的关键之处在于教会计算机人类推理的能力这几乎是不可能的。比如人是怎么做到的仔细想想其实我们也完全不清楚我们是怎么做出这种推理的呢首先我们得知道man是什么再要知道king是什么再要知道国王从历史上来看男的比较多这样的事再联想起女应该对应什么……做过深度学习就知道其实认知是最大的难题。但是这里使用了一种非常有意思方式完成了这件事。3.2 Solution核心的思想是用统计的方法量化一个word的上下文关系通过大量统计得知一般来说这个词和其他词的上下文关系两个词之间的关系可以用向量差来表示。于是我们只需要让两对词之间的两个关系尽可能相似。上文我们提到WE就是这样一种量化单词向量的方法。于是man和king向量的关系我们可以用它们向量差来表示。woman向量需要和所有词都作差找出一个关系这个关系向量和上述关系向量最为接近。不知道你晕了没有可能我描述得不好其实相当简单。单词可以用向量来表示单词之间的关系可以用向量来表示关系之间的相似度可以用向量的余弦定理来表示于是我们就可以求最相似的词说到这里终于能够真正地理解向量和线性代数——刻画多维空间的数学工具。太过精彩。关于算法细节这里不再赘述总之就是余弦定理。4 应用二句子情感分类4.1 浅层网络又看起来像一个认知问题感觉特别难。其实这次可以换成深度学习监督学习的角度。既然每个词的特征都给你提取出来了那么只需要用一个浅层的神经网路对这些特征进行一个简单的多分类学习即可很简单吧。仔细想想其实最关键的只有两步。word的特征向量机器学习自动求最优解4.2 考虑上下文上述方法的缺点在于完全没考虑上下文的关系。一个非常直观的例子I am not happy。这句话明显是表达不开心但是我们的模型会