知识图谱 --- 面向非结构化数据的知识抽取 No.2 关系抽取

知识图谱 --- 面向非结构化数据的知识抽取 No.2 关系抽取 关系抽取 从文本中抽取两个或者多个实体之间的语义关系。1 基于模板的关系抽取方法特点早期基于语言学知识结合语料特点由领域专家手工编写模板示例1模板1[X]与妻子 [Y]2模板2[X]老婆[Y]利用上述模板在文本中进行匹配可以获得新的具有“夫妻”关系的实体。 为了进一步提高模板匹配的准确率还可以将句法分析的结果加入到模板中。优点构建简单可以较快的在小规模数据集上实现关系抽取系统。缺点数据规模大时需要耗费领域专家大量的时间可移植性较差同时手工构建的模板数量有限召回率普遍不高。2 基于监督学习的关系抽取方法2.1 简单介绍基于监督学习的关系抽取方法是将关系抽取转化为分类问题在大量标注数据的基础上训练有监督学习模型进行关系抽取。基本步骤1预定义关系的类型2人工标注数据3设计关系识别所需的特征一般根据实体所在句子的上下文计算获得根据计算特征的复杂性常用特征可以分为a. 轻量级基于实体和词的特征如实体前后的词、实体类型、实体之间的距离b. 中量级基于句子中语块序列的特征c. 重量级实体间的依存关系路径、实体间依存树结构的距离以及其他特定的结构特征4选择分类模型如SVMNNNB等5基于标注数据训练模型6对训练的模型进行评估发展传统的基于监督学习的关系抽取是一种依赖特征工程的方法机器学习方法。深度学习的方法不需要人工构建各种特征其输入一般只包括句子中的词及其位置的向量表示。2.2 基于深度学习的关系抽取方法基于DL的关系抽取方法主要有流水线方法和联合抽取。2.2.1 流水线方法流水线方法是将识别实体和关系抽取作为两个分离的过程进行处理因此关系抽取的结果也依赖于实体抽取的结果示例1CR-CNN模型首先给定输入的句子CR-CNN模型首先将句子中的词映射到低维向量每个词的向量包含了词向量和位置向量两部分。这一步类似于词嵌入过程然后模型对固定大小滑动窗口中的词的向量进行卷积操作为每个窗口生成的新的长度的特征向量。相当于每个卷积核是一个词的上下文的输入接着对所有的窗口特征向量求最大值模型得到整个句子的向量表示。最后进行关系分类计算句子向量和每个关系类型向量的点积得到实体具有每种预定义关系的分值。2Attention CNNs模型将注意力机制引入到神经网络中对反映实体关系更重要的词语赋予更大的权重。特点在输入层模型引入了词与实体相关的注意力在池化层和混合层引入了针对目标关系类别的注意力。3Attention BLSTM模型模型包含两个LSTM网络从正向、反向处理输入的句子从而得到每个词考虑左边和右边序列背景的状态向量词的两个状态向量通过元素级求和产生词的向量表示。接着模型通过注意力层组合词的向量产生句向量 进而基于句向量将关系分类。2.2.2 联合抽取方法联合抽取方法是将实体抽取和关系抽取相结合在统一的模型中共同优化可以避免流水线方法存在的错误积累问题代价就是网络参数会变大。模型示例由三个表示层组成嵌入层词嵌入层、序列层基于单词序列的LSTM-RNN层、依存关系层基于依赖性子树的LSTM-RNN层2.3 基于监督学习的关系抽取方法优缺点优点准确率高标注数据越多越准确缺点标注数据成本太高不能扩展新的关系3 基于弱监督学习的关系抽取方法3.1 远程监督方法通过将知识图谱与非结构化文本对齐的方式自动构建大量的训练数据减少模型对人工标注数据的依赖增强模型的跨领域适应能力。基本假设如果两个实体在知识图谱中存在某种关系则包含两个实体的句子均表达了这种关系。基本步骤1从知识图谱中抽取存在目标关系的实体对2从非结构化文本中抽取含有实体对的句子作为训练样例3训练监督学习模型进行关系抽取优点可以利用丰富的知识库信息减少一定的人工标注缺点假设过于肯定引入大量噪声存在语义漂移现象很难发现新的关系3.2 Bootstrapping方法优点构建成本低适合大规模构建可以发现新的关系隐含的缺点对初始给定的种子集敏感比如苹果这个实体有多个含义存在语义漂移问题结果准确率较低缺乏对每一个结果的置信度的计算4 学习视频https://www.bilibili.com/video/av54122146/?p3t1062