一种面向文本的领域术语与术语关系抽取方法
摘要:
本发明公开了一种面向文本的领域术语与术语关系抽取方法,其特征在于,包括下述步骤:首先对原始语料进行预处理,获得候选词集,包括分句、分词及词性标注,干扰词过滤;其次,从原始语料和互联网中提取出术语特征,并结合双模型结构算法,从候选词中分离出术语;然后,采用倒排索引的方法构建术语词典,并利用最长匹配算法,标注待识别文本中的术语;最后,根据多维度节点标记规则,通过条件随机场模型进行多层次标记序列标注,得到待识别文本中术语间的关系。
公开/授权文献
0/0