一种量化确定专业领域词汇集最优维度的方法

    公开(公告)号:CN105701248A

    公开(公告)日:2016-06-22

    申请号:CN201610122005.0

    申请日:2016-03-03

    Inventor: 钱丽萍 汪立东

    CPC classification number: G06F17/30864 G06F17/30705 G06F17/30731

    Abstract: 本发明公开了一种量化确定专业领域词汇集量优维度的方法。该方法包括:选择少量专业领域种子词汇,以定制接口搜索互联网搜索引擎和专业文献索引网站获取样本文档,利用专家标注的样本文档,生成正、负文档相关的词汇集合;计算词汇的聚合重要性,以其建立正、负词汇特征集合的权序关系;递增特征维度,按序选择该维度数目的正、负词汇,生成合并特征集合;基于合并特征集合计算正、负词汇特征集合之间的距离、相似度和区分指数;以区分指数的变化率确定区分维度,按序从正词汇特征集中选择该维度数目的词汇,生成最优数目的专业领域词汇特征集;以新选择的专业领域词汇作为种子词,重复上述过程进行迭代自举,直至不再获得新的专业领域词汇。

    一种量化确定专业领域词汇集最优维度的方法

    公开(公告)号:CN105701248B

    公开(公告)日:2019-04-09

    申请号:CN201610122005.0

    申请日:2016-03-03

    Inventor: 钱丽萍 汪立东

    Abstract: 本发明公开了一种量化确定专业领域词汇集量优维度的方法。该方法包括:选择少量专业领域种子词汇,以定制接口搜索互联网搜索引擎和专业文献索引网站获取样本文档,利用专家标注的样本文档,生成正、负文档相关的词汇集合;计算词汇的聚合重要性,以其建立正、负词汇特征集合的权序关系;递增特征维度,按序选择该维度数目的正、负词汇,生成合并特征集合;基于合并特征集合计算正、负词汇特征集合之间的距离、相似度和区分指数;以区分指数的变化率确定区分维度,按序从正词汇特征集中选择该维度数目的词汇,生成最优数目的专业领域词汇特征集;以新选择的专业领域词汇作为种子词,重复上述过程进行迭代自举,直至不再获得新的专业领域词汇。

    一种基于文件序列化的自动机远程分发和初始化方法

    公开(公告)号:CN105302851B

    公开(公告)日:2018-12-21

    申请号:CN201510572332.1

    申请日:2015-09-10

    Abstract: 本发明提供一种基于文件序列化的自动机远程分发和初始化方法,将位于内存的自动机序列化成本地文件,然后将序列化后的文件进行分发和快速部署,以替代原有的基于规则和特征的分发和部署方式。该方法包括步骤:S1.配置后端服务器,将特征和规则进行初始化生成自动机;S2.在所述后端服务器上将自动机序列化到本地,以文件形式存储;S3.配置分发网络和n台处理机,所述后端服务器将文件形式存在的自动机通过分发网络发送给所有需要进行匹配处理的处理机;S4.每台处理机都接收文件形式存在的自动机,并初始化到内存;S5.处理机根据新生成自动机进行特征的匹配和检测处理。

Patent Agency Ranking