-
公开(公告)号:CN111353300B
公开(公告)日:2023-09-01
申请号:CN202010093817.3
申请日:2020-02-14
申请人: 中科天玑数据科技股份有限公司 , 国家计算机网络与信息安全管理中心
IPC分类号: G06F40/284 , G06F40/289 , G06F18/214 , G06F18/241
摘要: 本发明提供了一种数据集构建方法及装置,包括步骤:数据采集,获取来自互联网数据源的第一数据,所述第一数据包括自然语言,所述第一数据经过预处理后,生成第二数据;数据特征分析,所述第二数据包括子数据,所述子数据包括第一特征数据,分析所述第一特征数据,得出所述第一特征数据的特征度;数据标签建立,根据所述第一特征数据的特征度确定所述子数据标签;数据分类存储,根据所述子数据标签将所述子数据分类保存,保存为数据集。实时采集互联网中的数据;根据特征数据和特征度提取对应的标签;通过所述子数据标签将所述子数据进行分类提高提取速度,提高工作效率。本发明提供了一种相关信息获取方法及装置,提高准确性,提高工作效率。
-
公开(公告)号:CN110020433B
公开(公告)日:2023-04-18
申请号:CN201910256769.2
申请日:2019-04-01
申请人: 中科天玑数据科技股份有限公司 , 国家计算机网络与信息安全管理中心
IPC分类号: G06F40/295 , G06F16/35 , G06Q50/00
摘要: 本发明公开了一种基于企业关联关系的工商高管人名消歧方法,涉及实体消歧领域,包括以下步骤:将待消歧数据集U,按高管姓名划分成组n个高管姓名组A;根据步骤S1得到的姓名组划分结果,对每个组A,构建N层以内的高管及企业关联关系网络G;针对每个姓名组A,根据密切度计算规则,计算姓名组A中高管节点之间的关联密切度f;根据关联密切度构建聚类函数CL,使用层次聚类算法得到消歧结果。本发明能自动化对工商高管人名进行消歧,具有较高的消歧准确率,且具有一定的阈值设置灵活性,可满足较多应用场景的工商高管人名消歧;同时可构建高管任职关联关系、高管投资关联关系,为高管全视角的关联图谱分析提供支撑。
-
公开(公告)号:CN111353300A
公开(公告)日:2020-06-30
申请号:CN202010093817.3
申请日:2020-02-14
申请人: 中科天玑数据科技股份有限公司 , 国家计算机网络与信息安全管理中心
IPC分类号: G06F40/284 , G06F40/289 , G06K9/62
摘要: 本发明提供了一种数据集构建方法及装置,包括步骤:数据采集,获取来自互联网数据源的第一数据,所述第一数据包括自然语言,所述第一数据经过预处理后,生成第二数据;数据特征分析,所述第二数据包括子数据,所述子数据包括第一特征数据,分析所述第一特征数据,得出所述第一特征数据的特征度;数据标签建立,根据所述第一特征数据的特征度确定所述子数据标签;数据分类存储,根据所述子数据标签将所述子数据分类保存,保存为数据集。实时采集互联网中的数据;根据特征数据和特征度提取对应的标签;通过所述子数据标签将所述子数据进行分类提高提取速度,提高工作效率。本发明提供了一种相关信息获取方法及装置,提高准确性,提高工作效率。
-
公开(公告)号:CN111401448B
公开(公告)日:2024-05-24
申请号:CN202010183470.1
申请日:2020-03-16
申请人: 中科天玑数据科技股份有限公司 , 国家计算机网络与信息安全管理中心
IPC分类号: G06F40/284
摘要: 本发明提供了一种交易平台分类方法和装置,包括步骤:数据采集,接收第一数据,根据第一数据获取第二数据,所述第二数据包括自然语言,对所述第二数据进行第一预处理,生成第三数据;数据处理,对所述第三数据进行分析,根据数据相关度,判定所述第三数据为第一类数据或第二类数据;分类模型建立,将所述第一类数据和第二类数据根据样本数和学习率建立分类模型;平台分类,接收平台数据和所述第三数据,将所述第三数据输入所述分类模型,判定所述第三数据为第一类数据或第二类数据;分析平台数据,判定与所述平台数据相关的第三数据。通过数据采集,数据处理,分类模型建立,平台分类,判断平台为场内或场外平台。
-
公开(公告)号:CN113761215A
公开(公告)日:2021-12-07
申请号:CN202110321491.X
申请日:2021-03-25
申请人: 中科天玑数据科技股份有限公司 , 国家计算机网络与信息安全管理中心
发明人: 赵忠华 , 李建广 , 余智华 , 王禄恒 , 陈欣洁 , 赵志云 , 冯凯 , 葛自发 , 杜漫 , 孙小宁 , 穆庆伟 , 万欣欣 , 申双成 , 李欣 , 孙立远 , 付培国 , 王晴 , 杜宛真
IPC分类号: G06F16/36 , G06F16/35 , G06F40/242 , G06F40/295
摘要: 本发明公开了一种基于反馈自学习的动态字典库生成方法,包括以下步骤:S1、字典库定义;S2、基于字典库分类体系;S4、基于语料库导出的标注数据,配合模型参数调整,逐步迭代优化模型;S5、将S4步生成的预测数据回填到字典库。有益效果:该方法通过概念模式定义、自然语言处理技术、全流程调度机制,实现从原始语料概念模式定义生成基础字典库,在基础字典库基础上进行标注模型的自动构建、迭代训练及修正,最后再利用标注模型来进行新的语料数据标注,反馈更新字典库,实现从标注训练到反馈自学习的闭环流程,达到模型自动逐步优化能力。最终实现字典库的自动完善,标注模型逐步优化的全自动循环过程。
-
公开(公告)号:CN111401450A
公开(公告)日:2020-07-10
申请号:CN202010184062.8
申请日:2020-03-16
申请人: 中科天玑数据科技股份有限公司 , 国家计算机网络与信息安全管理中心
IPC分类号: G06K9/62 , G06F40/284 , G06Q40/04
摘要: 本发明提供了一种交易场所分类方法和装置,包括步骤:接收第一数据,根据第一数据获取第二数据,所述第二数据为文本数据,对所述第二数据进行标记处理,生成第三数据;对所述第三数据进行第二预处理,得出第四数据,将所述第四数据进行转换,得出第五数据,根据所述第五数据,生成第一模型;将所述第五数据划分为第一部分和第二部分,将所述第一部分导入第一库生成所述第一边界,将所述第二部分导入验证,得出第二模型;接收场所信息,将所述场所信息进行所述第二预处理得出所述第一信息,将所述第一信息导入所述第二模型,得出场所类别。通过分界线判断所述场所类别,在直观而且快捷的同时,提高所述场所类别的划分准确性。
-
公开(公告)号:CN111401448A
公开(公告)日:2020-07-10
申请号:CN202010183470.1
申请日:2020-03-16
申请人: 中科天玑数据科技股份有限公司 , 国家计算机网络与信息安全管理中心
IPC分类号: G06K9/62 , G06F40/284
摘要: 本发明提供了一种交易平台分类方法和装置,包括步骤:数据采集,接收第一数据,根据第一数据获取第二数据,所述第二数据包括自然语言,对所述第二数据进行第一预处理,生成第三数据;数据处理,对所述第三数据进行分析,根据数据相关度,判定所述第三数据为第一类数据或第二类数据;分类模型建立,将所述第一类数据和第二类数据根据样本数和学习率建立分类模型;平台分类,接收平台数据和所述第三数据,将所述第三数据输入所述分类模型,判定所述第三数据为第一类数据或第二类数据;分析平台数据,判定与所述平台数据相关的第三数据。通过数据采集,数据处理,分类模型建立,平台分类,判断平台为场内或场外平台。
-
公开(公告)号:CN111369369A
公开(公告)日:2020-07-03
申请号:CN202010184061.3
申请日:2020-03-16
申请人: 中科天玑数据科技股份有限公司 , 国家计算机网络与信息安全管理中心
摘要: 本发明提供了一种微盘交易平台监控系统,包括:规则管理模块,用于设定、维护微盘交易平台违法违规判定规则、决策分析规则;数据处理模块,用于采集或导入微盘交易平台信息,并将信息标准化后存入数据库;违规分析处理模块:用于根据违法违规判定规则对微盘交易平台进行判定分析;决策分析模块:用于根据决策分析规则,对微盘平台进行综合分析和评级;预警通知模块:用于将判定有风险的微盘交易平台进行预警通知;本发明还提供了一种微盘交易平台监控方法,对微盘交易平台进行监管,及时发现违法违规的微盘交易平台,进行示警,用户根据示警信息能及时知悉违法违规的微盘交易平台,能根据示警信息及时对违法违规的微盘交易平台进行处理。
-
公开(公告)号:CN110837608B
公开(公告)日:2024-04-12
申请号:CN201911080716.6
申请日:2019-11-07
申请人: 中科天玑数据科技股份有限公司 , 国家计算机网络与信息安全管理中心
IPC分类号: G06F16/9538 , G06F16/951
摘要: 本发明提供了一种基于多源数据的舆情话题传播路径分析系统,包括:多源数据采集模块,用于对舆情话题进行多源数据采集,获取至少一项来源信息;传播路径分析模块,用于根据来源信息的类型采用不同的单源传播路径建立方案,得到单源传播路径,多个单源传播路径相互关联,得到交叉传播路径;传播主路径分析模块,用于分析各个节点的转发关系和转发量,得到舆情话题的关键传播节点,保留根节点与关键传播节点、关键传播节点之间的传播路径,删掉无关路径,得到传播主路径;路径显示模块,用于显示路径信息。本发明还提供了一种基于多源数据的舆情话题传播路径分析方法,帮助用户更加直观的了解舆情话题的传播情况。
-
公开(公告)号:CN109977414B
公开(公告)日:2023-03-14
申请号:CN201910256768.8
申请日:2019-04-01
申请人: 中科天玑数据科技股份有限公司 , 国家计算机网络与信息安全管理中心
摘要: 本发明公开了一种互联网金融平台用户评论主题分析系统及方法,涉及自然语言处理领域;分析系统包括数据采集模块、金融词向量学习模块、评论主题生成模块、用户评论分类模块和评论主题更新模块;分析方法所述方法利用金融论坛中平台用户印象聚类生成用户评论主题,基于用户评论主题对互联网金融平台相关用户评论进行分析,并定期对评论主题进行更新。本发明不需要进行长期人工干预,借助互联网中易于获取的用户知识实现稳定的互联网金融平台评论分析及主题提取,分析获得的评论主题较有代表性,从而可以通过分析结果帮助用户更直观了解该互联网金融平台。
-
-
-
-
-
-
-
-
-