-
公开(公告)号:CN111026866A
公开(公告)日:2020-04-17
申请号:CN201911019149.3
申请日:2019-10-24
Applicant: 北京中科闻歌科技股份有限公司
IPC: G06F16/35 , G06F40/289
Abstract: 本发明公开了一种面向领域的文本信息抽取聚类方法、设备和存储介质。该方法包括:获取文本信息集合;所述文本信息集合包括:目标领域内的多个文本信息和目标领域外的多个文本信息;将所述文本信息集合输入预先训练的抽取聚类模型;通过所述抽取聚类模型对所述文本信息集合执行抽取和聚类处理,得到所述目标领域内每个主题对应的代表性信息。本发明将抽取和聚类融合在一起,使得抽取和聚类相互支撑,在抽取聚类过程中,人工干预少且抽取和聚类高效。
-
公开(公告)号:CN110134942A
公开(公告)日:2019-08-16
申请号:CN201910260924.8
申请日:2019-04-01
Applicant: 北京中科闻歌科技股份有限公司
IPC: G06F17/27 , G06F16/951 , G06F16/9535 , G06F16/35
Abstract: 本发明实施例涉及一种文本热点提取方法及装置,包括:采用正则表达式对输入的至少一个文本数据按照设定规则进行分割处理,得到多个第一短文本数据;采用依存句法分析算法将第二短文本数据生成对应的第四短文本数据;将第三短文本数据和第四文短本数据进行向量化处理,得到对应的多个文本向量;基于相似度算法确定任意两个文本向量之间的相似度;将相似度大于相似度阈值的两个文本向量进行合并处理,句法分析抽取关系词而组成的短句提高了信息抽取的可观性和准确度,让用户可以更好的理解文本内容从而获取核心关键信息点,通过Word2vec将短句向量化进行相似度对比,保留词语之间的语义信息,从而保证了排重工作的准确性,尽可能的避免了热点信息的冗余。
-
公开(公告)号:CN109815395A
公开(公告)日:2019-05-28
申请号:CN201811608345.X
申请日:2018-12-26
Applicant: 北京中科闻歌科技股份有限公司
IPC: G06F16/9535 , G06F16/957
Abstract: 本发明实施例涉及一种网页垃圾信息过滤方法、装置及存储介质,所述方法包括:按照设定处理规则对输入的原始文本进行分割,得到多个目标数据;对多个所述目标数据进行预处理;将经预处理后的多个目标数据进行向量化;确定经过向量化处理后的多个目标数据对应的多个相似度值;基于多个所述相似度值确定所述原始文本中的异常文本,够准确的提高内容识别系统的准确性和鲁棒性。
-
公开(公告)号:CN109815296A
公开(公告)日:2019-05-28
申请号:CN201811654206.0
申请日:2018-12-29
Applicant: 北京中科闻歌科技股份有限公司
Abstract: 本发明实施例涉及一种公证文档的人物知识库构建方法、装置及存储介质,所述方法包括:接收输入的公证文档数据;从所述公证文档数据中提取人名信息;从所述公证文档数据中提取与所述人名信息对应的属性信息;根据所述人名信息和所述属性信息更新数据库,当后续需要使用有关该人物的公证文档数据时,通过数据库调取,即可获取该人物的属性信息,节省人工查询的时间,提升办事效率。
-
公开(公告)号:CN108769278A
公开(公告)日:2018-11-06
申请号:CN201810319766.4
申请日:2018-04-11
Applicant: 北京中科闻歌科技股份有限公司
CPC classification number: H04L61/302 , H04L51/32 , H04L61/15
Abstract: 本发明涉及一种社交媒体账号管理方法及系统,该方法包括:通过所述互联网协议地址和端口访问任一社交媒体对应的注册网站;通过浏览器控件完成账号注册,将所述账号与所述互联网协议地址绑定为合格账号进行存储;当接收到任务时,从所述合格账号中获取执行所述任务的合格账号,通过所述浏览器控件根据所述合格账号进行登录以完成所述任务。本发明实施例主要提供针对国外社交媒体账号自动注册及利用注册账号进行指定任务的工作,同时通过将注册完成的账号与相对应的互联网协议地址进行绑定存储,以使用相匹配的互联网协议地址登录相关账号,提高账号可用性和存活概率。
-
公开(公告)号:CN119783663A
公开(公告)日:2025-04-08
申请号:CN202411861891.X
申请日:2024-12-17
Applicant: 北京中科闻歌科技股份有限公司 , 新华融合媒体科技发展(北京)有限公司
IPC: G06F40/258 , G06N3/0455 , G06N3/08
Abstract: 本发明提供了一种基于大语言模型的事件名生成方法、设备及介质,涉及事件名生成技术领域,所述方法包括:获取目标文章集合A;将A中的每一篇目标文章输入至预设的预训练语言模型,以得到标题摘要组列表B;获取B中每一标题摘要组对应的token长度,以得到B对应的token长度列表NB;确定B对应的分批处理的初始批次数量NUM;若NUM>1,则将B划分为若干批次,以得到B对应的批次列表C;根据C和预设的大语言模型,得到目标事件对应的事件名称;本发明中的方法,在生成事件的名称的过程中,结合目标事件的多篇目标文章,所参考的信息较多,从而使得生成的目标事件的名称更加准确。
-
公开(公告)号:CN119782889A
公开(公告)日:2025-04-08
申请号:CN202411952956.1
申请日:2024-12-27
Applicant: 北京中科闻歌科技股份有限公司
IPC: G06F18/24 , G06F18/213 , G06V10/44 , G06N3/0455 , G06F18/22 , G06N3/048
Abstract: 本申请涉及一种基于大模型的多模态假新闻检测方法、装置、及设备,尤其涉及信息处理技术领域。包括:将多模态待测新闻分别输入大模型gte‑Qwen2‑1.5B‑instruct、预训练视觉模型SwinT和预训练图文对比模型Clip,得到文本特征、图像特征以及文本对比特征和图像对比特征;计算归一化后的文本对比特征与图像对比特征之间的余弦相似度,得到图文相似度;将图文相似度作为注意力矩阵阈值来增强文本特征和图像特征,以提取局部异同特征;将图文相似度作为权重来增强文本特征和图像特征,以提取全局异同特征;将局部异同特征和全局异同特征输入假新闻分类器,得到假新闻分类器输出的多模态待测新闻的真实性预测值。
-
公开(公告)号:CN119782463A
公开(公告)日:2025-04-08
申请号:CN202411840111.3
申请日:2024-12-13
Applicant: 北京中科闻歌科技股份有限公司
IPC: G06F16/3329 , G06F16/353 , G06F40/35 , G06N3/045 , G06N5/022
Abstract: 本发明提供了一种仿人类复杂问题检索方法、电子设备及存储介质,该方法包括:对原始问题语句进行拆解处理,以得到若干个原子问题语句;根据若干个原子问题语句之间的关联关系,确定若干个原子问题语句之间的执行顺序;根据每一原子问题语句对应的语句类型,确定每一原子问题语句对应的目标检索信源;根据若干原子问题语句之间的执行顺序,依次通过每一原子问题语句对应的目标检索信源,对该原子问题语句进行检索,得到每一原子问题语句对应的原始答复语句;对若干原始答复语句进行语义整合,得到原始问题语句对应的目标答复语句,以通过意图识别、问题拆解、逻辑规划、扩展生成以及动态执行等多个模块协同工作,有效解决了复杂问题的检索难题。
-
公开(公告)号:CN119005198A
公开(公告)日:2024-11-22
申请号:CN202411030867.1
申请日:2024-07-30
Applicant: 北京中科闻歌科技股份有限公司
Abstract: 本公开涉及一种基于大模型的海量负面信息检测方法、装置、设备及介质。其中,基于大模型的海量负面信息检测方法包括:获取待检测文本,由目标机器学习模型对待检测文本进行分析输出第一结果,在第一结果为待检测文本对应的情感分析结果为非负面时,获取目标指令语句,由目标大语言模型基于目标指令语句对待检测文本进行情感分析,输出第二结果,将第二结果确定为待检测文本的检测结果,目标大语言模型的第一参数量高于目标机器学习模型的第二参数量,由此,能够通过不同参数量的机器学习模型和大语言模型结合的方式对待检测文本进行情感分析,确定待检测文本的检测结果,实现了在对待检测文本快速进行情感分析的基础上提高了情感分析的准确性。
-
公开(公告)号:CN118940826A
公开(公告)日:2024-11-12
申请号:CN202411434591.3
申请日:2024-10-15
Applicant: 北京中科闻歌科技股份有限公司 , 新华融合媒体科技发展(北京)有限公司
IPC: G06N5/02
Abstract: 本发明涉及自然语言处理领域,提供一种事件知识图谱构建方法、装置和电子设备,包括:基于源文本数据集构建事件图谱;基于所述事件图谱和开源知识图谱之间的共同实体,对所述事件图谱和所述开源知识图谱进行融合,得到融合了事件图谱和开源知识图谱的事件知识图谱;获取所述事件知识图谱中的节点和有向边的特征向量,得到进行了知识表示的事件知识图谱,作为目标事件知识图谱。本发明通过将事件图谱与知识图谱深度融合得到具有丰富知识表示的事件知识图谱。
-
-
-
-
-
-
-
-
-