-
公开(公告)号:CN115269834A
公开(公告)日:2022-11-01
申请号:CN202210782688.8
申请日:2022-06-28
申请人: 国家计算机网络与信息安全管理中心 , 中国科学院信息工程研究所
摘要: 本发明公开了一种基于BERT的高精度文本分类方法及装置,在输入端采用FastText模型,对词汇进行嵌入表示得到表示向量,然后把表示向量作为BERT模型的输入,将BERT的输出结果接上全连接层+softmax,实现文本分类。本发明提前用FastText模型处理语料数据,获取字符的特征,解决了OOV的embedding问题,同时获取词的形态变换,对富有词型变换的语料具有更好的表示能力;使用BERT能够提前预训练大量的语料,增加了词向量的语义丰富度,获得更好的上下文表示;在BERT模型的输出添加全连接层和softmax进行文本分类,提高了文本分类的精度。
-
公开(公告)号:CN115190217A
公开(公告)日:2022-10-14
申请号:CN202210801788.0
申请日:2022-07-07
申请人: 国家计算机网络与信息安全管理中心
摘要: 本发明公开了一种融合自编码网络的数据安全加密方法和装置,涉及互联网数据处理技术领域。本发明为了解决现有数据安全加密时面对包含大量图片的海量数据存储资源开销大、数据传输不安全、数据传输效率低的缺陷,其方法为采用文本加密模块对文本类型数据作加密处理,构建图片自编码网络模型,采用图片压缩模块对待加密的原始图片类型数据作预压缩处理;采用图片加密模块对图片压缩编码作加密处理,采用解密模块对需要应用于下游任务的文本密文数据或图片密文数据进行解密,采用图片重建模块对解密后的图片压缩编码进行重建复原,译码器将码字通过重建处理后得到重建图片类型数据。本发明主要用于海量数据传输。
-
公开(公告)号:CN114978585A
公开(公告)日:2022-08-30
申请号:CN202210380490.7
申请日:2022-04-12
申请人: 国家计算机网络与信息安全管理中心 , 北京赋乐科技有限公司
摘要: 本公开的实施例提供了基于流量特征的深度学习对称加密协议识别方法、装置、设备和计算机可读存储介质。所述方法包括获取网络流量数据;对所述网络流量数据进行预处理,得到对称加密流量;基于主成分分析‑皮尔森系数法流量识别模型和基于注意力机制的CNN‑LSTM算法流量识别模型,构建基于流量特征的对称加密协议识别模型;将所述对称加密流量,输入至所述基于流量特征的对称加密协议识别模型,完成对所述网络流量数据的识别。以此方式,实现了对对称加密协议的高效识别。
-
公开(公告)号:CN112258377A
公开(公告)日:2021-01-22
申请号:CN202011088661.6
申请日:2020-10-13
申请人: 国家计算机网络与信息安全管理中心
摘要: 本发明公开了一种鲁棒二值神经网络的构建方法及设备。鲁棒二值神经网络的构建方法,包括:对训练数据进行二值化处理;基于二值化处理后的训练数据,对预设二值神经网络进行训练;对完成训练的预设二值神经网络进行纠错编码。采用本发明,通过对训练数据进行二值化处理,可以将内存占用降低为原有的浮点型权值的1/32;同时,对训练好的二值神经网络进行纠错编码,使得编码后二元神经网络具有抵抗檫除或者错误的噪音干扰,所以编码后的二元神经网络具有很好的鲁棒性。
-
公开(公告)号:CN110674678A
公开(公告)日:2020-01-10
申请号:CN201910725061.7
申请日:2019-08-07
申请人: 国家计算机网络与信息安全管理中心
摘要: 本发明公开了一种视频中敏感标志的识别方法及装置,所述方法包括:获取待审核视频,通过机器预识别系统对所述待审核视频进行敏感标志识别,输出所述待审核视频含有敏感标志的得分;判断所述得分是有大于或等于预定输出阈值,如果判断为是,则将所述待审核视频发送到人工审核窗口以进行人工确认本发明能够进一步提高视频审核工作的审核效率,从而构建更安全的网络环境。
-
公开(公告)号:CN118520929B
公开(公告)日:2024-10-29
申请号:CN202411003497.2
申请日:2024-07-25
申请人: 国家计算机网络与信息安全管理中心
IPC分类号: G06N3/09 , G06N3/0455 , G06F40/194
摘要: 本发明提供一种文本相似度确定模型的训练方法及文本相似度计算方法,属于计算机技术领域,该训练方法包括:获取第一数据集和第二数据集;第一数据集中包括至少一个短文本数据对;第二数据集中包括至少一个目标文本数据对,目标文本数据对中的两个目标文本数据至少一个为长文本数据;基于句向量对比模型,获取第二数据集中各目标文本数据的关键表述;句向量对比模型是基于第一数据集和第一损失函数对第一预训练模型训练得到的;基于各关键表述和第二损失函数,对第二预训练模型进行训练,得到文本相似性确定模型。通过在判定过程中引入短文本和长文本,提升了文本相似度确定模型输出结果的准确性。
-
公开(公告)号:CN115080871B
公开(公告)日:2024-05-17
申请号:CN202210847062.0
申请日:2022-07-07
申请人: 国家计算机网络与信息安全管理中心
IPC分类号: G06F16/9536 , G06F16/901 , G06N3/0464 , G06N3/042 , G06N3/045 , G06N3/08 , G06Q50/00
摘要: 本发明公开了一种跨社交网络社交用户对齐方法,涉及社交网络的用户关系挖掘领域。本发明为了解决现有社交用户对齐方法不能跨社交网络、计算精度低、对齐效率低的缺陷,采用如下步骤实现:采集社交网络的用户属性信息,构建用户关系拓扑图;根据边权重和节点的出入度计算节点权重;构建一阶近邻关系模型和二阶近邻关系模型,确定一阶邻居节点和二阶邻居节点,得到用户节点之间的相互关系;构建社交对齐神经网络,通过社交对齐神经网络对用户关系拓扑图中各节点进行邻居节点的信息聚合、拼接与非线性变换,得到跨社交网络的社交用户身份对齐结果。本发明主要用于通过跨社交网络对其社交用户实现用户关系挖掘。
-
公开(公告)号:CN117251524A
公开(公告)日:2023-12-19
申请号:CN202310446513.4
申请日:2023-04-24
申请人: 国家计算机网络与信息安全管理中心 , 讯飞智元信息科技有限公司
IPC分类号: G06F16/33 , G06F16/35 , G06F40/289 , G06F40/30 , G06F18/2431 , G06F18/2415 , G06F18/214 , G06N3/0455 , G06N3/0464 , G06N3/047 , G06N3/084
摘要: 本发明公开了一种基于多策略融合的短文本分类方法,属于自然语言处理领域,主要涉及深度神经网络、数据增强以及文本分类。该方法包括如下步骤:通过数据预处理剔除噪声数据、基于词性标注关键词进行分类,基于数据增强的文本分类,最终通过多策略融合设置相应的阈值门限获取网络短文本数据标签。本发明通过提出一种基于多策略融合的短文本分类的解决方法,从而提升短文本数据分类的效果,进而提升业务人员发现相关短文本数据精准度和业务效率。
-
公开(公告)号:CN116992128A
公开(公告)日:2023-11-03
申请号:CN202310761657.9
申请日:2023-06-26
申请人: 国家计算机网络与信息安全管理中心
IPC分类号: G06F16/9535 , G06F18/24 , G06Q10/0639
摘要: 本申请公开了一种检测推荐系统的推荐结果多样性的方法及设备,包括:获取所述推荐系统的推荐结果,并基于预设主题分类模型对所述推荐结果进行分类,以获得推荐内容的主题类别;确定推荐内容的主题类别中,相似的主题内容,通过预设情感立场检测模型进行情感立场检测;根据情感立场检测结果,计算考虑情感立场多样性的多样性评价指标。本申请的方法将情感立场维度的多样性融入到推荐系统多样性指标中,由此提出了一种考虑了情感立场多样性的推荐系统多样性检测方法。
-
公开(公告)号:CN116595316A
公开(公告)日:2023-08-15
申请号:CN202310430301.7
申请日:2023-04-20
申请人: 国家计算机网络与信息安全管理中心
IPC分类号: G06F18/10 , G06F18/22 , G06F18/214 , G06F16/9035 , G06F16/951 , G06F16/9537 , G06F16/9538 , G06F16/9535 , G06F16/9038
摘要: 本发明提出了一种基于评分卡模型的多平台虚假信息识别方法及装置,方法包括:获取各自表征一主题的多组数据信息;基于数据信息与预先标记的数据信息的比对情况进行筛选;对当前数据信息进行排序以及填充处理;利用当前数据信息,构建评分卡模型,并确认每一主题对应的数据信息中,各个维度信息对数据信息危险程度的影响情况;利用当前构建的评分卡模型,对再次获取的表征一主题的数据信息进行识别处理。本发明应用评分卡模型,可基于同一主题的虚假信息识别,并且可以根据影响主题信息的多种因素,在不同的周期内,识别不同维度数据的影响因素权重。
-
-
-
-
-
-
-
-
-