相似样本语料的生成方法、装置、电子设备及存储介质
摘要:
本申请涉及数据处理领域,尤其涉及一种相似样本语料的生成方法、装置、电子设备及存储介质,解决相似样本语料的生成过程复杂,以及难以生成有效相似样本语料的问题,方法为:获取目标领域的一个第一种子语句,以及其他领域中的各个第二种子语句,将第一种子语句输入添加噪音扰动的各个预训练模型,获得各个第一融合结果,以及获取根据各个第二种子语句确定的各个第二融合结果,再根据所述各个第一融合结果,生成各组相似正样本语料,以及根据所述各个第一融合结果和各个第二融合结果,生成各组相似负样本语料。这样,不仅简化了相似样本语料的生成过程,还提高了相似样本语料的生成效率,而且能够生成有效的相似样本语料。
0/0