-
公开(公告)号:CN114330373A
公开(公告)日:2022-04-12
申请号:CN202111470031.X
申请日:2021-12-03
Applicant: 哈尔滨工业大学
IPC: G06F40/51 , G06F40/58 , G06F40/289 , G06K9/62
Abstract: 本发明公开了一种基于ELECTRA的翻译质量估计伪数据生成方法。对于句子级QE伪数据,使用基于机器译文作为输入母本生成伪数据和基于人工后编辑译文生成伪数据产生两种数据分布的伪数据,并针对数据分布差异提出了先使用人工后编辑译文生成的伪数据对模型进行初次训练再使用机器译文生成的伪数据与原数据混合后的数据集二次训练的方法。对于词语级伪数据,针对训练数据标签分布不平衡的问题,生成了分布更为合理的伪数据,采取先使用得到的伪数据对模型训练再使用原数据集进行二次训练的方法。本发明针对翻译质量估计数据稀缺这一问题。