一种自适应的基于词汇文本难度的生词标注系统及方法

    公开(公告)号:CN112949259B

    公开(公告)日:2023-08-08

    申请号:CN202110316129.3

    申请日:2021-03-24

    Abstract: 本发明提出一种自适应的基于词汇文本难度的生词标注方法及系统,所述方法包括以下步骤:步骤一、进行文本词汇难度评估,计算词汇w在包含N个词语的文本text中出现n次的α概率分位数;步骤二、进行词表对比,确定文本text中不在词库Lex的超纲词汇,并将这些词汇按照难度排序后存储;步骤三、进行生词标注,计算基于词汇文本难度词汇列表的累积词汇量,并对超过难度要求的生词进行标注;步骤四、进行文本难度评估,并给出文本难度提示信息。本发明既可以根据学习者所处的学习阶段,也可以根据文本的具体用词情况和学习者的真实水平,自动实现阅读文本生词的自动标注。

    一种自适应中文新词识别方法与系统

    公开(公告)号:CN111339753B

    公开(公告)日:2023-06-16

    申请号:CN202010117792.6

    申请日:2020-02-25

    Abstract: 本发明提出一种自适应中文新词识别方法及系统,所述方法包括如下步骤:文本初始化步骤:用于对输入文本text做结构化处理,获得一个包含原有中文汉字并保持原文本中中文汉字相邻关系、间隔关系的宽字符序列;非偶然共现判定步骤:使用二项分布或使用泊松分布近似表征一对汉字前后相邻出现的概率分布,并基于给定的非偶然共现显著性水平αp确定文本text中的所有非偶然共现的相邻汉字对;统计关联性判定步骤:给定关联性显著性水平αk,判定文本text中相邻中文字符的关联程度,筛选出具有内部强关联的中文字符串;现有词库过滤步骤:基于现有词典,在满足非偶然共现和内部关联性强的字符串中筛选出尚未在词典中出现的中文字符串。

    一种自适应中文新词识别方法与系统

    公开(公告)号:CN111339753A

    公开(公告)日:2020-06-26

    申请号:CN202010117792.6

    申请日:2020-02-25

    Abstract: 本发明提出一种自适应中文新词识别方法及系统,所述方法包括如下步骤:文本初始化步骤:用于对输入文本text做结构化处理,获得一个包含原有中文汉字并保持原文本中中文汉字相邻关系、间隔关系的宽字符序列;非偶然共现判定步骤:使用二项分布或使用泊松分布近似表征一对汉字前后相邻出现的概率分布,并基于给定的非偶然共现显著性水平αp确定文本text中的所有非偶然共现的相邻汉字对;统计关联性判定步骤:给定关联性显著性水平αk,判定文本text中相邻中文字符的关联程度,筛选出具有内部强关联的中文字符串;现有词库过滤步骤:基于现有词典,在满足非偶然共现和内部关联性强的字符串中筛选出尚未在词典中出现的中文字符串。

    一种无监督自适应领域术语识别方法及系统

    公开(公告)号:CN116701628A

    公开(公告)日:2023-09-05

    申请号:CN202310676884.1

    申请日:2023-06-08

    Abstract: 本发明涉及一种无监督自适应领域术语识别方法及系统,其方法包括:S1:对待识别文本进行预处理,得到字符串序列;S2:分词处理字符串序列,对分词结果序列的邻接汉字对进行非偶然共现判定,得到非偶然相邻的汉字对集合NCP;S3:根据独立性假设检验,得到NCP中具有强关联性的汉字对,合并汉字对所在的字符串,进而获得满足非偶然性且具有强关联性的字符串作为备选术语;S4:过滤术语备选词中的垃圾字符串,得到过滤后的备选术语;S5:基于掩码语言模型获取过滤后的备选术语的词向量;S6:对备选术语和已有术语的词向量进行密度聚类和筛选,确定备选术语的所属领域。本发明提供的方法可对专业领域文本中的专业术语进行自动识别。

    一种自适应的基于词汇文本难度的生词标注系统及方法

    公开(公告)号:CN112949259A

    公开(公告)日:2021-06-11

    申请号:CN202110316129.3

    申请日:2021-03-24

    Abstract: 本发明提出一种自适应的基于词汇文本难度的生词标注方法及系统,所述方法包括以下步骤:步骤一、进行文本词汇难度评估,计算词汇w在包含N个词语的文本text中出现n次的α概率分位数;步骤二、进行词表对比,确定文本text中不在词库Lex的超纲词汇,并将这些词汇按照难度排序后存储;步骤三、进行生词标注,计算基于词汇文本难度词汇列表的累积词汇量,并对超过难度要求的生词进行标注;步骤四、进行文本难度评估,并给出文本难度提示信息。本发明既可以根据学习者所处的学习阶段,也可以根据文本的具体用词情况和学习者的真实水平,自动实现阅读文本生词的自动标注。

Patent Agency Ranking