识别版面阅读顺序的方法及装置

    公开(公告)号:CN102479173A

    公开(公告)日:2012-05-30

    申请号:CN201010559135.3

    申请日:2010-11-25

    Abstract: 本发明提供一种识别版面阅读顺序的方法,包括:读取待识别版面,并分析该版面以得到版面布局信息和字符文本对象和图像对象的对象属性;根据版面布局信息和对象属性,将字符文本对象合并为文本段落并将图像对象识别为图像段落;采用全局递归切割与局部先后顺序判定相结合的方式来确定文本段落和图像段落的阅读顺序,其中,通过投影来进行全局切割,对于全局切割之后仍包含多个段落的分组,采用局部判定方法来判断段落的先后顺序。相应地,提供一种识别版面阅读顺序的装置。本发明将字符和图像均识别为段落,并采用全局递归切割与局部判定相结合的方式识别段落阅读顺序,从而实现了复杂版面中文本和图像的正确识别,并且效率和准确率高。

    一种版面信息识别的方法及装置

    公开(公告)号:CN102262618A

    公开(公告)日:2011-11-30

    申请号:CN201010193898.0

    申请日:2010-05-28

    Abstract: 本发明提供一种版面信息识别方法,包括:读取待识别版面,分离字符文本对象与图像对象,合并文本块,将图像对象保留为图像块;从合并的文本块中识别出图注文本块;利用优化方法对图像块和图注文本块进行最优匹配,从而获得相关联的图像块与图注文本块;从所述版面的文本块中去掉图注文本块,并确定其余文本块和图像块的阅读顺序;在阅读顺序中将图注文本块插回到相关联的图像块之后。相应地,本发明提供一种版面信息识别装置。本发明将版面上的全部图像和图注综合考虑,通过最优匹配方法获得图像与图注的全局最优匹配,不受图像与图注数目以及它们之间空间样式的限制,能够从全局上找到最优的关联关系,从而改进现有的版面阅读顺序识别效果。

    一种版面信息识别的方法及装置

    公开(公告)号:CN102262618B

    公开(公告)日:2014-07-09

    申请号:CN201010193898.0

    申请日:2010-05-28

    Abstract: 本发明提供一种版面信息识别方法,包括:读取待识别版面,分离字符文本对象与图像对象,合并文本块,将图像对象保留为图像块;从合并的文本块中识别出图注文本块;利用优化方法对图像块和图注文本块进行最优匹配,从而获得相关联的图像块与图注文本块;从所述版面的文本块中去掉图注文本块,并确定其余文本块和图像块的阅读顺序;在阅读顺序中将图注文本块插回到相关联的图像块之后。相应地,本发明提供一种版面信息识别装置。本发明将版面上的全部图像和图注综合考虑,通过最优匹配方法获得图像与图注的全局最优匹配,不受图像与图注数目以及它们之间空间样式的限制,能够从全局上找到最优的关联关系,从而改进现有的版面阅读顺序识别效果。

    识别版面阅读顺序的方法及装置

    公开(公告)号:CN102479173B

    公开(公告)日:2013-11-06

    申请号:CN201010559135.3

    申请日:2010-11-25

    Abstract: 本发明提供一种识别版面阅读顺序的方法,包括:读取待识别版面,并分析该版面以得到版面布局信息和字符文本对象和图像对象的对象属性;根据版面布局信息和对象属性,将字符文本对象合并为文本段落并将图像对象识别为图像段落;采用全局递归切割与局部先后顺序判定相结合的方式来确定文本段落和图像段落的阅读顺序,其中,通过投影来进行全局切割,对于全局切割之后仍包含多个段落的分组,采用局部判定方法来判断段落的先后顺序。相应地,提供一种识别版面阅读顺序的装置。本发明将字符和图像均识别为段落,并采用全局递归切割与局部判定相结合的方式识别段落阅读顺序,从而实现了复杂版面中文本和图像的正确识别,并且效率和准确率高。

Patent Agency Ranking