-
公开(公告)号:CN101727461A
公开(公告)日:2010-06-09
申请号:CN200810223791.9
申请日:2008-10-13
Applicant: 中国科学院计算技术研究所
IPC: G06F17/30
Abstract: 本发明提供一种网页的正文抽取方法,包括下列步骤:1)将为所述网页建立的DOM树中的所有特征节点进行合并段落操作;2)从承载最长段落的节点集合中任选一个节点,从所选节点回溯至所述DOM树的根节点,计算各个节点的父节点及其子树与该节点及其子树承载的文本的标点符号的数量的差值,顺序构成增量序列;3)在所述增量序列中查找第一个0值的增量,或第一个小于其前面相邻增量且小于或等于其后面相邻增量的增量;4)如果查找到所述增量,则确定该增量的对应节点及其子树所承载的文本是网页的正文;5)如果未查找到所述增量,则确定根节点及其子树所承载的文本是网页的正文。本发明抽取精度高,实现速度快,维护代价低且适应性好。
-
公开(公告)号:CN101661468A
公开(公告)日:2010-03-03
申请号:CN200810119238.0
申请日:2008-08-29
Applicant: 中国科学院计算技术研究所
IPC: G06F17/30
Abstract: 本发明公开了一种从论坛帖子列表页面中抽取帖子元数据的方法,其包括如下步骤:步骤S1,提供论坛帖子列表页面作为样例页面,根据样例页面中的帖子记录的组织结构特征生成抽取模板;步骤S2,根据抽取模板,对与样例页面中的帖子记录的组织结构相同或相似的论坛帖子列表页面作在线抽取操作,获得帖子元数据。本发明能够满足处理大量的大规模论坛数据的实际需求,且抽取精度高、抽取速度快、维护代价小。
-
公开(公告)号:CN1645373A
公开(公告)日:2005-07-27
申请号:CN200510011212.0
申请日:2005-01-20
Applicant: 中国科学院计算技术研究所
IPC: G06F17/30
Abstract: 本发明涉及网络信息处理技术领域,是一种利用网络用户对网页之间相关性的潜在理解来优化网站链接结构的方法。该方法利用网站的服务器日志中蕴含的网络用户对网页之间相关性的潜在理解,从网站的服务器日志中抽取出用户主观上认为的网站链接结构,即虚拟链接结构;并将虚拟链接结构与网站的实际链接结构相比较,计算二者的匹配程度,匹配度越高,说明该网站的链接质量越好;最后将匹配结果量化,汇报给网站设计者。因为该方法是根据网络用户主观上对网站中各网页之间相关性的理解,去纠正网站设计者对网站链接结构的理解,所以能够真正地帮助网站设计者去优化网站链接结构,为用户提供更好的服务。
-
-