一种新闻列表页判断方法及筛选新闻列表页的方法

    公开(公告)号:CN104182482A

    公开(公告)日:2014-12-03

    申请号:CN201410382359.X

    申请日:2014-08-06

    CPC classification number: G06F17/30873 G06F17/30867 G06F17/30876

    Abstract: 本发明提供一种新闻列表页判断方法及筛选新闻列表页的方法,该方法包括获取网页,判断所述网页是否为新闻网页;如果所述网页不是新闻网页,则在所述网页中采集子网页对各个子网页重复本判定流程;如果所述网页是新闻网页并且被判定为频道内新闻网页,则判断所述网页的父网页是否为新闻网页;如果所述父网页不是新闻网页,则记录所述网页与所述父网页的关联信息;以及根据所述关联信息判断出新闻列表页等步骤。利用本发明提供的方法找到新闻列表页之后,现有的新闻采集器可以直接将新闻列表页作为起始页采集新闻内容,从而提高新闻数据的采集效率。

    分布式顺序表片内二级索引方法及系统

    公开(公告)号:CN104133867A

    公开(公告)日:2014-11-05

    申请号:CN201410345063.0

    申请日:2014-07-18

    Inventor: 查礼 万浩 程学旗

    CPC classification number: G06F17/30321

    Abstract: 本发明公开了一种分布式顺序表片内二级索引方法及系统,其中系统包括,索引布局管理模块,为每个数据存储文件创建对应的索引存储文件;一致性更新模块,写入数据时,先将该数据写入预写日志中,再写入内存存储中,若该内存存储中该数据部分丢失,将该预写入日志中未成功写入磁盘上的该数据重新写入该内存存储中;内存存储刷写模块,若该内存存储存量达到某阈值,先生成该内存存储中类型不为“删除”的数据记录对应的索引记录,并刷写该索引记录到该磁盘上生成该索引存储文件,再生成数据存储文件;合并和分裂模块,索引存储文件随着数据存储文件一起合并和分裂,保证两者的一致性;多维区间查询模块,对每个数据分片单独查询,一次查询可使用多列索引。

    在线社会网络中网络群体的检测方法及系统

    公开(公告)号:CN103198432B

    公开(公告)日:2014-11-05

    申请号:CN201310127459.3

    申请日:2013-04-12

    Abstract: 本发明提供一种在线社会网络中网络群体的检测方法,所采集的节点集中随机选择一个节点,从所选节点的邻居节点中选择未与所选节点建立群关系的且收益最大的邻居节点并在该邻居节点与所选节点之间建立群关系;对所选节点进行策略更新,并重新计算由于所选节点的策略更新所影响到的所有节点的收益;不断上述步骤,直到所述节点集中没有收益可改进的节点时,输出节点集中互相之间存在群关系的所有节点作为所检测的网络群体。该方法结合在线社会网络中节点的信息交互行为和节点间的社会关系,可以在在线社会关系网络中发现具有动态特性和行为因素影响的网络群体。

    一种面向流式数据的在线处理方法及系统

    公开(公告)号:CN103853766A

    公开(公告)日:2014-06-11

    申请号:CN201210510056.2

    申请日:2012-12-03

    CPC classification number: G06F17/3048 G06F17/30545

    Abstract: 本发明公开了一种面向流式数据的在线处理方法,包括:步骤1,建立在线内存缓存层,对所述流式数据按照键值结构进行属性抽取后存储在所述在线内存缓存层中;步骤2,在所述内存缓存层中对所述流式数据建立混合索引结构;步骤3,对建立好索引结构的每条流式数据增加一个访问标志位,此标志位用于标志不同分析程序对于该流式数据的注册情况,同时对每一个分析程序访问流式数据的状态进行记录。步骤4,数据清理,若某流式数据被所述内存缓存层中的所有指定的分析程序访问过,则将该流式数据进行清理操作。本发明大幅度减小了流式处理过程中的数据读写压力,能够有效缓解大规模流式数据处理系统中数据库的压力,且能够提升流式数据的实时处理速度。

    一种面向微博客系统中未来意见领袖的创建方法及系统

    公开(公告)号:CN103279484A

    公开(公告)日:2013-09-04

    申请号:CN201310144152.4

    申请日:2013-04-23

    Abstract: 本发明提供一种面向微博客系统中未来意见领袖的创建方法及系统,方法包括:步骤1,初始化网络环境;步骤2,选择博弈发起方用户;步骤3,选择博弈接收方用户;步骤4,构建博弈收益矩阵;步骤5,计算是否存在纳什均衡点,如果存在则选择使双方用户收益和最大的纳什均衡点,根据纳什均衡点执行相应的关系动作和消息动作,如果不存在则选择执行使博弈发起方用户收益最大的关系动作或消息动作;步骤6,更新用户属性;步骤7,计算意见领袖特征值;步骤8,根据意见领袖特征值的变化趋势,获得成为意见领袖的用户特征组合,利用用户特征组合创建未来意见领袖。本发明在博弈过程中选择用户行为,对微博系统中网络拓扑结构生成与变化进行评估。

    一种面向微博客平台的社交朋友圈的挖掘方法及系统

    公开(公告)号:CN103279482A

    公开(公告)日:2013-09-04

    申请号:CN201310143346.2

    申请日:2013-04-23

    Abstract: 本发明提供一种面向微博客平台的社交朋友圈的挖掘方法及系统,其方法包括:步骤1,通过微博客平台所提供的数据接口得到待查看用户的朋友列表;步骤2,针对所述朋友列表中的每个朋友用户,通过微博客平台所提供的数据接口得到所述每个朋友用户的朋友列表;步骤3,计算所述待查看用户的朋友列表与所述每个朋友用户的朋友列表的邻里相似度;步骤4,取出邻里相似度大于指定阈值的朋友用户,作为所述待查看用户的现实朋友用户;步骤5,计算所述待查看用户与所述现实朋友用户所构成的有向连通图中的最强连通子图,所获得的每个最强连通子图构成所述待查看用户的社交朋友圈。本发明能够在海量用户中挖掘社交朋友圈。

    一种微博流行趋势预测方法、装置及系统

    公开(公告)号:CN103258248A

    公开(公告)日:2013-08-21

    申请号:CN201310190225.3

    申请日:2013-05-21

    Abstract: 本发明提供一种微博流行趋势预测方法、装置及系统。所述方法包括:获得微博用户群体行为特征描述,所述微博用户群体行为特征描述表征用户发布微博的行为特征以及微博转发和评论中用户的行为特征。所述方法还包括:根据微博发布后第1至i-1个时间间隔的转发和评论数量,以及所述微博用户群体行为特征描述,计算所述微博在第i个时间间隔的转发和评论数量,其中i为大于1的正整数。本发明从时间维度出发,对微博用户的群体行为特征进行描述,在保证微博流行趋势预测的准确性以及效率的同时还可以在线实时进行预测。

    一种短文本数据的事件演化分析方法

    公开(公告)号:CN103150383A

    公开(公告)日:2013-06-12

    申请号:CN201310082990.3

    申请日:2013-03-15

    Abstract: 本发明提供一种短文本数据的事件演化分析方法,包括:根据词库和当前时段输入的短文本数据构造当前时段的文档—词项矩阵并对其进行非负矩阵分解,得到文档—事件矩阵和事件—词项矩阵;根据事件—词项矩阵计算当前时段的事件和前一时段的事件之间的相似度,根据该相似度、当前时段的事件和前一时段的剩余图构造当前时段的事件关系图;当前时段的事件关系图分割为一个或多个子图;对子图进行归类得到新生成事件集和演化事件集;根据文档—事件矩阵计算每个事件关联的文档数,并根据该文档数做演化事件集的趋势分析和预测,作为下一时段非负矩阵分解的约束条件。该方法适于动态地跟踪短文本数据的事件演化过程。

    基于开放知识库的短文本语义概念自动化扩展方法及系统

    公开(公告)号:CN103150382A

    公开(公告)日:2013-06-12

    申请号:CN201310081984.6

    申请日:2013-03-14

    Abstract: 本发明公开了一种基于开放知识库的短文本语义概念自动化扩展方法,所述方法将每条短文本生成的n-gram集合中的每个元素链接到开放知识库中与该元素最相关的概念,并且基于开放知识库的概念关系矩阵和所链接的概念,为该元素生成扩展的语义概念集合。该方法仅采用开放知识库文档中的锚文本信息而不采用文档的词项信息和目录信息来构建概念关系矩阵,这使得该矩阵的构造和计算方便,而且克服了目录信息粒度比较粗,歧义多的问题。而且在语义概念扩展阶段,采用基于上下文的语义相似度计算方法来进行语义概念扩展,同时考虑了短文本内容的上下文内容的一致性和概念在抽象语义层的相似性,提高了语义概念扩展的准确性。

    一种从单记录网页中抽取规律噪音的方法

    公开(公告)号:CN103064966A

    公开(公告)日:2013-04-24

    申请号:CN201210592795.0

    申请日:2012-12-31

    Abstract: 本发明提供一种从单记录网页中抽取规律噪音的方法,所述方法包括:首先将多个单记录网页转化为DOM树,并且将所述DOM树按照结构进行分类;然后,将同一类别的DOM树进行对齐合并得到站点板块风格树;在所述站点版块风格树中定位网页正文标题节点的近似位置和网页正文主体节点的近似位置,最后根据所述网页正文标题节点和所述网页正文主体节点的近似位置,抽取正文前、正文中和正文后的规律噪音。所述方法减少了建站点版块风格树所需的空间资源、降低了可能出现的漏抽取的情况,加快了抽取速度;此外,本发明的抽取结果具有较高的准确性,取得了较好的效果,并且可靠性高。

Patent Agency Ranking