Patent search ap:("南京大学") AND inv:"张文哲" Page 1

1.

发明授权
一种分布式爬虫系统及周期性增量抓取方法有权

公开(公告)号：CN107193960B

公开(公告)日：2020-11-10

申请号：CN201710372282.1

申请日：2017-05-24

Applicant: 南京大学

Inventor： 张雷 , 韩建军 , 张文哲 , 谭龙海 , 王崇骏

IPC: G06F16/951

Abstract: 本发明公开一种分布式爬虫系统，该系统被配置为基于ZooKeeper的分布式服务、系统组件和数据库三大部分，其中，系统组件包括系统监控组件Monitor、协调组件Coordinator、日志收集组件Logger、基础爬虫组件Spider，数据库包括Redis内存数据库，redis是key‑value的存储形式，Redis内存数据库中存放有分布式URL任务队列和分布式BloomFilter。本发明还公开一种基于该系统的周期性增量抓取方法，包括：协调组件Coordinator周期性导入任务到分布式URL任务队列，并唤醒正在休眠的Spider组件；Spider组件根据当前分布式URL任务队列的执行情况进行休眠或周期性增量抓取。该系统及方法解决了如何将单机爬虫有效的结合在一起，实现集群环境下高可用、高稳定和高吞吐率的分布式爬虫，并实现周期性增量抓取。

2.

发明公开
一种基于有监督情感文本和词向量的情感词典构建方法有权

公开(公告)号：CN108647191A

公开(公告)日：2018-10-12

申请号：CN201810473308.6

申请日：2018-05-17

Applicant: 南京大学

Inventor： 张雷 , 张文哲 , 李昀 , 姚懿荣 , 谢俊元

IPC: G06F17/21 , G06F17/27 , G06F17/30 , G06N3/08

Abstract: 本发明提出一种基于有监督情感文本和词向量的情感词典构建方法，包括数据处理阶段、词向量情感嵌入阶段、情感词典生成阶段共三个阶段。本方法使用神经网络生成词向量，将情感嵌入到词向量内部，挖掘词与词之间的内在联系，然后构建词关系图，使用标签传播算法传播情感标签，自动构建特定领域的情感词典。通过本发明解决了基于人工和基于知识库的方法所构造的情感词典在处理特定领域的情感分析任务时不准确的问题。

3.

发明授权
一种基于有监督情感文本和词向量的情感词典构建方法有权

公开(公告)号：CN108647191B

公开(公告)日：2021-06-25

申请号：CN201810473308.6

申请日：2018-05-17

Applicant: 南京大学

Inventor： 张雷 , 张文哲 , 李昀 , 姚懿荣 , 谢俊元

IPC: G06F40/117 , G06F40/242 , G06F40/289 , G06F16/33 , G06N3/08

Abstract: 本发明提出一种基于有监督情感文本和词向量的情感词典构建方法，包括数据处理阶段、词向量情感嵌入阶段、情感词典生成阶段共三个阶段。本方法使用神经网络生成词向量，将情感嵌入到词向量内部，挖掘词与词之间的内在联系，然后构建词关系图，使用标签传播算法传播情感标签，自动构建特定领域的情感词典。通过本发明解决了基于人工和基于知识库的方法所构造的情感词典在处理特定领域的情感分析任务时不准确的问题。

4.

发明公开
一种分布式爬虫系统及周期性增量抓取方法有权

公开(公告)号：CN107193960A

公开(公告)日：2017-09-22

申请号：CN201710372282.1

申请日：2017-05-24

Applicant: 南京大学

Inventor： 张雷 , 韩建军 , 张文哲 , 谭龙海 , 王崇骏

IPC: G06F17/30

Abstract: 本发明公开一种分布式爬虫系统，该系统被配置为基于ZooKeeper的分布式服务、系统组件和数据库三大部分，其中，系统组件包括系统监控组件Monitor、协调组件Coordinator、日志收集组件Logger、基础爬虫组件Spider，数据库包括Redis内存数据库，redis是key‑value的存储形式，Redis内存数据库中存放有分布式URL任务队列和分布式BloomFilter。本发明还公开一种基于该系统的周期性增量抓取方法，包括：协调组件Coordinator周期性导入任务到分布式URL任务队列，并唤醒正在休眠的Spider组件；Spider组件根据当前分布式URL任务队列的执行情况进行休眠或周期性增量抓取。该系统及方法解决了如何将单机爬虫有效的结合在一起，实现集群环境下高可用、高稳定和高吞吐率的分布式爬虫，并实现周期性增量抓取。

Patent Agency Ranking