|
设计内容:
1、 设计的主要任务
主要任务:基于python语言,设计面向腾讯新闻网的网络爬虫,利用分词工具jieba分词对新闻文本进行分词以及词频统计。
2、 设计的主要内容
(1)使用多线程技术实现爬虫,让爬虫具备更强大的抓取能力。
(2)网络爬虫要实现对特定网页的爬取。网络爬虫还要完成信息提取任务,对于抓取回来的网页提取出标题、时间、责编、正文等。对网络爬虫的连接网络设置在及读取时间,避免无限制等待。研究网络爬虫的原理并实现爬虫的相关功能。
(3)最终实现的网络爬虫应该能根据设定的主题,实现对URL进行分析,从设定的url进行一定深度的搜索,并最终得到需要的数据。
(4)对爬取结果进行中文分词。
|