任务书主要内容:
该系统主要实现了对网站图片、实时新闻、基金利率、图书信息的爬取,以及利用Django框架对整个数据做了一个后台管理系统,在网页中利用xpath语句对网页信息进行解析,通过selenium自动化工具解决图片动态加载问题,通过代理池分配随机IP解决防止恶意ip访问问题。后台数据管理实现了数据实时显示,可以手动添加和删除解决数据利用问题,并可拥有不同管理员权限对数据进行访问。
毕业论文(设计)要求及完成的工作:
1.熟悉爬虫发展现状以及未来发展。
2.熟悉Python语言和Scrapy爬虫框架。
3.熟悉如何应对反爬虫策略。
4.熟悉Django框架做后台管理。
5.整理资料、撰写论文。