毕业论文找文献是个问题，我直接用python把全网文献爬了一遍，这波就很舒服

马上要毕业了兄弟们，毕业论文是个麻烦事，论文要的资料得一条一条去网上查看，那多浪费时间，咱直接写个爬虫，批量下载慢慢看，不舒服？

在这里插入图片描述

使用软件
Python和pycharm就可以了，版本的话都行，只要你别用python2。

模块

requests  #模拟请求
Selenium   # 浏览器自动化操作

win+r打开搜索框，输入cmd按确定打开命令提示符窗口，输入pip install 加上你要安装的模块名，回车即可安装，下载速度慢就换国内镜像源。

然后要下载一个谷歌浏览器驱动，版本跟你的浏览器最相近的那个就行。
不会的看我置顶文章。

页面分析

首先分析一下知网页面元素，我们一般是在首页输入框中输入你想搜的内容，然后跳转到搜索页面。
在这里插入图片描述
我们通过浏览器的检查页面，得到输入框和搜索图标的XPATH分别为：

input_xpath = '/html[1]/body[1]/div[1]/div[2]/div[1]/div[1]/input[1]'
button_xpath =  '/html[1]/body[1]/div[1]/div[2]/div[1]/div[1]/input[2]'

在输入框输入要搜索的内容，操作搜索按钮转到结果页。

以搜索Python为例，共找到15,925条，300页，每页中包含20个条目，每个条目包含题目、作者、来源等等内容。

在这里插入图片描述通过对当前页面分析发现每个条目对应的的xpath的规律

/html[1]/body[1]/div[5]/div[2]/div[2]/div[2]/form[1]/div[1]/table[1]/tbody[1]/tr[1]/td[2]

就是倒数第二个标签数字代表本页的第几个条目，最后一个标签 2 - 6 分别代表题目、作者、来源、发表时间和数据库。在当前页面无法或者文献的摘要信息，下载链接，需要进一步点击进入相关文献条目。

进入详情页面后，根据class name：abstract-text 能够很容易定位到摘要的文本，class name： btn-dlcaj 定位到下载链接，