PySpider 是国人 binux 编写的强大的网络爬虫框架,它带有强大的 WebUI、脚本编辑器、任务监控器、项目管理器以及结果处理器,同时它支持多种数据库后端、多种消息队列,另外它还支持 JavaScript 渲染页面的爬取,使用起来非常方便,本节介绍一下它的安装过程。
相关链接
- 官方文档:http://docs.pyspider.org/
- PyPi:https://pypi.python.org/pypi/pyspider
- GitHub:https://github.com/binux/pyspider
- 官方教程:http://docs.pyspider.org/en/latest/tutorial
- 在线实例:http://demo.pyspider.org
准备工作
PySpider 是支持 JavaScript 渲染的,而这个过程是依赖于 PhantomJS 的,所以还需要安装 PhantomJS,所以在安装之前请安装好 PhantomJS,参考 https://setup.scrape.center/phantomjs。
pip 安装
推荐使用 pip 安装,命令如下:
1 |
pip3 install pyspider |
命令执行完毕即可完成安装。
常见错误
Windows 下可能会出现这样的错误提示:Command “python setup.py egg_info” failed with error code 1 in /tmp/pip-build-vXo1W3/pycurl
这个是 PyCurl 安装错误,一般会出现在 Windows 下,需要安装 PyCurl 库,下载链接为:http://www.lfd.uci.edu/~gohlke/pythonlibs/#pycurl,找到对应 Python 版本然后下载相应的 Wheel 文件。
如 Windows 64 位,Python3.6 则下载 pycurl‑7.43.0‑cp36‑cp36m‑win_amd64.whl,随后用 Pip 安装即可,命令如下:
1 |
pip3 install pycurl‑7.43.0‑cp36‑cp36m‑win_amd64.whl |
Linux 下如果遇到 PyCurl 的错误可以参考本文:https://imlonghao.com/19.html
验证安装
安装完成之后,可以直接在命令行下启动 PySpider:
1 |
pyspider all |
控制台会有类似如下输出,如图所示:
这时 PySpider 的 Web 服务就会在本地 5000 端口运行,直接在浏览器打开:http://localhost:5000/ 即可进入 PySpider 的 WebUI 管理页面,如图所示:
如果出现类似页面那证明 PySpider 已经安装成功了。