投稿    登录
欢迎来访~

 分类:Python

Python

[Python3网络爬虫开发实战] 5-数据存储

[Python3网络爬虫开发实战] 5-数据存储
用解析器解析出数据之后,接下来就是存储数据了。保存的形式可以多种多样,最简单的形式是直接保存为文本文件,如TXT、JSON、CSV等。另外,还可以保存到数据库中,如关系型数据库MySQL,非关系型数据库MongoDB、Redis等。 转载请注明:静觅 » [Pytho...

崔庆才 2018-01-29 16:42 9927浏览 0评论 18喜欢

Python

[Python3网络爬虫开发实战] 4.3-使用pyquery

[Python3网络爬虫开发实战] 4.3-使用pyquery
在上一节中,我们介绍了Beautiful Soup的用法,它是一个非常强大的网页解析库,你是否觉得它的一些方法用起来有点不适应?有没有觉得它的CSS选择器的功能没有那么强大? 如果你对Web有所涉及,如果你比较喜欢用CSS选择器,如果你对jQuery有所了解,那么这里有一个更适合...

崔庆才 2018-01-28 16:31 39615浏览 4评论 51喜欢

Python

[Python3网络爬虫开发实战] 4.2-使用Beautiful Soup

[Python3网络爬虫开发实战] 4.2-使用Beautiful Soup
前面介绍了正则表达式的相关用法,但是一旦正则表达式写的有问题,得到的可能就不是我们想要的结果了。而且对于一个网页来说,都有一定的特殊结构和层级关系,而且很多节点都有id或class来作区分,所以借助它们的结构和属性来提取不也可以吗? 这一节中,我们就来介绍一个强大的解析工具Bea...

崔庆才 2018-01-28 16:19 57598浏览 3评论 96喜欢

Python

[Python3网络爬虫开发实战] 4.1-使用XPath

[Python3网络爬虫开发实战] 4.1-使用XPath
XPath,全称XML Path Language,即XML路径语言,它是一门在XML文档中查找信息的语言。它最初是用来搜寻XML文档的,但是它同样适用于HTML文档的搜索。 所以在做爬虫时,我们完全可以使用XPath来做相应的信息抽取。本节中,我们就来介绍XPath的基本用法。...

崔庆才 2018-01-28 16:03 44803浏览 1评论 57喜欢

Python

[Python3网络爬虫开发实战] 4-解析库的使用

[Python3网络爬虫开发实战] 4-解析库的使用
上一章中,我们实现了一个最基本的爬虫,但提取页面信息时使用的是正则表达式,这还是比较烦琐,而且万一有地方写错了,可能导致匹配失败,所以使用正则表达式提取页面信息多多少少还是有些不方便。 对于网页的节点来说,它可以定义id、class或其他属性。而且节点之间还有层次关系,在网页中可...

崔庆才 2018-01-28 15:58 13586浏览 1评论 24喜欢

Python

[Python3网络爬虫开发实战] 3.3-正则表达式

[Python3网络爬虫开发实战] 3.3-正则表达式
本节中,我们看一下正则表达式的相关用法。正则表达式是处理字符串的强大工具,它有自己特定的语法结构,有了它,实现字符串的检索、替换、匹配验证都不在话下。 当然,对于爬虫来说,有了它,从HTML里提取想要的信息就非常方便了。 1. 实例引入 说了这么多,可能我们对它到底是个什么还是比...

崔庆才 2018-01-27 14:32 40991浏览 5评论 88喜欢

Python

[Python3网络爬虫开发实战] 3.2.2-高级用法

[Python3网络爬虫开发实战] 3.2.2-高级用法
在前一节中,我们了解了requests的基本用法,如基本的GET、POST请求以及Response对象。本节中,我们再来了解下requests的一些高级用法,如文件上传、cookie设置、代理设置等。 1. 文件上传 我们知道requests可以模拟提交一些数据。假如有的网站需要...

崔庆才 2018-01-27 14:26 28028浏览 3评论 52喜欢

Python

[Python3网络爬虫开发实战] 3.2.1-基本用法

[Python3网络爬虫开发实战] 3.2.1-基本用法
1. 准备工作 在开始之前,请确保已经正确安装好了requests库。如果没有安装,可以参考1.2.1节安装。 2. 实例引入 urllib库中的urlopen()方法实际上是以GET方式请求网页,而requests中相应的方法就是get()方法,是不是感觉表达更明确一些?下面通...

崔庆才 2018-01-27 14:14 35007浏览 6评论 61喜欢