投稿    登录
欢迎来访~

 分类:Python

Python

[Python3网络爬虫开发实战] 4.3-使用pyquery

[Python3网络爬虫开发实战] 4.3-使用pyquery
在上一节中,我们介绍了Beautiful Soup的用法,它是一个非常强大的网页解析库,你是否觉得它的一些方法用起来有点不适应?有没有觉得它的CSS选择器的功能没有那么强大? 如果你对Web有所涉及,如果你比较喜欢用CSS选择器,如果你对jQuery有所了解,那么这里有一个更适合...

崔庆才 2018-01-28 16:31 36778浏览 4评论 46喜欢

Python

[Python3网络爬虫开发实战] 4.2-使用Beautiful Soup

[Python3网络爬虫开发实战] 4.2-使用Beautiful Soup
前面介绍了正则表达式的相关用法,但是一旦正则表达式写的有问题,得到的可能就不是我们想要的结果了。而且对于一个网页来说,都有一定的特殊结构和层级关系,而且很多节点都有id或class来作区分,所以借助它们的结构和属性来提取不也可以吗? 这一节中,我们就来介绍一个强大的解析工具Bea...

崔庆才 2018-01-28 16:19 53709浏览 3评论 92喜欢

Python

[Python3网络爬虫开发实战] 4.1-使用XPath

[Python3网络爬虫开发实战] 4.1-使用XPath
XPath,全称XML Path Language,即XML路径语言,它是一门在XML文档中查找信息的语言。它最初是用来搜寻XML文档的,但是它同样适用于HTML文档的搜索。 所以在做爬虫时,我们完全可以使用XPath来做相应的信息抽取。本节中,我们就来介绍XPath的基本用法。...

崔庆才 2018-01-28 16:03 40630浏览 1评论 55喜欢

Python

[Python3网络爬虫开发实战] 4-解析库的使用

[Python3网络爬虫开发实战] 4-解析库的使用
上一章中,我们实现了一个最基本的爬虫,但提取页面信息时使用的是正则表达式,这还是比较烦琐,而且万一有地方写错了,可能导致匹配失败,所以使用正则表达式提取页面信息多多少少还是有些不方便。 对于网页的节点来说,它可以定义id、class或其他属性。而且节点之间还有层次关系,在网页中可...

崔庆才 2018-01-28 15:58 12527浏览 1评论 23喜欢

Python

[Python3网络爬虫开发实战] 3.3-正则表达式

[Python3网络爬虫开发实战] 3.3-正则表达式
本节中,我们看一下正则表达式的相关用法。正则表达式是处理字符串的强大工具,它有自己特定的语法结构,有了它,实现字符串的检索、替换、匹配验证都不在话下。 当然,对于爬虫来说,有了它,从HTML里提取想要的信息就非常方便了。 1. 实例引入 说了这么多,可能我们对它到底是个什么还是比...

崔庆才 2018-01-27 14:32 36726浏览 5评论 84喜欢

Python

[Python3网络爬虫开发实战] 3.2.2-高级用法

[Python3网络爬虫开发实战] 3.2.2-高级用法
在前一节中,我们了解了requests的基本用法,如基本的GET、POST请求以及Response对象。本节中,我们再来了解下requests的一些高级用法,如文件上传、cookie设置、代理设置等。 1. 文件上传 我们知道requests可以模拟提交一些数据。假如有的网站需要...

崔庆才 2018-01-27 14:26 25867浏览 2评论 50喜欢

Python

[Python3网络爬虫开发实战] 3.2.1-基本用法

[Python3网络爬虫开发实战] 3.2.1-基本用法
1. 准备工作 在开始之前,请确保已经正确安装好了requests库。如果没有安装,可以参考1.2.1节安装。 2. 实例引入 urllib库中的urlopen()方法实际上是以GET方式请求网页,而requests中相应的方法就是get()方法,是不是感觉表达更明确一些?下面通...

崔庆才 2018-01-27 14:14 32027浏览 5评论 60喜欢

Python

[Python3网络爬虫开发实战] 3.2-使用requests

[Python3网络爬虫开发实战] 3.2-使用requests
上一节中,我们了解了urllib的基本用法,但是其中确实有不方便的地方,比如处理网页验证和Cookies时,需要写Opener和Handler来处理。为了更加方便地实现这些操作,就有了更为强大的库requests,有了它,Cookies、登录验证、代理设置等操作都不是事儿。 接下...

崔庆才 2018-01-27 14:12 22904浏览 0评论 64喜欢