Python爬虫之网络请求-编程学习网

1.IP代理

某些网站会检测一段时间内某IP的访问次数，若访问次数过多会禁止访问，这时需要设置一些代理服务器，每隔一段时间换一个代理。IP代理的分类：

①透明代理：目标网站可以得知使用了代理以及源IP地址，显然这不符合要求；
②匿名代理：目标网站知道使用了代理，但不知道源IP地址；
③高匿代理：最保险的方式，目标网站既不知道使用了代理，也不知道源IP地址。

2.Cookie

解决http的无状态性，第一次向服务器发送请求时，服务器生成Cookie作为请求头并储存到浏览器中；浏览器再次发送请求时将携带Cookie信息。

import urllib.request
from http import cookiejar
filename = 'cookie.txt'
#获取Cookie
def get_cookie():
    #实例化一个MozillaCookieJar用于存储cookie
    cookie = cookiejar.MozillaCookieJar(filename)
    #创建handler对象
    handler = urllib.request.HTTPCookieProcessor(cookie)
    #创建opener对象
    opener = urllib.request.build_opener(handler)
    #请求网址
    url = 'https://tieba.baidu.com/index.html?traceid=#'
    resp = opener.open(url) #发送请求
    #存储cookie文件
    cookie.save()
 
#读取cookie
def use_cookie():
    #实例化MozillaCookieJar
    cookie = cookiejar.MozillaCookieJar()
    #加载cookie文件
    cookie.load(filename)
    print(cookie)
 
get_cookie()
use_cookie()

3.异常处理

①urllib.error.URLError：用于捕获由urllib.request产生的异常，使用reason属性返回错误原因

import urllib.request
import urllib.error
 
url = 'http://www.google.com'
try:
    resp = urllib.request.urlopen(url)
except urllib.error.URLError as e:
    print(e.reason)

输出结果：

[WinError 10060] 由于连接方在一段时间后没有正确答复或连接的主机没有反应，连接尝试失败。

②urllib.error.HTTPError：用于处理HTTP与HTTPS请求的错误，

有三个属性：

code：请求返回的状态码
reason：返回错误的原因
headers：请求返回的响应头信息

import urllib.request
import urllib.error
 
url = 'https://movie.douban.com/'
try:
    resp = urllib.request.urlopen(url)
except urllib.error.HTTPError as e:
    print('原因：',e.reason)
    print('响应状态码：',str(e.code))
    print('响应头数据：',e.headers)

到此这篇关于Python爬虫之网络请求的文章就介绍到这了,更多相关Python 网络请求内容请搜索编程网以前的文章或继续浏览下面的相关文章希望大家以后多多支持编程网！

文章详情

Python爬虫之网络请求

目录

1.IP代理

2.Cookie

3.异常处理

软考中级精品资料免费领

相关文章

猜你喜欢

Python爬虫之网络请求

python爬虫#网络请求request

Python爬虫之网络请求实例分析

爬虫学习之第一章网络请求

python之网络爬虫

python爬虫系列网络请求案例详解

Python爬虫基础讲解之请求

Python3网络爬虫实战-2、请求库安

Python3网络爬虫实战-1、请求库安

4.网络爬虫—Post请求(实战演示)

Python网络爬虫之HTTP原理

Python网络爬虫之获取网络数据

Python爬虫-02：HTTPS请求与

Python网络爬虫之Web网页基础

Python爬虫基础之请求的示例分析

python写网络爬虫

Python网络爬虫之如何获取网络数据

Python网络爬虫之怎么获取网络数据

Java HttpClient爬虫请求

python爬虫之请求模块urllib的基本使用