1. Cookie

为什么要使用Cookie呢?
Cookie,指某些网站为了辨别用户身份、进行session跟踪而储存在用户本地终端上的数据(通常经过加密)
比如说有些网站需要登录后才能访问某个页面,在登录之前,你想抓取某个页面内容是不允许的。那么我们可以利用Urllib库保存我们登录的Cookie,然后再抓取其他页面就达到目的了。

1.1 Opener

当你获取一个URL你使用一个opener(一个urllib.OpenerDirector的实例)。在前面,我们都是使用的默认的opener,也就是urlopen。它是一个特殊的opener,可以理解成opener的一个特殊实例,传入的参数仅仅是url,data,timeout。
如果我们需要用到Cookie,只用这个opener是不能达到目的的,所以我们需要创建更一般的opener来实现对Cookie的设置

1.2 Cookielib

cookielib模块的主要作用是提供可存储cookie的对象,以便于与urllib模块配合使用来访问Internet资源。Cookielib模块非常强大,我们可以利用本模块的CookieJar类的对象来捕获cookie并在后续连接请求时重新发送,比如可以实现模拟登录功能。该模块主要的对象有CookieJar、FileCookieJar、MozillaCookieJar、LWPCookieJar

案例1:获取Cookie保存到变量
  1. from urllib.request import HTTPCookieProcessor
  2. from urllib.request import build_opener
  3. from urllib.request import Request
  4. from http.cookiejar import CookieJar
  5. from urllib.parse import urlencode
  6. #声明一个CookieJar对象实例来保存cookie
  7. cookie = CookieJar()
  8. #利用HTTPCookieProcessor对象来创建cookie处理器
  9. cookiePro = HTTPCookieProcessor(cookie)
  10. #通过handler来构建opener
  11. opener = build_opener(cookiePro)
  12. login_url = "http://www.sxt.cn/index/login/login"
  13. header = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/61.0.3163.79 Safari/537.36"}
  14. fromdata = {
  15. "user": "17703181473",
  16. "password": "123456"
  17. }
  18. data = urlencode(fromdata).encode()
  19. request = Request(login_url, headers=header, data=data)
  20. response = opener.open(request)
  21. info_url = 'http://www.sxt.cn/index/user.html'
  22. request_info = Request(info_url)
  23. response = opener.open(request_info)
  24. html = response.read()
  25. print(html.decode())

我们使用以上方法将cookie保存到变量中,然后打印出了cookie中的值,运行结果如下
以上程序的原理如下
创建一个带有cookie的opener,在访问登录的URL时,将登录后的cookie保存下来,然后利用这个cookie来访问其他网址。

案例2:cookie保存文件的读取
  1. from urllib.request import build_opener, Request
  2. from urllib.request import HTTPCookieProcessor
  3. from http.cookiejar import MozillaCookieJar
  4. from urllib.parse import urlencode
  5. def get_cookie():
  6. # 请求头
  7. headers = {
  8. "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.181 Safari/537.36"}
  9. login_url = "http://www.sxt.cn/index/login/login.html"
  10. form_data = {
  11. "user": "17703181473",
  12. "password": "123456"
  13. }
  14. # 转换编码
  15. f_data = urlencode(form_data)
  16. req = Request(login_url, headers=headers, data=f_data.encode())
  17. # 创建保存可以序列化cookie的文件对象
  18. cookie = MozillaCookieJar("cookie.txt")
  19. # 构造可保存cookie的控制器
  20. c_handler = HTTPCookieProcessor(cookie)
  21. # 构造opener
  22. opener = build_opener(c_handler)
  23. # 发送请求 -- 登录成功 (用户名和密码 正确)
  24. opener.open(req)
  25. cookie.save(ignore_discard=True, ignore_expires=True)
  26. def use_cookie():
  27. # 请求头
  28. headers = {
  29. "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.181 Safari/537.36"}
  30. info_url = "http://www.sxt.cn/index/user.html"
  31. # 创建保存可以序列化cookie的文件对象
  32. cookie = MozillaCookieJar()
  33. # 加载cookie文件
  34. cookie.load("cookie.txt", ignore_discard=True, ignore_expires=True)
  35. # 构造可保存cookie的控制器
  36. c_handler = HTTPCookieProcessor(cookie)
  37. # 构造opener
  38. opener = build_opener(c_handler)
  39. # 构造访问个人页面请求
  40. req1 = Request(info_url, headers=headers)
  41. # 发送请求
  42. resp2 = opener.open(req1)
  43. # 打印信息
  44. print(resp2.read().decode())
  45. if __name__ == '__main__':
  46. # get_cookie()
  47. use_cookie()

2. URLError

首先解释下URLError可能产生的原因:

  • 网络无连接,即本机无法上网
  • 连接不到特定的服务器
  • 服务器不存在

在代码中,我们需要用try-except语句来包围并捕获相应的异常,代码如下:

  1. from urllib.request import Request, urlopen
  2. from urllib.error import URLError
  3. url = "http://www.sx435334t.cn/index/us3er.html"
  4. try:
  5. headers = {
  6. "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.181 Safari/537.36"
  7. }
  8. req = Request(url, headers=headers)
  9. resp = urlopen(url, timeout=1)
  10. print(resp.read().decode())
  11. except URLError as e:
  12. if len(e.args) == 0:
  13. print(e.code)
  14. else:
  15. print(e.args[0])
  16. print("获取数据完毕")

我们利用了 urlopen方法访问了一个不存在的网址,运行结果如下:

  1. [Errno 11004] getaddrinfo failed