酷站(www.ku0.com)-致力于为互联网从业者提供动力!

热门关键词:  企业  as  baidu  c4rp3nt3r  美女
【阿里云】采购季上云仅¥223/3年

Python爬虫使用代理IP的方法

来源:互联网搜集 作者:秩名 人气: 发布时间:2019-10-27
本篇文章主要介绍了Python爬虫使用代理IP的方法,对大家的学习或者工作具有一定的参考学习价值,感兴趣的小伙伴们可以参考一下,也感谢大家对酷站(ku0.com)的支持。

使用爬虫时,如果目标网站对访问的速度或次数要求较高,那么你的 IP 就很容易被封掉,也就意味着在一段时间内无法再进行下一步的工作。这时候代理 IP 能够给我们带来很大的便利,不管网站怎么封,只要能找到一个新的代理 IP 就可以继续进行下一步的研究。

目前很多网站都提供了一些免费的代理 IP 供我们使用,当然付费的会更好用一点。本文除了展示怎样使用代理 IP,也正好体验一下前面文章中搭建的代理 IP 池,不知道的可以点击这里:Python搭建代理IP池(一)- 获取 IP。只要访问代理池提供的接口就可以获取到代理 IP 了,接下来就看怎样使用吧!

测试的网址是:http://httpbin.org/get,访问该站点可以得到请求的一些相关信息,其中 origin 字段就是客户端的 IP,根据它来判断代理是否设置成功,也就是是否成功伪装了IP

获取 IP

代理池使用 Flask 提供了获取的接口:http://localhost:5555/random

只要访问这个接口再返回内容就可以拿到 IP 了

Urllib

先看一下 Urllib 的代理设置方法:
 

from urllib.error import URLError
import urllib.request
from urllib.request import ProxyHandler, build_opener
 
# 获取IP
ip_response = urllib.request.urlopen("http://localhost:5555/random")
ip = ip_response.read().decode('utf-8')
 
proxy_handler = ProxyHandler({
  'http': 'http://' + ip,
  'https': 'https://' + ip
})
opener = build_opener(proxy_handler)
try:
  response = opener.open('http://httpbin.org/get')
  print(response.read().decode('utf-8'))
except URLError as e:
  print(e.reason)

运行结果:

{
 "args": {},
 "headers": {
  "Accept-Encoding": "identity",
  "Host": "httpbin.org",
  "User-Agent": "Python-urllib/3.7"
 },
 "origin": "108.61.201.231, 108.61.201.231",
 "url": "https://httpbin.org/get"
} 

Urllib 使用 ProxyHandler 设置代理,参数是字典类型,键名为协议类型,键值是代理,代理前面需要加上协议,即 http 或 https,当请求的链接是 http 协议的时候,它会调用 http 代理,当请求的链接是 https 协议的时候,它会调用https代理,所以此处生效的代理是:http://108.61.201.231 和 https://108.61.201.231

ProxyHandler 对象创建之后,再利用 build_opener() 方法传入该对象来创建一个 Opener,这样就相当于此 Opener 已经设置好代理了,直接调用它的 open() 方法即可使用此代理访问链接

Requests

Requests 的代理设置只需要传入 proxies 参数:

import requests
 
# 获取IP
ip_response = requests.get("http://localhost:5555/random")
ip = ip_response.text
 
proxies = {
  'http': 'http://' + ip,
  'https': 'https://' + ip,
}
try:
  response = requests.get('http://httpbin.org/get', proxies=proxies)
  print(response.text)
except requests.exceptions.ConnectionError as e:
  print('Error', e.args)

运行结果:

 
{
 "args": {},
 "headers": {
  "Accept": "*/*",
  "Accept-Encoding": "gzip, deflate",
  "Host": "httpbin.org",
  "User-Agent": "python-requests/2.21.0"
 },
 "origin": "47.90.28.54, 47.90.28.54",
 "url": "https://httpbin.org/get"
}
 

Requests 只需要构造代理字典然后通过 proxies 参数即可设置代理,比较简单

Selenium
 
 
import requests
from selenium import webdriver
import time

# 借助requests库获取IP
ip_response = requests.get("http://localhost:5555/random")
ip = ip_response.text

chrome_options = webdriver.ChromeOptions()
chrome_options.add_argument('--proxy-server=http://' + ip)
browser = webdriver.Chrome(chrome_options=chrome_options)
browser.get('http://httpbin.org/get')
time.sleep(5)
 

运行结果:


版权声明:本文内容来源于互联网或用户自行发布贡献,该文观点仅代表原作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 959677720#qq.cn(#换@) 举报,一经查实,本站将立刻删除。
原文链接:https://blog.csdn.net/weixin_44613063/article/details/102714671

相关文章

  • django连接数据库出现1045错误的解决方法

    django连接数据库出现1045错误的解决方法

    根据菜鸟教程Django教程学习,运行python manage.py migrate 报错,出现 django.db.utils.OperationalError: (1045, Access denied for user 账号@localhost (using password: YES)) 错误。 这种错误指的是连接数据库时账号密码错误。 1.......
    05-15
  • Django在Model保存前记录日志

    Django在Model保存前记录日志

    Django中如何在Model保存前做一定的固定操作,比如写一句日志? 关键词: 信号 利用Django的Model的Signal Dispatcher, 通过django.db.models.signals.pre_save() 方法,在事件发生前, 发射 触发信号,这一切都被调度中的receiver方法深......
    05-15
  • 解决python动态库m.so.1.0错误问题

    解决python动态库m.so.1.0错误问题

    $ python -V python: error while loading shared libraries: libpython3.6m.so.1.0: cannot open shared object file: No such file or directory ldd是列出动态库依赖关系: $ ldd /usr/local/bin/python3.6linux-vdso.so.1 = (0x00007......
    05-09
  • 基于windows实现python定时爬虫

    基于windows实现python定时爬虫

    Windows系统下使用任务计划程序,Linux下可以使用crontab命令添加自启动计划。 这里写Windows 10 / windows Server 2016系统的设置方法。 首先编写一个.bat脚本。新建一个txt,将下面三行代码复制进去,main.py改成自己程序名字。保存为.......
    05-01
  • 全网首秀之Pycharm十大实用技巧介绍!

    全网首秀之Pycharm十大实用技巧介绍!

    PyCharm 应该是大多数 python 开发者的首选 IDE,每天我们都在上面敲着熟悉的代码,写出一个又一个奇妙的功能。它是帮助用户在使用 Python 语言开发时提高其效率的工具,但是好多人只是把它当做一个文本编辑器使用,并没有发挥出它的优势......
    04-27
  • python追踪except信息方式的介绍

    python追踪except信息方式的介绍

    看下面这个函数 def test(): sum = 3/0 if __name__ == __main__: test() 除0肯定是不对的,会引发一个except,内容如下: File E:\Src\dongsheng\TestPython\testtrace_back.py, line 23, in module test() File E:\Src\dongsheng\TestP......
    04-25
  • Python实现仿射密码的代码

    Python实现仿射密码的代码

    仿射密码思路: 1、加解密公式: 2、构造对应字典: 3、代码实现 构造字典,建立映射关系: ? 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 # 构造字典,A -- 0 ... def char_2_num(x): list_s = [] list_num = [] for i i......
    04-23
  • 利用matplotlib为图片上添加触发事件进行交互的介绍

    利用matplotlib为图片上添加触发事件进行交互的介绍

    解决方案网上有很多,尝试以后依然bug,这里先做一个记录,有时间再来处理。 错误报告如下: OpenCV Error: Unspecified error (The function is not implemented. Rebuild the library with Windows, GTK+ 2.x or Carbon support. If you ......
    04-23
  • jupyter notebook 实现matplotlib图动态刷新的介绍

    jupyter notebook 实现matplotlib图动态刷新的介绍

    我就废话不多说了,大家还是直接看代码吧! import matplotlib%matplotlib inlinefrom IPython import display 需要刷新的地方,画完图之后添加 display.clear_output(wait=True) 补充知识:jupyter notebook matplotlib绘制动态图并显示......
    04-22
  • Django框架配置mysql数据库实现过程详细介绍

    Django框架配置mysql数据库实现过程详细介绍

    django配置mysql数据库: 1.首先更改django项目文件中的settings.py的数据库配置 ? 1 2 3 4 5 6 7 8 9 10 DATABASES = { default : { ENGINE : django.db.backends.mysql , NAME : django_test , # 使用的数据库名, USER : root , # 用户......
    04-22

最新更新