python网络爬虫系列（二）——ProxyHandler处理器实现代理IP

ProxyHandler处理器（代理）：

很多网站会检测某一段时间某个IP的访问次数（通过流量统计，系统日志等），如果访问次数多的不像正常人，它会禁止这个lP的访问。
所以我们可以设置一些代理服务器，每隔一段时间换一个代理，就算IP被禁止，依然可以换个IP继续爬取。
urllib中通过ProxyHandler来设置使用代理服务器，下面代码说明如何使用自定义opener来使用代理

代理的原理：在请求目的网站之前，先请求代理服务器，然后让代理服务器去请求目的网站，代理服务器拿到目的网站的数据后，再转发给我们的代码。
http://httpbin.org：这个网站可以方便的查看http请求的一些参数。比如本机在外网中的IP地址
在代码中使用代理：
- 使用urllib.request.ProxyHandler，传入一个代理，这个代理是一个字典，字典的key依赖于代理服务器能够接收的类型，一般是http或者https，值是ip:port。
- 使用上一步创建的handler，以及request.build_opener创建一个opener对象。
- 使用上一步创建的opener，调用open函数，发起请求。

免费代理网站：

示例代码如下：

from urllib import request

# 没有使用代理的本机外网ip地址为120.229.8X.XX
url = 'http://www.httpbin.org/ip'
resp = request.urlopen(url)
print(resp.read()) # 120.229.8X.XX

# 使用代理的
# 1、使用ProxyHandler，传入代理，构建一个handler
handler = request.ProxyHandler({'http':'122.136.212.132:53281'})

# 2、使用上面创建的handler构建一个opener
opener = request.build_opener(handler)

# 3、使用opener去发送一个请求
resp1 = opener.open(url)
print(resp1.read())

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

python网络爬虫系列（二）——ProxyHandler处理器实现代理IP

ProxyHandler处理器（代理）：

如何使用 JS 判断用户是否处于活跃状态

通过HPA+CronHPA组合应对业务复杂弹性伸缩场景

❤️‍🔥 Solon Cloud Event 新的事务特性与应用

六、Numpy的使用（詳解）

python網絡爬蟲系列（二）——ProxyHandler處理器實現代理IP

十一、加權線性迴歸案例：預測鮑魚的年齡

CSMA/CD協議（先聽再說，邊聽邊說）

十二、案例：加利福尼亞房屋價值數據集（多元線性迴歸）& Lasso & 嶺迴歸 & 分箱處理非線性問題 & 多項式迴歸

https://yachay.unat.edu.pe/blog/index.php?comment_area=format_blog&comment_component=blog&comment_co

linux以太網驅動總結