六合彩开奖手机网址,bet365集团,卡塔尔世界杯比赛第一场 (中国)·官方网站

如果你在爬蟲過程中有遇到“您的請求太過頻繁，請稍后再試”，或者說代碼完全正確，可是爬蟲過程中突然就訪問不了，那么恭喜你，你的爬蟲被對方識破了，輕則給予友好提示警告，嚴重的可能會對你的ip進行封禁，所以代理ip那就尤為重要了。今天我們就來談一下代理IP，去解決爬蟲被封的問題。

網上有許多代理ip，免費的、付費的。大多數公司爬蟲會買這些專業版，對于普通人來說，免費的基本滿足我們需要了，不過免費有一個弊端，時效性不強，不穩定，所以我們就需要對采集的ip進行一個簡單的驗證。

1.目標采集

本文主要針對西刺代理，這個網站很早之前用過，不過那個時候它還提供免費的api，現在api暫不提供了，我們就寫個簡單的爬蟲去采集。

打開西刺代理，有幾個頁面，果斷選擇高匿代理。

如何解決爬蟲被封的問題

Chrome瀏覽器右鍵檢查查看network，不難發現，每個ip地址都在td標簽中，對于我們來說就簡單許多了，初步的想法就是獲取所有的ip，然后校驗可用性，不可用就剔除。

如何解決爬蟲被封的問題

定義匹配規則

importreip_compile=re.compile(r'(d+.d+.d+.d+)')#匹配IPport_compile=re.compile(r'(d+)')#匹配端口

2.校驗這里我使用淘寶ip地址庫檢驗可用性

2.1、關于淘寶IP地址庫

目前提供的服務包括：1. 根據用戶提供的IP地址，快速查詢出該IP地址所在的地理信息和地理相關的信息，包括國家、省、市和運營商。2. 用戶可以根據自己所在的位置和使用的IP地址更新我們的服務內容。我們的優勢：1. 提供國家、省、市、縣、運營商全方位信息，信息維度廣，格式規范。2. 提供完善的統計分析報表，省準確度超過99.8%，市準確度超過96.8%，數據質量有保障。

2.2、接口說明

請求接口（GET）：http://ip.taobao.com/service/getIpInfo.php?ip=[ip地址字符串]例：http://ip.taobao.com/service/getIpInfo2.php?ip=111.177.181.44

響應信息：（json格式的）國家、省（自治區或直轄市）、市（縣）、運營商

返回數據格式：

{"code":0,"data":{"ip":"210.75.225.254","country":"u4e2du56fd","area":"u534eu5317","region":"u5317u4eacu5e02","city":"u5317u4eacu5e02","county":"","isp":"u7535u4fe1","country_id":"86","area_id":"100000","region_id":"110000","city_id":"110000","county_id":"-1","isp_id":"100017"}}

其中code的值的含義為，0：成功，1：失敗。

注意：為了保障服務正常運行，每個用戶的訪問頻率需小于10qps。我們先通過瀏覽器測試一下

輸入地址http://ip.taobao.com/service/getIpInfo2.php?ip=111.177.181.44

如何解決爬蟲被封的問題

再次輸入一個地址http://ip.taobao.com/service/getIpInfo2.php?ip=112.85.168.98

代碼操作

importrequestscheck_api="http://ip.taobao.com/service/getIpInfo2.php?ip="api=check_api+iptry:response=requests.get(url=api,headers=api_headers,timeout=2)print("ip：%s 可用"%ip)exceptExceptionase:print("此ip %s 已失效：%s"%(ip,e))

3.代碼

代碼中加入了異常處理，其實自己手寫的demo寫不寫異常處理都可以，但是為了方便其他人調試，建議在可能出現異常的地方加入異常處理。

importrequestsimportreimportrandomfrombs4importBeautifulSoupua_list=[ "Mozilla/5.0(WindowsNT10.0;Win64;x64)AppleWebKit/537.36(KHTML,likeGecko)Chrome/72.0.3626.109Safari/537.36", "Mozilla/5.0(X11;Linuxx86_64)AppleWebKit/537.36(KHTML,likeGecko)Chrome/62.0.3202.75Safari/537.36", "Mozilla/5.0(Macintosh;IntelMacOSX10_13_6)AppleWebKit/537.36(KHTML,likeGecko)Chrome/72.0.3626.119Safari/537.36", "Mozilla/5.0(WindowsNT6.1;WOW64)AppleWebKit/537.36(KHTML,likeGecko)Chrome/45.0.2454.101Safari/537.36" ]defip_parse_xici(page):""":param page:采集的頁數:return:""" ip_list=[] forpginrange(1,int(page)): url='http://www.xicidaili.com/nn/'+str(pg) user_agent=random.choice(ua_list) my_headers={ 'Accept':'text/html,application/xhtml+xml,application/xml;', 'Accept-Encoding':'gzip,deflate,sdch', 'Accept-Language':'zh-CN,zh;q=0.8', 'Referer':'http://www.xicidaili.com/nn', 'User-Agent':user_agent } try: r=requests.get(url,headers=my_headers) soup=BeautifulSoup(r.text,'html.parser') exceptrequests.exceptions.ConnectionError: print('ConnectionError') else: data=soup.find_all('td') #定義IP和端口Pattern規則 ip_compile=re.compile(r'(d+.d+.d+.d+)')#匹配IP port_compile=re.compile(r'(d+)')#匹配端口 ips=re.findall(ip_compile,str(data))#獲取所有IP ports=re.findall(port_compile,str(data))#獲取所有端口 check_api="http://ip.taobao.com/service/getIpInfo2.php?ip=" foriinrange(len(ips)): ifi

運行代碼：

日志

4.為你的爬蟲加入代理ip

建議大家可以把采集的ip存入數據庫，這樣每次爬蟲的時候直接調用即可，順便提一下代碼中怎么加入代理ip。

importrequestsurl='www.baidu.com'headers={ "User-Agent":"Mozilla/5.0(Macintosh; IntelMacOSX10_13_6)AppleWebKit/537.36(KHTML, likeGecko)Chrome/72.0.3626.119Safari/537.36",}proxies={ "http":"http://111.177.181.44:9999", #"https":"https://111.177.181.44:9999", } res=requests.get(url=url,headers=headers,proxies=proxies)

好了，媽媽再也不擔心我爬蟲被封了，代碼可從文中復制粘貼。

聲明：本文內容及配圖由入駐作者撰寫或者入駐合作網站授權轉載。文章觀點僅代表作者本人，不代表電子發燒友網立場。文章及其配圖僅供工程師學習之用，如有內容侵權或者其他違規問題，請聯系本站處理。舉報投訴

IP

IP

+關注

關注
5

文章
1718

瀏覽量
149961
代碼

代碼

+關注

關注
30

文章
4825

瀏覽量
69044
爬蟲

爬蟲

+關注

關注
0

文章
82

瀏覽量
7006

原文標題：聽說你的爬蟲被封了?

文章出處：【微信號：atleadai，微信公眾號：LeadAI OpenLab】歡迎添加關注！文章轉載請注明出處。

Python數據爬蟲學習內容

，利用爬蟲，我們可以解決部分數據問題，那么，如何學習Python數據爬蟲能？1.學習Python基礎知識并實現基本的爬蟲過程一般獲取數據的過程都是按照發送請求-獲得頁面反饋-解析并且存儲數據這三個

發表于 05-09 17:25

應對反爬蟲的策略

被機器人肆意地濫用，網站的安全和流量費用就會面臨嚴重威脅，因此很多網站都會想辦法防止爬蟲程序接入。為了能夠更好的爬蟲，我們需要使用可變的ip地址，建立網絡爬蟲的第一原則是：所有信息都可以偽造。但是有

發表于 12-12 17:39

如何提高爬蟲采集效率

次數　　單次爬蟲的主要把時間消耗在網絡請求等待響應上面，所以能減少網站訪問就減少網站訪問，既減少自身的工作量，也減輕網站的壓力，還降低被封的風險。　　第一步要做的就是流程優化，盡量精簡流程，一些數據

發表于 12-23 17:16

網絡爬蟲之關于爬蟲http代理的常見使用方式

在做爬蟲的過程中，如果你爬取的頻率過快，不符合人的操作模式。有些網站的反爬蟲機制通過監測到你的IP異常，訪問頻率過高。就會對你進行封IP處理。目前已有比較多的第三方平臺專門進行代理IP的服務，那

發表于 04-26 17:43

網絡爬蟲nodejs爬蟲代理配置

隨著互聯網的發展進步，現在互聯網上也有許多網絡爬蟲。網絡爬蟲通過自己爬蟲程序向目標網站采集相關數據信息。當然互聯網的網站會有反爬策略。比如某電商網站就會限制一個用戶IP的訪問頻率，從而出現驗證碼

發表于 09-01 17:23

Golang爬蟲語言接入代理？

golang語言也是爬蟲中的一種框架語言。當然很多網絡爬蟲新手都會面臨選擇什么語言適合于爬蟲。一般很多爬蟲用戶都會選擇python和java框架語言來寫

發表于 09-09 17:41

什么是爬蟲？

什么是爬蟲？爬蟲的價值？最簡單的python爬蟲爬蟲基本架構

發表于 11-05 06:13

如何運行imdb爬蟲？

imdbcn爬蟲實例　imdbcn網站結構分析　創建爬蟲項目　運行imdb爬蟲

發表于 11-05 07:07

0基礎入門Python爬蟲實戰課

大數據時代，有兩種技能可以給自己增加競爭優勢。一種是數據分析，旨在挖掘數據的價值，做出最佳決策；另一種是數據獲取，即爬蟲。學會它，相當于在數據時代掌握了攫取能源的最有效方式。谷歌百度等搜索引擎的崛起

發表于 07-25 09:28

python網絡爬蟲概述

網絡爬蟲(Web Spider)又稱網絡蜘蛛、網絡機器人，是一種按照一定的規則，自動地抓取萬維網信息的程序或者腳本。網絡爬蟲按照系統結構和實現技術，大致可分為一下幾種類型：通用網絡爬蟲：就是盡可能

發表于 03-21 16:51

python爬蟲入門教程之python爬蟲視頻教程分布式爬蟲打造搜索引擎

本文檔的主要內容詳細介紹的是python爬蟲入門教程之python爬蟲視頻教程分布式爬蟲打造搜索引擎

發表于 08-28 15:32 ?29次下載

爬蟲是如何實現數據的獲取爬蟲程序如何實現

進入大數據時代，爬蟲技術越來越重要，因為它是獲取數據的一個重要手段，是大數據和云計算的基礎。那么，爬蟲到底是如何實現數據的獲取的呢？今天和大家分享的就是一個系統學習爬蟲技術的過程：先掌握爬蟲

發表于 01-02 16:30 ?10次下載

Python爬蟲你真的會寫爬蟲嗎？

你以為你真的會寫爬蟲了嗎？快來看看真正的爬蟲架構！

發表于 05-02 17:02 ?3955次閱讀

如何解決Python爬蟲中文亂碼問題？Python爬蟲中文亂碼的解決方法

如何解決Python爬蟲中文亂碼問題？Python爬蟲中文亂碼的解決方法在Python爬蟲過程中，遇到中文亂碼問題是常見的情況。亂碼問題主要是由于編碼不一致所導致的，下面我將詳細介紹

發表于 01-12 15:11 ?2551次閱讀

詳細解讀爬蟲多開代理IP的用途，以及如何配置！

爬蟲多開代理IP是一種在爬蟲開發中常用的技術策略，主要用于提高數據采集效率、避免IP被封禁以及獲取地域特定的數據。

發表于 09-14 07:55 ?555次閱讀

吴忠躺衫网络科技有限公司

搜索歷史

如何解決爬蟲被封的問題

1.目標采集

2.校驗這里我使用淘寶ip地址庫檢驗可用性

3.代碼

4.為你的爬蟲加入代理ip

評論

Python數據爬蟲學習內容

應對反爬蟲的策略

如何提高爬蟲采集效率

網絡爬蟲之關于爬蟲http代理的常見使用方式

網絡爬蟲nodejs爬蟲代理配置

Golang爬蟲語言接入代理？

什么是爬蟲？

如何運行imdb爬蟲？

0基礎入門Python爬蟲實戰課

python網絡爬蟲概述

python爬蟲入門教程之python爬蟲視頻教程分布式爬蟲打造搜索引擎

爬蟲是如何實現數據的獲取爬蟲程序如何實現

Python爬蟲你真的會寫爬蟲嗎？

如何解決Python爬蟲中文亂碼問題？Python爬蟲中文亂碼的解決方法

詳細解讀爬蟲多開代理IP的用途，以及如何配置！

搜索歷史

如何解決爬蟲被封的問題

1.目標采集

2.校驗 這里我使用淘寶ip地址庫檢驗可用性

3.代碼

4.為你的爬蟲加入代理ip

評論

2.校驗這里我使用淘寶ip地址庫檢驗可用性