IP代理中間件和user-agent中間件的編寫

在製作爬蟲的時候需要對我們的爬蟲進行僞裝,有兩種僞裝的方式:第一種是通過代理IP,第二種是通過修改user-agent。

一、代理IP

    image.png

    image.png

    image.png

二、user-agent

    import random
    # user agent 列表
    USER_AGENT_LIST = [
        'MSIE (MSIE 6.0; X11; Linux; i686) Opera 7.23',
        'Opera/9.20 (Macintosh; Intel Mac OS X; U; en)',
        'Opera/9.0 (Macintosh; PPC Mac OS X; U; en)',
        'iTunes/9.0.3 (Macintosh; U; Intel Mac OS X 10_6_2; en-ca)',
        'Mozilla/4.76 [en_jp] (X11; U; SunOS 5.8 sun4u)',
        'iTunes/4.2 (Macintosh; U; PPC Mac OS X 10.2)',
        'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv:5.0) Gecko/20100101 Firefox/5.0',
        'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv:9.0) Gecko/20100101 Firefox/9.0',
        'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.8; rv:16.0) Gecko/20120813 Firefox/16.0',
        'Mozilla/4.77 [en] (X11; I; IRIX;64 6.5 IP30)',
        'Mozilla/4.8 [en] (X11; U; SunOS; 5.7 sun4u)'
       ]
    # 隨機生成user agent
    USER_AGENT = random.choice(USER_AGENT_LIST)

--------------------- 


    image.png

    image.png

    image.png

    注意事項:

        1、中間件定義完要在settings文件內啓用

        2、爬蟲文件名和爬蟲名稱不能相同,spider目錄內不能存在相同爬蟲名稱的項目文件

        3、做一個文明守法的好網民,不要爬取公民的隱私數據,不要給對方系統帶來不必要的麻煩。


發表評論
所有評論
還沒有人評論,想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.
相關文章