Python爬蟲 --- 2.3 Scrapy 框架的簡單使用

原文鏈接：https://www.fkomm.cn/article/2018/8/3/28.html

網絡爬蟲，是在網上進行數據抓取的程序，使用它能夠抓取特定網頁的HTML數據。

Scrapy框架的簡單使用：

雖然我們利用一些庫開發一個爬蟲程序，但是使用框架可以大大提高效率，縮短開發時間。Scrapy是一個使用Python編寫的，輕量級的框架，簡單輕巧，並且使用起來非常的方便。使用Scrapy可以很方便的完成網上數據的採集工作，它爲我們完成了大量的工作，而不需要自己費大力氣去開發。

下面我們來通過一個很簡單的例子來介紹Scrapy框架的使用。

我們要爬的網址是：搜讀網： http://www.sodu.cc。

我喜歡在這個網站看小說，裏面的小說內容還是比較豐富的，推薦讀者喜歡看小說的可以來看看。因爲只是簡單介紹，所以我只準備抓取小說的標題。

好的，基本流程既然確定了，那接下來就一步一步的完成就可以了。

其實只需要四步即可！！！

步驟一：創建一個工程和Spider模板

我們先用命令行創建一個Scrapy工程：

$ scrapy startproject soudu

接着，我們進入到工程目錄：

$ cd soudu

我們來看一下目錄結構：

tree
# OUT:
.
├── soudu                  #外層目錄
│   ├── __init__.py         #初始化腳本    
│   ├── __pycache__         #Python緩存文件。暫時無視
│   ├── items.py            #Items代碼模板，繼承類自scrapy.Item
│   ├── middlewares.py      #Middlewares代碼模板(繼承類)
│   ├── pipelines.py        #Pipelines代碼模板(繼承類)
│   ├── settings.py         #Scrapy爬蟲的配置文件
│   └── spiders             #Spiders代碼模板目錄 我們寫爬蟲的地方
│       ├── __init__.py
│       └── __pycache__
└── scrapy.cfg              #部署爬蟲的配置文件

4 directories, 7 files

最後，我們用命令行創建第一個Spider：

$ scrapy genspider title www.sodu.cc

這樣我們就創建了一個名爲title的爬蟲了。

我們來看看他長什麼樣，打開/spiders/title.py:

# -*- coding: utf-8 -*-
import scrapy

class NewsSpider(scrapy.Spider):
    name = 'title'
    allowed_domains = ['www.sodu.cc']
    start_urls = ['http://www.sodu.cc/']

    def parse(self, response):
        pass

可以看到，Scrapy已經幫我們把爬蟲的框架寫好了，我們只要在這個框架的基礎上進行進一步的定製就可以了。

步驟二：編寫Spider

我們來着手定製我們的爬蟲吧：

看一下詳細的註釋

# -*- coding: utf-8 -*-
import scrapy

# 將我們需要爬的項目引入進來
from soudu.items import SouduItem

class DemoSpider(scrapy.Spider):

    #該爬蟲的名字
    name = "title"

    #規定爬蟲爬取網頁的域名   
    allowed_domains = ['www.sodu.cc']

    #開始爬取的url鏈接
    start_urls = ['http://www.sodu.cc/']

    def parse(self, response):
        '''
        parse()函數接收Response參數，就是網頁爬取後返回的數據
        用於處理響應，他負責解析爬取的內容
        生成解析結果的字典，並返回新的需要爬取的請求
        '''

        #由於是demo 我們不做完全的功能，
        #只要求爬取出第一部小說的名字
        #xpath規則可以通過查看網頁源文件得出，chrome右鍵檢查定位到所要爬取的內容
        name = response.xpath('//a[@onclick="getpage(this)"]/text()').extract()[0]

        #建立一個items字典，用於保存我們爬到的結果，並返回給pipline處理
        items = {}
        items['第一部小說名']= name

        return items

步驟三：編寫Item Pipeline

首先我們編寫itmes.py來定義這個爬蟲框架需要爬哪些內容：

# -*- coding: utf-8 -*-

# Define here the models for your scraped items
#
# See documentation in:
# https://doc.scrapy.org/en/latest/topics/items.html

import scrapy

class SouduItem(scrapy.Item):
    # define the fields for your item here like:
    # name = scrapy.Field()
    name = scrapy.Field()

接着我們編寫 piplines.py來處理spider爬到的內容：

# -*- coding: utf-8 -*-

# Define your item pipelines here
#
# Don't forget to add your pipeline to the ITEM_PIPELINES setting
# See: http://doc.scrapy.org/en/latest/topics/item-pipeline.html
class ZimukuPipeline(object):
    def process_item(self, item, spider):

        # 因爲是最簡單的，所以我們把爬到的結果打印一下

        print(item)

        return item

步驟四：優化配置Settings.py

# -*- coding: utf-8 -*-

# Scrapy settings for soudu project
#
# For simplicity, this file contains only settings considered important or
# commonly used. You can find more settings consulting the documentation:
#
#     https://doc.scrapy.org/en/latest/topics/settings.html
#     https://doc.scrapy.org/en/latest/topics/downloader-middleware.html
#     https://doc.scrapy.org/en/latest/topics/spider-middleware.html

BOT_NAME = 'soudu'

SPIDER_MODULES = ['soudu.spiders']
NEWSPIDER_MODULE = 'soudu.spiders'

# Crawl responsibly by identifying yourself (and your website) on the user-agent
#USER_AGENT = 'soudu (+http://www.yourdomain.com)'

# Obey robots.txt rules
ROBOTSTXT_OBEY = True

#只增加了這一行，通過配置告訴Scrapy明白是誰來處理結果
ITEM_PIPELINES = {
   'soudu.pipelines.SouduPipeline': 300,
}

好了，這樣一個爬蟲就算完成了，那怎麼獲取爬到的結果呢？？？

運行

首先我們通過命令來執行爬蟲：

$ scrapy crawl title

讓我們這個最最簡單的爬蟲跑起來。

來看一下結果：

我只截取部分我們需要的內容，其他的我且暫不寫出了：

2018-08-03 19:31:53 [scrapy.core.scraper] DEBUG: Scraped from <200 http://www.sodu.cc/>
{'第一部小說名': '聖墟'}

是不是可以看到我們需要找到的內容了？

Scrapy框架的基本使用已經說完了，以後我會一步一步來講解其他的例子。

Python爬蟲 --- 2.3 Scrapy 框架的簡單使用

Scrapy框架的簡單使用：

步驟一：創建一個工程和Spider模板

步驟二：編寫Spider

步驟三：編寫Item Pipeline

步驟四：優化配置Settings.py

運行

電子科技大學計算機科學與技術就讀體驗

Golang爬蟲代理接入的技術與實踐

python機器學習實戰（二）

Python爬蟲 --- 2.3 Scrapy 框架的簡單使用

Python爬蟲 --- 2.5 Scrapy之汽車之家爬蟲實踐

Python爬蟲 --- 2.4 Scrapy之天氣預報爬蟲實踐

Python爬蟲--- 1.5 爬蟲實踐：獲取百度貼吧內容

https://yachay.unat.edu.pe/blog/index.php?comment_area=format_blog&comment_component=blog&comment_co

linux以太網驅動總結

Python爬蟲 --- 2.3 Scrapy 框架的簡單使用

Scrapy框架的簡單使用：

步驟一： 創建一個工程和Spider模板

步驟二：編寫Spider

步驟三：編寫Item Pipeline

步驟四：優化配置Settings.py

運行

步驟一：創建一個工程和Spider模板