python爬取盤搜的有效鏈接實現代碼

原創

2020-04-05 12:01

這篇文章主要介紹了python爬取盤搜的有效鏈接，本文通過實例代碼給大家介紹的非常詳細，具有一定的參考借鑑價值 ,需要的朋友可以參考下
因爲盤搜搜索出來的鏈接有很多已經失效了，影響找數據的效率，因此想到了用爬蟲來過濾出有效的鏈接，順便練練手~

這是本次爬取的目標網址http://www.pansou.com，首先先搜索個python，之後打開開發者工具，

可以發現這個鏈接下的json數據就是我們要爬取的數據了，把多餘的參數去掉，

剩下的鏈接格式爲http://106.15.195.249:8011/search_new?q=python&p=1，q爲搜索內容，p爲頁碼
以下是代碼實現：

import requests
import json
from multiprocessing.dummy import Pool as ThreadPool
from multiprocessing import Queue
import sys
headers = {
  "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.100 Safari/537.36"
}
q1 = Queue()
q2 = Queue()
urls = [] # 存取url列表
# 讀取url
def get_urls(query):
  # 遍歷50頁
  for i in range(1,51):
    # 要爬取的url列表，返回值是json數據，q參數是搜索內容，p參數是頁碼
    url = "http://106.15.195.249:8011/search_new?&q=%s&p=%d" % (query,i)
    urls.append(url)
# 獲取數據
def get_data(url):
  print("開始加載，請等待...")
  # 獲取json數據並把json數據轉換爲字典
  resp = requests.get(url, headers=headers).content.decode("utf-8")
  resp = json.loads(resp)
  # 如果搜素數據爲空就拋出異常停止程序
  if resp['list']['data'] == []:
    raise Exception
  # 遍歷每一頁數據的長度
  for num in range(len(resp['list']['data'])):
    # 獲取百度雲鏈接
    link = resp['list']['data'][num]['link']
    # 獲取標題
    title = resp['list']['data'][num]['title']
    # 訪問百度雲鏈接，判斷如果頁面源代碼中有“失效時間：”這段話的話就表明鏈接有效，鏈接無效的頁面是沒有這段話的
    link_content = requests.get(link, headers=headers).content.decode("utf-8")
    if "失效時間：" in link_content:
      # 把標題放進隊列1
      q1.put(title)
      # 把鏈接放進隊列2
      q2.put(link)
      # 寫入csv文件
      with open("wangpanziyuan.csv", "a+", encoding="utf-8") as file:
        file.write(q1.get()+","+q2.get() + "\n")
  print("ok")
if __name__ == '__main__':
  # 括號內填寫搜索內容
  get_urls("python")
  # 創建線程池
  pool = ThreadPool(3)
  try:
    results = pool.map(get_data, urls)
  except Exception as e:
    print(e)
  pool.close()
  pool.join()
  print("退出")

總結

以上所述是小編給大家介紹的python爬取盤搜的有效鏈接實現代碼希望對大家有所幫助，
非常感謝你的閱讀
大學的時候選擇了自學python，工作了發現吃了計算機基礎不好的虧，學歷不行這是沒辦法的事，只能後天彌補，於是在編碼之外開啓了自己的逆襲之路，不斷的學習python核心知識，深入的研習計算機基礎知識，整理好了，我放在我們的Python學習扣qun：250933691，如果你也不甘平庸，那就與我一起在編碼之外，不斷成長吧！

其實這裏不僅有技術，更有那些技術之外的東西，比如，如何做一個精緻的程序員，而不是“屌絲”，程序員本身就是高貴的一種存在啊，難道不是嗎？[點擊加入]想做你自己想成爲高尚人，加油！

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

python爬取盤搜的有效鏈接實現代碼

自學編程兩個月，現在我月入 4 萬元

「實戰應用」如何用圖表控件LightningChart創建2D氣泡圖

百度安全多篇議題入選Blackhat Asia以硬技術發現“芯”問題

Google Chrome驅動程序 124.0.6367.62（正式版本）去哪下載？

python爬蟲開發之urllib模塊詳細使用方法與實例全解

Python網絡爬蟲項目：內容提取器的定義

Python面向對象程序設計中類的定義、實例化、封裝及私有變量/方法詳解

python爬蟲基本知識

Python爬蟲DNS解析緩存方法實例分析

https://yachay.unat.edu.pe/blog/index.php?comment_area=format_blog&comment_component=blog&comment_co

linux以太網驅動總結