Python網絡爬蟲信息提取mooc代碼實例

原創

2020-06-27 06:19

這篇文章主要介紹了python網絡爬蟲與信息提取mooc,文中通過示例代碼介紹的非常詳細，對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
實例一–爬取頁面

import requests
url="https//itemjd.com/2646846.html"
try:
 r=requests.get(url)
 r.raise_for_status()
 r.encoding=r.apparent_encoding
 print(r.text[:1000])
except:
 print("爬取失敗")

正常頁面爬取

實例二–爬取頁面

import requests
url="https://www.amazon.cn/gp/product/B01M8L5Z3Y"
try:
 kv={'user-agent':'Mozilla/5.0'}
 r=requests.get(url,headers=kv)
 r.raise_for_status()
 r.encoding=r.apparent_encoding
 print(r.text[1000:2000])
except:
 print("爬取失敗")

對訪問用戶名有限制，模擬瀏覽器對網站請求

實例三–爬取搜索引擎

#百度的關鍵詞接口：http://www.baidu.com/s?wd=keyword
#360的關鍵詞接口：http://www.so.com/s?q=keyword
import requests
keyword="python"
try:
 kv={'wd':keyword}
 r=requests.get("http://www.baidu.com/s",params=kv)
 print(r.request.url)
 r.raise_for_status()
 print(len(r.text))
except:
 print("爬取失敗")
--------------------------------------------------
import requests
keyword="python"
try:
 kv={'q':keyword}
 r=requests.get("http://www.so.com/s",params=kv)
 print(r.request.url)
 r.raise_for_status()
 print(len(r.text))
except:
 print("爬取失敗")

實例四–:爬取圖片

import requests
import os
url="http://image.nationalgeographic.com.cn/2017/0211/20170211061910157.jpg"
root="F://pics//"
path=root+url.split('/')[-1]
try:
 if not os.path.exists(root):
  os.mkdir(root)
 if not os.path.exists(path):
  r=requests.get(url)
  with open(path,'wb') as f:
   f.write(r.content)
   f.close()
   print("文件保存成功")
 else:
  print("文件已經存在")
except:
 print("爬取失敗")

爬取並保存圖片

實例五–IP地址歸屬地查詢：

http://m.ip138.com/ip.asp?ip=ipaddress

url="http://www.ip138.com/iplookup.asp?ip="
try:
 r=requests.get(url+'202.204.80.112'+'&action=2')
 r.raise_for_status()
 r.encoding=r.apparent_encoding
 print(r.text[-500:])
except:
 print("爬取失敗")

最後給大家推薦一個口碑不錯的python聚集地【點擊進入】，這裏有很多的老前輩學習技巧，學習心得

，面試技巧，職場經歷等分享，更爲大家精心準備了零基礎入門資料，實戰項目資料，每天都有程序員

定時講解Python技術，分享一些學習的方法和需要留意的小細節

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

Python網絡爬蟲信息提取mooc代碼實例

認知提升的方法

C#開源的兩款功能強大的錄屏神器

螞蟻面試：Springcloud核心組件的底層原理，你知道多少？

前端 Vue yarn.lock文件：詳解和使用指南

python爬蟲開發之urllib模塊詳細使用方法與實例全解

Python網絡爬蟲項目：內容提取器的定義

Python面向對象程序設計中類的定義、實例化、封裝及私有變量/方法詳解

python爬蟲基本知識

Python爬蟲DNS解析緩存方法實例分析

https://yachay.unat.edu.pe/blog/index.php?comment_area=format_blog&comment_component=blog&comment_co

linux以太網驅動總結