Python3 selenium 網頁table數據抓爬

原創

浮生梦浮生

2020-06-04 02:22

項目介紹

本項目是對一些複雜的報表解析爬取列表數據，以國家網爲例（大家最好換一個網站），會自動根據數據庫配置text（數據庫爲字典方式），進行
點擊樹形結構，然後input下拉框內時間，並選擇省（時間和省由配置文件配置），但下拉列表的xpath沒有數據庫化，現階段是寫死在代碼中
項目開始由遞歸進行判定是否爲最後一層，字典表可配置N層，看你網站的複雜度

加入QQ羣：943841699

源碼地址：https://gitee.com/xywdy/table_creeper.git

技術

Python3.6
selenium(如果對selenium不瞭解，可參考博客
https://blog.csdn.net/wudaoshihun/article/details/82982596
https://blog.csdn.net/wudaoshihun/article/details/82990670
https://blog.csdn.net/wudaoshihun/article/details/82990920
https://blog.csdn.net/wudaoshihun/article/details/82947091）

本項目採用谷歌瀏覽器內核，需安裝谷歌及匹配的driver
參考：https://blog.csdn.net/wudaoshihun/article/details/82353056
並且linux無界面，需要配置無界面方式進行爬取
參考：https://blog.csdn.net/wudaoshihun/article/details/82948013

使用說明

1. 把resource文件下SQL拷貝並導入數據庫
2. 配置config.py
3. 根據技術目錄指引安裝完畢
4. 現階段只有一張表，class_type爲類型，若不同類型網站，則class_type不同，
group_code爲分組編碼，可根據00000000，每個位代表不同含義，與自己庫中的分類對應。

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

首批！Zilliz 獲得亞馬遜雲科技生成式 AI 合作伙伴能力認證

Zilliz 正式宣佈通過亞馬遜雲科技生成式 AI 能力認證！這一認證不僅肯定了 Zilliz 在人工智能和非結構化數據領域的卓越能力，也標誌着 Zilliz 在推動 AI 技術創新和應用的道路上邁出了重要一步。亞馬遜雲科技生

2024-06-06 14:16:04

首批！華爲雲盤古研發大模型通過代碼大模型評估，獲當前最高等級

本文分享自華爲雲社區《首批！華爲雲盤古研發大模型通過代碼大模型評估，獲當前最高等級》，作者：華爲雲頭條。近日，在中國信通院組織的首輪代碼大模型評估中，華爲技術有限公司的華爲雲盤古研發大模型最終獲得4+級，成爲國內首批通過該項評估的企業之

2024-06-13 10:57:02

BCS2024｜Baidu Comate：以研發提效爲驅動實現“安全左移”

2024年6月5日，以“AI驅動安全”爲主題的2024全球數字經濟大會數字安全高層論壇暨北京網絡安全大會戰略峯會（簡稱“BCS大會”）在北京國家會議中心開幕。 BCS2024｜“互聯網創新發展”論壇百度研發安全負責人陳長林出席互聯網創

2024-06-08 09:41:40

低代碼：加速企業數字化轉型的利器

隨着企業數字化轉型步伐的加快，低代碼開發平臺迅速成爲市場的焦點。**憑藉其能簡化開發流程、縮短交付時間和降低成本等優勢，**低代碼已經贏得了企業和開發人員的廣泛認可，已成爲推動企業數字化轉型、提高企業創新效率、競爭力的關鍵工具。本文將詳細介

2024-06-07 21:18:49

原來Stable Diffusion是這樣工作的

stable diffusion是一種潛在擴散模型，可以從文本生成人工智能圖像。爲什麼叫做潛在擴散模型呢？這是因爲與在高維圖像空間中操作不同，它首先將圖像壓縮到潛在空間中，然後再進行操作。在這篇文章中，我們將深入瞭解它到底是如何工作的,還

2024-06-06 21:38:48

企業實施數字化轉型有哪些方面？

本人研究企業數字化轉型10餘年，爲企業軟件選型、數字化提供諮詢服務！目前重點研究低代碼數字化轉型玩法，力爭爲各行各業探索出一條最具性價比的數字化方式。關於“企業數字化轉型包括哪些方面”這個問題，咱先來看個例子哈~ 比如說某製造企業通過數

2024-06-06 21:27:46

度安講 * 第二期「安全左移·業務護航」技術沙龍成功舉辦

當下，“安全左移”作爲落地DevSecOps的重要實踐之一，已在業界達成共識。DevSecOps作爲一種集開發、安全、運維於一體的軟件開發和運營模式，強調在敏捷交付下，“安全”在軟件開發生命週期的全覆蓋貫穿和核心位置。所謂“安全左移”，與

2024-06-03 21:42:25

向量數據庫引領 AI 創新——Zilliz 亮相 2024 亞馬遜雲科技中國峯會

2024年5月29日，亞馬遜雲科技中國峯會在上海召開，此次峯會聚集了來自全球各地的科技領袖、行業專家和創新企業，探討雲計算、大數據、人工智能等前沿技術的發展趨勢和應用場景。作爲領先的向量數據庫技術公司，Zilliz 在本次峯會上展示了最新的

2024-05-30 21:25:17

2024年國內最全面最前沿人工智能理論和實踐資料

引言【導讀】2024第11屆全球互聯網架構大會圓滿結束。會議邀請了100餘位行業內的領軍人物和革新者，大會通過主題演講、實踐案例分享，以及前瞻性的技術討論，探索AI技術的邊界。(最新AI-大模型獲取地址點擊領取) 近日

2024-05-29 22:52:52

還能報名！風靡硅谷開發者的Unstructured Data Meetup 杭州站與您6月15日見面！

"最硅谷"的Unstructured Data Meetup即將來到杭州西溪！衆所周知，AI 三要素包括：算力、算法和數據。數據的價值愈發凸顯，而其中非結構化數據更是備受關注。IDC 預測，到 2027年，全球數據總量中將有超過 86.7

2024-06-12 14:15:35

一文搞懂DevOps、DataOps、MLOps、AIOps：所有“Ops”的比較

引言近年來，"Ops"一詞在 IT 運維領域的使用迅速增加。IT 運維正在向自動化過程轉變，以改善客戶交付。傳統的應用程序開發採用 DevOps 實施持續集成（CI）和持續部署（CD）。但對於數據密集型的機器學習和人工智能（AI）應用，精

2024-06-07 14:08:38

Opal 機器學習平臺：愛奇藝數智一體化實踐

01 綜述 Opal 是愛奇藝大數據團隊研發的機器學習平臺，包含特徵生產、樣本構建、模型訓練、模型部署在內的多環節 Bigdata + AI 開發服務，內置多種訓練鏡像、

愛奇藝技術產品團隊

2024-06-01 02:21:16

基於對比稀疏擾動技術的時間序列解釋框架 ContraLSP

開篇近日，由阿里雲計算平臺大數據基礎工程技術團隊主導，與南京大學、賓夕法尼亞州立大學、清華大學等高校合作，解釋時間序列預測模型的論文《Explaining Time Series via Contrastive and Locally

2024-06-01 00:25:50

兒童節變身小小音樂家*用ModelArts製作一張AIGC音樂專輯

本文分享自華爲雲社區《兒童節變身小小音樂家*用ModelArts製作一張AIGC音樂專輯》*作者* 華爲雲社區精選。兒童節*如何給小朋友準備一份特別的禮物* 這份AIGC音樂專輯製作攻略一定要收下一段文字靈感就能編織出一曲悠揚悅耳的旋

2024-05-31 11:04:39

金融反欺詐指南：車險欺詐爲何如此猖獗？

青島市人民檢察院在其官方微信公衆號上發佈的梁某保險詐騙案顯示，2020 年以來，某汽修廠負責人梁某、某汽車服務公司負責人孫某，與保險公司的趙某等人相互勾結，收購二手北汽等品牌新能源汽車，併爲這些車輛購買車損險。隨後，他們利用暴雨天氣，故意製

2024-05-30 00:16:51

24小時熱門文章

最新文章

最新評論文章