爬虫入门tast4：爬取某新闻

原創

胖虎卖汤圆

2020-05-01 16:01

爬取某新闻

1 了解ajax加载
2 通过chrome的开发者工具，监控网络请求，并分析
3 用selenium完成爬虫
4 具体流程如下：

import time
from  selenium import webdriver

driver = webdriver.Chrome()
driver.get('https://news.qq.com/')

两秒垂直滚动一次

for i in range(1,100):
    time.sleep(2)
    driver.execute_script("window.scrollTo(window.scrollX, %d);"%(i*200))

利用xpath定位标签（其中data-biz每天会变，如果爬出来为空的话记得修改xpath）：

html=driver.page_source
from lxml import etree
tree = etree.HTML(html) 
content = tree.xpath('//ul[@data-biz="5999"]/li')   # data-biz每天会变

结果就不展示了，大家可以输出看看

for k, i in enumerate(content):
    try:
        url = i.xpath('./div/h3/a/@href')[0]
        title = i.xpath('./div/h3/a/text()')[0]
        print('序号：%d title：%s url：%s' % (k, title, url))
    except:
        url = i.xpath('./h3/a/@href')[0]
        title = i.xpath('./h3/a/text()')[0]
        print('序号：%d title：%s url：%s' % (k, title, url))


driver.close()  # 关闭浏览器一个Tab
# or
driver.quit()  # 关闭浏览器窗口

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

开发者分享：利用 EMQX Cloud 与 ESP32 微控制器实现智能液冷散热系统

作者：陶德坤，EMQX Cloud 開發者。作爲一名後端開發人員，我經常需要同時運行多個 Jetbrains IDE （集成開發環境），所以經常面臨筆記本電腦過熱問題。我曾嘗試過各種散熱方法，從傳統的風扇到更先進的半導體冷卻系統，但這些

2024-05-07 21:55:53

我们团队来了一位新同事，主动要求帮忙敲代码！欢迎 AI 001号

通義靈碼｜7X24的AI智能編程助手工號：AI001 他叫通義靈碼，一個硅基生命。出生在0101星球，沒有性別，但有人格類型。他是INTJ，建築師型人格，艾薩克·牛頓和甘道夫同款。他會寫一點代碼，但不如我們會得多。我看了下他的簡歷，

2024-05-07 21:12:06

频繁FullGC线上问题排查

一、問題近期頻繁收到關於FullGC的告警二、基礎知識介紹 2.1 Java內存結構目前系統使用的是ParNewGC、CMS垃圾回收，此時的1.8JDK內存模型如下：注意大對象可以直接放到老年代中，可以通過-XX:Pretenur

2024-05-06 23:55:18

我在下载模块的时候下不下来出现这种情况是什么意思？

大家好，我是Python進階者。一、前言前幾天在Python白銀交流羣【無敵劈叉小狗】問了一個Python庫下載失敗的問題。問題如下：我在下載模塊的時候下不下來出現這種情況是什麼意思？二、實現過程這裏【莫生氣】給了一個指導：執行那

2024-05-06 21:49:13

[oeasy]python0015_键盘改造_将esc和capslock对调_hjkl_移动_双手正位

鍵盤改造 🥋 回憶上次內容上次練習了複製粘貼按鍵作用 <kb

2024-05-06 11:45:36

教你用Perl实现Smgp协议

本文分享自華爲雲社區《華爲雲短信服務教你用Perl實現Smgp協議》，作者：張儉。引言&協議概述中國電信短消息網關協議（SMGP）是中國網通爲實現短信業務而制定的一種通信協議，全稱叫做Short Message Gateway Pro

2024-05-06 10:32:43

有遇到过吗？同样的规则 Excel 中比Python 结果大

大家好，我是Python進階者。一、前言前幾天在Python白銀交流羣【Jethro Shen】問了一個Python處理Excel數據讀取的問題。問題如下：有遇到過嗎？同樣的規則 Excel 中比Python 結果大？二、實

2024-05-01 09:49:01

这种运行结果里的10.100000001，怎么能最快改成10.1？

大家好，我是Python進階者。一、前言前幾天在Python白銀交流羣【無敵劈叉小狗】問了一個Python基礎的問題。問題如下：這種運行結果裏的10.100000001，怎麼能最快改成10.1，所有結果都最多一位小數。二、實現過程

2024-04-30 21:49:58

通义灵码实战系列：一个新项目如何快速启动，如何维护遗留系统代码库？

作者：別象進入 2024 年，AI 熱度持續上升，翻閱科技區的文章，AI 可謂是軍書十二卷，卷卷有爺名。而麥肯錫最近的研究報告顯示，軟件工程是 AI 影響最大的領域之一，AI 已經成爲了軟件工程的必選項，也有研究稱開發者每天的事務性工作可

2024-04-30 21:12:20

Apache DolphinScheduler支持Flink吗？

隨着大數據技術的快速發展，很多企業開始將Flink引入到生產環境中，以滿足日益複雜的數據處理需求。而作爲一款企業級的數據調度平臺，Apache DolphinScheduler也跟上了時代步伐，推出了對Flink任務類型的支持。 Flink

2024-04-30 11:49:27

从原始边列表到邻接矩阵Python实现图数据处理的完整指南

本文分享自華爲雲社區《從原始邊列表到鄰接矩陣Python實現圖數據處理的完整指南》，作者：檸檬味擁抱。在圖論和網絡分析中，圖是一種非常重要的數據結構，它由節點（或頂點）和連接這些節點的邊組成。在Python中，我們可以使用鄰接矩陣來表示

2024-04-30 10:34:05

Python爬虫技术与数据可视化：Numpy、pandas、Matplotlib的黄金组合

前言在當今信息爆炸的時代，數據已成爲企業決策和發展的關鍵。而互聯網作爲信息的主要來源，網頁中蘊含着大量的數據等待被挖掘。Python爬蟲技術和數據可視化工具的結合，爲我們提供了一個強大的工具箱，可以幫助我們從網絡中抓取數據，並將其可視

2024-04-29 23:26:28

Spring AI 抢先体验，5 分钟玩转 Java AI 应用开发

作者：劉軍 Spring AI 是 Spring 官方社區項目，旨在簡化 Java AI 應用程序開發，讓 Java 開發者像使用 Spring 開發普通應用一樣開發 AI 應用。 Spring Cloud Alibaba AI 以 Spr

2024-04-29 21:12:12

1 名工程师轻松管理 20 个工作流，创业企业用 Serverless 让数据处理流程提效

作者：嶽洋、陳德全、劉靜娜北京語勢科技有限公司成立於 2023 年 6 月，語勢科技定位爲“智能投資時代的主題入口”，在資管行業從以機構爲核心轉向以用戶爲核心的變革時代，通過打造主題投資引擎，賦能普惠投資一體化，打造以投資者和資管機構爲主

2024-04-28 21:12:22

11个Python循环技巧

本文分享自華爲雲社區《Python中的循環技巧指南》，作者：檸檬味擁抱。當我們處理數據時，有時候需要創建多個列表以存儲不同類型或不同條件下的數據。在Python中，我們可以利用循環來快速、高效地創建這些列表。本文將介紹如何使用循環在Pyt

2024-04-28 10:33:08

24小時熱門文章

最新文章

最新評論文章