一区二区三区三上|欧美在线视频五区|国产午夜无码在线观看视频|亚洲国产裸体网站|无码成年人影视|亚洲AV亚洲AV|成人开心激情五月|欧美性爱内射视频|超碰人人干人人上|一区二区无码三区亚洲人区久久精品

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內不再提示

python解析庫的使用--XPath

python爬蟲知識分享 ? 來源:python爬蟲知識分享 ? 作者:python爬蟲知識分享 ? 2022-03-22 15:50 ? 次閱讀

XPath(XML Path Language)是一門在XML文檔中查找信息的語言。

XPath 可用來在XML文檔中對元素和屬性進行遍歷。

XPath 是 W3C XSLT 標準的主要元素,并且 XQueryXPointer 都構建于 XPath 表達之上。

官方網(wǎng)址:http://lxml.de 官方文檔:http://lxml.de/api/index.html

注:XQuery 是用于 XML 數(shù)據(jù)查詢的語言(類似SQL查詢數(shù)據(jù)庫中的數(shù)據(jù))

注:XPointer 由統(tǒng)一資源定位地址(URL)中#號之后的描述組成,類似于HTML中的錨點鏈接

python中如何安裝使用XPath:

①: 安裝 lxml 庫。

②: from lxml import etree

③: Selector = etree.HTML(網(wǎng)頁源代碼)

④: Selector.xpath(xpath選取規(guī)則)

1. 準備工作:

  • 要使用XPath首先要先安裝lxml庫:
pip install lxml

2. XPath選取節(jié)點規(guī)則

表達式 描述
nodename 選取此節(jié)點的所有子節(jié)點。
/ 從當前節(jié)點選取直接子節(jié)點
// 從匹配選擇的當前節(jié)點選擇所有子孫節(jié)點,而不考慮它們的位置
. 選取當前節(jié)點。
.. 選取當前節(jié)點的父節(jié)點。
@ 選取屬性。
  • XPath 運算符
運算符 描述 實例 返回值
| 計算兩個節(jié)點集 //book | //cd 返回所有擁有 book 和 cd 元素的節(jié)點集
+ 加法 6 + 4 10
- 減法 6 - 4 2
* 乘法 6 * 4 24
div 除法 8 div 4 2
= 等于 price=9.80 如果 price 是 9.80,則返回 true。、\n 如果 price 是 9.90,則返回 false。
!= 不等于 price!=9.80 如果 price 是 9.90,則返回 true。\n 如果 price 是 9.80,則返回 false。
< 小于 price<9.80 如果 price 是 9.00,則返回 true。\n 如果 price 是 9.90,則返回 false。
<= 小于或等于 price<=9.80 如果 price 是 9.00,則返回 true。\n 如果 price 是 9.90,則返回 false。
> 大于 price>9.80 如果 price 是 9.90,則返回 true。\n如果 price 是 9.80,則返回 false。
>= 大于或等于 price>=9.80 如果 price 是 9.90,則返回 true。\n如果 price 是 9.70,則返回 false。
or price=9.80 or price=9.70 如果 price 是 9.80,則返回 true。\n如果 price 是 9.50,則返回 false。
and price>9.00 and price<9.90 如果 price 是 9.80,則返回 true。\n如果 price 是 8.50,則返回 false。
mod 計算除法的余數(shù) 5 mod 2 1

3. 解析案例:

  • 首先創(chuàng)建一個html文件:my.html 用于測試XPath的解析效果

我的常用鏈接

  • 使用XPath解析說明
# 導入模塊
from lxml import etree

# 讀取html文件信息(在真實代碼中是爬取的網(wǎng)頁信息)
f = open("./my.html",'r',encoding="utf-8")
content = f.read()
f.close()

# 解析HTML文檔,返回根節(jié)點對象
html = etree.HTML(content)
#print(html)  # 

# 獲取網(wǎng)頁中所有標簽并遍歷輸出標簽名
result = html.xpath("http://*")
for t in result:
    print(t.tag,end=" ")
#[html head title body h3 ul li a li a ... ... td]
print()

# 獲取節(jié)點
result = html.xpath("http://li") # 獲取所有l(wèi)i節(jié)點
result = html.xpath("http://li/a") # 獲取所有l(wèi)i節(jié)點下的所有直接a子節(jié)點
result = html.xpath("http://ul//a") # 效果同上(ul下所有子孫節(jié)點)
result = html.xpath("http://a/..") #獲取所有a節(jié)點的父節(jié)點
print(result)

# 獲取屬性和文本內容
result = html.xpath("http://li/a/@href") #獲取所有l(wèi)i下所有直接子a節(jié)點的href屬性值
result = html.xpath("http://li/a/text()") #獲取所有l(wèi)i下所有直接子a節(jié)點內的文本內容
print(result) #['百度', '京東', '搜狐', '新浪', '淘寶']

result = html.xpath("http://li/a[@class]/text()") #獲取所有l(wèi)i下所有直接含有class屬性子a節(jié)點內的文本內容
print(result) #['百度', '搜狐', '新浪']

#獲取所有l(wèi)i下所有直接含有class屬性值為aa的子a節(jié)點內的文本內容
result = html.xpath("http://li/a[@class='aa']/text()") 
print(result) #['搜狐', '新浪']

#獲取class屬性值中含有shop的li節(jié)點下所有直接a子節(jié)點內的文本內容
result = html.xpath("http://li[contains(@class,'shop')]/a/text()") 
print(result) #['搜狐', '新浪']


# 按序選擇
result = html.xpath("http://li[1]/a/text()") # 獲取每組li中的第一個li節(jié)點里面的a的文本
result = html.xpath("http://li[last()]/a/text()") # 獲取每組li中最后一個li節(jié)點里面的a的文本
result = html.xpath("http://li[position()<3]/a/text()") # 獲取每組li中前兩個li節(jié)點里面的a的文本
result = html.xpath("http://li[last()-2]/a/text()") # 獲取每組li中倒數(shù)第三個li節(jié)點里面的a的文本
print(result) 

print("--"*30)
# 節(jié)點軸選擇
result = html.xpath("http://li[1]/ancestor::*") # 獲取li的所有祖先節(jié)點
result = html.xpath("http://li[1]/ancestor::ul") # 獲取li的所有祖先中的ul節(jié)點
result = html.xpath("http://li[1]/a/attribute::*") # 獲取li中a節(jié)點的所有屬性值
result = html.xpath("http://li/child::a[@) #獲取li子節(jié)點中屬性href值的a節(jié)點
result = html.xpath("http://body/descendant::a") # 獲取body中的所有子孫節(jié)點a
print(result) 

result = html.xpath("http://li[3]") #獲取li中的第三個節(jié)點    
result = html.xpath("http://li[3]/following::li") #獲取第三個li節(jié)點之后所有l(wèi)i節(jié)點
result = html.xpath("http://li[3]/following-sibling::*") #獲取第三個li節(jié)點之后所有同級li節(jié)點
for v in result:
    print(v.find("a").text)
  • 解析案例
# 導入模塊
from lxml import etree

# 讀取html文件信息(在真實代碼中是爬取的網(wǎng)頁信息)
f = open("./my.html",'r')
content = f.read()
f.close()

# 解析HTML文檔,返回根節(jié)點對象
html = etree.HTML(content)

# 1. 獲取id屬性為hid的h3節(jié)點中的文本內容
print(html.xpath("http://h3[@id='hid']/text()")) #['我的常用鏈接']


# 2. 獲取li中所有超級鏈接a的信息
result = html.xpath("http://li/a")
for t in result:
    # 通過xapth()二次解析結果
    #print(t.xpath("text()")[0], ':', t.xpath("@href")[0])

    # 效果同上,使用節(jié)點對象屬性方法解析
    print(t.text, ':', t.get("href"))

'''
#結果:
百度 : http://www.baidu.com
京東 : http://www.jd.com
搜狐 : http://www.sohu.com
新浪 : http://www.sina.com
淘寶 : http://www.taobao.com
'''

'''
HTML元素的屬性:
    tag:元素標簽名
    text:標簽中間的文本
HTML元素的方法:
    find()    查找一個匹配的元素
    findall() 查找所有匹配的元素    
    get(key, default=None) 獲取指定屬性值
    items()獲取元素屬性,作為序列返回
    keys()獲取屬性名稱列表
    value()將元素屬性值作為字符串序列
'''


審核編輯:湯梓紅
聲明:本文內容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權轉載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學習之用,如有內容侵權或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • 信息
    +關注

    關注

    0

    文章

    407

    瀏覽量

    35802
  • 數(shù)據(jù)

    關注

    8

    文章

    7233

    瀏覽量

    90798
  • python
    +關注

    關注

    56

    文章

    4822

    瀏覽量

    85902
收藏 人收藏

    評論

    相關推薦
    熱點推薦

    ?如何在虛擬環(huán)境中使用 Python,提升你的開發(fā)體驗~

    。RaspberryPiOS預裝了Python3。干擾系統(tǒng)Python的安裝可能會給你的操作系統(tǒng)帶來問題。安裝第三方Python時,請務必使用正確的包管理工具。在Lin
    的頭像 發(fā)表于 03-25 09:34 ?148次閱讀
    ?如何在虛擬環(huán)境中使用 <b class='flag-5'>Python</b>,提升你的開發(fā)體驗~

    使用Python實現(xiàn)xgboost教程

    裝: bash復制代碼conda install -c conda-forge xgboost 2. 導入必要的 在你的Python腳本或Jupyter Notebook中,導入必要的
    的頭像 發(fā)表于 01-19 11:21 ?994次閱讀

    適用于MySQL和MariaDB的Python連接器:可靠的MySQL數(shù)據(jù)連接器和數(shù)據(jù)

    和 MariaDB 數(shù)據(jù)服務器以及托管數(shù)據(jù)服務,以對存儲的數(shù)據(jù)執(zhí)行創(chuàng)建、讀取、更新和刪除操作。該解決方案完全實現(xiàn)了 Python DB API 2.0 規(guī)范,并作為 Windows、macOS
    的頭像 發(fā)表于 01-17 12:18 ?351次閱讀
    適用于MySQL和MariaDB的<b class='flag-5'>Python</b>連接器:可靠的MySQL數(shù)據(jù)連接器和數(shù)據(jù)<b class='flag-5'>庫</b>

    適用于Oracle的Python連接器:可訪問托管以及非托管的數(shù)據(jù)

    適用于 Oracle 的 Python 連接器 適用于 Oracle 的 Python 連接器是一種可靠的連接解決方案,用于從 Python 應用程序訪問 Oracle 數(shù)據(jù)服務器和
    的頭像 發(fā)表于 01-14 10:30 ?337次閱讀

    數(shù)據(jù)事件觸發(fā)的設置和應用

    數(shù)據(jù)無論對于生產管理還是很多的實際應用都非常重要。小編這次聊一下數(shù)據(jù)事件觸發(fā)的應用。示例使用了postgresql和Python
    的頭像 發(fā)表于 12-13 15:14 ?485次閱讀

    使用Python進行串口通信的案例

    當然!以下是一個使用Python進行串口通信的簡單示例。這個示例展示了如何配置串口、發(fā)送數(shù)據(jù)以及接收數(shù)據(jù)。我們將使用 pyserial ,這是一個非常流行的用于串口通信的Python
    的頭像 發(fā)表于 11-22 09:11 ?1072次閱讀

    如何使用Python構建LSTM神經網(wǎng)絡模型

    構建一個LSTM(長短期記憶)神經網(wǎng)絡模型是一個涉及多個步驟的過程。以下是使用Python和Keras構建LSTM模型的指南。 1. 安裝必要的 首先,確保你已經安裝了Python
    的頭像 發(fā)表于 11-13 10:10 ?1246次閱讀

    Python解析:通過實現(xiàn)代理請求與數(shù)據(jù)抓取

    Python中,有多個可以幫助你實現(xiàn)代理請求和數(shù)據(jù)抓取。這些提供了豐富的功能和靈活的API,使得你可以輕松地發(fā)送HTTP請求、處理響應、解析HTML/XML/JSON數(shù)據(jù),以及進
    的頭像 發(fā)表于 10-24 07:54 ?404次閱讀

    陀螺儀LSM6DSOW開發(fā)(5)----MotionFX解析空間坐標

    本文將探討如何使用MotionFX解析空間坐標。MotionFX是一種用于傳感器融合的強大工具,可以將加速度計、陀螺儀和磁力計的數(shù)據(jù)融合在一起,實現(xiàn)精確的姿態(tài)和位置估計。本文將介紹如何初始化
    的頭像 發(fā)表于 08-15 18:13 ?2036次閱讀
    陀螺儀LSM6DSOW開發(fā)(5)----MotionFX<b class='flag-5'>庫</b><b class='flag-5'>解析</b>空間坐標

    pytorch和python的關系是什么

    在當今的人工智能領域,Python已經成為了最受歡迎的編程語言之一。Python的易學易用、豐富的和框架以及強大的社區(qū)支持,使其成為了數(shù)據(jù)科學、機器學習和深度學習等領域的首選語言。而在深度學習領域
    的頭像 發(fā)表于 08-01 15:27 ?2964次閱讀

    Python建模算法與應用

    上成為理想的腳本語言,特別適用于快速的應用程序開發(fā)。本文將詳細介紹Python在建模算法中的應用,包括常見的建模算法、Python在建模中的優(yōu)勢、常用以及實際案例。
    的頭像 發(fā)表于 07-24 10:41 ?996次閱讀

    opencv-python和opencv一樣嗎

    不一樣。OpenCV(Open Source Computer Vision Library)是一個開源的計算機視覺和機器學習軟件,它提供了大量的圖像和視頻處理功能。OpenCV-Python
    的頭像 發(fā)表于 07-16 10:38 ?1812次閱讀

    深度學習常用的Python

    深度學習作為人工智能的一個重要分支,通過模擬人類大腦中的神經網(wǎng)絡來解決復雜問題。Python作為一種流行的編程語言,憑借其簡潔的語法和豐富的支持,成為了深度學習研究和應用的首選工具。本文將深入探討
    的頭像 發(fā)表于 07-03 16:04 ?983次閱讀

    如何使用Python進行神經網(wǎng)絡編程

    。 為什么使用Python? Python是一種廣泛使用的高級編程語言,以其易讀性和易用性而聞名。Python擁有強大的,如TensorFlow、Keras和PyTorch,這些
    的頭像 發(fā)表于 07-02 09:58 ?629次閱讀

    ESP32下如何加自定義Python?

    我看官方有提供Micropython的bin文件,但我想根據(jù)自己外設擴充一下Python,這個應該從哪里入手? 之前做過RTT系統(tǒng)的python擴充,RTT有提供Micropyth
    發(fā)表于 06-18 06:27