XPath(XML Path Language)是一門在XML文檔中查找信息的語言。
XPath 可用來在XML文檔中對元素和屬性進行遍歷。
XPath 是 W3C XSLT 標(biāo)準(zhǔn)的主要元素,并且 XQuery 和 XPointer 都構(gòu)建于 XPath 表達之上。
官方網(wǎng)址:http://lxml.de 官方文檔:http://lxml.de/api/index.html
注:XQuery 是用于 XML 數(shù)據(jù)查詢的語言(類似SQL查詢數(shù)據(jù)庫中的數(shù)據(jù))
注:XPointer 由統(tǒng)一資源定位地址(URL)中#號之后的描述組成,類似于HTML中的錨點鏈接
python中如何安裝使用XPath:
①: 安裝 lxml 庫。
②: from lxml import etree
③: Selector = etree.HTML(網(wǎng)頁源代碼)
④: Selector.xpath(xpath選取規(guī)則)
1. 準(zhǔn)備工作:
- 要使用XPath首先要先安裝lxml庫:
pip install lxml
2. XPath選取節(jié)點規(guī)則
| 表達式 | 描述 |
|---|---|
| nodename | 選取此節(jié)點的所有子節(jié)點。 |
| / | 從當(dāng)前節(jié)點選取直接子節(jié)點 |
| // | 從匹配選擇的當(dāng)前節(jié)點選擇所有子孫節(jié)點,而不考慮它們的位置 |
| . | 選取當(dāng)前節(jié)點。 |
| .. | 選取當(dāng)前節(jié)點的父節(jié)點。 |
| @ | 選取屬性。 |
- XPath 運算符
| 運算符 | 描述 | 實例 | 返回值 |
|---|---|---|---|
| | | 計算兩個節(jié)點集 | //book | //cd | 返回所有擁有 book 和 cd 元素的節(jié)點集 |
| + | 加法 | 6 + 4 | 10 |
| - | 減法 | 6 - 4 | 2 |
| * | 乘法 | 6 * 4 | 24 |
| div | 除法 | 8 div 4 | 2 |
| = | 等于 | price=9.80 | 如果 price 是 9.80,則返回 true。、\n 如果 price 是 9.90,則返回 false。 |
| != | 不等于 | price!=9.80 | 如果 price 是 9.90,則返回 true。\n 如果 price 是 9.80,則返回 false。 |
| < | 小于 | price<9.80 | 如果 price 是 9.00,則返回 true。\n 如果 price 是 9.90,則返回 false。 |
| <= | 小于或等于 | price<=9.80 | 如果 price 是 9.00,則返回 true。\n 如果 price 是 9.90,則返回 false。 |
| > | 大于 | price>9.80 | 如果 price 是 9.90,則返回 true。\n如果 price 是 9.80,則返回 false。 |
| >= | 大于或等于 | price>=9.80 | 如果 price 是 9.90,則返回 true。\n如果 price 是 9.70,則返回 false。 |
| or | 或 | price=9.80 or price=9.70 | 如果 price 是 9.80,則返回 true。\n如果 price 是 9.50,則返回 false。 |
| and | 與 | price>9.00 and price<9.90 | 如果 price 是 9.80,則返回 true。\n如果 price 是 8.50,則返回 false。 |
| mod | 計算除法的余數(shù) | 5 mod 2 | 1 |
3. 解析案例:
- 首先創(chuàng)建一個html文件:my.html 用于測試XPath的解析效果
我的常用鏈接
- 使用XPath解析說明
# 導(dǎo)入模塊
from lxml import etree
# 讀取html文件信息(在真實代碼中是爬取的網(wǎng)頁信息)
f = open("./my.html",'r',encoding="utf-8")
content = f.read()
f.close()
# 解析HTML文檔,返回根節(jié)點對象
html = etree.HTML(content)
#print(html) #
# 獲取網(wǎng)頁中所有標(biāo)簽并遍歷輸出標(biāo)簽名
result = html.xpath("http://*")
for t in result:
print(t.tag,end=" ")
#[html head title body h3 ul li a li a ... ... td]
print()
# 獲取節(jié)點
result = html.xpath("http://li") # 獲取所有l(wèi)i節(jié)點
result = html.xpath("http://li/a") # 獲取所有l(wèi)i節(jié)點下的所有直接a子節(jié)點
result = html.xpath("http://ul//a") # 效果同上(ul下所有子孫節(jié)點)
result = html.xpath("http://a/..") #獲取所有a節(jié)點的父節(jié)點
print(result)
# 獲取屬性和文本內(nèi)容
result = html.xpath("http://li/a/@href") #獲取所有l(wèi)i下所有直接子a節(jié)點的href屬性值
result = html.xpath("http://li/a/text()") #獲取所有l(wèi)i下所有直接子a節(jié)點內(nèi)的文本內(nèi)容
print(result) #['百度', '京東', '搜狐', '新浪', '淘寶']
result = html.xpath("http://li/a[@class]/text()") #獲取所有l(wèi)i下所有直接含有class屬性子a節(jié)點內(nèi)的文本內(nèi)容
print(result) #['百度', '搜狐', '新浪']
#獲取所有l(wèi)i下所有直接含有class屬性值為aa的子a節(jié)點內(nèi)的文本內(nèi)容
result = html.xpath("http://li/a[@class='aa']/text()")
print(result) #['搜狐', '新浪']
#獲取class屬性值中含有shop的li節(jié)點下所有直接a子節(jié)點內(nèi)的文本內(nèi)容
result = html.xpath("http://li[contains(@class,'shop')]/a/text()")
print(result) #['搜狐', '新浪']
# 按序選擇
result = html.xpath("http://li[1]/a/text()") # 獲取每組li中的第一個li節(jié)點里面的a的文本
result = html.xpath("http://li[last()]/a/text()") # 獲取每組li中最后一個li節(jié)點里面的a的文本
result = html.xpath("http://li[position()<3]/a/text()") # 獲取每組li中前兩個li節(jié)點里面的a的文本
result = html.xpath("http://li[last()-2]/a/text()") # 獲取每組li中倒數(shù)第三個li節(jié)點里面的a的文本
print(result)
print("--"*30)
# 節(jié)點軸選擇
result = html.xpath("http://li[1]/ancestor::*") # 獲取li的所有祖先節(jié)點
result = html.xpath("http://li[1]/ancestor::ul") # 獲取li的所有祖先中的ul節(jié)點
result = html.xpath("http://li[1]/a/attribute::*") # 獲取li中a節(jié)點的所有屬性值
result = html.xpath("http://li/child::a[@) #獲取li子節(jié)點中屬性href值的a節(jié)點
result = html.xpath("http://body/descendant::a") # 獲取body中的所有子孫節(jié)點a
print(result)
result = html.xpath("http://li[3]") #獲取li中的第三個節(jié)點
result = html.xpath("http://li[3]/following::li") #獲取第三個li節(jié)點之后所有l(wèi)i節(jié)點
result = html.xpath("http://li[3]/following-sibling::*") #獲取第三個li節(jié)點之后所有同級li節(jié)點
for v in result:
print(v.find("a").text)
- 解析案例
# 導(dǎo)入模塊
from lxml import etree
# 讀取html文件信息(在真實代碼中是爬取的網(wǎng)頁信息)
f = open("./my.html",'r')
content = f.read()
f.close()
# 解析HTML文檔,返回根節(jié)點對象
html = etree.HTML(content)
# 1. 獲取id屬性為hid的h3節(jié)點中的文本內(nèi)容
print(html.xpath("http://h3[@id='hid']/text()")) #['我的常用鏈接']
# 2. 獲取li中所有超級鏈接a的信息
result = html.xpath("http://li/a")
for t in result:
# 通過xapth()二次解析結(jié)果
#print(t.xpath("text()")[0], ':', t.xpath("@href")[0])
# 效果同上,使用節(jié)點對象屬性方法解析
print(t.text, ':', t.get("href"))
'''
#結(jié)果:
百度 : http://www.baidu.com
京東 : http://www.jd.com
搜狐 : http://www.sohu.com
新浪 : http://www.sina.com
淘寶 : http://www.taobao.com
'''
'''
HTML元素的屬性:
tag:元素標(biāo)簽名
text:標(biāo)簽中間的文本
HTML元素的方法:
find() 查找一個匹配的元素
findall() 查找所有匹配的元素
get(key, default=None) 獲取指定屬性值
items()獲取元素屬性,作為序列返回
keys()獲取屬性名稱列表
value()將元素屬性值作為字符串序列
'''
審核編輯:湯梓紅
聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。
舉報投訴
-
信息
+關(guān)注
關(guān)注
0文章
409瀏覽量
36399 -
數(shù)據(jù)
+關(guān)注
關(guān)注
8文章
7335瀏覽量
94777 -
python
+關(guān)注
關(guān)注
57文章
4876瀏覽量
90041
發(fā)布評論請先 登錄
相關(guān)推薦
熱點推薦
如何在 Vision Five 2 上安裝 python 庫?
這可能是一個完全愚蠢的問題,但我如何在 Vision Five 2 上安裝 python 庫。
使用該命令后,它給了我這個錯誤。
默認(rèn)為用戶安裝,因為普通站點包不可寫
錯誤:找不到滿足要求
發(fā)表于 03-06 07:51
無法去除 Python VisionFive.i2c 庫的終端輸出?
燒的官方最新八月份的 debian 12 的系統(tǒng)。
根據(jù)這個案例安裝好了 python 環(huán)境和 VisionFive 庫。
執(zhí)行下面這條代碼:
import VisionFive.i2c
發(fā)表于 02-25 06:13
1688 商品詳情 API 調(diào)用與數(shù)據(jù)解析 Python 實戰(zhàn)
你想要的是 1688 商品詳情 API 的 Python 調(diào)用與數(shù)據(jù)解析實戰(zhàn)方案,核心是完成 API 憑證配置、接口請求(含簽名)、響應(yīng)數(shù)據(jù)解析、異常處理 的全流程落地,我會提供可直接運行的代碼,并
cJSON庫是什么?
cJSON庫是什么?cJSON是一個輕量級的json解析庫。使用起來非常簡單,整個庫非常地簡潔,核心功能的實現(xiàn)都在cJSON.c文件,非常適合閱讀源代碼來學(xué)習(xí)C語言。最近讀完這個
發(fā)表于 01-29 07:13
Python調(diào)用API教程
兩個不同系統(tǒng)之間的信息交互。在這篇文章中,我們將詳細(xì)介紹Python調(diào)用API的方法和技巧。 一、用Requests庫發(fā)送HTTP請求 使用Python調(diào)用API的第一步是發(fā)送HTTP請求,通常
HTTP開發(fā)必備:核心庫與httpplus擴展庫應(yīng)用示例全攻略
HTTP開發(fā)的必備參考!本文匯總核心庫基礎(chǔ)操作與httpplus擴展庫高級特性,通過示例解析,讓你快速上手各類HTTP開發(fā)需求。
termux如何搭建python游戲
termux如何搭建python游戲
Termux搭建Python游戲開發(fā)環(huán)境的完整指南
一、Termux基礎(chǔ)環(huán)境準(zhǔn)備
Termux是一款無需root即可在安卓設(shè)備上運行的Linux終端
發(fā)表于 08-29 07:06
數(shù)據(jù)庫數(shù)據(jù)恢復(fù)—服務(wù)器異常斷電導(dǎo)致Oracle數(shù)據(jù)庫故障的數(shù)據(jù)恢復(fù)案例
備份,僅有一些斷斷續(xù)續(xù)的歸檔日志。
Oracle數(shù)據(jù)庫恢復(fù)流程:
1、檢測數(shù)據(jù)庫故障情況;
2、嘗試掛起并修復(fù)數(shù)據(jù)庫;
3、解析數(shù)據(jù)庫
linux虛擬環(huán)境中調(diào)用Linux 版matlab編譯的python庫時出錯
matlab代碼編譯為CAO_python的python庫,其中cp_Main_python.m為入口文件,編譯后生成的文件有mccExcludedFiles.log、setup.py
發(fā)表于 07-18 10:40
python入門圣經(jīng)-高清電子書(建議下載)
和Pygal 等強大的Python 庫和工具介紹,以及列表、字典、if 語句、類、文件與異常、代碼測試等內(nèi)容;
第二部分將理論付諸實踐,講解如何開發(fā)三個項目,包括簡單的Python 2D 游戲開發(fā)如何利用數(shù)據(jù)
發(fā)表于 04-10 16:53
求助,關(guān)于S32K3_SPD_1.0.4_D2312軟件包問題求解
S32K3_SPD_1.0.4_D2312 軟件包,但在生成時遇到問題
“ 解析文件 ”C
發(fā)表于 04-03 08:16
?如何在虛擬環(huán)境中使用 Python,提升你的開發(fā)體驗~
。RaspberryPiOS預(yù)裝了Python3。干擾系統(tǒng)Python的安裝可能會給你的操作系統(tǒng)帶來問題。安裝第三方Python庫時,請務(wù)必使用正確的包管理工具。在Lin
零基礎(chǔ)入門:如何在樹莓派上編寫和運行Python程序?
在這篇文章中,我將為你簡要介紹Python程序是什么、Python程序可以用來做什么,以及如何在RaspberryPi上編寫和運行一個簡單的Python程序。什么是Python程序?
Python在嵌入式系統(tǒng)中的應(yīng)用場景
你想把你的職業(yè)生涯提升到一個新的水平?Python在嵌入式系統(tǒng)中正在成為一股不可缺少的新力量。盡管傳統(tǒng)上嵌入式開發(fā)更多地依賴于C和C++語言,Python的優(yōu)勢在于其簡潔的語法、豐富的庫和快速的開發(fā)周期,這使得它在某些嵌入式場景
python解析庫的使用--XPath
評論