精彩不停!Python解析庫(kù)lxml與xpath用法總結(jié)
4.xpath 軸
軸可定義相對(duì)于當(dāng)前節(jié)點(diǎn)的節(jié)點(diǎn)集。
軸名稱結(jié)果ancestor選取當(dāng)前節(jié)點(diǎn)的所有先輩(父、祖父等)。ancestor-or-self選取當(dāng)前節(jié)點(diǎn)的所有先輩(父、祖父等)以及當(dāng)前節(jié)點(diǎn)本身。attribute選取當(dāng)前節(jié)點(diǎn)的所有屬性。child選取當(dāng)前節(jié)點(diǎn)的所有子元素。descendant選取當(dāng)前節(jié)點(diǎn)的所有后代元素(子、孫等)。descendant-or-self選取當(dāng)前節(jié)點(diǎn)的所有后代元素(子、孫等)以及當(dāng)前節(jié)點(diǎn)本身。following選取文檔中當(dāng)前節(jié)點(diǎn)的結(jié)束標(biāo)簽之后的所有節(jié)點(diǎn)。namespace選取當(dāng)前節(jié)點(diǎn)的所有命名空間節(jié)點(diǎn)。parent選取當(dāng)前節(jié)點(diǎn)的父節(jié)點(diǎn)。preceding選取文檔中當(dāng)前節(jié)點(diǎn)的開(kāi)始標(biāo)簽之前的所有節(jié)點(diǎn)。preceding-sibling選取當(dāng)前節(jié)點(diǎn)之前的所有同級(jí)節(jié)點(diǎn)。self選取當(dāng)前節(jié)點(diǎn)。
5.xpath運(yùn)算符
下面列出了可用在 XPath 表達(dá)式中的運(yùn)算符:
運(yùn)算符描述實(shí)例返回值|計(jì)算兩個(gè)節(jié)點(diǎn)集//book | //cd返回所有擁有 book 和 cd 元素的節(jié)點(diǎn)集+加法6 + 410-減法6 - 42*乘法6 * 424div除法8 div 42=等于price=9.80如果 price 是 9.80,則返回 true。如果 price 是 9.90,則返回 false。。讲坏扔趐rice!=9.80如果 price 是 9.90,則返回 true。如果 price 是 9.80,則返回 false。<小于price<9.80如果 price 是 9.00,則返回 true。如果 price 是 9.90,則返回 false。<=小于或等于price<=9.80如果 price 是 9.00,則返回 true。如果 price 是 9.90,則返回 false。>大于price>9.80如果 price 是 9.90,則返回 true。如果 price 是 9.80,則返回 false。>=大于或等于price>=9.80如果 price 是 9.90,則返回 true。如果 price 是 9.70,則返回 false。or或price=9.80 or price=9.70如果 price 是 9.80,則返回 true。如果 price 是 9.50,則返回 false。and與price>9.00 and price<9.90如果 price 是 9.80,則返回 true。如果 price 是 8.50,則返回 false。mod計(jì)算除法的余數(shù)5 mod 21
好了,xpath的內(nèi)容就這么多了。接下來(lái)我們要介紹一個(gè)神器lxml,他的速度很快,曾經(jīng)一直是我使用beautifulsoup時(shí)最鐘愛(ài)的解析器,沒(méi)有之一,因?yàn)樗乃俣鹊拇_比其他的html.parser 和html5lib快了許多。
二、lxml
1.lxml安裝
lxml 是一個(gè)xpath格式解析模塊,安裝很方便,直接pip install lxml 或者easy_install lxml即可。
2.lxml 使用
lxml提供了兩種解析網(wǎng)頁(yè)的方式,一種是你解析自己寫的離線網(wǎng)頁(yè)時(shí),另一種 則是解析線上網(wǎng)頁(yè)。
導(dǎo)入包:
from lxml import etree
1.解析離線網(wǎng)頁(yè):
html=etree.parse('xx.html',etree.HTMLParser())aa=html.xpath('/[@id="s_xmancard_news"]/div/div[2]/div/div[1]/h2/a[1]/@href')print(aa)
2.解析在線網(wǎng)頁(yè):
from lxml import etreeimport requestsrep=requests.get('https://www.baidu.com')html=etree.HTML(rep.text)aa=html.xpath('/[@id="s_xmancard_news"]/div/div[2]/div/div[1]/h2/a[1]/@href')print(aa)
那么我們?cè)趺传@取這些標(biāo)簽和標(biāo)簽對(duì)應(yīng)的屬性值了,很簡(jiǎn)單,首先獲取標(biāo)簽只需你這樣做:
然后我們可以,比方說(shuō),你要獲取a標(biāo)簽內(nèi)的文本和它的屬性href所對(duì)應(yīng)的值,有兩種方法,
1.表達(dá)式內(nèi)獲取
aa=html.xpath('/[@id="s_xmancard_news"]/div/div[2]/div/div[1]/h2/a[1]/text()')
ab=html.xpath('/[@id="s_xmancard_news"]/div/div[2]/div/div[1]/h2/a[1]/@href')
2.表達(dá)式外獲取
aa=html.xpath('/[@id="s_xmancard_news"]/div/div[2]/div/div[1]/h2/a[1]')
aa.text
aa.a(chǎn)ttrib.get('href')
這樣就完成了獲取,怎么樣,是不是很簡(jiǎn)單了,哈哈哈。
下面再來(lái)lxml的解析規(guī)則:
表達(dá)式描述nodename選取此節(jié)點(diǎn)的所有子節(jié)點(diǎn)/從當(dāng)前節(jié)點(diǎn)選取直接子節(jié)點(diǎn)//從當(dāng)前節(jié)點(diǎn)選取子孫節(jié)點(diǎn).選取當(dāng)前節(jié)點(diǎn)..選取當(dāng)前節(jié)點(diǎn)的父節(jié)點(diǎn)@選取屬性
html = lxml.etree.HTML(text)#使用text構(gòu)造一個(gè)XPath解析對(duì)象,etree模塊可以自動(dòng)修正HTML文本html = lxml.etree.parse('./ex.html',etree.HTMLParser())#直接讀取文本進(jìn)行解析from lxml import etreeresult = html.xpath('/')#選取所有節(jié)點(diǎn)result = html.xpath('//li')#獲取所有l(wèi)i節(jié)點(diǎn)result = html.xpath('//li/a')#獲取所有l(wèi)i節(jié)點(diǎn)的直接a子節(jié)點(diǎn)result = html.xpath('//li//a')#獲取所有l(wèi)i節(jié)點(diǎn)的所有a子孫節(jié)點(diǎn)result = html.xpath('//a[@href="link.html"]/../@class')#獲取所有href屬性為link.html的a節(jié)點(diǎn)的父節(jié)點(diǎn)的class屬性result = html.xpath('//li[@class="ni"]')#獲取所有class屬性為ni的li節(jié)點(diǎn)result = html.xpath('//li/text()')#獲取所有l(wèi)i節(jié)點(diǎn)的文本result = html.xpath('//li/a/@href')#獲取所有l(wèi)i節(jié)點(diǎn)的a節(jié)點(diǎn)的href屬性result = html.xpath('//li[contains(@class,"li")]/a/text())#當(dāng)li的class屬性有多個(gè)值時(shí),需用contains函數(shù)完成匹配result = html.xpath('//li[contains(@class,"li") and @name="item"]/a/text()')#多屬性匹配result = html.xpath('//li[1]/a/text()')result = html.xpath('//li[last()]/a/text()')result = html.xpath('//li[position()<3]/a/text()')result = html.xpath('//li[last()-2]/a/text()')#按序選擇,中括號(hào)內(nèi)為XPath提供的函數(shù)result = html.xpath('//li[1]/ancestor::*')#獲取祖先節(jié)點(diǎn)result = html.xpath('//li[1]/ancestor::div')result = html.xpath('//li[1]/attribute::*')#獲取屬性值result = html.xpath('//li[1]/child::a[@href="link1.html"]')#獲取直接子節(jié)點(diǎn)result = html.xpath('//li[1]/descendant::span')#獲取所有子孫節(jié)點(diǎn)result = html.xpath('//li[1]/following::*[2]')#獲取當(dāng)前節(jié)點(diǎn)之后的所有節(jié)點(diǎn)的第二個(gè)result = html.xpath('//li[1]/following-sibling::*')#獲取后續(xù)所有同級(jí)節(jié)點(diǎn)
3.lxml案例
為了偷懶,小編決定還是采用urllib那篇文章的代碼,哈哈哈,機(jī)智如我。
好了,今天就講這么多,大家感興趣的話可以多多關(guān)注哦,精彩不停息。。。

發(fā)表評(píng)論
請(qǐng)輸入評(píng)論內(nèi)容...
請(qǐng)輸入評(píng)論/評(píng)論長(zhǎng)度6~500個(gè)字
圖片新聞
-
機(jī)器人奧運(yùn)會(huì)戰(zhàn)報(bào):宇樹(shù)機(jī)器人摘下首金,天工Ultra搶走首位“百米飛人”
-
存儲(chǔ)圈掐架!江波龍起訴佰維,索賠121萬(wàn)
-
長(zhǎng)安汽車母公司突然更名:從“中國(guó)長(zhǎng)安”到“辰致科技”
-
豆包前負(fù)責(zé)人喬木出軌BP后續(xù):均被辭退
-
字節(jié)AI Lab負(fù)責(zé)人李航卸任后返聘,Seed進(jìn)入調(diào)整期
-
員工持股爆雷?廣汽埃安緊急回應(yīng)
-
中國(guó)“智造”背后的「關(guān)鍵力量」
-
小米汽車研發(fā)中心重磅落地,寶馬家門口“搶人”
最新活動(dòng)更多
-
即日-9.1立即下載>> 【限時(shí)下載】ADI中國(guó)三十周年感恩回饋助力企業(yè)升級(jí)!
-
即日-9.16點(diǎn)擊進(jìn)入 >> 【限時(shí)福利】TE 2025國(guó)際物聯(lián)網(wǎng)展·深圳站
-
10月23日立即報(bào)名>> Works With 開(kāi)發(fā)者大會(huì)深圳站
-
10月24日立即參評(píng)>> 【評(píng)選】維科杯·OFweek 2025(第十屆)物聯(lián)網(wǎng)行業(yè)年度評(píng)選
-
11月27日立即報(bào)名>> 【工程師系列】汽車電子技術(shù)在線大會(huì)
-
12月18日立即報(bào)名>> 【線下會(huì)議】OFweek 2025(第十屆)物聯(lián)網(wǎng)產(chǎn)業(yè)大會(huì)
推薦專題
- 1 阿里首位程序員,“掃地僧”多隆已離職
- 2 先進(jìn)算力新選擇 | 2025華為算力場(chǎng)景發(fā)布會(huì)暨北京xPN伙伴大會(huì)成功舉辦
- 3 宇樹(shù)機(jī)器人撞人事件的深度剖析:六維力傳感器如何成為人機(jī)安全的關(guān)鍵屏障
- 4 清華跑出具身智能獨(dú)角獸:給機(jī)器人安上眼睛和大腦,融資近20億
- 5 特朗普要求英特爾首位華人 CEO 辭職
- 6 踢館大廠和微軟,剖析WPS靈犀的AI實(shí)用主義
- 7 騰訊 Q2 財(cái)報(bào)亮眼:AI 已成第二增長(zhǎng)曲線
- 8 谷歌吹響AI沖鋒號(hào),AI還有哪些機(jī)會(huì)
- 9 蘋果把身家押在Siri上:一場(chǎng)輸不起的自我革命
- 10 共探合作新機(jī)遇!江門市新會(huì)區(qū)(深圳)“AI + 機(jī)器人” 產(chǎn)業(yè)對(duì)接會(huì)成功舉辦