在寫爬蟲的時候,經常會使用xpath進行資料的提取,對於如下的**:
<div
id="test1"
div>
使用xpath提取是非常方便的。假設網頁的源**在selector中:
data = selector.xpath('//div[@id="test1"]/text()').extract()[0]
然而如果遇到下面這段**呢?
<div
id="test2"
>美女,<
font
color
=red
font
><
div>
如果使用:
data = selector.xpath('//div[@id="test2"]/text()').extract()[0]
只能提取到「美女,」;
如果使用:
data = selector.xpath('//div[@id="test2"]/font/text()').extract()[0]
這還不是最糟糕的,還有第三段**:
<div
id="test3"
>我左青龍,<
span
id="tiger"
>右白虎,<
ul>上朱雀,<
li>下玄武。
li>
ul>老牛在當中,
span
>龍頭在胸口。<
div>
而且內部的標籤還不固定,如果我有一百段這樣類似的html**,又如何使用xpath表示式,以最快最方便的方式提取出來?
我差一點就去用正規表示式替換了。還好我去stack overflow上面提了問。於是很快就有人給我解答了。
使用xpath的string(.)
以第三段**為例:
data = selector.xpath('//div[@id="test3"]')info = data.xpath('string(.)').extract()[0]
這樣,就可以把「我左青龍,右白虎,上朱雀,下玄武。老牛在當中,龍頭在胸口」整個句子提取出來,賦值給info變數。
xpath提取多個標籤下的text
原文 主題xpath 在寫爬蟲的時候,經常會使用xpath進行資料的提取,對於如下的 使用xpath提取是非常方便的。假設網頁的源 在selector中 data selector.xpath div id test1 text extract 0 然而如果遇到下面這段 呢?id test2 美女,...
xpath提取多個標籤下的text
在寫爬蟲的時候,經常會使用xpath進行資料的提取,對於如下的 div id test1 div 使用xpath提取是非常方便的。假設網頁的源 在selector中 data selector.xpath div id test1 text extract 0 然而如果遇到下面這段 呢?div id...
用xpath獲取該標籤下的所有子標籤和文字
xpath獲取該節點下 所有標籤和文字組成的字串 需要獲取子標籤以及文字內容時使用此方法,如果只是想獲取所有子標籤裡面的文字,參考另一篇部落格。from lxml import etree html 關鍵字內容 doc etree.html html msg doc.xpath div class ...