xpath提取多個標籤下的text

在寫爬蟲的時候，經常會使用xpath進行資料的提取，對於如下的**：

<
div 
id="test1"
div>

使用xpath提取是非常方便的。假設網頁的源**在selector中：

data = selector.xpath('//div[@id="test1"]/text()').extract()[0]

然而如果遇到下面這段**呢？

<
div 
id="test2"
>美女，<
font 
color
=red
font
><
div>

如果使用：

data = selector.xpath('//div[@id="test2"]/text()').extract()[0]

只能提取到「美女，」；

如果使用：

data = selector.xpath('//div[@id="test2"]/font/text()').extract()[0]

這還不是最糟糕的，還有第三段**：

<
div 
id="test3"
>我左青龍，<
span 
id="tiger"
>右白虎，<
ul>上朱雀，<
li>下玄武。
li>
ul>老牛在當中，
span
>龍頭在胸口。<
div>

而且內部的標籤還不固定，如果我有一百段這樣類似的html**，又如何使用xpath表示式，以最快最方便的方式提取出來？

我差一點就去用正規表示式替換了。還好我去stack overflow上面提了問。於是很快就有人給我解答了。

使用xpath的string(.)

以第三段**為例：

data = selector.xpath('//div[@id="test3"]')
info = data.xpath('string(.)').extract()[0]

這樣，就可以把「我左青龍，右白虎，上朱雀，下玄武。老牛在當中，龍頭在胸口」整個句子提取出來，賦值給info變數。

xpath提取多個標籤下的text

原文主題xpath 在寫爬蟲的時候，經常會使用xpath進行資料的提取，對於如下的使用xpath提取是非常方便的。假設網頁的源在selector中 data selector.xpath div id test1 text extract 0 然而如果遇到下面這段呢？id test2 美女，...

xpath提取多個標籤下的text

在寫爬蟲的時候，經常會使用xpath進行資料的提取，對於如下的 div id test1 div 使用xpath提取是非常方便的。假設網頁的源在selector中 data selector.xpath div id test1 text extract 0 然而如果遇到下面這段呢？div id...

用xpath獲取該標籤下的所有子標籤和文字

xpath獲取該節點下所有標籤和文字組成的字串需要獲取子標籤以及文字內容時使用此方法，如果只是想獲取所有子標籤裡面的文字，參考另一篇部落格。from lxml import etree html 關鍵字內容 doc etree.html html msg doc.xpath div class ...

xpath提取多個標籤下的text

xpath提取多個標籤下的text

xpath提取多個標籤下的text

用xpath獲取該標籤下的所有子標籤和文字

相關推薦