xpath提取多個標籤下的text

2022-03-24 09:43:00 字數 1180 閱讀 2629

在寫爬蟲的時候,經常會使用xpath進行資料的提取,對於如下的**:

<

div

id="test1"

div>

使用xpath提取是非常方便的。假設網頁的源**在selector中:

data = selector.xpath('//div[@id="test1"]/text()').extract()[0]

然而如果遇到下面這段**呢?

<

div

id="test2"

>美女,<

font

color

=red

font

><

div>

如果使用:

data = selector.xpath('//div[@id="test2"]/text()').extract()[0]

只能提取到「美女,」;

如果使用:

data = selector.xpath('//div[@id="test2"]/font/text()').extract()[0]

這還不是最糟糕的,還有第三段**:

<

div

id="test3"

>我左青龍,<

span

id="tiger"

>右白虎,<

ul>上朱雀,<

li>下玄武。

li>

ul>老牛在當中,

span

>龍頭在胸口。<

div>

而且內部的標籤還不固定,如果我有一百段這樣類似的html**,又如何使用xpath表示式,以最快最方便的方式提取出來?

我差一點就去用正規表示式替換了。還好我去stack overflow上面提了問。於是很快就有人給我解答了。

使用xpath的string(.)

以第三段**為例:

data = selector.xpath('//div[@id="test3"]')

info = data.xpath('string(.)').extract()[0]

這樣,就可以把「我左青龍,右白虎,上朱雀,下玄武。老牛在當中,龍頭在胸口」整個句子提取出來,賦值給info變數。

xpath提取多個標籤下的text

原文 主題xpath 在寫爬蟲的時候,經常會使用xpath進行資料的提取,對於如下的 使用xpath提取是非常方便的。假設網頁的源 在selector中 data selector.xpath div id test1 text extract 0 然而如果遇到下面這段 呢?id test2 美女,...

xpath提取多個標籤下的text

在寫爬蟲的時候,經常會使用xpath進行資料的提取,對於如下的 div id test1 div 使用xpath提取是非常方便的。假設網頁的源 在selector中 data selector.xpath div id test1 text extract 0 然而如果遇到下面這段 呢?div id...

用xpath獲取該標籤下的所有子標籤和文字

xpath獲取該節點下 所有標籤和文字組成的字串 需要獲取子標籤以及文字內容時使用此方法,如果只是想獲取所有子標籤裡面的文字,參考另一篇部落格。from lxml import etree html 關鍵字內容 doc etree.html html msg doc.xpath div class ...