原文
主題xpath
在寫爬蟲的時候,經常會使用xpath進行資料的提取,對於如下的**:
使用xpath提取是非常方便的。假設網頁的源**在selector中:
data = selector.xpath('//div[@id="test1"]/text()').extract()[0]
然而如果遇到下面這段**呢?
id="test2">美女,
如果使用:
data = selector.xpath('//div[@id="test2"]/text()').extract()[0]
只能提取到「美女,」;
如果使用:
data = selector.xpath('//div[@id="test2"]/font/text()').extract()[0]
這還不是最糟糕的,還有第三段**:
id="test3">左,id="tiger">右,上,下。li>
ul>老牛在當中。span>
而且內部的標籤還不固定,如果我有一百段這樣類似的html**,又如何使用xpath表示式,以最快最方便的方式提取出來?
我差一點就去用正規表示式替換了。還好我去stack overflow上面提了問。於是很快就有人給我解答了。
使用xpath的string(.)
以第三段**為例:
這樣,就可以把「左,右,上,下。老牛在當中。」整個句子提取出來,賦值給info變數。data = selector.xpath('//div[@id="test3"]')
info = data.xpath('string(.)').extract()[0]
也可以用
info = $("#test3").html();
xpath提取多個標籤下的text
在寫爬蟲的時候,經常會使用xpath進行資料的提取,對於如下的 div id test1 div 使用xpath提取是非常方便的。假設網頁的源 在selector中 data selector.xpath div id test1 text extract 0 然而如果遇到下面這段 呢?div id...
xpath提取多個標籤下的text
在寫爬蟲的時候,經常會使用xpath進行資料的提取,對於如下的 div id test1 div 使用xpath提取是非常方便的。假設網頁的源 在selector中 data selector.xpath div id test1 text extract 0 然而如果遇到下面這段 呢?div id...
用xpath獲取該標籤下的所有子標籤和文字
xpath獲取該節點下 所有標籤和文字組成的字串 需要獲取子標籤以及文字內容時使用此方法,如果只是想獲取所有子標籤裡面的文字,參考另一篇部落格。from lxml import etree html 關鍵字內容 doc etree.html html msg doc.xpath div class ...