當(dāng)前位置：首頁 > 编程资源 > 编程问答 >内容正文

编程问答

网络爬虫--10.使用正则表达式的爬虫

發(fā)布時間：2023/12/20 编程问答 39 豆豆

生活随笔收集整理的這篇文章主要介紹了网络爬虫--10.使用正则表达式的爬虫小編覺得挺不錯的,現(xiàn)在分享給大家,幫大家做個參考.

文章目錄

一. 前言
二. 第一步：獲取數(shù)據(jù)
三. 第二步：篩選數(shù)據(jù)
四. 第三步：保存數(shù)據(jù)
五. 第四步：實現(xiàn)循環(huán)抓取

一. 前言

現(xiàn)在擁有了正則表達式這把神兵利器，我們就可以進行對爬取到的全部網(wǎng)頁源代碼進行篩選了。

下面我們一起嘗試一下爬取內(nèi)涵段子網(wǎng)站： http://www.neihan8.com/article/list_5_1.html

打開之后，不難看到里面一個一個灰常有內(nèi)涵的段子，當(dāng)你進行翻頁的時候，注意url地址的變化：

第一頁url: http: //www.neihan8.com/article/list_5_1 .html

第二頁url: http: //www.neihan8.com/article/list_5_2 .html

第三頁url: http: //www.neihan8.com/article/list_5_3 .html

第四頁url: http: //www.neihan8.com/article/list_5_4 .html

這樣我們的url規(guī)律找到了，要想爬取所有的段子，只需要修改一個參數(shù)即可。下面我們就開始一步一步將所有的段子爬取下來吧。

二. 第一步：獲取數(shù)據(jù)

按照我們之前的用法，我們需要寫一個加載頁面的方法。

這里我們統(tǒng)一定義一個類，將url請求作為一個成員方法處理。

我們創(chuàng)建一個文件，叫duanzi_spider.py

然后定義一個Spider類，并且添加一個加載頁面的成員方法

class Duanzi_spider():def __init__(self):self.url = "http://www.neihan8.com/article/list_5_%s.html"self.headers = {"User_Agent":"Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_5) AppleW\ebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36","Accept-Encoding":None,"Accept-Language": "zh-CN,zh;q=0.8"}def load_page(self,url):'''可以復(fù)用的頁面請求方法'''response = requests.get(url,timeout=10,headers=self.headers)if response.status_code==200:print(response.request.headers)return response.content.decode("gbk")else:raise ValueError("status_code is:",response.status_code)

程序正常執(zhí)行的話，我們會在屏幕上打印了內(nèi)涵段子第一頁的全部html代碼。但是我們發(fā)現(xiàn)，html中的中文部分顯示的可能是亂碼。
注意：對于每個網(wǎng)站對中文的編碼各自不同，所以html.decode(‘gbk’)的寫法并不是通用寫法，根據(jù)網(wǎng)站的編碼而異

三. 第二步：篩選數(shù)據(jù)

接下來我們已經(jīng)得到了整個頁面的數(shù)據(jù)。但是，很多內(nèi)容我們并不關(guān)心，所以下一步我們需要進行篩選。如何篩選，就用到了上一節(jié)講述的正則表達式。首先：

import re

然后, 在我們得到的response中進行篩選匹配。

我們需要一個匹配規(guī)則:

我們可以打開內(nèi)涵段子的網(wǎng)頁，鼠標(biāo)點擊右鍵 " 查看源代碼 " 你會發(fā)現(xiàn)每條段子的內(nèi)容大致如下

<a href="/article/44959.html"><b>回家奔喪</b></a></h4><div class="f18 mb20">一老太太跋山涉水來到部隊，看望她的孫子，<br />警衛(wèi)問：“她找誰？”老太說：“找xx，”警衛(wèi)打完電話說：<br />“xx三天前說她他奶奶過世，回家奔喪去了，奔喪去了，去了。。”</div> def get_content(self,html):''' 根據(jù)網(wǎng)頁內(nèi)容，同時匹配標(biāo)題和段子內(nèi)容'''pattern = re.compile(r'<a\shref="/article/\d+\.html">(.*?)</a>.*?<div\sclass="f18 mb20">(.*?)</div>', re.S)t = pattern.findall(html)result = []for i in t:temp = []for j in i:j = re.sub(r"[<b>|</b>|<br />|<br>|<p>|</p>|\\u3000|\\r\\n|\s]","",j)j = j.replace("&ldqo;",'"').replace("&helli;","...").replace("&dqo;",'"').strip()# j = re.sub(r"[&ldqo;|&dqo;]","\"",j)?# j = re.sub(r"…","...",j)temp.append(j)print(temp)result.append(temp)return result

這里需要注意一個是re.S是正則表達式中匹配的一個參數(shù)。

如果沒有re.S 則是只匹配一行有沒有符合規(guī)則的字符串，如果沒有則下一行重新匹配。

如果加上re.S 則是將所有的字符串將一個整體進行匹配，findall 將所有匹配到的結(jié)果封裝到一個list中。

ok程序?qū)懙竭@，我們再一次執(zhí)行一下。

Power@PowerMac ~$ python duanzi_spider.py

我們第一頁的全部段子，不包含其他信息全部的打印了出來。
你會發(fā)現(xiàn)段子中有很多 < p> , </ p> 很是不舒服，實際上這個是html的一種段落的標(biāo)簽。
在瀏覽器上看不出來，但是如果按照文本打印會有

出現(xiàn)，那么我們只需要把我們不希望的內(nèi)容去掉即可了。

我們可以如下簡單修改一下 get_content().

j = re.sub(r"[< b>|</ b>|< br />|< br>|< p>|</ p>|\u3000|\r\n|\s]","",j)
j = j.replace("&ldqo;",’"’).replace("&helli;","…").replace("&dqo;",’"’).strip()

四. 第三步：保存數(shù)據(jù)

我們可以將所有的段子存放在文件中。比如，我們可以將得到的每個item不是打印出來，而是存放在一個叫 duanzi.txt 的文件中也可以。

def save_content(self,content):myFile = open("./duanzi.txt", 'a')for temp in content:myFile.write("\n"+temp[0]+"\n"+temp[1]+"\n")myFile.write("-----------------------------------------------------")myFile.close()

然后我們實現(xiàn)保存的方法，當(dāng)前頁面的所有段子就存在了本地的duanzi.txt文件中。

五. 第四步：實現(xiàn)循環(huán)抓取

接下來我們就通過參數(shù)的傳遞對page進行疊加來遍歷內(nèi)涵段子吧的全部段子內(nèi)容。

同時也通過這個run方法實現(xiàn)整個程序的主要邏輯

def run(self):i = 1while True:html = self.load_page(self.url%i)result = self.get_content(html)print ("按回車?yán)^續(xù)...")print ("輸入 quit 退出")command = input()if (command == "quit"):breaki+=1

最后，我們執(zhí)行我們的代碼，完成后查看當(dāng)前路徑下的duanzi.txt文件，里面已經(jīng)有了我們要的內(nèi)涵段子。

以上便是一個非常精簡使用的小爬蟲程序，使用起來很是方便，如果想要爬取其他網(wǎng)站的信息，只需要修改其中某些參數(shù)和一些細節(jié)就行了。

總結(jié)

以上是生活随笔為你收集整理的网络爬虫--10.使用正则表达式的爬虫的全部內(nèi)容，希望文章能夠幫你解決所遇到的問題。

如果覺得生活随笔網(wǎng)站內(nèi)容還不錯，歡迎將生活随笔推薦給好友。

上一篇： git官网下载不了
下一篇：计算机风险评估管理程序,第5章信息安全