當前位置：首頁 > 编程语言 > python >内容正文

python

python爬取vip小说章节_怎么用python爬sf轻小说文库的vip章节小说

發布時間：2024/3/24 python 48 豆豆

生活随笔收集整理的這篇文章主要介紹了 python爬取vip小说章节_怎么用python爬sf轻小说文库的vip章节小说小編覺得挺不錯的,現在分享給大家,幫大家做個參考.

展開全部

你需要先購買vip，不2113然的話是爬不了的，除非系5261統有漏洞，記4102住爬蟲不是萬能的

步驟一：研究1653該網站

打開登錄頁面

進入以下頁面 “”。你會看到如下圖所示的頁面（執行注銷，以防你已經登錄）

仔細研究那些我們需要提取的詳細信息，以供登錄之用

在這一部分，我們會創建一個字典來保存執行登錄的詳細信息：

1. 右擊 “Username or email” 字段，選擇“查看元素”。我們將使用 “name” 屬性為 “username” 的輸入框的值。“username”將會是 key 值，我們的用戶名/電子郵箱就是對應的 value 值（在其他的網站上這些 key 值可能是 “email”，“ user_name”，“ login”，等等）。

2. 右擊 “Password” 字段，選擇“查看元素”。在腳本中我們需要使用 “name” 屬性為 “password” 的輸入框的值。“password” 將是字典的 key 值，我們輸入的密碼將是對應的 value 值（在其他網站key值可能是 “userpassword”，“loginpassword”，“pwd”，等等）。

3. 在源代碼頁面中，查找一個名為 “csrfmiddlewaretoken” 的隱藏輸入標簽。“csrfmiddlewaretoken” 將是 key 值，而對應的 value 值將是這個隱藏的輸入值（在其他網站上這個 value 值可能是一個名為 “csrftoken”，“ authenticationtoken” 的隱藏輸入值）。列如：“Vy00PE3Ra6aISwKBrPn72SFml00IcUV8”。

最后我們將會得到一個類似這樣的字典：

payload = {

"username": "",

"password": "",

"csrfmiddlewaretoken": ""

}

請記住，這是這個網站的一個具體案例。雖然這個登錄表單很簡單，但其他網站可能需要我們檢查瀏覽器的請求日志，并找到登錄步驟中應該使用的相關的 key 值和 value 值。

步驟2：執行登錄網站

對于這個腳本，我們只需要導入如下內容：

import requests

from lxml import html

首先，我們要創建 session 對象。這個對象會允許我們保存所有的登錄會話請求。

session_requests = requests.session()

第二，我們要從該網頁上提取在登錄時所使用的 csrf 標記。在這個例子中，我們使用的是 lxml 和 xpath 來提取，我們也可以使用正則表達式或者其他的一些方法來提取這些數據。

login_url = ""

result = session_requests.get(login_url)

tree = html.fromstring(result.text)

authenticity_token = list(set(tree.xpath("//input[@name='csrfmiddlewaretoken']/@value")))[0]

**更多關于xpath 和lxml的信息可以在這里找到。

接下來，我們要執行登錄階段。在這一階段，我們發送一個 POST 請求給登錄的 url。我們使用前面步驟中創建的 payload 作為 data 。也可以為該請求使用一個標題并在該標題中給這個相同的 url 添加一個參照鍵。

result = session_requests.post(

login_url,

data = payload,

headers = dict(referer=login_url)

)

步驟三：爬取內容

現在，我們已經登錄成功了，我們將從 bitbucket dashboard 頁面上執行真正的爬取操作。

url = ''

result = session_requests.get(

url,

headers = dict(referer = url)

)

為了測試以上內容，我們從 bitbucket dashboard 頁面上爬取了項目列表。我們將再次使用 xpath 來查找目標元素，清除新行中的文本和空格并打印出結果。如果一切都運行 OK，輸出結果應該是你 bitbucket 賬戶中的 buckets / project 列表。

Python

tree = html.fromstring(result.content)

bucket_elems = tree.findall(".//span[@class='repo-name']/")

bucket_names = [bucket.text_content.replace("n", "").strip() for bucket in bucket_elems]

print bucket_names

你也可以通過檢查從每個請求返回的狀態代碼來驗證這些請求結果。它不會總是能讓你知道登錄階段是否是成功的，但是可以用來作為一個驗證指標。

例如：

Python

result.ok # 會告訴我們最后一次請求是否成功

result.status_code # 會返回給我們最后一次請求的狀態

就是這樣。

已贊過

已踩過<

你對這個回答的評價是？

評論

收起

總結

以上是生活随笔為你收集整理的python爬取vip小说章节_怎么用python爬sf轻小说文库的vip章节小说的全部內容，希望文章能夠幫你解決所遇到的問題。

如果覺得生活随笔網站內容還不錯，歡迎將生活随笔推薦給好友。

上一篇： python高级面试题_10个高级pyt
下一篇： gvim支持python3编译，解决om

日韩av黄I国产麻豆传媒I国产91av视频在线观看I日韩一区二区三区在线看I美女国产在线I麻豆视频国产在线观看I成人黄色短片

python

python爬取vip小说章节_怎么用python爬sf轻小说文库的vip章节小说

總結