生活随笔
收集整理的這篇文章主要介紹了
大写牛逼,用 Python 登录主流 24 个网站
小編覺得挺不錯的,現在分享給大家,幫大家做個參考.
爬蟲腳本是大家經常用到的,那就避開不了登錄?這一關。
使用Python一般需要request庫,補充 header 中的 post 要素,有些還會有 隱藏的 hidden 參數,可以通過瀏覽器 F12 或者元素審查來發現,對于初學者來說都是一個坑。
還有需要解決驗證碼的問題,一種方法是下載驗證碼圖片識別驗證碼再次post,或者使用云打碼平臺。當然,有些驗證碼及其變態就不那么容易解決了,比如選字順序、滑塊、12306那種人為都會選錯的。
本篇boy哥分享一個GitHub項目《awesome-python-login-model》,主要就是利用Python解決登錄主流平臺的,包含24個主流平臺,目前在GitHub上已經表星11.8k了。
Github鏈接:https://github.com/Kr1s77/awesome-python-login-model
▍已完成的主流網站
上面是作者已經完成的一些主流網站了,其中有的是通過?selenium登錄,有的是通過?抓包直接模擬登錄,有的是利用 scrapy框架。
這個很容易理解,因為有的網站設計比較復雜,通過抓包很難實現模擬登錄,這樣用 selenium+webdriver 就會相對輕松一些。
雖然在登錄的時候采用的是selenium,為了效率,我們可以在登錄過后得到的cookie維護起來,然后調用requests或者scrapy等進行數據采集,這樣數據采集的速度可以得到保證。
▍模擬登錄GitHub
這里boy哥給大家展示一個模擬登錄GitHub的代碼。
"""
github第二種登錄方式
info:
author:CriseLYJ
github:https://github.com/CriseLYJ/
update_time:2019-3-7
"""import?re
import?requests
from?lxml?import?etreeclass?Login(object):
class?GithubLogin(object):def?__init__(self,?email,?password):#?初始化信息self.headers?=?{'User-Agent':?'Mozilla/5.0?(Macintosh;?Intel?Mac?OS?X?10_14_2)?AppleWebKit/537.36?(KHTML,?like?Gecko)?Chrome/71.0.3578.98?Safari/537.36','Referer':?'https://github.com/','Host':?'github.com'}self.session?=?requests.Session()self.login_url?=?'https://github.com/login'self.post_url?=?'https://github.com/session'self.session?=?requests.Session()self.email?=?emailself.password?=?password
????#?模擬登錄def?login_GitHub(self):#?登錄入口post_data?=?{'commit':?'Sign?in','utf8':?'?','authenticity_token':?self.get_token(),'login':?self.email,'password':?self.password}resp?=?self.session.post(self.post_url,?data=post_data,?headers=self.headers)print('StatusCode:',?resp.status_code)if?resp.status_code?!=?200:print('Login?Fail')match?=?re.search(r'"user-login"?content="(.*?)"',?resp.text)user_name?=?match.group(1)print('UserName:',?user_name)response?=?self.session.post(self.post_url,?data=post_data,?headers=self.headers)print(response.status_code)print(post_data)if?response.status_code?==?200:print("登錄成功!")else:print("登錄失敗!")
????#?獲取token信息#?Get?login?tokendef?get_token(self):response?=?self.session.get(self.login_url,?headers=self.headers)html?=?etree.HTML(response.content.decode())token?=?html.xpath('//input[@name="authenticity_token"]/@value')[0]return?tokenif?response.status_code?!=?200:print('Get?token?fail')return?Nonematch?=?re.search(r'name="authenticity_token"?value="(.*?)"',?response.text)if?not?match:print('Get?Token?Fail')return?Nonereturn?match.group(1)if?__name__?==?'__main__':email?=?input('請輸入您的賬號:?')password?=?input('請輸入您的密碼:?')email?=?input('Account:')password?=?input('Password:')login?=?Login(email,?password)login?=?GithubLogin(email,?password)login.login_GitHub()
相信這對初學爬蟲的朋友是一個很好的教程。
但提示一下,模擬登錄的代碼隨時都有可能失效,因為前端的網頁HTML、CSS、JS等結構可能會根據公司業務調整之類的發生變化。
所以,重點是掌握了各種技巧,學會這些完全可以自己調試完成登錄,那時候你也可以成為 contributor 了!
Github鏈接:https://github.com/Kr1s77/awesome-python-login-model
公眾號文末改版了,如果覺得有幫助,還請多多支持,歡迎?分享、點贊、在看?三連。
為了回饋廣大讀者朋友,我特地免費送給大家三份大禮1. Pandas 官方教程中文版。?
2. 300G 硬核 Python 視頻,涵蓋你所有想看。??
3. 一個月精通 Python 的秘籍。
下面是部分視頻的截圖資料獲取方法
長按掃描下方二維碼關注
在后臺回復關鍵詞:資料掃描關注,回復"資料"免費領取
總結
以上是生活随笔為你收集整理的大写牛逼,用 Python 登录主流 24 个网站的全部內容,希望文章能夠幫你解決所遇到的問題。
如果覺得生活随笔網站內容還不錯,歡迎將生活随笔推薦給好友。