當(dāng)前位置：首頁(yè) >

爬虫前面

發(fā)布時(shí)間：2023/12/10 35 豆豆

生活随笔收集整理的這篇文章主要介紹了爬虫前面小編覺(jué)得挺不錯(cuò)的,現(xiàn)在分享給大家,幫大家做個(gè)參考.

什么是爬蟲？

網(wǎng)絡(luò)爬蟲（又被稱為網(wǎng)頁(yè)蜘蛛，網(wǎng)絡(luò)機(jī)器人，在FOAF社區(qū)中間，更經(jīng)常的稱為網(wǎng)頁(yè)追逐者），是一種按照一定的規(guī)則，自動(dòng)地抓取萬(wàn)維網(wǎng)信息的程序或者腳本。另外一些不常使用的名字還有螞蟻、自動(dòng)索引、模擬程序或者蠕蟲。

其實(shí)通俗的講就是通過(guò)程序去獲取web頁(yè)面上自己想要的數(shù)據(jù)，也就是自動(dòng)抓取數(shù)據(jù)

爬蟲可以做什么？

你可以爬去妹子的圖片，爬取自己想看看的視頻。。等等你想要爬取的數(shù)據(jù)，只要你能通過(guò)瀏覽器訪問(wèn)的數(shù)據(jù)都可以通過(guò)爬蟲獲取

爬蟲的本質(zhì)是什么？

模擬瀏覽器打開網(wǎng)頁(yè)，獲取網(wǎng)頁(yè)中我們想要的那部分?jǐn)?shù)據(jù)

瀏覽器打開網(wǎng)頁(yè)的過(guò)程：
當(dāng)你在瀏覽器中輸入地址后，經(jīng)過(guò)DNS服務(wù)器找到服務(wù)器主機(jī)，向服務(wù)器發(fā)送一個(gè)請(qǐng)求，服務(wù)器經(jīng)過(guò)解析后發(fā)送給用戶瀏覽器結(jié)果，包括html,js,css等文件內(nèi)容，瀏覽器解析出來(lái)最后呈現(xiàn)給用戶在瀏覽器上看到的結(jié)果

所以用戶看到的瀏覽器的結(jié)果就是由HTML代碼構(gòu)成的，我們爬蟲就是為了獲取這些內(nèi)容，通過(guò)分析和過(guò)濾html代碼，從中獲取我們想要資源（文本，圖片，視頻.....）

轉(zhuǎn)載于:https://www.cnblogs.com/zhoujhello/p/9743368.html

總結(jié)

以上是生活随笔為你收集整理的爬虫前面的全部?jī)?nèi)容，希望文章能夠幫你解決所遇到的問(wèn)題。

如果覺(jué)得生活随笔網(wǎng)站內(nèi)容還不錯(cuò)，歡迎將生活随笔推薦給好友。

爬虫

上一篇： git的smart Checkout跟f
下一篇： IDEA通过git怎么回滚到某个提交节点