php 仿安居客源码_python抓取安居客小区数据的程序代码
抓取數據不管用什么編程語言幾乎都是可以實現了,今天我們需要采集安居客的小區數據,下面我們來看一個python抓取安居客小區數據的程序代碼了,希望下文能夠對大家有幫助。
某功能需要一套城市所有小區的位置信息數據,一開始是使用的百度地圖api來進行關鍵詞搜索,勉強能用,但數據量非常少,還是有大量的社區/小區搜不到。
周末在家上網時發現安居客上直接就有每個城市的小區大全,欣喜若狂,于是就立即寫了個爬蟲試試。
以下貼代碼,python2.7,lxml+request庫。#coding=utf-8
#author : zx
#date : 2015/07/27
import requests
import MySQLdb
import time
import string
import random
from lxml import etree
#ua頭信息 get時可以隨機使用
headers = [
{ "User-Agent":"Mozilla/5.0 (Linux; U; Android 4.1; en-us; GT-N7100 Build/JRO03C) AppleWebKit/534.30 (KHTML, like Gecko) Version/4.0 Mobile Safari/534.30"},
{ "User-Agent":"Mozilla/5.0 (compatible; MSIE 10.0; Windows Phone 8.0; Trident/6.0; IEMobile/10.0; ARM; Touch; NOKIA; Lumia 520)"},
{ "User-Agent":"Mozilla/5.0 (BB10; Touch) AppleWebKit/537.10+ (KHTML, like Gecko) Version/10.0.9.2372 Mobile Safari/537.10+"},
{ "User-Agent":"Mozilla/5.0 (Linux; Android 4.4.2; GT-I9505 Build/JDQ39) AppleWebKit/537.36 (KHTML, like Gecko) Version/1.5 Chrome/28.0.1500.94 Mobile Safari/537.36"}
]
#城市入口頁面
#我只抓的青島本地
#其它城市或全國城市可通過這個頁面抓取城市列表http://m.anjuke.com/cityList
url = 'http://m.anjuke.com/qd/xiaoqu/'
req = requests.get(url)
cookie = req.cookies.get_dict()
#鏈接數據庫
conn = MySQLdb.connect('localhost', '*****', '******', '***', charset='utf8')
cursor = conn.cursor()
sql = "insert into xiaoqu (name, lat, lng, address, district) values (%s, %s, %s, %s, %s)"
sql_v = []
page = etree.HTML(req.text)
districtHTML = page.xpath(u"//div[@class='listcont cont_hei']")[0]
#采集目標城市的各行政區域url
#當然如果不想區分行政區可以直接抓“全部” 即上面url中的所有小區及分頁
districtUrl = {}
i = 0
for a in districtHTML:
if i==0:
i = 1
continue
districtUrl[a.text] = a.get('href')
#開始采集
total_all = 0
for k,u in districtUrl.items():
p = 1 #分頁
while True:
header_i = random.randint(0, len(headers)-1)
url_p = u.rstrip('/') + '-p' + str(p)
r = requests.get(url_p, cookies=cookie, headers=headers[header_i])
page = etree.HTML(r.text) #這里轉換大小寫要按情況...
communitysUrlDiv = page.xpath(u"//div[@class='items']")[0]
total = len(communitysUrlDiv)
i = 0
for a in communitysUrlDiv:
i+=1
r = requests.get(a.get('href'), cookies=cookie, headers=headers[header_i])
#抓取時發現有少量404頁會直接導致程序報錯退出- -!
#唉 說明代碼寫的還不夠健壯啊
#加了if判斷和try, 錯誤時可以跳過或做一些簡單處理和調試...
if r.status_code == 404:
continue
page = etree.HTML(r.text)
try:
name = page.xpath(u"//h1[@class='f1']")[0].text
except:
print a.get('href')
print r.text
raw_input()
#有少量小區未設置經緯度信息
#只能得到它的地址了
try:
latlng = page.xpath(u"//a[@class='comm_map']")[0]
lat = latlng.get('lat')
lng = latlng.get('lng')
address = latlng.get('address')
except:
lat = ''
lng = ''
address = page.xpath(u"//span[@class='rightArea']/em")[0].text
sql_v.append((name, lat, lng, address, k))
print "\r\r\r",
print u"正在下載 %s 的數據,第 %d 頁,共 %d 條,當前:".encode('gbk') %(k.encode('gbk'),p, total) + string.rjust(str(i),3).encode('gbk'),
time.sleep(0.5) #每次抓取停頓
#執行插入數據庫
cursor.executemany(sql, sql_v)
sql_v = []
time.sleep(5) #每頁完成后停頓
total_all += total
print ''
print u"成功入庫 %d 條數據,總數 %d".encode('gbk') % (total, total_all)
if total < 500:
break
else:
p += 1
#及時關閉數據庫 做個好孩子 任務完成~
cursor.close()
conn.close()
print u'所有數據采集完成! 共 %d 條數據'.encode('gbk') % (total_all)
raw_input()
注釋我覺得已經寫的很詳細了,在cmd中顯示,字符串當然要轉一下碼。
以下是運行狀態和得到的數據截圖。
本文原創發布php中文網,轉載請注明出處,感謝您的尊重!
總結
以上是生活随笔為你收集整理的php 仿安居客源码_python抓取安居客小区数据的程序代码的全部內容,希望文章能夠幫你解決所遇到的問題。
- 上一篇: Java判断字符串包含英文
- 下一篇: php adodb类库下载,PHP_PH