在現在這個信息爆炸的時代,要想高效的獲取數據,爬蟲是非常好用的。而用python做爬蟲也十分簡單方便,下麵通過一個簡單的小爬蟲程式來看一看寫爬蟲的基本過程: 首先是要用到的庫,因為是剛入門最簡單的程式,我們主要就用到下麵這兩: import requests //用於請求網頁 import re / ...
在現在這個信息爆炸的時代,要想高效的獲取數據,爬蟲是非常好用的。而用python做爬蟲也十分簡單方便,下麵通過一個簡單的小爬蟲程式來看一看寫爬蟲的基本過程:
首先是要用到的庫,因為是剛入門最簡單的程式,我們主要就用到下麵這兩:
import requests //用於請求網頁 import re //正則表達式,用於解析篩選網頁中的信息
其中re是python自帶的,requests庫需要我們自己安裝,在命令行中輸入pip install requests即可。
然後隨便找一個網站,註意不要嘗試爬取隱私敏感信息,這裡找了個表情包網站:
註:此處表情包網站中的內容本來就可以免費下載,所以爬蟲只是簡化了我們一個個點的流程,註意不能去爬取付費資源。
我們要做的就是通過爬蟲把這些表情包下載到我們電腦里。
編寫爬蟲程式
首先肯定要通過python訪問這個網站,代碼如下:headers = { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:98.0) Gecko/20100101 Firefox/98.0' } response = requests.get('https://qq.yh31.com/zjbq/',headers=headers) //請求網頁
其中之所以要加headers這一段是因為有些網頁會識別到你是通過python請求的然後把你拒絕,所以我們要換個正常的請求頭。可以隨便找一個或者f12從網路信息里複製一個。
然後我們要找到我們要爬取的圖片在網頁代碼里的位置,f12查看源代碼,找到表情包如下:
然後建立匹配規則,用正則表達式把中間那串替換掉,最簡單的就是.*?
t = '<img src="(.*?)" alt="(.*?)" width="160" height="120">'
像這樣。
然後就可以調用re庫里的findall方法把相關內容爬下來了:
result = re.findall(t, response.text)
返回的內容是由字元串組成的列表,最後我們經由爬到的地址通過python語句把圖片下下來保存到文件夾里就行了。
程式代碼
import requests import re import os image = '表情包' if not os.path.exists(image): os.mkdir(image) headers = { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:98.0) Gecko/20100101 Firefox/98.0' } response = requests.get('https://qq.yh31.com/zjbq/',headers=headers) response.encoding = 'GBK' response.encoding = 'utf-8' print(response.request.headers) print(response.status_code) t = '<img src="(.*?)" alt="(.*?)" width="160" height="120">' result = re.findall(t, response.text) for img in result: print(img) res = requests.get(img[0]) print(res.status_code) s = img[0].split('.')[-1] #截取圖片尾碼,得到表情包格式,如jpg ,gif with open(image + '/' + img[1] + '.' + s, mode='wb') as file: file.write(res.content)
最後結果就是這個樣子: