【python】這麼**得小姐姐網~不敢趕緊採集一波~免得它沒了

来源:https://www.cnblogs.com/Qqun261823976/archive/2022/10/21/16814504.html
-Advertisement-
Play Games

前言 大家早好、午好、晚好吖~ 今天我們來採集一下這個小姐姐網~ 環境使用: Python 3.8 解釋器 Pycharm 編輯器 import re import requests >>> pip install requests 如果安裝python第三方模塊: win + R 輸入 cmd 點 ...


前言

大家早好、午好、晚好吖~

 

今天我們來採集一下這個小姐姐網~

 

 


環境使用:

  • Python 3.8 解釋器

  • Pycharm 編輯器

  • import re

  • import requests >>> pip install requests


如果安裝python第三方模塊:

  1. win + R 輸入 cmd 點擊確定, 輸入安裝命令 pip install 模塊名 (pip install requests) 回車

  2. 在pycharm中點擊Terminal(終端) 輸入安裝命令


如何配置pycharm裡面的python解釋器?

  1. 選擇file(文件) >>> setting(設置) >>> Project(項目) >>> python interpreter(python解釋器)

  2. 點擊齒輪, 選擇add

  3. 添加python安裝路徑


pycharm如何安裝插件?

  1. 選擇file(文件) >>> setting(設置) >>> Plugins(插件)

  2. 點擊 Marketplace 輸入想要安裝的插件名字 比如:翻譯插件 輸入 translation / 漢化插件 輸入 Chinese

  3. 選擇相應的插件點擊 install(安裝) 即可

  4. 安裝成功之後 是會彈出 重啟pycharm的選項 點擊確定, 重啟即可生效

源碼、教程 ==點擊 藍色字體 自取== ,我都放在這裡了。


python實現案例: 批量數據採集/下載 <有方法 通用>

一. 數據來源分析

  1. 明確需求, 我們採集網上什麼數據內容, 在什麼地方

    分析我們想要高清原圖在什麼地方有

  2. 瀏覽器自帶工具: 開發者工具 F12

    • 滑鼠右鍵點擊 插件 選擇 network 刷新網頁
    • 點擊選擇 Img 可以直接找到圖片地址

    繼續分析, 圖片鏈接是從哪裡來的

    • 通過搜索分析, 可以知道, 我們想要圖片原圖url 就在 圖片詳情頁網頁源代碼裡面

 

 

二. 代碼實現步驟:

  1. 發送請求, 模擬瀏覽器對於 圖片目錄頁面 發送請求

  2. 獲取數據, 獲取伺服器返迴響應數據
    開發者工具 response

  3. 解析數據, 提取我們想要數據內容
    圖片詳情頁url地址

  4. 發送請求, 模擬瀏覽器對於 圖片詳情頁url 發送請求

  5. 獲取數據, 獲取伺服器返迴響應數據
    開發者工具 response

  6. 解析數據, 提取我們想要數據內容
    圖片原圖高清url地址, 以及 標題

  7. 保存數據, 把圖片保存文本文件夾

代碼

# 導入數據請求模塊 --> 第三方模塊, 需要 pip install requests   不會 0  會 1
import requests
# 導入正則模塊  內置模塊 不需要安裝的
import re

  

 

"""
1. 發送請求, 模擬瀏覽器對於 圖片目錄頁面url 發送請求

  • python代碼如何模擬瀏覽器?

使用headers 請求頭

實現多頁數據採集:

分析請求url地址變化規律 --> 分析圖片目錄頁面url地址變化規律

每個網站數據結構是不一樣, 數據來源也不一樣, 但是分析數據來源思路 和 代碼實現步驟過程 差不多的

"""

for page in range(1, 5):
    # 字元串格式化方法: 把page傳入到字元串當中
    print(f'=================正在採集第{page}頁的數據內容=================')

 

確定請求鏈接

有網站名得鏈接發出來就不給過拉~寶子們自己按照下麵得圖添加一下哦

 

 

==或點擊 藍色字體 自取== ,我都放在這裡了。

    # 模擬瀏覽器 --> headers 請求頭
    headers = {
        'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/101.0.0.0 Safari/537.36'
    }
    # 發送請求
    response = requests.get(url=url, headers=headers)

 

<Response [200]> 表示請求成功

"""

  1. 獲取數據, 獲取伺服器返迴響應數據

開發者工具 response

  • response.text 獲取響應文本數據

  • response.json() 獲取響應json字典數據 <一定要完整json數據, 否則就會報錯>

  1. 解析數據, 提取我們想要數據內容

圖片詳情頁url地址

re.findall('匹配什麼數據', '什麼地方') 調用re模塊裡面findall 去找到匹配數據: 找到所有我們想要數據內容

從 什麼地方 去匹配查詢 什麼數據

從 response.text 去匹配 <li><a target="_blank" href="(.*?)" alt="(.*?)" title=".*?"> 其中 (.*?) 就是我們想要的數據

  • () 表示精確匹配: 我們要的內容

  • 沒有括弧 泛匹配 不要的內容

  • .*? 通配符 元字元 . 表示匹配任意字元<除了換行符\n以外> * 匹配前一個字元0或者無限個 ? 非貪婪匹配模式

"""

提取詳情頁url地址

    img_info = re.findall('<li><a target="_blank" href="(.*?)" alt="(.*?)" title=".*?">', response.text)
    # for迴圈遍歷 把列表裡面元素 一個一個提取出來
    for img, title in img_info:

 

img: 圖片詳情頁url地址

title: 圖片標題

"""

4. 發送請求, 模擬瀏覽器對於 圖片詳情頁url 發送請求

5. 獲取數據, 獲取伺服器返迴響應數據

開發者工具 response

6. 解析數據, 提取我們想要數據內容

圖片原圖高清url地址, 以及 標題

[0] 列表索引取值 提取第一個元素

"""

        # 發送請求 獲取響應文本數據
        html_data = requests.get(url=img, headers=headers).text
        # 提取原圖url地址
        img_url = re.findall('<img alt=".*?" title=".*?" src="(.*?)">', html_data)[0]

 

"""

7. 保存數據, 把圖片保存文本文件夾

  • 發送請求, 獲取數據內容

  • response.content 獲取響應二進位數據 <圖片/視頻/音頻/特定格式文件..>

如果圖片名字一樣的話, 會覆蓋掉

  • split() 字元串分割 返回列表

  • [-1] 列表索引取值, 提取最後一個元素

  • title + img_url.split('/')[-1] 字元串拼接

"""

        # 獲取二進位數據
        img_content = requests.get(url=img_url).content
        # 替換特殊字元
        img_title = title + img_url.split('/')[-1]
        img_title = re.sub(r'[\/:*?:<>|]', '_', img_title)
        with open('img漫畫\\' + img_title, mode='wb') as f:
            f.write(img_content)
        print(img_url, img_title)

 

 

 

 

 

 

 

 

文章看不懂,我專門錄了對應的視頻講解,本文只是大致展示,完整代碼和視頻教程點擊下方藍字

==點擊 藍色字體 自取,我都放在這裡了。==

尾語

您的分享是我們最大的動力!

-Advertisement-
Play Games
更多相關文章
  • 每日演算法 今日是: 1、將字元串轉換為駝峰格式 2、判斷字元串中是否有連續重覆的字元 將字元串轉換成駝峰格式 // css 中經常有類似 background-image 這種通過 - 連接的字元,通過 javascript 設置樣式的時候需要將這種樣式轉換成 backgroundImage 駝峰格 ...
  • 命令模式是一種數據驅動的設計模式,它屬於行為型設計模式。通過使用命令模式,可以極大地降低系統的耦合度。 ...
  • 項目中有一個查重的需求,就類似論文查重這種的需求,我的組長已經寫好了這個 Demo 了,我也挺感興趣的,所以也看了看是如何實現的,看完後,感慨一聲,噢!原來是這樣實現的啊!。現在呢,就記錄下我從中學到的知識! ...
  • 滿漢樓03 5.拓展_多表查詢 前面都是對單表進行操作 思考一個問題:如果多表查詢怎麼處理?例如,查看賬單時,希望現實菜品名稱 查詢的結果從上圖變為下圖: 方案一 由多張表組合查詢的的結果,我們仍然可以將其映射成一個Javabean 例如MultTableBean類,該類的屬性可以來自多張表的欄位, ...
  • Module 模塊例化的兩種方式:按埠位置例化、按埠名例化。 module top_module ( input a, input b, output out ); mod_a instance1 ( .in1(a), .in2(b), .out(out) ); endmodule Module ...
  • Jupyter Notebook 有兩種鍵盤輸入模式。 編輯模式,允許你往單元中鍵入代碼或文本;這時的單元框線是綠色的。 命令模式,鍵盤輸入運行程式命令;這時的單元框線是灰色。 1命令模式 (按鍵 Esc 開啟)快捷鍵: Enter : 轉入編輯模式 Shift-Enter : 運行本單元,選中下個 ...
  • 滿漢樓03 4.功能實現05 4.8查看賬單功能 按照之間搭建起來的框架,在BillService編寫方法 4.8.1代碼實現 1.修改Bill類 重寫Bill類中的toString方法 @Override public String toString() { return id + "\t\t" ...
  • 介面文檔 介面編寫已經寫完了,需要編寫介面文檔,給前端的人使用 -請求地址 -請求方式 -支持的編碼格式 -請求參數(get,post參數) -返回格式示例 在公司的寫法 1)直接使用word或者md寫2)使用介面文檔平臺,在介面文檔平臺錄入(Yapi(百度開源的自己搭建),第三方平臺(收費),自己 ...
一周排行
    -Advertisement-
    Play Games
  • 移動開發(一):使用.NET MAUI開發第一個安卓APP 對於工作多年的C#程式員來說,近來想嘗試開發一款安卓APP,考慮了很久最終選擇使用.NET MAUI這個微軟官方的框架來嘗試體驗開發安卓APP,畢竟是使用Visual Studio開發工具,使用起來也比較的順手,結合微軟官方的教程進行了安卓 ...
  • 前言 QuestPDF 是一個開源 .NET 庫,用於生成 PDF 文檔。使用了C# Fluent API方式可簡化開發、減少錯誤並提高工作效率。利用它可以輕鬆生成 PDF 報告、發票、導出文件等。 項目介紹 QuestPDF 是一個革命性的開源 .NET 庫,它徹底改變了我們生成 PDF 文檔的方 ...
  • 項目地址 項目後端地址: https://github.com/ZyPLJ/ZYTteeHole 項目前端頁面地址: ZyPLJ/TreeHoleVue (github.com) https://github.com/ZyPLJ/TreeHoleVue 目前項目測試訪問地址: http://tree ...
  • 話不多說,直接開乾 一.下載 1.官方鏈接下載: https://www.microsoft.com/zh-cn/sql-server/sql-server-downloads 2.在下載目錄中找到下麵這個小的安裝包 SQL2022-SSEI-Dev.exe,運行開始下載SQL server; 二. ...
  • 前言 隨著物聯網(IoT)技術的迅猛發展,MQTT(消息隊列遙測傳輸)協議憑藉其輕量級和高效性,已成為眾多物聯網應用的首選通信標準。 MQTTnet 作為一個高性能的 .NET 開源庫,為 .NET 平臺上的 MQTT 客戶端與伺服器開發提供了強大的支持。 本文將全面介紹 MQTTnet 的核心功能 ...
  • Serilog支持多種接收器用於日誌存儲,增強器用於添加屬性,LogContext管理動態屬性,支持多種輸出格式包括純文本、JSON及ExpressionTemplate。還提供了自定義格式化選項,適用於不同需求。 ...
  • 目錄簡介獲取 HTML 文檔解析 HTML 文檔測試參考文章 簡介 動態內容網站使用 JavaScript 腳本動態檢索和渲染數據,爬取信息時需要模擬瀏覽器行為,否則獲取到的源碼基本是空的。 本文使用的爬取步驟如下: 使用 Selenium 獲取渲染後的 HTML 文檔 使用 HtmlAgility ...
  • 1.前言 什麼是熱更新 游戲或者軟體更新時,無需重新下載客戶端進行安裝,而是在應用程式啟動的情況下,在內部進行資源或者代碼更新 Unity目前常用熱更新解決方案 HybridCLR,Xlua,ILRuntime等 Unity目前常用資源管理解決方案 AssetBundles,Addressable, ...
  • 本文章主要是在C# ASP.NET Core Web API框架實現向手機發送驗證碼簡訊功能。這裡我選擇是一個互億無線簡訊驗證碼平臺,其實像阿裡雲,騰訊雲上面也可以。 首先我們先去 互億無線 https://www.ihuyi.com/api/sms.html 去註冊一個賬號 註冊完成賬號後,它會送 ...
  • 通過以下方式可以高效,並保證數據同步的可靠性 1.API設計 使用RESTful設計,確保API端點明確,並使用適當的HTTP方法(如POST用於創建,PUT用於更新)。 設計清晰的請求和響應模型,以確保客戶端能夠理解預期格式。 2.數據驗證 在伺服器端進行嚴格的數據驗證,確保接收到的數據符合預期格 ...