Python BeautifulSoup 使用_ZenDei技術網路在線

Python BeautifulSoup 使用

-Advertisement-

BS4庫簡單使用: 1.最好配合LXML庫，下載：pip install lxml 2.最好配合Requests庫，下載：pip install requests 3.下載bs4：pip install bs4 4.直接輸入pip沒用？解決：環境變數->系統變數->Path->新建：C:\Pytho ...

BS4庫簡單使用: 1.最好配合LXML庫，下載：pip install lxml 2.最好配合Requests庫，下載：pip install requests 3.下載bs4：pip install bs4 4.直接輸入pip沒用？解決：環境變數->系統變數->Path->新建：C:\Python27\Scripts 案例：獲取網站標題 # -*- coding:utf-8 -*- from bs4 import BeautifulSoup import requests url = "https://www.baidu.com" response = requests.get(url) soup = BeautifulSoup(response.content, 'lxml') print soup.title.text 標簽識別示例1： # -*- coding:utf-8 -*- from bs4 import BeautifulSoup html = ''' <html> <head><title>The Dormouse's story</title></head> <body> <p class="title"><b>The Dormouse's story</b></p> <p class="story">Once upon a time there were three little sisters; and their names were <a href="http://example.com/elsie" class="sister" id="link1">Elsie</a>, <a href="http://example.com/lacie" class="sister" id="link2">Lacie</a> and <a href="http://example.com/tillie" class="sister" id="link3">Tillie</a>; and they lived at the bottom of a well.</p> <p class="story">...</p> </body> </html> ''' soup = BeautifulSoup(html, 'lxml') # BeautifulSoup中有內置的方法來實現格式化輸出 print(soup.prettify()) # title標簽內容 print(soup.title.string) # title標簽的父節點名 print(soup.title.parent.name) # 標簽名為p的內容 print(soup.p) # 標簽名為p的class內容 print(soup.p["class"]) # 標簽名為a的內容 print(soup.a) # 查找所有的字元a print(soup.find_all('a')) # 查找id='link3'的內容 print(soup.find(id='link3')) 示例2： # -*- coding:utf-8 -*- from bs4 import BeautifulSoup html = ''' <html> <head><title>The Dormouse's story</title></head> <body> <p class="story">Once upon a time there were three little sisters; and their names were <a href="http://example.com/elsie" class="sister" id="link1">Elsie</a>, <a href="http://example.com/lacie" class="sister" id="link2">Lacie</a> and <a href="http://example.com/tillie" class="sister" id="link3">Tillie</a>; and they lived at the bottom of a well.</p> <p class="story">...</p> </body> </html> ''' soup = BeautifulSoup(html, 'lxml') # 將p標簽下的所有子標簽存入到了一個列表中 print (soup.p.contents) find_all示例: # -*- coding:utf-8 -*- from bs4 import BeautifulSoup html = ''' <div class="panel"> <div class="panel-heading"> <h4>Hello</h4> </div> <div class="panel-body"> <ul class="list" id="list-1"> <li class="element">Foo</li> <li class="element">Bar</li> <li class="element">Jay</li> </ul> <ul class="list list-small" id="list-2"> <li class="element">Foo</li> <li class="element">Bar</li> </ul> </div> </div> ''' soup = BeautifulSoup(html, 'lxml') # 查找所有的ul標簽內容 print(soup.find_all('ul')) # 針對結果再次find_all,從而獲取所有的li標簽信息 for ul in soup.find_all('ul'): print(ul.find_all('li')) # 查找id為list-1的內容 print(soup.find_all(attrs={'id': 'list-1'})) # 查找class為element的內容 print(soup.find_all(attrs={'class': 'element'})) # 查找所有的text='Foo'的文本 print(soup.find_all(text='Foo')) CSS選擇器示例： # -*- coding:utf-8 -*- from bs4 import BeautifulSoup html = ''' <div class="panel"> <div class="panel-heading"> <h4>Hello</h4> </div> <div class="panel-body"> <ul class="list" id="list-1"> <li class="element">Foo</li> <li class="element">Bar</li> <li class="element">Jay</li> </ul> <ul class="list list-small" id="list-2"> <li class="element">Foo</li> <li class="element">Bar</li> </ul> </div> </div> ''' soup = BeautifulSoup(html, 'lxml') # 獲取class名為panel下panel-heading的內容 print(soup.select('.panel .panel-heading')) # 獲取class名為ul和li的內容 print(soup.select('ul li')) # 獲取class名為element，id為list-2的內容 print(soup.select('#list-2 .element')) # 使用get_text()獲取文本內容 for li in soup.select('li'): print(li.get_text()) # 獲取屬性的時候可以通過[屬性名]或者attrs[屬性名] for ul in soup.select('ul'): print(ul['id']) # print(ul.attrs['id'])

您的分享是我們最大的動力!

-Advertisement-

更多相關文章

設計模式：模板方法模式

模板方法模式是編程中經常用到的模式，它定義了一個操作的演算法骨架，將某些步驟延遲到子類實現。這樣，新的子類可以在不改變一個演算法結構的前提下重新定義該演算法的某些特定步驟。核心：處理某個流程的代碼都已具備，但其中某個節點的代碼暫時不能確定，所以將這個節點的代碼實現轉移到子類完成。例子：模擬一個銀行 ...
Java運行時數據區概述

Java 虛擬機在執行Java程式的過程中會把它所管理的記憶體劃分為若幹個不同的數據區域,這些區域都有各自的用途 ...
大名鼎鼎的Requests庫用了什麼編碼風格？

原文：https://www.kennethreitz.org/essays/kenneth-reitzs-code-style 作者：Kenneth Reitz 原題：Kenneth Reitz’s Code Style™ Requests 的代碼庫使用 PEP-8 編碼風格。除了 PEP-8 ...
使用selenium和phantomJS瀏覽器登陸豆瓣的小演示

# 使用selenium和phantomJS瀏覽器登陸豆瓣的小演示 # 導入庫 from selenium import webdriver # 實例化一個瀏覽器對象 web = webdriver.PhantomJS() # 請求頁面 web.get("https://www.douban.com... ...
JVM記憶體模型圖以及簡單介紹

局部變數表：應用程式中定義的普通變數就存放在棧中，棧中變數的大小程式運行開始的時候已經固定。棧：方法執行時創建棧針，然後進入到棧中，根據先進後出的順序進行執行。堆：對重存放程式中創建的對象。新生代：新生代分為三個區域。Eden，ServivorFrom，ServivorTo。新創建的對象先存放 ...
支付寶app支付服務端的實現-Java版

前言最近在工作中需要使用支付寶app支付，在初次使用過程中也不可避免的出現了一些問題，那麼本次隨筆主要是概述支付寶app支付服務端的整個實現過程以及就服務端出現的一些問題做一些總結。 1.準備工作 1.1 入駐螞蟻金服開放平臺 https://open.alipay.com/platform/ho ...
SpringBoot集成rabbitmq（一）

前言 Rabbitmq是一個開源的消息代理軟體，是AMQP協議的實現。核心作用就是創建消息隊列，非同步發送和接收消息。通常用來在高併發中處理削峰填谷、延遲處理、解耦系統之間的強耦合、處理秒殺訂單。入門rabbitmq之前主要是想瞭解下秒殺排隊訂單入庫後，非同步通知客戶端秒殺結果。基礎知識 1、基本概 ...
批量保存雲盤鏈接的deom

寫在前面的聲明：作為一個正在自學爬蟲的小白，用爬蟲爬了八千本書的雲盤鏈接，然後就想把這寫鏈接的資源都轉存到自己的雲盤裡，以防某一天資源失效。本來想在網上找個能夠批量保存的軟體，哪知道找到幾個都不能用，用手動保存肯定是不現實的。隨後想到才學的selenium能夠模擬瀏覽器的操作，就像自己寫段自動保存 ...