Pandas基礎知識隨筆

来源:https://www.cnblogs.com/haiyangzhao/archive/2020/07/28/13392355.html
-Advertisement-
Play Games

#!/usr/bin/python3# -*- coding: UTF-8 -*-import pandas as pdimport numpy as npimport matplotlib.pyplot as pltdef main(): # 創建一個列表Series,pandas會創建整形指標 ...


#!/usr/bin/python3
# -*- coding: UTF-8 -*-
import pandas as pd
import numpy as np
import matplotlib.pyplot as plt


def main():
# 創建一個列表Series,pandas會創建整形指標

s = pd.Series([1, 2, 3, np.nan, 6, 8])
print(s)

# 通過傳遞數據字相同的數組,時間索引,列標簽創建DataFrame

dates = pd.date_range('20130101', periods=6)
print(dates)

# 上下文聯繫

df = pd.DataFrame(np.random.randn(6, 4), index=dates, columns=list('ABCD'))
print(df)

# 字典模式
df2 = pd.DataFrame({
'A': 1.,
'B': pd.Timestamp('20130102'),
'C': pd.Series(1, index=list(range(4)), dtype='float32'),
'D': np.array([3] * 4, dtype='int32'),
'E': pd.Categorical(["test", "train", "test", "train"]),
'F': 'foo'})
print(df2)

# 查看格列dtype
print(df2.dtypes)

###第二部分查看所有基本功能
# 頭
print(df.head())

# 尾
print(df.tail(3))

# 查看索引,列和數組數據
print(df.index)

# 查看列
print(df.columns)

# 查看值
print(df.values)

# 查看數據快速統計
print(df.describe())

# 對數據列轉換
print(df.T)

# 按照行排序
print(df.sort_index(axis=1, ascending=False))

# 按照值排序
print(df.sort_values(by='B'))

# 選擇數據 標準Python/Numpy 表達式直觀可用

# 獲取 選擇一列返回Series
print(df['A'])

# 通過[]選擇 進行切片
print(df[0:3])

# 標簽選擇,通過標簽獲取交叉區域
print(df.loc[dates[0]])

# 通過標簽獲取更多的數據
print(df.loc[:, ['A', 'B']])

# 標簽切片
print(df.loc['20130102':'20130104', ['A', 'B']])

# 返回對象縮減維度
df.loc['20130102', ['A', 'B']]

# 獲取單個值
print(df.loc[dates[0], 'A'])

# 快速訪問單個標量
print(df.at[dates[0], 'A'])

# loc 和 iloc 的區別 loc按標簽搜索,iloc按索搜索
print(df.iloc[3])

# 通過數值切片 左開右閉
print(df.iloc[3:5, 0:2])

# 通過指定表位置
print(df.iloc[[1, 2, 4], [0, 2]])

# 對行切片
print(df.iloc[1:3, :])

# 對列切片
print(df.iloc[:, 1:3])

# 獲取特定值
print(df.iloc[1, 1])

# 通過某;列選擇數據
print(df[df.A > 0])

# 通過where選擇數據
print(df[df > 0])

# 通過isin()過濾數據
df2 = df.copy()
df2['E'] = ['one', 'one', 'two', 'three', 'four', 'three']
print(df2)

print(df2[df2['E'].isin(['two', 'four'])])

# 通過標簽更新值
df.at[dates[0], 'A'] = 0

# 通過位置更新值
df.iat[0, 1] = 0

# 通過數組更新值
df.loc[:, 'D'] = np.array([5] * len(df))

print(df)

# 通過where更新值
df2 = df.copy()
df2[df2 > 0] = -df2
print(df2)

# 缺失數據處理reindex()可以修改/增加/刪除索引,會返回一個數據的副本:
df1 = df.reindex(index=dates[0:4], columns=list(df.columns) + ['E'])
df1.loc[dates[0]:dates[1], 'E'] = 1
print(df1)

# d丟掉缺失行
print(df1.dropna(how='any'))

# 對缺失行 賦值
print(df1.fillna(value=5))

# 對缺失的布爾值賦值
print(pd.isnull(df1))

# 平均值
print(df.mean())

# 按照行求均值
print(df.mean(axis=1))

# 操作不同維護需要對齊,pandas 會沿著指定維度執行
s = pd.Series([1, 2, 5, np.nan, 6, 8], index=dates).shift(2)
print(s)
print(df.sub(s, axis='index'))

"""
註:
這裡對齊維度指的對齊時間index
shift(2)指沿著時間軸將數據順移兩位
sub指減法,與NaN進行操作,結果也是NaN

"""
# 應用
# 對數據應用function 註: - cumsum 累加

print(df.apply(np.cumsum))
print(df.apply(lambda x: x.max() - x.min()))

# 直方圖
s = pd.Series(np.random.randint(0, 7, size=10))
print(s)

# j計數
print(s.value_counts())

# 支持字元串
s = pd.Series(['A', 'B', 'C', 'Aaba', 'bACA', np.nan, 'CABA', 'dog', 'cat'])
print(s)

# 連接合併
df = pd.DataFrame(np.random.randn(10, 4))
print(df)
pieces = [df[:3], df[3:7], df[7:]]
print(pd.concat(pieces))

# join操作
left = pd.DataFrame({'key': ['foo', 'foo'], 'lval': [1, 2]})
right = pd.DataFrame({'key': ['foo', 'foo'], 'rval': [4, 5]})
print(left)
print(right)
print(pd.merge(left, right, on='key'))

# 追加
df = pd.DataFrame(np.random.randn(8, 4), columns=['A', 'B', 'C', 'D'])
print(df)

s = df.iloc[3]
print(s)
print(df.append(s, ignore_index=True))

# group by 操作
df = pd.DataFrame({'A': ['foo', 'bar', 'foo', 'bar', 'foo', 'bar', 'foo', 'foo'],
'B': ['one', 'one', 'two', 'three', 'two', 'two', 'one', 'three'],
'C': np.random.randn(8),
'D': np.random.randn(8)})

print(df)

# 分組求和
print(df.groupby(['A']).sum())

# 多列求和
print(df.groupby(['A', 'B']).sum())

#繪圖
ts=pd.Series(np.random.randn(1000),index=pd.date_range('1/1/2000',periods=1000))
ts=ts.cumsum()
print(ts.plot())
plt.close('all')


if __name__ == '__main__':
main()

您的分享是我們最大的動力!

-Advertisement-
Play Games
更多相關文章
  • 利用pandas模塊實現Excel與MySQL的互通 代碼實現 Excel數據導入MySQL(方式一) # 批量導入數據(速度快) def importdata(localpath: str, db: str, foreignkey): data = pandas.read_excel(localp ...
  • 百度雲盤:Python數據科學手冊PDF高清完整版免費下載 提取碼:cbbj 內容簡介 本書是對以數據深度需求為中心的科學、研究以及針對計算和統計方法的參考書。本書共五章,每章介紹一到兩個Python數據科學中的重點工具包。首先從IPython和Jupyter開始,它們提供了數據科學家需要的計算環境 ...
  • 方法的可變參數: 方法中有無參方法,有帶參方法,都多個參數的方法;代碼如下: public class Dome { /* 方法無參和帶參 */ public static void method() { System.out.println("我是一個無參的方法"); } public stati ...
  • 百度雲盤:零基礎學PythonPDF高清完整版免費下載 提取碼:8hb2 內容簡介 Python是目前最流行的動態腳本語言之一。本書由淺入深,全面、系統地介紹了使用Python進行開發的各種知識和技巧。 本書內容包括Python環境的安裝和配置、Python的基本語法、模塊和函數、內置數據結構、字元 ...
  • Tomcat的使用及伺服器和web的一些基礎知識 兩種不同的軟體架構* C/S 客戶端/伺服器端 B\S 瀏覽器/伺服器端 資源的分類 靜態資源: 所有用戶訪問後,得到的結果是一樣的,稱為靜態資源,靜態資源可直接被瀏覽器解析 如 html,css,JavaScript 動態資源: 不同用戶訪問後得到 ...
  • (原文鏈接:https://almirai.live/Coding/Java/ppa-install-oracle-java-11/)[https://almirai.live/Coding/Java/ppa-install-oracle-java-11/] 添加源 Ubuntu/Mint 64bi ...
  • 練習2: 題目:企業發放的獎金根據利潤提成。利潤(I)低於或等於10萬元時,獎金可提10%;利潤高於10萬元,低於20萬元時,低於10萬元的部分按10%提成,高於10萬元的部分,可提成7.5%;20萬到40萬之間時,高於20萬元的部分,可提成5%;40萬到60萬之間時高於40萬元的部分,可提成3%; ...
  • 前言 JAVA起於1995年,經過20多年的發展,在眾多語言中脫穎而出,JAVA如今已經發展成為世界第一編程語言。而且越來越多的人加入到JAVA開發的大軍中。 2014年的數據:全球的軟體開發者數量達到1850萬,其中1100萬是專業的軟體開發人員,另外750萬是開發愛好者,其中我國程式員占比是很少 ...
一周排行
    -Advertisement-
    Play Games
  • 概述:在C#中,++i和i++都是自增運算符,其中++i先增加值再返回,而i++先返回值再增加。應用場景根據需求選擇,首碼適合先增後用,尾碼適合先用後增。詳細示例提供清晰的代碼演示這兩者的操作時機和實際應用。 在C#中,++i 和 i++ 都是自增運算符,但它們在操作上有細微的差異,主要體現在操作的 ...
  • 上次發佈了:Taurus.MVC 性能壓力測試(ap 壓測 和 linux 下wrk 壓測):.NET Core 版本,今天計劃準備壓測一下 .NET 版本,來測試並記錄一下 Taurus.MVC 框架在 .NET 版本的性能,以便後續持續優化改進。 為了方便對比,本文章的電腦環境和測試思路,儘量和... ...
  • .NET WebAPI作為一種構建RESTful服務的強大工具,為開發者提供了便捷的方式來定義、處理HTTP請求並返迴響應。在設計API介面時,正確地接收和解析客戶端發送的數據至關重要。.NET WebAPI提供了一系列特性,如[FromRoute]、[FromQuery]和[FromBody],用 ...
  • 原因:我之所以想做這個項目,是因為在之前查找關於C#/WPF相關資料時,我發現講解圖像濾鏡的資源非常稀缺。此外,我註意到許多現有的開源庫主要基於CPU進行圖像渲染。這種方式在處理大量圖像時,會導致CPU的渲染負擔過重。因此,我將在下文中介紹如何通過GPU渲染來有效實現圖像的各種濾鏡效果。 生成的效果 ...
  • 引言 上一章我們介紹了在xUnit單元測試中用xUnit.DependencyInject來使用依賴註入,上一章我們的Sample.Repository倉儲層有一個批量註入的介面沒有做單元測試,今天用這個示例來演示一下如何用Bogus創建模擬數據 ,和 EFCore 的種子數據生成 Bogus 的優 ...
  • 一、前言 在自己的項目中,涉及到實時心率曲線的繪製,項目上的曲線繪製,一般很難找到能直接用的第三方庫,而且有些還是定製化的功能,所以還是自己繪製比較方便。很多人一聽到自己畫就害怕,感覺很難,今天就分享一個完整的實時心率數據繪製心率曲線圖的例子;之前的博客也分享給DrawingVisual繪製曲線的方 ...
  • 如果你在自定義的 Main 方法中直接使用 App 類並啟動應用程式,但發現 App.xaml 中定義的資源沒有被正確載入,那麼問題可能在於如何正確配置 App.xaml 與你的 App 類的交互。 確保 App.xaml 文件中的 x:Class 屬性正確指向你的 App 類。這樣,當你創建 Ap ...
  • 一:背景 1. 講故事 上個月有個朋友在微信上找到我,說他們的軟體在客戶那邊隔幾天就要崩潰一次,一直都沒有找到原因,讓我幫忙看下怎麼回事,確實工控類的軟體環境複雜難搞,朋友手上有一個崩潰的dump,剛好丟給我來分析一下。 二:WinDbg分析 1. 程式為什麼會崩潰 windbg 有一個厲害之處在於 ...
  • 前言 .NET生態中有許多依賴註入容器。在大多數情況下,微軟提供的內置容器在易用性和性能方面都非常優秀。外加ASP.NET Core預設使用內置容器,使用很方便。 但是筆者在使用中一直有一個頭疼的問題:服務工廠無法提供請求的服務類型相關的信息。這在一般情況下並沒有影響,但是內置容器支持註冊開放泛型服 ...
  • 一、前言 在項目開發過程中,DataGrid是經常使用到的一個數據展示控制項,而通常表格的最後一列是作為操作列存在,比如會有編輯、刪除等功能按鈕。但WPF的原始DataGrid中,預設只支持固定左側列,這跟大家習慣性操作列放最後不符,今天就來介紹一種簡單的方式實現固定右側列。(這裡的實現方式參考的大佬 ...