MySQL數據結構和索引

来源:https://www.cnblogs.com/JokerWorld/p/18325995
-Advertisement-
Play Games

一、MySQL數據結構 InnoDB引擎 MySQL預設引擎是InnoDB引擎,這個引擎的主要特點是支持事務和行鎖, 數據結構 2.1 二叉樹(二叉查找樹) 二叉樹是一種特殊的樹,二叉樹中每個節點的度都不能大於2,就是說每個節點最多只能有左右兩個子節點 當我們像二叉查找樹儲存數據的時候,是安裝從大到 ...


一、MySQL數據結構

InnoDB引擎

MySQL預設引擎是InnoDB引擎,這個引擎的主要特點是支持事務和行鎖,

數據結構

2.1 二叉樹(二叉查找樹)

image.png

  • 二叉樹是一種特殊的樹,二叉樹中每個節點的度都不能大於2,就是說每個節點最多只能有左右兩個子節點
  • 當我們像二叉查找樹儲存數據的時候,是安裝從大到小(或從小到大)的順序保存的,這樣有可能會形成一個單項鏈表的結構,搜索性能就會大打折扣。

為瞭解決平衡避免出現這種鏈表的結構,所以才有了平衡二叉樹

2.2 平衡二叉樹

平衡二叉樹就能解決上面的問題
image.png
(1)非葉子節點最多擁有兩個子節點
(2)非葉子節值大於左邊子節點、小於右邊子節點;
(3)樹的左右兩邊的層級數相差不會大於1,
(4)沒有值相等重覆的節點

平衡二叉樹會通過左旋右旋來平衡二叉樹,避免變成單向鏈表結構,但過度要求平衡,會頻繁的左右旋,
所以後面就出現了紅黑樹

2.3 紅黑樹

紅黑樹只是減少左右旋,本身還是會左旋和右旋
image.png

  • 性質1:每個節點要麼是紅色,要麼是黑色。
  • 性質2:根節點是黑色。
  • 性質3:每個葉子節點(NIL節點,也就是 NULL 節點)是黑色。
  • 性質4:如果一個節點是紅色的,則它的兩個子節點都是黑色的(從每個葉子到根的所有路徑上不能有兩個連續的紅色節點)。
  • 性質5:從任一節點到其每個葉子的所有簡單路徑都包含相同數量的黑色節點。
  1. 平衡性
    • 紅黑樹通過上述性質確保了樹的高度保持在 O(log n),其中 n 是樹中的節點數。
    • 這種性質保證了紅黑樹的操作(查找、插入、刪除)的時間複雜度為 O(log n)。
  2. 插入操作
    • 插入新節點時,新節點預設著色為紅色。
    • 插入後,如果破壞了紅黑樹的性質,需要通過旋轉和重新著色來恢復性質。
    • 可能的旋轉操作包括左旋、右旋、左右旋和右左旋。
  3. 刪除操作
    • 刪除節點可能導致紅黑樹失去平衡。
    • 刪除後,需要通過旋轉和重新著色來恢復性質。
    • 刪除操作可能涉及複雜的顏色調整和旋轉。
  4. 旋轉操作
    • 左旋(Left Rotation):如果需要將一個節點的右子節點提升到更高的位置,可以進行左旋。
    • 右旋(Right Rotation):如果需要將一個節點的左子節點提升到更高的位置,可以進行右旋。
    • 左右旋(Left-Right Rotation):先對節點的左子節點進行左旋,然後對節點本身進行右旋。
    • 右左旋(Right-Left Rotation):先對節點的右子節點進行右旋,然後對節點本身進行左旋。

2.4 B-Tree(平衡多路查找樹)


每一個節點都儲存完整的一條數據,這是和B+Tree最明顯的區別,對於範圍查詢效率不高。
InnoDB存儲引擎中有頁(Page)的概念,頁是其磁碟管理的最小單位。InnoDB存儲引擎中預設每個頁的大小為16KB(16384/1024),InnoDB在把磁碟數據讀入到記憶體時會以頁為基本單位

假如說:每個磁碟塊的大小是1k(一個指針+一個數據節點是1k),那麼一頁就是有16個磁碟塊,如果每次載入一頁,也有16個指針,而且每個指針指向一個磁碟塊(第二層),那麼對於一個三層的b-樹來說。能存儲的節點數就是:16X16X16 = 4096

當需要查詢的數據很多時,也就是十萬百萬級別的時候,B-Tree結構對於查詢的效率就不怎麼管用了,因為這個時候樹的層級會很高,當存儲的數據量很大時同樣會導致B-Tree的深度較大,增大查詢時的磁碟I/O次數
所以後面的B+Tree進一步優化這件事。

2.5 B+Tree


和B-Tree的主要區別是B+Tree的所有數據存儲在葉子結點中,非葉子節點只存儲鍵值信息和指針,而有數據的葉子結點會形成一個雙向鏈表的結構,可以範圍查詢。

InnoDB存儲引擎中頁的大小為16KB,一般表的主鍵類型為INT(占用4個位元組)或BIGINT(占用8個位元組),指針類型也一般為4或8個位元組,也就是說一個頁(B+Tree中的一個節點)中大概存儲16KB/(8B+8B)=1K個鍵值(因為是估值,為方便計算,這裡的K取值為1000。也就是說一個深度為3的B+Tree索引可以維護1000 * 1000 * 50(最後一層每個磁碟塊存多少數據節點,假設是50個) = 5千萬條記錄。深度一般是三到四層

特點:

  1. 所有的葉子結點中包含了全部關鍵字的信息,非葉子節點只存儲鍵值信息,及指向含有這些關鍵字記錄的指針,且葉子結點本身依關鍵字的大小自小而大的順序鏈接,所有的非終端結點可以看成是索引部分,結點中僅含有其子樹根結點中最大(或最小)關鍵字。 (而B樹的非終節點也包含需要查找的有效信息)
  2. 所有葉子節點之間都有一個鏈指針。
  3. 數據記錄都存放在葉子節點中。

二、索引

什麼是索引?

資料庫管理系統(DBMS)中用於加快數據檢索速度的一種數據結構,InnoDB用的是B+Tree的結構
特點:

  • 占用磁碟空間
  • 大大提高查詢效率,減少磁碟IO
  • 降低增刪改的效率

索引的類型

  • 聚簇索引(Clustered Index):數據按照索引順序存儲,每個表只能有一個聚簇索引。
  • 非聚簇索引(Nonclustered Index):數據和索引分開存儲,一個表可以有多個非聚簇索引。
  • 唯一索引(Unique Index):保證索引中的鍵值唯一。
  • 全文索引(Full-text Index):用於全文搜索,支持複雜的內容搜索

聚簇索引和非聚簇索引

聚簇索引,每個節點都存有完整的數據
非聚簇索引,只存了Key和指針和ID

回表和索引覆蓋:
回表:當查詢一個或一些數據的時候,如:select * from table where name = Joker 的時候,假設索引欄位是 name,非聚簇索引查到了名字,但需要的是全部的數據,這時候和根據查到ID進行聚簇索引查詢,這就是回表。
索引覆蓋,以上,如果是 select name from table where name = Joker,需要的數據剛好可以通過非聚簇索引查詢,不需要回表,這時候就是索引覆蓋。(所以MySQL優化中有一個要求是:避免使用select *)

索引失效

可以使用Explain來查詢是否使用了索引
避免索引失效對於提高資料庫查詢性能至關重要。以下是幾種常見的方法來確保索引的有效使用:

1. 最左首碼原則

  • 全值匹配:確保 WHERE 子句中的條件與索引列的順序相匹配。
  • 不要跳過索引列:如果索引是複合索引(多個列組成的索引),查詢時應該從最左邊的列開始,依次向右進行匹配,不能跳過中間的列。

2. 避免在索引列上進行操作

  • 不要在索引列上使用函數:例如 WHERE UPPER(column) = 'value'
  • 不要在索引列上進行表達式操作:例如 WHERE column * 2 = 10
  • 避免類型轉換:確保查詢中的常量與索引列的數據類型一致。

3. 範圍條件後的列不可用

  • 如果使用了範圍條件(如 <, <=, >, >=, BETWEEN, LIKE 開頭的模式匹配等),則在範圍條件之後的索引列無法被使用。

4. 使用覆蓋索引

  • 覆蓋索引:當索引包含了所有需要查詢的欄位時,可以避免回表查詢(即不需要再從主鍵索引中查找數據)。
  • 減少 SELECT * 的使用:明確指定所需的列,而不是使用 SELECT *

5. LIKE 語句的使用

  • 避免以通配符開頭:如果使用 LIKE '%value%',則索引可能失效。但如果使用 LIKE 'value%'LIKE '%value',則索引仍可有效利用。

6. 數據類型的匹配

  • 確保索引列和查詢中的值的數據類型一致,避免隱式類型轉換。

7. 避免使用 NOT IN 和 NOT EXISTS

  • 使用 NOT INNOT EXISTS 可能會導致索引失效。可以嘗試使用 LEFT JOINNOT EXISTS 結合子查詢的方式代替。

8. 選擇合適的數據類型

  • 為索引列選擇合適的數據類型,尤其是當有多種數據類型可以選擇時,選擇占用空間較小的數據類型可以節省存儲空間,提高索引的效率。

9. 維護索引

  • 定期檢查和優化索引,例如使用 ANALYZE TABLEOPTIMIZE TABLE 命令。

10. 避免使用 SELECT *

  • 明確列出需要查詢的欄位,減少不必要的數據傳輸。

11. 使用全文索引

  • 對於全文搜索,使用全文索引(如 FULLTEXT 索引)。

12. 限制使用 OR

  • 當使用 OR 時,確保至少有一個條件能夠使用有效的索引。

通過遵循以上原則,可以有效地避免索引失效的問題,從而提升資料庫查詢的性能。


您的分享是我們最大的動力!

-Advertisement-
Play Games
更多相關文章
  • 1. 事物的四大特性 事務是邏輯上的一組操作,要麼都執行,要麼都不執行 原子性(Atomicity):事務是最小的執行單位,不允許分割。事務的原子性確保動作要麼全部完成,要麼完全不起作用; 一致性(Consistency):執行事務前後,數據保持一致,例如轉賬業務中,無論事務是否成功,轉賬者和收款人 ...
  • GreatSQL 的刷新鎖 前言 因為運維小伙伴執行dump備份命令,導致資料庫卡住,很多會話都在waiting for table flush,基於這一故障,我對GreatSQL的刷新鎖進行了研究。感興趣的小伙伴請隨我一探究竟吧。 刷新鎖的癥狀 刷新鎖問題的主要癥狀是資料庫會進入嘎然而止的狀態,所 ...
  • 經過實測:1.09億的數據量進行中文檢索。ElasticSearch單機的檢索性能在0.005~5.6秒之間,此檢索速度可滿足95%的業務場景(註意:每條ES文檔平均65個漢字,數據源取自幾千本小說,大部分文檔在15~300個漢字之間,不然字數太多索引太大電腦存不下)。 前置文章 由於本文章的前置操 ...
  • 如何讓SQL Server像MySQL一樣擁有慢查詢日誌(Slow Query Log慢日誌) SQL Server一直以來被人詬病的一個問題是缺少了像MySQL的慢日誌功能,程式員和運維無法知道資料庫過去歷史的慢查詢語句。 因為SQLServer預設是不捕獲過去歷史的長時間阻塞的SQL語句,導致大 ...
  • “10000條”問題(個人稱謂) 癥狀: 在數據量不大的情況下,可能還會使用from + size的傳統分頁方式,但是數量受限,只能取前10000條的數據。 緣由:ES限值10000條,是ES團隊挑選一個不大不小的數作為閾值,為了避免深度分頁的策略。 調整:max_result_window 用於控 ...
  • 解鎖 SQL Server 2022的時間序列數據功能 SQL Server2022在處理時間序列數據時,SQL Server 提供了一些優化和功能,比如 DATE_BUCKET 函數、視窗函數(如 FIRST_VALUE 和 LAST_VALUE)以及其他時間日期函數,以便更高效地處理時間序列數據 ...
  • 寫在前面 大家好,不知道前面的20題大家寫的怎麼樣,前面分享的20題是SQL中查詢的基礎題型,這部分被稱為DQL部分,是每個學習MySQL必須要學會的部分,下麵就讓我來介紹MySQL中的其他部分。 回顧DQL部分 先介紹一下sql語句的語法和執行順序(序號代表順序由1~9): select 查詢列表 ...
  • DML(數據定義語言) 插入語句 方式一:經典的插入語句 * 語法: insert into 表名(列名,...) values(值1,...); 方式二: 語法: insert into 表名 set 列名=值,列名=值,...... 方式一和方式二對比: 方式一支持插入多行,方式二不支持; 方式 ...
一周排行
    -Advertisement-
    Play Games
  • 移動開發(一):使用.NET MAUI開發第一個安卓APP 對於工作多年的C#程式員來說,近來想嘗試開發一款安卓APP,考慮了很久最終選擇使用.NET MAUI這個微軟官方的框架來嘗試體驗開發安卓APP,畢竟是使用Visual Studio開發工具,使用起來也比較的順手,結合微軟官方的教程進行了安卓 ...
  • 前言 QuestPDF 是一個開源 .NET 庫,用於生成 PDF 文檔。使用了C# Fluent API方式可簡化開發、減少錯誤並提高工作效率。利用它可以輕鬆生成 PDF 報告、發票、導出文件等。 項目介紹 QuestPDF 是一個革命性的開源 .NET 庫,它徹底改變了我們生成 PDF 文檔的方 ...
  • 項目地址 項目後端地址: https://github.com/ZyPLJ/ZYTteeHole 項目前端頁面地址: ZyPLJ/TreeHoleVue (github.com) https://github.com/ZyPLJ/TreeHoleVue 目前項目測試訪問地址: http://tree ...
  • 話不多說,直接開乾 一.下載 1.官方鏈接下載: https://www.microsoft.com/zh-cn/sql-server/sql-server-downloads 2.在下載目錄中找到下麵這個小的安裝包 SQL2022-SSEI-Dev.exe,運行開始下載SQL server; 二. ...
  • 前言 隨著物聯網(IoT)技術的迅猛發展,MQTT(消息隊列遙測傳輸)協議憑藉其輕量級和高效性,已成為眾多物聯網應用的首選通信標準。 MQTTnet 作為一個高性能的 .NET 開源庫,為 .NET 平臺上的 MQTT 客戶端與伺服器開發提供了強大的支持。 本文將全面介紹 MQTTnet 的核心功能 ...
  • Serilog支持多種接收器用於日誌存儲,增強器用於添加屬性,LogContext管理動態屬性,支持多種輸出格式包括純文本、JSON及ExpressionTemplate。還提供了自定義格式化選項,適用於不同需求。 ...
  • 目錄簡介獲取 HTML 文檔解析 HTML 文檔測試參考文章 簡介 動態內容網站使用 JavaScript 腳本動態檢索和渲染數據,爬取信息時需要模擬瀏覽器行為,否則獲取到的源碼基本是空的。 本文使用的爬取步驟如下: 使用 Selenium 獲取渲染後的 HTML 文檔 使用 HtmlAgility ...
  • 1.前言 什麼是熱更新 游戲或者軟體更新時,無需重新下載客戶端進行安裝,而是在應用程式啟動的情況下,在內部進行資源或者代碼更新 Unity目前常用熱更新解決方案 HybridCLR,Xlua,ILRuntime等 Unity目前常用資源管理解決方案 AssetBundles,Addressable, ...
  • 本文章主要是在C# ASP.NET Core Web API框架實現向手機發送驗證碼簡訊功能。這裡我選擇是一個互億無線簡訊驗證碼平臺,其實像阿裡雲,騰訊雲上面也可以。 首先我們先去 互億無線 https://www.ihuyi.com/api/sms.html 去註冊一個賬號 註冊完成賬號後,它會送 ...
  • 通過以下方式可以高效,並保證數據同步的可靠性 1.API設計 使用RESTful設計,確保API端點明確,並使用適當的HTTP方法(如POST用於創建,PUT用於更新)。 設計清晰的請求和響應模型,以確保客戶端能夠理解預期格式。 2.數據驗證 在伺服器端進行嚴格的數據驗證,確保接收到的數據符合預期格 ...