【Elasticsearch 7 探索之路】（三）倒排索引

-Advertisement-

上一篇，我們介紹了 ES 文檔的基本 CURE 和批量操作。我們都知道倒排索引是搜索引擎非常重要的一種數據結構，什麼是倒排索引，倒排索引的原理是什麼。 1 索引過程在講解倒排索引前，我們先瞭解索引創建，下圖是 Elasticsearch 中數據索引過程的流程。從上圖可以看到，文檔未在 ES 中進 ...

上一篇，我們介紹了 ES 文檔的基本 CURE 和批量操作。我們都知道倒排索引是搜索引擎非常重要的一種數據結構，什麼是倒排索引，倒排索引的原理是什麼。

1 索引過程

在講解倒排索引前，我們先瞭解索引創建，下圖是 Elasticsearch 中數據索引過程的流程。

從上圖可以看到，文檔未在 ES 中進行索引，而是由 Analyzer 組件對其執行一些操作並將其拆分為 token/term。然後將這些術語作為倒排索引存儲在磁碟中。假設我們有兩個名為 name 和 age 欄位，當要將文檔索引到 ES 時，Analyzers 組件以某些定界符（有預設定界符，例如空格，句號等）將它們分割開獲取 token，再對每個 token 應用特定的過濾器。經過分析的這些標記稱為 term。然後將這些 term 針對該欄位）存儲在倒排列表中。

2 倒排索引

2.1 正排與倒排索引

一般在我們閱讀圖書，我們會根據目錄快速定位想要閱讀的章節，過了一段時間，你想要的回顧之前某一個知識點，你發現從目錄難以查找到對應的地方，這時你可能就會從索引頁從去查找對應內容索引，從而找到頁碼。

搜索引擎其實跟我們的使用圖書很相似，下麵我來對圖書和搜索引擎進行一個簡單的類比，來看一下搜素引擎中正排和倒排索引。

圖書
- 正排索引-目錄頁
- 倒排索引-索引頁
搜索引擎
- 正排索引-文檔 Id 到文檔內容和單詞的關聯
- 倒排索引-單詞到文檔 Id 的關係

2.2 倒排索引的核心組成

舉個例子，假設我們有 3 個文檔：

Doc 1:breakthrough drug for schizophrenia

Doc 2:new schizophrenia drug 

Doc 3:new approach for treatment of schizophrenia

經過分析，文件中的術語如下

文檔	分詞結果
Doc 1	breakthrough,drug,for,schizophrenia
Doc 2	new,schizophrenia,drug
Doc 3	new,approach,for,treatment,of

倒排列表的元數據結構：

(DocID;TF;<POS>)

其中：

DocID：出現某單詞的文檔ID
TF(詞頻)：單詞在該文檔中出現的次數
POS：單詞在文檔中的位置

則它們生成的倒排索引

單詞	逆向文檔頻率	倒排列表(DocID;TF;))
breakthrough	1	(1;1;<1>)
drug	2	(1;1;<2>),(2;1;<3>)
for	2	(1;1;<3>),(3;1;<3>)
schizophrenia	2	(1;1;<4>),(2;1;<2>)
new	2	(2;1;<1>),(3;1;<1>)
approach	1	(3;1;<2>)
treatment	1	(3;1;<4>)
of	1	(3;1;<5>)

ES 倒排索引包含兩個部分
- 單詞詞典（Term Dictionary)，索引最小單位，記錄所有文檔的單詞，記錄單詞到倒排列表的關聯關係
  - 單詞詞典一般都會非常多，通過 B+ 樹或 Hash 表方式以滿足高性能的插入與查詢
- 倒排列表（Posting List)-由倒排索引項（Posting）組成
  - 文檔 ID
  - 詞頻 TF，該單詞在文檔中出現的次數，用於相關性評分
  - 位置（Position)，單詞在文檔中分詞的位置。用於語句搜索（phrase query)
  - 偏移（Offset)，記錄單詞的開始結束位置，實現高亮顯示

ES 也可以指定對某些欄位不做索引

優點：節省存儲空間
缺點：欄位無法被搜索

3 總結

在之前文章說了 ES 的文檔是基於 JSON 格式，在我們創建索引的時候，對每一個文檔記錄對應索引相關的信息。在對倒排索引進行搜索時，查詢單詞是否在單詞字典，獲取單詞在倒排列表的指針，獲取有該單詞單詞的文檔 Id 列表，通過 ES 的倒排索引，我們輕易對全文進行快速搜素。

您的分享是我們最大的動力!

-Advertisement-

更多相關文章

強制刪除文件（夾）的方法

強制刪除文件（夾）的方法，不問原理，簡單粗暴！在桌面右鍵新建一個.txt文件，不妨命名為del.txt,把下麵兩行代碼複製進去，保存，關閉。 DEL /F /A /Q \\?\%1 RD /S /Q \\?\%1 將del.txt另存為del.bat（註意：新的尾碼是.bat）。最後，把想要刪除 ...
VMware Tools安裝方法

安裝VMware Tools的步驟點擊【虛擬機】選項中的【安裝VMware Tools】，此時在Ubuntu的桌面上就會出現一個光碟圖標。如果之前已經安裝過了，【虛擬機】選項中應為【重新安裝VMware Tools】。如果【重新安裝VMware Tools】選項是灰色的，則需要點擊【虛擬機】選 ...
讓Windows的文件名區分大小寫

背景最近在Linux官網下載了Linux內核，下載下來的是一個尾碼為.tar.xz的壓縮包，於是在毫不知情的情況下隨隨便便解壓了，解壓過程中出現了很多問題。其中一個問題就是在Windows下，不區分大小寫的文件名，但是在Ubuntu下就可以區分。比如，abc.txt和ABC.txt會被認為是同一 ...
arm-linux-gcc-5.4.0安裝方法

首先需要下載arm linux gcc的安裝包這裡提供一個5.4.0版本的安裝包，如有需要自行下載。下載鏈接：https://pan.baidu.com/s/1prpdmVNWBFzg79OXQsyt6A 提取碼：fH20 安裝步驟獲得最高許可權以便能在/usr文件夾下進行操作 sudo su ...
debian 10 安裝fcitx 後設置

設置好代理後 apt-get install fcitx 後仍然看不到語言欄可能是在設置fcitx時的字體太小了輸入法配置 ->外觀->字體加大即可 ...
fuse3 編譯相關簡要記錄於 fuse3 系統調優

下麵是在使用fuse3 編譯bbfs 過程中一些參數，用於備忘： FUSE_CFLAGS="-I/usr/local/include/fuse3" FUSE_LIBS="-L/usr/local/lib/x86_64-linux-gnu -lfuse3 -lpthread -ldl" ./confi ...
理解Spark SQL(一）—— CLI和ThriftServer

Spark SQL主要提供了兩個工具來訪問hive中的數據，即CLI和ThriftServer。前提是需要Spark支持Hive，即編譯Spark時需要帶上hive和hive-thriftserver選項，同時需要確保在$SPARK_HOME/conf目錄下有hive-site.xml配置文件（可以 ...
sqlserver實現分隔字元串

sqlserver 使用函數實現分隔字元串 create function dbo.fn_split ( @str_source nvarchar(max), @split_char nvarchar(100) ) returns @temp table ( id int primary key i ...