數據倉庫(12)數據治理之數倉數據管理實踐心得

来源:https://www.cnblogs.com/the-pig-of-zf/archive/2022/05/11/16259912.html
-Advertisement-
Play Games

這邊文章聊聊自己對數據治理開發實踐的一些思路,就是聊聊怎麼開始去做數據治理這件事情。說起數據治理,有時候雖然看了很多文章,看了很多的介紹,瞭解數據治理的理論,但是實際上需要我們去搞的時候,就會踩很多的坑。這裡記一下自己做數據治理的一些思路,做做筆記,也分享給需要的同學。 當然,想要做數據治理,想要學 ...


這邊文章聊聊自己對數據治理開發實踐的一些思路,就是聊聊怎麼開始去做數據治理這件事情。說起數據治理,有時候雖然看了很多文章,看了很多的介紹,瞭解數據治理的理論,但是實際上需要我們去搞的時候,就會踩很多的坑。這裡記一下自己做數據治理的一些思路,做做筆記,也分享給需要的同學。

當然,想要做數據治理,想要學習瞭解,一下數據治理的範圍,理論等,最好可以看看別人怎麼做的,瞭解數據治理可以參考:數據倉庫(11)什麼是大數據治理,數據治理的範圍是哪些

那接下來就繼續說說數據治理的一些思路心得。

接到數據治理的任務?要怎麼做?

  • 梳理目前數據集群,以及業務的總體情況

這個,其實沒有什麼好說,做事情之前,肯定是要先瞭解,我們要做的東西是怎麼樣的,評估可能會遇到的問題,這樣才能進一步做出來好的數據質量方案。

  • 對數據治理進行分類

瞭解了我們面對的數據集群之後,就要瞭解對我們需要治理的方向,進行分類了,這個對我們後續的方案設計和組件的選取、改造會有很大的影響,不一樣的分類,我們要解決問題的範圍,是不一樣的。

那要怎麼分類?首先是大的方向。

  1. 主數據管理
  2. 元數據管理
  3. 數據標準
  4. 數據質量管理
  5. 數據安全管理
  6. 數據計算管理
  7. 數據存儲管理

大的方向確定了,當其實還是太大了,還是需要進一步的進行切割。

像是數據質量管理,可以進一步切分為

1 唯一性校驗:不存在無意義的重覆數據
2 完整性校驗:數據完整且連續
3 一致性校驗:數據在多數據源中意義一致
4 有效性校驗:這裡主要指數據在分析的時間點是有效,而非過期或失效數據
5 準確性校驗:數據合理、準確,並符合數據類型的標準

元數據管理,要劃分為技術元數據和業務元數據等,具體的劃分粒度,應該需要到具體的,可實現的,不容易混淆,以及偏於以後數據的管理和使用。畢竟這個東西後續要給開發,給數據bi等人使用的。當然,我們可能不能已下載就劃分好一個最好的分類,我們應該迴圈迭代,做出一個更加符合實際出來。

數據管理這個,如果說技術能力,開發人力有限,那其實往往更加簡單的方式更好,也便於推廣,應該說一個可用的方案好過於一個全面,但用起來不方便的方案。

  • 針對某個類別的數據,進行具體設計,開發,併進一步成規範

上面,我們已經大概梳理好了我們數據治理的範圍和分類,進一步的,我們就需要落地了。這個時候,我們就要進一步的針對,我們的劃分的問題,提出,我們的方案,並實現他。

如果,上面說的數據質量管理中的準確性校驗,這個時候,我們就面臨了一個問題,怎麼樣的數據,符合數據合理、準確,並符合數據類型的標準這樣的數據規範?我們會怎麼去驗證這個東西呢?正常情況下,開發人員是怎麼去驗證這個東西的?

所以,這個時候,我們就需要抽象出這些具體的操作,拼通過合適的方案實現他。

如果,準確性校驗,開發人員一般是通過寫sql,通過一定的數據規則判斷的,比如數據的波動,數據值的範圍等。那麼我們做這個的時候,是不是就可以做這樣的一個系統,可以配置sql,或者一些比較通過的邏輯,定時比對數據,得到我們的一個結果,實現這樣的一個功能?當然這個肯定不是最好的方案,但是一個可用的方案好過於一個全面,但用起來不方便的方案。然後不停的迭代優化,完善。

當然,這個時候也要放過來思考我們上面的劃分是不是,合理,比如數據質量管理,是不是可以使用同一個思路去做?爭取事半功倍。

  • 執行規範

做好上面的事情,接下來,就是考驗執行了的時候了,任何方案在,最終如果不能很好的執行,那就是事倍功半。

啰里啰唆,寫了這一點點心得,邏輯可能不是很通暢,希望可以給到各個在數據治理掙扎的同學,一點思路,這個也是我的個人筆記,後續有新的想法,再更新。

參考資料:數據倉庫(12)數據治理之數倉數據管理實踐心得

本文來自博客園,作者:張飛的豬,轉載請註明原文鏈接:https://www.cnblogs.com/the-pig-of-zf/p/16259912.html


您的分享是我們最大的動力!

-Advertisement-
Play Games
更多相關文章
  • rpm資源包下載 在一些內網或區域網環境中,無法通過 yum install xxx 進行程式包的下載安裝。 需要從具有外網環境的電腦上下載離線程式包,拷貝至內網環境中手動安裝。 方法一:使用 yum 下載 yum --downloadonly --downloaddir=/home/package ...
  • 1.第一個shell vi first.sh !/bin/bash 作者:Arya 編寫時間:2022-04-22 功能:this is my first blog! echo "this is my first shell!" 2.crond服務 以守護進程方式在無需人工干預的情況下來處理著一系列 ...
  • https://www.cnblogs.com/yeungchie/ XFCE是一款輕量級 Linux 桌面,當前版本已經將所有部件從 GTK2 更新到 GTK3,從D-Dbus Glib更新到GDBus,大部分組件支持Object Introspection(簡稱 GI,用於產生與解析 C 程式庫 ...
  • 為什麼要使用Docusaurus Docusaurus 是 Facebook 專門為開源項目開發者提供的一款易於維護的靜態網站創建工具,使用 Markdown 即可更新網站。構建一個帶有主頁、文檔、API、幫助以及博客頁面的靜態網站,只需5分鐘。 Docusaurus 是一個靜態站點生成器。它構建了 ...
  • cat命令詳解 用法 功能 cat filename 獲取文件內容 cat file1 file2 > newfile 將file2的內容追加到file1,生成新文件newfile,但不會刪除原文件 cat > file 創建並編輯file,若file存在,則原文件內容被覆蓋, 按ctrl c 或者 ...
  • 鏡像下載、功能變數名稱解析、時間同步請點擊 阿裡雲開源鏡像站 第一次在Linux雲伺服器上部署前後端分離項目,查了很多資料和視頻,踩了許多坑。成功實現部署若依的前後端分離項目後,想記錄一下前後端部署的過程,供學習的小伙伴參考。 1.環境準備 一定要在開始前先準備好以下工具和環境(可以上網查找安裝的方法),後 ...
  • 引言 我們在定時任務中經常能接觸到cron表達式,但是在寫cron表達式的時候我們會遇到各種各樣版本的cron表達式,比如我遇到過5位、6位甚至7位的cron表達式,導致我一度搞混這些表達式。更嚴重的是,當我們沒有準確寫出cron表達式時,會出現定時任務一直沒有執行,或者定時任務執行太頻繁的糟糕情況 ...
  • 一、Flink中的狀態 官方文檔 有狀態的計算是流處理框架要實現的重要功能,因為稍複雜的流處理場景都需要記錄狀態,然後在新流入數據的基礎上不斷更新狀態。下麵的幾個場景都需要使用流處理的狀態功能: 數據流中的數據有重覆,想對重覆數據去重,需要記錄哪些數據已經流入過應用,當新數據流入時,根據已流入過的數 ...
一周排行
    -Advertisement-
    Play Games
  • 1、預覽地址:http://139.155.137.144:9012 2、qq群:801913255 一、前言 隨著網路的發展,企業對於信息系統數據的保密工作愈發重視,不同身份、角色對於數據的訪問許可權都應該大相徑庭。 列如 1、不同登錄人員對一個數據列表的可見度是不一樣的,如數據列、數據行、數據按鈕 ...
  • 前言 上一篇文章寫瞭如何使用RabbitMQ做個簡單的發送郵件項目,然後評論也是比較多,也是準備去學習一下如何確保RabbitMQ的消息可靠性,但是由於時間原因,先來說說設計模式中的簡單工廠模式吧! 在瞭解簡單工廠模式之前,我們要知道C#是一款面向對象的高級程式語言。它有3大特性,封裝、繼承、多態。 ...
  • Nodify學習 一:介紹與使用 - 可樂_加冰 - 博客園 (cnblogs.com) Nodify學習 二:添加節點 - 可樂_加冰 - 博客園 (cnblogs.com) 介紹 Nodify是一個WPF基於節點的編輯器控制項,其中包含一系列節點、連接和連接器組件,旨在簡化構建基於節點的工具的過程 ...
  • 創建一個webapi項目做測試使用。 創建新控制器,搭建一個基礎框架,包括獲取當天日期、wiki的請求地址等 創建一個Http請求幫助類以及方法,用於獲取指定URL的信息 使用http請求訪問指定url,先運行一下,看看返回的內容。內容如圖右邊所示,實際上是一個Json數據。我們主要解析 大事記 部 ...
  • 最近在不少自媒體上看到有關.NET與C#的資訊與評價,感覺大家對.NET與C#還是不太瞭解,尤其是對2016年6月發佈的跨平臺.NET Core 1.0,更是知之甚少。在考慮一番之後,還是決定寫點東西總結一下,也回顧一下.NET的發展歷史。 首先,你沒看錯,.NET是跨平臺的,可以在Windows、 ...
  • Nodify學習 一:介紹與使用 - 可樂_加冰 - 博客園 (cnblogs.com) Nodify學習 二:添加節點 - 可樂_加冰 - 博客園 (cnblogs.com) 添加節點(nodes) 通過上一篇我們已經創建好了編輯器實例現在我們為編輯器添加一個節點 添加model和viewmode ...
  • 前言 資料庫併發,數據審計和軟刪除一直是數據持久化方面的經典問題。早些時候,這些工作需要手寫複雜的SQL或者通過存儲過程和觸發器實現。手寫複雜SQL對軟體可維護性構成了相當大的挑戰,隨著SQL字數的變多,用到的嵌套和複雜語法增加,可讀性和可維護性的難度是幾何級暴漲。因此如何在實現功能的同時控制這些S ...
  • 類型檢查和轉換:當你需要檢查對象是否為特定類型,並且希望在同一時間內將其轉換為那個類型時,模式匹配提供了一種更簡潔的方式來完成這一任務,避免了使用傳統的as和is操作符後還需要進行額外的null檢查。 複雜條件邏輯:在處理複雜的條件邏輯時,特別是涉及到多個條件和類型的情況下,使用模式匹配可以使代碼更 ...
  • 在日常開發中,我們經常需要和文件打交道,特別是桌面開發,有時候就會需要載入大批量的文件,而且可能還會存在部分文件缺失的情況,那麼如何才能快速的判斷文件是否存在呢?如果處理不當的,且文件數量比較多的時候,可能會造成卡頓等情況,進而影響程式的使用體驗。今天就以一個簡單的小例子,簡述兩種不同的判斷文件是否... ...
  • 前言 資料庫併發,數據審計和軟刪除一直是數據持久化方面的經典問題。早些時候,這些工作需要手寫複雜的SQL或者通過存儲過程和觸發器實現。手寫複雜SQL對軟體可維護性構成了相當大的挑戰,隨著SQL字數的變多,用到的嵌套和複雜語法增加,可讀性和可維護性的難度是幾何級暴漲。因此如何在實現功能的同時控制這些S ...