如果你處理過大量數(shù)據(jù),你也許聽說過“數(shù)據(jù)治理”一詞,你可能會想,它是什么?適不適合你?如何實施?簡單來說,數(shù)據(jù)治理就是處理數(shù)據(jù)的策略——如何存儲、訪問、驗證、保護和使用數(shù)據(jù)。數(shù)據(jù)治理包括制定獲取方案:誰能訪問、使用和共享你的數(shù)據(jù)。
這些問題正變得越來越重要,因為企業(yè)依靠收集、存儲和分析大量數(shù)據(jù),來達成業(yè)務目標。數(shù)據(jù)變成了企業(yè)的盈利工具、業(yè)務媒介和商業(yè)機密。數(shù)據(jù)泄露會導致法律糾紛,還會令消費者對公司的核心業(yè)務失去信心。
如果心存僥幸,全憑各個部門自行處理數(shù)據(jù),那么你將缺乏統(tǒng)一管理數(shù)據(jù)的策略,也許會讓各個部門制定自己的策略。這是無法想象的,就像是缺乏管理實物庫存的策略,允許各個實體部門隨心所欲地生產(chǎn)、儲存和銷售產(chǎn)品一樣。數(shù)據(jù)使用不當就像庫存使用不當一樣,會給企業(yè)造成數(shù)百萬美元的損失,因此必須制定策略,使數(shù)據(jù)具有一致性和安全性,并隨時可用。這些應用于數(shù)據(jù)領域的策略就構(gòu)成了數(shù)據(jù)治理。
數(shù)據(jù)治理的特點
數(shù)據(jù)治理策略必須涵蓋數(shù)據(jù)的整個生命周期,從數(shù)據(jù)收集一直到數(shù)據(jù)管護。在這個生命周期中,數(shù)據(jù)治理必須解決以下問題:
· 從哪里獲取數(shù)據(jù)以及如何獲取,這是數(shù)據(jù)生命周期的起點。數(shù)據(jù)來源決定了數(shù)據(jù)治理策略的基礎。例如,數(shù)據(jù)來源所決定的一個重要因素是數(shù)據(jù)集的大小。是從目標市場、現(xiàn)有客戶和社交媒體收集數(shù)據(jù)?還是使用外部供應商收集數(shù)據(jù)或者分析你收集的數(shù)據(jù)?輸入數(shù)據(jù)流是什么?數(shù)據(jù)治理必須著眼于這些問題,制定策略來管理數(shù)據(jù)的采集,引導外部供應商處理他們收集的數(shù)據(jù)或者分析你收集的數(shù)據(jù),控制數(shù)據(jù)的路徑和生命周期。
· 驗證數(shù)據(jù),尤其是驗證多來源數(shù)據(jù),這是一個讓數(shù)據(jù)管理者十分頭疼的問題。區(qū)分重要數(shù)據(jù)和噪聲數(shù)據(jù)只是這個問題的開始。如果你是從附屬企業(yè)收集數(shù)據(jù),你必須確保數(shù)據(jù)是可靠的。如果你是從社交媒體網(wǎng)站收集數(shù)據(jù),在你的策略中,必須有一種驗證重要數(shù)據(jù)的方法。任何情況下,你都必須確保收集的數(shù)據(jù)是合法的,并且沒有被篡改——這個問題在并行計算環(huán)境中尤其令人擔心,因為并行計算常常被用來收集大量數(shù)據(jù),這往往會使用云服務,故而增加了安全隱患。
· 數(shù)據(jù)治理策略必須解決存儲問題,而存儲方案在很大程度上取決于數(shù)據(jù)集的大小。以PB計的大數(shù)據(jù)必須存儲在安全的冗余系統(tǒng)中,常常利用層次體系,根據(jù)使用頻率來提供數(shù)據(jù)。這樣一來,昂貴的在線系統(tǒng)提供的是被頻繁請求的數(shù)據(jù),而請求頻率較低的數(shù)據(jù)則存儲在不那么昂貴、可用率較低的系統(tǒng)上。不幸的是,這些優(yōu)先級較低的系統(tǒng)也可能安全性較低,從而允許訪問敏感但請求頻率低的數(shù)據(jù)。因此,在制定數(shù)據(jù)存儲方案時,良好的數(shù)據(jù)治理策略必須考慮到方方面面的因素。
· 數(shù)據(jù)治理必須制定訪問控制策略,在需求和安全之間找到平衡。要讓那些需要數(shù)據(jù)來完成工作的人,可以在必要時無障礙地訪問數(shù)據(jù)。出于安全原因,他們能夠訪問的數(shù)據(jù)不應該超出他們的權(quán)限。數(shù)據(jù)應該在請求合法的前提下,才能被訪問,但出于安全原因,對敏感數(shù)據(jù)應該加大訪問難度,只向具有特定安全級別的用戶開放。應該對用戶和數(shù)據(jù)本身設置訪問級別,管理賬戶時,應與人力資源部和采購部緊密互動,這一點非常重要,因為這樣可以及時地使離職員工和停止合作的供應商不再擁有訪問權(quán)限。處理好這些細節(jié)以及確保數(shù)據(jù)所有權(quán)和責任,這是構(gòu)成完整的數(shù)據(jù)治理策略的一部分。
· 使用/共享/分析。數(shù)據(jù)如何被使用是數(shù)據(jù)治理策略至關重要的一部分。潛在用途包括,使用數(shù)據(jù)來管理賬戶,改善客戶體驗,投放定向廣告,提供市場分析,與附屬企業(yè)共享數(shù)據(jù)。必須仔細界定哪些數(shù)據(jù)可用于共享或者用于營銷,并保護它們免遭攻擊和泄露,因為數(shù)據(jù)本來就應該被用于純粹的內(nèi)部用途。要讓客戶知道,收集數(shù)據(jù)的所有公司都必須遵守數(shù)據(jù)使用和共享方面的規(guī)定。能夠確保數(shù)據(jù)使用合規(guī),這是擁有數(shù)據(jù)治理策略的另一個重要好處。
· 收集、驗證、存儲、訪問和使用都是安全計劃的必要組成部分,必須有一個全面的策略來解決這些問題以及其他安全問題。