大數(shù)據(jù)時(shí)代,審核數(shù)據(jù)的真實(shí)性也有了更有效的手段。大數(shù)據(jù)的特征之一是多樣性,不同來源、不同維度的數(shù)據(jù)之間存在一定的關(guān)聯(lián)度,可以交叉驗(yàn)證。例如,某地的工業(yè)產(chǎn)值虛報(bào)了一倍,但用電量和能耗卻沒有達(dá)到相應(yīng)的規(guī)模。這就是數(shù)據(jù)異常,很容易被系統(tǒng)識別出來。發(fā)現(xiàn)異常后,相關(guān)部門再進(jìn)行復(fù)核,就能更有針對性地防止、打擊數(shù)據(jù)造假。
數(shù)據(jù)是一種資源,但數(shù)據(jù)又跟煤、石油等物質(zhì)性資源不一樣。物質(zhì)性資源不可再生,你用多了,別人就用少了,因而很難共享。數(shù)據(jù)可以重復(fù)使用、不斷產(chǎn)生新的價(jià)值。大數(shù)據(jù)資源的使用是非惡性競爭的,共享的前提下,更能夠制造雙贏。從另一個(gè)角度來說,數(shù)據(jù)如果不被融合、聯(lián)系在一起,也不能稱之為大數(shù)據(jù)。
大數(shù)據(jù)不能被直接拿來使用,統(tǒng)計(jì)學(xué)依然是數(shù)據(jù)分析的靈魂
現(xiàn)在社會上有一種流行的說法,認(rèn)為在大數(shù)據(jù)時(shí)代,“樣本=全體”,人們得到的不是抽樣數(shù)據(jù)而是全數(shù)據(jù),因而只需要簡單地?cái)?shù)一數(shù)就可以下結(jié)論了,復(fù)雜的統(tǒng)計(jì)學(xué)方法可以不再需要了。
在我看來,這種觀點(diǎn)非常錯(cuò)誤。首先,大數(shù)據(jù)告知信息但不解釋信息。打個(gè)比方說,大數(shù)據(jù)是“原油”而不是“汽油”,不能被直接拿來使用。就像股票市場,即使把所有的數(shù)據(jù)都公布出來,不懂的人依然不知道數(shù)據(jù)代表的信息。大數(shù)據(jù)時(shí)代,統(tǒng)計(jì)學(xué)依然是數(shù)據(jù)分析的靈魂。正如加州大學(xué)伯克利分校邁克爾·喬丹教授指出的,“沒有系統(tǒng)的數(shù)據(jù)科學(xué)作為指導(dǎo)的大數(shù)據(jù)研究,就如同不利用工程科學(xué)的知識來建造橋梁,很多橋梁可能會坍塌,并帶來嚴(yán)重的后果。”
其次,全數(shù)據(jù)的概念本身很難經(jīng)得起推敲。全數(shù)據(jù),顧名思義就是全部數(shù)據(jù)。這在某些特定的場合對于某些特定的問題確實(shí)可能實(shí)現(xiàn)。比如,要比較清華、北大兩校同學(xué)數(shù)學(xué)能力整體上哪個(gè)更強(qiáng),可以收集到兩校同學(xué)高考時(shí)的數(shù)學(xué)成績作為研究的數(shù)據(jù)對象。從某種意義上說,這是全數(shù)據(jù)。但是,并不是說我們有了這個(gè)全數(shù)據(jù)就能很好地回答問題。
一方面,這個(gè)數(shù)據(jù)雖然是全數(shù)據(jù),但仍然具有不確定性。入校時(shí)的數(shù)學(xué)成績并不一定完全代表學(xué)生的數(shù)學(xué)能力。假如讓所有同學(xué)重新參加一次高考,幾乎每個(gè)同學(xué)都會有一個(gè)新的成績。分別用這兩組全數(shù)據(jù)去做分析,結(jié)論就可能發(fā)生變化。另一方面,事物在不斷地發(fā)展和變化,同學(xué)入校時(shí)的成績并不能夠代表現(xiàn)在的能力。全體同學(xué)的高考成績數(shù)據(jù),僅對于那次考試而言是全數(shù)據(jù)。“全”是有邊界的,超出了邊界就不再是全知全能了。事物的發(fā)展充滿了不確定性,而統(tǒng)計(jì)學(xué),既研究如何從數(shù)據(jù)中把信息和規(guī)律提取出來,找出最優(yōu)化的方案;也研究如何把數(shù)據(jù)當(dāng)中的不確定性量化出來。
所以說,在大數(shù)據(jù)時(shí)代,數(shù)據(jù)分析的很多根本性問題和小數(shù)據(jù)時(shí)代并沒有本質(zhì)區(qū)別。當(dāng)然,大數(shù)據(jù)的特點(diǎn),確實(shí)對數(shù)據(jù)分析提出了全新挑戰(zhàn)。例如,許多傳統(tǒng)統(tǒng)計(jì)方法應(yīng)用到大數(shù)據(jù)上,巨大計(jì)算量和存儲量往往使其難以承受;對結(jié)構(gòu)復(fù)雜、來源多樣的數(shù)據(jù),如何建立有效的統(tǒng)計(jì)學(xué)模型也需要新的探索和嘗試。對于新時(shí)代的數(shù)據(jù)科學(xué)而言,這些挑戰(zhàn)也同時(shí)意味著巨大的機(jī)遇,有可能會產(chǎn)生新的思想、方法和技術(shù)。