卡里姆 科夏瓦杰是多倫多的一名醫(yī)生和網(wǎng)絡(luò)健康顧問(wèn),他要從500名醫(yī)生那里反饋的海量數(shù)據(jù)中總結(jié)出怎樣才能更好地治療病人。但是眾所周知,醫(yī)生的“書(shū)法”本來(lái)就堪比天書(shū),要想讓電腦識(shí)別出其中的拼寫(xiě)錯(cuò)誤和縮寫(xiě)更是難于登天。
比如科夏瓦杰指出:“患者是否吸煙是個(gè)很重要的信息。如果你直接閱讀病歷,你馬上就能明白醫(yī)生是什么意思。但是要想讓電腦去理解它,那就只能祝你好運(yùn)了。雖然你也可以在電腦上設(shè)置‘從不吸煙’或‘吸煙=0’的選項(xiàng)。但是一個(gè)患者每天吸多少支煙?這幾乎是電腦不可能搞明白的問(wèn)題。
由于宣傳報(bào)道把大數(shù)據(jù)吹得神乎其神,因此很多人可能覺(jué)得大數(shù)據(jù)用起來(lái)特別簡(jiǎn)單:只要把相當(dāng)于一整個(gè)圖書(shū)館的信息插到電腦上,然后就可以坐在一邊,等著電腦給出精辟見(jiàn)解,告訴你如何提高自動(dòng)生產(chǎn)線的生產(chǎn)效率,如何讓網(wǎng)購(gòu)者在網(wǎng)上購(gòu)買(mǎi)更多的運(yùn)動(dòng)鞋,或是如何治療癌癥。但事實(shí)遠(yuǎn)遠(yuǎn)比想象復(fù)雜得多。由于信息會(huì)過(guò)時(shí)、不準(zhǔn)確和缺失,因此數(shù)據(jù)不可避免地也有“不干凈”的時(shí)候。如何把數(shù)據(jù)變“干凈”是一個(gè)越來(lái)越重要但又經(jīng)常被人忽略的工作,但它可以防止你犯下代價(jià)高昂的錯(cuò)誤。
雖然科技一直都在進(jìn)步,但是人們?cè)趦艋瘮?shù)據(jù)上能想到的法子并不多。即便是處理一些相對(duì)較“干凈”的數(shù)據(jù),要想獲得有用的結(jié)果往往也是件費(fèi)時(shí)費(fèi)力的事情。
博思艾倫咨詢公司(Booz Allen)副總裁約什 沙利文說(shuō):“我對(duì)我的客戶說(shuō),這是個(gè)混亂骯臟的世界,沒(méi)有完全干凈的數(shù)據(jù)集。”
數(shù)據(jù)分析師一般喜歡先尋找非常態(tài)的信息。由于數(shù)據(jù)量太巨大,他們一般都會(huì)把篩選數(shù)據(jù)的工作交給軟件來(lái)完成,來(lái)尋找是否有些反常的東西需要進(jìn)一步檢查。隨著時(shí)間的推移,電腦篩選數(shù)據(jù)的精確性也會(huì)提高。通過(guò)對(duì)類(lèi)似案例進(jìn)行分類(lèi),它們也會(huì)更好地了解一些詞語(yǔ)和句子的含義,然后提高篩選的精確性。
沙利文說(shuō):“這種方法簡(jiǎn)單直接,但‘訓(xùn)練’你的模型可以需要一周又一周的時(shí)間。”
有些公司也提供了用來(lái)凈化數(shù)據(jù)的軟件和服務(wù),其中既包括像IBM和SAP一樣的科技巨頭,也包括Cloudera和Talend開(kāi)放工作室從事等大數(shù)據(jù)和分析的專門(mén)機(jī)構(gòu)。一大批創(chuàng)業(yè)公司也想爭(zhēng)當(dāng)大數(shù)據(jù)的看門(mén)人,其中有代表性的包括Trifacta、Tamr和Paxata等。
由于“不干凈”的數(shù)據(jù)太多,醫(yī)療業(yè)被認(rèn)為是大數(shù)據(jù)技術(shù)最難搞定的行業(yè)之一。雖然隨著電子病歷的普及,將醫(yī)療信息輸入電腦的難度已經(jīng)變得越來(lái)越低,但是研究人員、制藥公司和醫(yī)療業(yè)分析人士要想把他們需要的數(shù)據(jù)盡情地拿來(lái)分析,在數(shù)據(jù)上要提高的地方還有很多。
健康數(shù)據(jù)咨詢公司InfoClin的醫(yī)生兼CEO科夏瓦杰花了很多時(shí)間,希望數(shù)以萬(wàn)計(jì)的電子醫(yī)療病歷中篩選有用的數(shù)據(jù),以提高對(duì)病人的診療水平。但他們?cè)诤Y選的過(guò)程中卻不斷遇到阻礙。
很多醫(yī)生在病歷中沒(méi)有記錄病人的血壓,這個(gè)問(wèn)題是無(wú)論哪種數(shù)據(jù)凈化方法都修復(fù)不了的。光憑借現(xiàn)有病歷的信息去判斷病人得了什么病對(duì)電腦來(lái)說(shuō)就已經(jīng)是一項(xiàng)極其困難的任務(wù)。醫(yī)生在輸入糖尿病編號(hào)的時(shí)候,可能忘了清楚地標(biāo)注究竟是患者本人得了糖尿病,還是他的某個(gè)家人得了糖尿病。又或許他們光是輸入了“胰島素”三個(gè)字,而沒(méi)有提到患者得了什么病,因?yàn)檫@對(duì)他們來(lái)說(shuō)是再明顯不過(guò)的事情。
醫(yī)生用來(lái)診斷、開(kāi)藥和填寫(xiě)病人基本信息時(shí)會(huì)大量用到一套獨(dú)特的速記字體。即使讓人類(lèi)來(lái)破解它也要大為頭痛,而對(duì)于電腦基本上是不可能完成的任務(wù)。比如科夏瓦杰提到有個(gè)醫(yī)生在病歷中寫(xiě)下“gpa”三個(gè)字母,讓他百思不得其解。好在他發(fā)現(xiàn)后面不遠(yuǎn)處又寫(xiě)著“gma”三字,他才恍然大悟——原來(lái)它們是爺爺(grandpa)和奶奶(grandma)的縮寫(xiě)。
科夏瓦杰說(shuō):“我花了好半天才明白它們到底是什么意思。”
科夏瓦杰認(rèn)為,解決數(shù)據(jù)“不干凈”的終極方法之一是要給病歷制定一套“數(shù)據(jù)紀(jì)律”。要訓(xùn)練醫(yī)生養(yǎng)成正確錄入信息的習(xí)慣,這樣事后凈化數(shù)據(jù)時(shí)才不至于亂得一團(tuán)糟。科夏瓦杰表示,谷歌有一個(gè)很有用的工具,可以在用戶進(jìn)行輸入時(shí)告訴他們?nèi)绾纹磳?xiě)生僻字,這樣的工具完全可以添加到電子病歷工具中。電腦雖然可以挑出拼寫(xiě)錯(cuò)誤,但是讓醫(yī)生摒棄不良習(xí)慣才是朝著正確的方向邁出了一步。