胡長(zhǎng)春 孫明鵬 胡飛
【摘要】在寫這篇文章之前,我們發(fā)現(xiàn)身邊很多IT人對(duì)于這些熱門的新技術(shù)趨之若鶩卻又很難說的明白清楚,如果問他大數(shù)據(jù)和你有什么關(guān)系?估計(jì)很少能說出一二三來(lái)。究其原因,一是因?yàn)榇蠹覍?duì)新技術(shù)有著相同的渴望,至少知其然在聊天時(shí)不會(huì)顯得很無(wú)知;二是在工作和生活環(huán)境中真正能參與實(shí)踐大數(shù)據(jù)的案例實(shí)在太少了,所以大家沒有必要花時(shí)間去知其所以然。
【關(guān)鍵詞】大數(shù)據(jù) ?結(jié)構(gòu)
一、大數(shù)據(jù)的結(jié)構(gòu)
首先,大數(shù)據(jù)就是互聯(lián)網(wǎng)發(fā)展到現(xiàn)今階段的一種表象而已,我們認(rèn)為應(yīng)該正確對(duì)待它,在以云計(jì)算為代表的技術(shù)創(chuàng)新大幕的襯托下,這些原本很難收集和使用的數(shù)據(jù)開始容易被利用起來(lái)了,通過各行各業(yè)的不斷創(chuàng)新,大數(shù)據(jù)會(huì)逐步為人類創(chuàng)造更多的價(jià)值。
其次,想要系統(tǒng)的認(rèn)知大數(shù)據(jù),必須要全面而細(xì)致的分解它,下面著重從三個(gè)層面來(lái)展開:
第一層面是技術(shù),技術(shù)是大數(shù)據(jù)價(jià)值體現(xiàn)的手段和前進(jìn)的基石。我們將分別從云計(jì)算、分布式處理技術(shù)、存儲(chǔ)技術(shù)和感知技術(shù)的發(fā)展來(lái)說明大數(shù)據(jù)從采集、處理、存儲(chǔ)到形成結(jié)果的整個(gè)過程。
第二層面是理論,理論是認(rèn)知的必經(jīng)途徑,也是被廣泛認(rèn)同和傳播的基線。從大數(shù)據(jù)的特征定義理解行業(yè)對(duì)大數(shù)據(jù)的整體描繪和定性;從對(duì)大數(shù)據(jù)價(jià)值的探討來(lái)深入解析大數(shù)據(jù)的珍貴所在;從對(duì)大數(shù)據(jù)的現(xiàn)在和未來(lái)去洞悉大數(shù)據(jù)的發(fā)展趨勢(shì);從大數(shù)據(jù)隱私這個(gè)特別而重要的視角審視人和數(shù)據(jù)之間的長(zhǎng)久博弈。
第三層面是實(shí)踐,實(shí)踐是大數(shù)據(jù)的最終價(jià)值體現(xiàn)?;ヂ?lián)網(wǎng)的大數(shù)據(jù),政府的大數(shù)據(jù),企業(yè)的大數(shù)據(jù)和個(gè)人的大數(shù)據(jù)等各方面都可以來(lái)描繪大數(shù)據(jù)已經(jīng)展現(xiàn)的美好景象及即將實(shí)現(xiàn)的藍(lán)圖。
二、和大數(shù)據(jù)相關(guān)的理論
1.特征定義
最早提出大數(shù)據(jù)時(shí)代到來(lái)的是麥肯錫:“數(shù)據(jù),已經(jīng)滲透到當(dāng)今每一個(gè)行業(yè)和業(yè)務(wù)職能領(lǐng)域,成為重要的生產(chǎn)因素。人們對(duì)于海量數(shù)據(jù)的挖掘和運(yùn)用,預(yù)示著新一波生產(chǎn)率增長(zhǎng)和消費(fèi)者盈余浪潮的到來(lái)?!?/p>
業(yè)界(IBM 最早定義)將大數(shù)據(jù)的特征歸納為4個(gè)“V”(量Volume,多樣Variety,價(jià)值Value,速Velocity),或者說特點(diǎn)有四個(gè)層面:第一,數(shù)據(jù)體量巨大。大數(shù)據(jù)的起始計(jì)量單位至少是P(1000個(gè)T)、E(100萬(wàn)個(gè)T)或Z(10億個(gè)T);第二,數(shù)據(jù)類型繁多。比如,網(wǎng)絡(luò)日志、視頻、圖片、地理位置信息等等。第三,價(jià)值密度低,商業(yè)價(jià)值高。第四,處理速度快。最后這一點(diǎn)也是和傳統(tǒng)的數(shù)據(jù)挖掘技術(shù)有著本質(zhì)的不同。
那么,什么是大數(shù)據(jù)思維?阿里巴巴的王堅(jiān)對(duì)于大數(shù)據(jù)有一些獨(dú)特的見解,比如:
“今天的數(shù)據(jù)不是大,真正有意思的是數(shù)據(jù)變得在線了,這個(gè)恰恰是互聯(lián)網(wǎng)的特點(diǎn)?!?/p>
“非互聯(lián)網(wǎng)時(shí)期的產(chǎn)品,功能一定是它的價(jià)值,今天互聯(lián)網(wǎng)的產(chǎn)品,數(shù)據(jù)一定是它的價(jià)值?!?/p>
“你千萬(wàn)不要想著拿數(shù)據(jù)去改進(jìn)一個(gè)業(yè)務(wù),這不是大數(shù)據(jù)。你一定是去做了一件以前做不了的事情?!?/p>
特別是最后一點(diǎn),我是非常認(rèn)同的,大數(shù)據(jù)的真正價(jià)值在于創(chuàng)造,在于填補(bǔ)無(wú)數(shù)個(gè)還未實(shí)現(xiàn)過的空白。
有人把數(shù)據(jù)比喻為蘊(yùn)藏能量的煤礦。煤炭按照性質(zhì)有焦煤、無(wú)煙煤、肥煤、貧煤等分類,而露天煤礦、深山煤礦的挖掘成本又不一樣。與此類似,大數(shù)據(jù)并不在“大”,而在于“有用”。價(jià)值含量、挖掘成本比數(shù)量更為重要。
2、價(jià)值探討
大數(shù)據(jù)是什么?投資者眼里是金光閃閃的兩個(gè)字:資產(chǎn)。比如,F(xiàn)acebook上市時(shí),評(píng)估機(jī)構(gòu)評(píng)定的有效資產(chǎn)中大部分都是其社交網(wǎng)站上的數(shù)據(jù)。
如果把大數(shù)據(jù)比作一種產(chǎn)業(yè),那么這種產(chǎn)業(yè)實(shí)現(xiàn)盈利的關(guān)鍵,在于提高對(duì)數(shù)據(jù)的“加工能力”,通過“加工”實(shí)現(xiàn)數(shù)據(jù)的“增值”。
如果,我們通過采集駕駛員手機(jī)的GPS數(shù)據(jù),就可以分析出當(dāng)前哪些道路正在堵車,并可以及時(shí)發(fā)布道路交通提醒;通過采集汽車的GPS位置數(shù)據(jù),就可以分析城市的哪些區(qū)域停車較多,這也代表該區(qū)域有著較為活躍的人群,這些分析數(shù)據(jù)適合賣給廣告投放商。
突然想起有人說,這東西是不是好復(fù)雜,是不是要英語(yǔ)、數(shù)學(xué)好好?其實(shí),也許掌握專業(yè)的數(shù)據(jù)分析管理能力的確挺難的,比如數(shù)據(jù)的采集、分析等,但作為一種方法,大數(shù)據(jù)重在啟發(fā)決策者的思路。畢竟,消息掌握得比較多的情況下,才有更大的可能作出正確的決策。
其實(shí),所謂的大數(shù)據(jù),只是一種商業(yè)數(shù)據(jù)分析管理的方法。它既不像某些培訓(xùn)機(jī)構(gòu)說得那么神,也沒必要談虎色變。一句話,了解了解總是好的...
坦白講,鄧小平說科學(xué)技術(shù)是第一生產(chǎn)力。可是從生產(chǎn)技術(shù)轉(zhuǎn)化為生產(chǎn)力還是要一段時(shí)間的,所以,現(xiàn)在想直接靠大數(shù)據(jù)轉(zhuǎn)化為生產(chǎn)力的人,可能有點(diǎn)心急了。不過,面對(duì)大的趨勢(shì),了解了解總沒有壞處。
參考文獻(xiàn):
1 林樹澤.數(shù)據(jù)庫(kù)信息系統(tǒng)物理設(shè)計(jì)優(yōu)化研究[D] .天津大學(xué).2012年.
2 劉俊.基于大數(shù)據(jù)流的Multi-Agent系統(tǒng)模型研究[J] .計(jì)算機(jī)技術(shù)與發(fā)展.2007年.
3 林昕&李心科.一種OLAP海量數(shù)據(jù)載入技術(shù)的研究[J] .計(jì)算機(jī)技術(shù)與發(fā)展.2008年.