當(dāng)前位置:中工網(wǎng)理論頻道談股論經(jīng)-正文
信息時(shí)代大數(shù)據(jù)的再認(rèn)識(shí)
李國(guó)杰
//agustinmoreno.com2016-03-07來(lái)源:貴陽(yáng)日?qǐng)?bào)
分享到:更多

  

  大數(shù)據(jù)已成為媒體與大眾關(guān)注的新技術(shù),大數(shù)據(jù)的應(yīng)用也預(yù)示著信息時(shí)代將進(jìn)入一個(gè)新階段,但人們對(duì)大數(shù)據(jù)的認(rèn)識(shí)有一個(gè)不斷加深的過(guò)程。在當(dāng)下的信息時(shí)代,我們對(duì)大數(shù)據(jù)應(yīng)有新的再認(rèn)識(shí)。

  大數(shù)據(jù)興起預(yù)示信息時(shí)代進(jìn)入新階段

  中國(guó)已開(kāi)始進(jìn)入信息時(shí)代,但許多人的思想還停留在工業(yè)時(shí)代。經(jīng)濟(jì)和科技工作中出現(xiàn)的許多問(wèn)題,其根源是對(duì)時(shí)代的認(rèn)識(shí)不到位。經(jīng)濟(jì)新常態(tài)意味著中國(guó)進(jìn)入了以信息化帶動(dòng)新型工業(yè)化、城鎮(zhèn)化和農(nóng)業(yè)現(xiàn)代化的新階段。大數(shù)據(jù)、移動(dòng)互聯(lián)網(wǎng)、社交網(wǎng)絡(luò)、云計(jì)算、物聯(lián)網(wǎng)等新一代信息技術(shù)構(gòu)成的IT架構(gòu)“第三平臺(tái)”是信息社會(huì)進(jìn)入新階段的標(biāo)志,對(duì)整個(gè)經(jīng)濟(jì)的轉(zhuǎn)型有引領(lǐng)和帶動(dòng)作用。媒體上經(jīng)常出現(xiàn)的互聯(lián)網(wǎng)+、創(chuàng)客、“第二次機(jī)器革命”、“工業(yè)4.0”等都與大數(shù)據(jù)和云計(jì)算有關(guān)。大數(shù)據(jù)和云計(jì)算是新常態(tài)下提高生產(chǎn)率的新杠桿,所謂創(chuàng)新驅(qū)動(dòng)發(fā)展就是主要依靠信息技術(shù)促進(jìn)生產(chǎn)率的提高。

  中國(guó)的大數(shù)據(jù)企業(yè)已經(jīng)有相當(dāng)好的基礎(chǔ)。全球十大互聯(lián)網(wǎng)服務(wù)企業(yè)中國(guó)占有4席(阿里巴巴、騰訊、百度和京東),其他6個(gè)Top10 互聯(lián)網(wǎng)服務(wù)企業(yè)全部是美國(guó)企業(yè),歐洲和日本沒(méi)有互聯(lián)網(wǎng)企業(yè)進(jìn)入Top10.這說(shuō)明中國(guó)企業(yè)在基于大數(shù)據(jù)的互聯(lián)網(wǎng)服務(wù)業(yè)務(wù)上已處于世界前列。在發(fā)展大數(shù)據(jù)技術(shù)上,我國(guó)有可能改變過(guò)去30年技術(shù)受制于人的局面,在大數(shù)據(jù)應(yīng)用上中國(guó)有可能在全世界起到引領(lǐng)作用。我們要吸取過(guò)去基礎(chǔ)研究為企業(yè)提供核心技術(shù)不夠的教訓(xùn),加強(qiáng)大數(shù)據(jù)基礎(chǔ)研究和前瞻技術(shù)研究,努力攻克大數(shù)據(jù)核心和關(guān)鍵技術(shù)。

  理解大數(shù)據(jù)需要上升到文化和認(rèn)識(shí)論的高度

  數(shù)據(jù)文化的本質(zhì)是尊重客觀世界的實(shí)事求是精神,數(shù)據(jù)就是事實(shí)。重視數(shù)據(jù)就是強(qiáng)調(diào)用事實(shí)說(shuō)話、按理性思維的科學(xué)精神。中國(guó)人的傳統(tǒng)習(xí)慣是定性思維而不是定量思維。目前許多城市在開(kāi)展政府?dāng)?shù)據(jù)開(kāi)放共享工作,但是發(fā)現(xiàn)多數(shù)老百姓對(duì)政府要開(kāi)放的數(shù)據(jù)并不感興趣。要讓大數(shù)據(jù)走上健康的發(fā)展軌道,首先要大力弘揚(yáng)數(shù)據(jù)文化。數(shù)據(jù)文化不只是大數(shù)據(jù)用于文藝、出版等文化產(chǎn)業(yè),而是指全民的數(shù)據(jù)意識(shí)。全社會(huì)應(yīng)認(rèn)識(shí)到:信息化的核心是數(shù)據(jù),只有政府和大眾都關(guān)注數(shù)據(jù)時(shí),才能真正理解信息化的實(shí)質(zhì);數(shù)據(jù)是一種新的生產(chǎn)要素,大數(shù)據(jù)的利用可以改變資本和土地等傳統(tǒng)要素在經(jīng)濟(jì)中的權(quán)重。

  提高數(shù)據(jù)意識(shí)的關(guān)鍵是要理解大數(shù)據(jù)的戰(zhàn)略意義。數(shù)據(jù)是與物質(zhì)、能源一樣重要的戰(zhàn)略資源,數(shù)據(jù)的采集和分析涉及每一個(gè)行業(yè),是帶有全局性和戰(zhàn)略性的技術(shù)。從硬技術(shù)到軟技術(shù)的轉(zhuǎn)變是當(dāng)今全球性的技術(shù)發(fā)展趨勢(shì),而從數(shù)據(jù)中發(fā)現(xiàn)價(jià)值的技術(shù)正是最有活力的軟技術(shù),數(shù)據(jù)技術(shù)與數(shù)據(jù)產(chǎn)業(yè)的落后將使我們像錯(cuò)過(guò)工業(yè)革命機(jī)會(huì)一樣延誤一個(gè)時(shí)代。

  正確認(rèn)識(shí)大數(shù)據(jù)的價(jià)值和效益

  人們總是期望從大數(shù)據(jù)中挖掘出意想不到的“大價(jià)值”。實(shí)際上大數(shù)據(jù)的價(jià)值主要體現(xiàn)在它的驅(qū)動(dòng)效應(yīng),即帶動(dòng)有關(guān)的科研和產(chǎn)業(yè)發(fā)展,提高各行各業(yè)通過(guò)數(shù)據(jù)分析解決困難問(wèn)題和增值的能力。大數(shù)據(jù)對(duì)經(jīng)濟(jì)的貢獻(xiàn)并不完全反映在大數(shù)據(jù)公司的直接收入上,應(yīng)考慮對(duì)其他行業(yè)效率和質(zhì)量提高的貢獻(xiàn)。大數(shù)據(jù)是典型的通用技術(shù),理解通用技術(shù)要采用“蜜蜂模型”:蜜蜂的效益主要不是自己釀的蜂蜜,而是蜜蜂傳粉對(duì)農(nóng)業(yè)的貢獻(xiàn)。

  有一個(gè)家喻戶曉的寓言可以從一個(gè)角度說(shuō)明大數(shù)據(jù)的價(jià)值:一位老農(nóng)民臨終前告訴他的3個(gè)兒子,他在他家的地中埋藏了一罐金子,但沒(méi)有講埋在哪里。他的兒子們把他家所有的地都深挖了一遍,沒(méi)有挖到金子,但由于深挖了土地,從此莊稼收成特別好。數(shù)據(jù)收集、分析的能力提高了,即使沒(méi)有發(fā)現(xiàn)什么普適的規(guī)律或令人完全想不到的新知識(shí),大數(shù)據(jù)的價(jià)值也已逐步體現(xiàn)。

  大數(shù)據(jù)研究和應(yīng)用要改變過(guò)去各部門(mén)和各學(xué)科相互分割、獨(dú)立發(fā)展的傳統(tǒng)思路,重點(diǎn)不是支持單項(xiàng)技術(shù)和單個(gè)方法的發(fā)展,而是強(qiáng)調(diào)不同部門(mén)、不同學(xué)科的協(xié)作。數(shù)據(jù)科學(xué)不是垂直的“煙囪”,而是像環(huán)境、能源科學(xué)一樣的橫向集成科學(xué)。

  從復(fù)雜性的角度看大數(shù)據(jù)研究和應(yīng)用面臨的挑戰(zhàn)

  圖文檢索、主題發(fā)現(xiàn)、語(yǔ)義分析、情感分析等數(shù)據(jù)分析工作十分困難,其原因是大數(shù)據(jù)涉及復(fù)雜的類型、復(fù)雜的結(jié)構(gòu)和復(fù)雜的模式,數(shù)據(jù)本身具有很高的復(fù)雜性。大數(shù)據(jù)的復(fù)雜性還體現(xiàn)在數(shù)據(jù)之間的相互關(guān)聯(lián)。大數(shù)據(jù)計(jì)算不能像處理小樣本數(shù)據(jù)集那樣做全局?jǐn)?shù)據(jù)的統(tǒng)計(jì)分析和迭代計(jì)算,在分析大數(shù)據(jù)時(shí),需要重新審視和研究它的可計(jì)算性、計(jì)算復(fù)雜性和求解算法。

  大數(shù)據(jù)應(yīng)用本質(zhì)上是在給定的時(shí)間、空間限制下,如何“算得多”。從“算得快”到“算得多”,考慮計(jì)算復(fù)雜性的思維邏輯有很大的轉(zhuǎn)變。所謂“算得多”并不是計(jì)算的數(shù)據(jù)量越大越好,需要探索從足夠多的數(shù)據(jù),到剛剛好的數(shù)據(jù),再到有價(jià)值的數(shù)據(jù)的按需約簡(jiǎn)方法。

  發(fā)展大數(shù)據(jù)應(yīng)避免的誤區(qū)

  不要一味追求“數(shù)據(jù)規(guī)模大”。大數(shù)據(jù)主要難點(diǎn)不是數(shù)據(jù)量大,而是數(shù)據(jù)類型多樣、要求及時(shí)回應(yīng)和原始數(shù)據(jù)真假難辨,F(xiàn)有數(shù)據(jù)庫(kù)軟件解決不了非結(jié)構(gòu)化數(shù)據(jù),要重視數(shù)據(jù)融合、數(shù)據(jù)格式的標(biāo)準(zhǔn)化和數(shù)據(jù)的互操作。采集的數(shù)據(jù)往往質(zhì)量不高是大數(shù)據(jù)的特點(diǎn)之一,但盡可能提高原始數(shù)據(jù)的質(zhì)量仍然值得重視。腦科學(xué)研究的最大問(wèn)題就是采集的數(shù)據(jù)可信度差,基于可信度很差的數(shù)據(jù)難以分析出有價(jià)值的結(jié)果。

  一味追求數(shù)據(jù)規(guī)模大不僅會(huì)造成浪費(fèi),而且效果未必很好。多個(gè)來(lái)源的小數(shù)據(jù)的集成融合可能挖掘出單一來(lái)源大數(shù)據(jù)得不到的大價(jià)值。應(yīng)多在數(shù)據(jù)的融合技術(shù)上下功夫,重視數(shù)據(jù)的開(kāi)放與共享。所謂數(shù)據(jù)規(guī)模大與應(yīng)用領(lǐng)域有密切關(guān)系,有些領(lǐng)域幾個(gè)PB的數(shù)據(jù)未必算大,有些領(lǐng)域可能幾十TB已經(jīng)是很大的規(guī)模。

  發(fā)展大數(shù)據(jù)不能無(wú)止境地追求“更大、更多、更快”,要走低成本、低能耗、惠及大眾、公正法治的良性發(fā)展道路。要像現(xiàn)在治理環(huán)境污染一樣,及早關(guān)注大數(shù)據(jù)可能帶來(lái)的“污染”和侵犯隱私等各種弊端。

  不要“技術(shù)驅(qū)動(dòng)”,要“應(yīng)用為先”。新的信息技術(shù)層出不窮,信息領(lǐng)域不斷冒出新概念、新名詞,估計(jì)繼“大數(shù)據(jù)”以后,“認(rèn)知計(jì)算”、“可穿戴設(shè)備”、“機(jī)器人”等新技術(shù)又會(huì)進(jìn)入炒作高峰。我們習(xí)慣于跟隨國(guó)外的熱潮,往往不自覺(jué)地跟著技術(shù)潮流走,最容易走上“技術(shù)驅(qū)動(dòng)”的道路。實(shí)際上發(fā)展信息技術(shù)的目的是為人服務(wù),檢驗(yàn)一切技術(shù)的唯一標(biāo)準(zhǔn)是應(yīng)用。發(fā)展大數(shù)據(jù)產(chǎn)業(yè)一定要堅(jiān)持“應(yīng)用為先”的發(fā)展戰(zhàn)略,堅(jiān)持應(yīng)用牽引的技術(shù)路線。技術(shù)有限,應(yīng)用無(wú)限。各地發(fā)展云計(jì)算和大數(shù)據(jù),一定要通過(guò)政策和各種措施調(diào)動(dòng)應(yīng)用部門(mén)和創(chuàng)新企業(yè)的積極性,通過(guò)跨界的組合創(chuàng)新開(kāi)拓新的應(yīng)用,從應(yīng)用中找出路。

  不能拋棄“小數(shù)據(jù)”方法。流行的“大數(shù)據(jù)”定義是:無(wú)法通過(guò)目前主流軟件工具在合理時(shí)間內(nèi)采集、存儲(chǔ)、處理的數(shù)據(jù)集。這是用不能勝任的技術(shù)定義問(wèn)題,可能導(dǎo)致認(rèn)識(shí)的誤區(qū)。按照這種定義,人們可能只會(huì)重視目前解決不了的問(wèn)題,如同走路的人想踩著自己身前的影子。其實(shí),目前各行各業(yè)碰到的數(shù)據(jù)處理多數(shù)還是“小數(shù)據(jù)”問(wèn)題。我們應(yīng)重視實(shí)際碰到的問(wèn)題,不管是大數(shù)據(jù)還是小數(shù)據(jù)。

  大數(shù)據(jù)界流行一種看法:大數(shù)據(jù)不需要分析因果關(guān)系、不需要采樣、不需要精確數(shù)據(jù)。這種觀念不能絕對(duì)化,實(shí)際工作中要邏輯演繹和歸納相結(jié)合、白盒與黑盒研究相結(jié)合、大數(shù)據(jù)方法與小數(shù)據(jù)方法相結(jié)合。

  要高度關(guān)注構(gòu)建大數(shù)據(jù)平臺(tái)的成本。目前全國(guó)各地都在建設(shè)大數(shù)據(jù)中心,呂梁山下都建立了容量達(dá)2 PB以上的數(shù)據(jù)處理中心,許多城市公安部門(mén)要求存儲(chǔ)3個(gè)月以上的高清監(jiān)控錄像。這些系統(tǒng)的成本都非常高。數(shù)據(jù)挖掘的價(jià)值是用成本換來(lái)的,不能不計(jì)成本,盲目建設(shè)大數(shù)據(jù)系統(tǒng)。什么數(shù)據(jù)需要保存,要保存多少時(shí)間,應(yīng)當(dāng)根據(jù)可能的價(jià)值和所需的成本來(lái)決定。大數(shù)據(jù)系統(tǒng)技術(shù)還在研究之中,美國(guó)的E級(jí)超級(jí)計(jì)算機(jī)系統(tǒng)要求能耗降低1000倍,計(jì)劃到2024年才能研制出來(lái),用現(xiàn)在的技術(shù)構(gòu)建的巨型系統(tǒng)能耗極高。

  我們不要攀比大數(shù)據(jù)系統(tǒng)的規(guī)模,而是要比實(shí)際應(yīng)用效果,比完成同樣的事消耗更少的資源和能量。先抓老百姓最需要的大數(shù)據(jù)應(yīng)用,因地制宜發(fā)展大數(shù)據(jù)。發(fā)展大數(shù)據(jù)與實(shí)現(xiàn)信息化的策略一樣:目標(biāo)要遠(yuǎn)大、起步要精準(zhǔn)、發(fā)展要快速。

零容忍黨員干部追求低級(jí)趣味

  趣味屬于人的心理和精神上的選擇,黨員干部遠(yuǎn)離低級(jí)趣味,關(guān)鍵是要管住自己,不但筑好“防火墻”,還要備好……  

掃碼關(guān)注

中工網(wǎng)微信


中工網(wǎng)微博


中工網(wǎng)抖音


工人日?qǐng)?bào)
客戶端
×