運維大數據分析平台
Ⅰ 大數據運維的主要工作內容是什麼
大數據運維,這里指互聯網運維,通常屬於技術部門,與研發、測試、系統管回理同為互聯網產品技術支答撐的4大部門,這個劃分在國內和國外以及大小公司間都會多少有一些不同。
一個互聯網產品的生成一般經歷的過程是:產品經理(proct manager,非技術部)需求分析、研發部門開發、測試部門測試、運維部門部署發布以及長期的運行維護。
一般來講國內的互聯網運維負責軟體測試交付後的發布和管理,其核心目標是將交付的業務軟體和硬體基礎設施高效合理的整合,轉換為可持續提供高質量服務的產品,同時最大限度降低服務運行的成本,保障服務運行的安全。
Ⅱ 大數據分析平台哪家好
以下為大家介紹幾個代表性數據分析平台:
1、 Cloudera
Cloudera提供一個可擴展、靈活、集成的平台,可用來方便的管理您的企業中快速增長的多種多樣的數據,從而部署和管理Hadoop和相關項目、操作和分析您的數據以及保護數據的安全。Cloudera Manager是一個復雜的應用程序,用於部署、管理、監控CDH部署並診斷問題,Cloudera Manager提供Admin Console,這是一種基於Web的用戶界面,是您的企業數據管理簡單而直接,它還包括Cloudera Manager API,可用來獲取集群運行狀況信息和度量以及配置Cloudera Manager。
2、 星環Transwarp
基於hadoop生態系統的大數據平台公司,國內唯一入選過Gartner魔力象限的大數據平台公司,對hadoop不穩定的部分進行了優化,功能上進行了細化,為企業提供hadoop大數據引擎及資料庫工具。
3、 阿里數加
阿里雲發布的一站式大數據平台,覆蓋了企業數倉、商業智能、機器學習、數據可視化等領域,可以提供數據採集、數據深度融合、計算和挖掘服務,將計算的幾個通過可視化工具進行個性化的數據分析和展現,圖形展示和客戶感知良好,但是需要捆綁阿里雲才能使用,部分體驗功能一般,需要有一定的知識基礎。maxcompute(原名ODPS)是數加底層的計算引擎,有兩個維度可以看這個計算引擎的性能,一個是6小時處理100PB的數據,相當於1億部高清電影,另外一個是單集群規模過萬台,並支持多集群聯合計算。
4、 華為FusionInsight
基於Apache進行功能增強的企業級大數據存儲、查詢和分析的統一平台。完全開放的大數據平台,可運行在開放的x86架構伺服器上,它以海量數據處理引擎和實時數據處理引擎為核心,針對金融、運營商等數據密集型行業的運行維護、應用開發等需求,打造了敏捷、智慧、可信的平台軟體。
5、網易猛獁
網易猛獁大數據平台使一站式的大數據應用開發和數據管理平台,包括大數據開發套件和hadoop發行版兩部分。大數據開發套件主要包含數據開發、任務運維、自助分析、數據管理、項目管理及多租戶管理等。大數據開發套件將數據開發、數據分析、數據ETL等數據科學工作通過工作流的方式有效地串聯起來,提高了數據開發工程師和數據分析工程師的工作效率。Hadoop發行版涵蓋了網易大數據所有底層平台組件,包括自研組件、基於開源改造的組件。豐富而全面的組件,提供完善的平台能力,使其能輕易地構建不同領域的解決方案,滿足不同類型的業務需求。
6.知於大數據分析平台
知於平台的定位與當今流行的平台定位不一樣,它針對的主要是中小型企業,為中小型企業提供大數據解決方案。現階段,平台主打的產品是輿情系統、文章傳播分析與網站排名監測,每個服務的價格單次在50元左右,性價比極高。
Ⅲ 豪越HYDO智能運維管理大數據平台好用不
還挺好用的,主要是運行比較穩定,很少出問題,所以比較省心,不印象日常的工作需要。有問題線上或者電話聯系,客服都是會耐心回答的
Ⅳ 大數據運維是干什麼的難學嗎費腦子嗎
只要你感興趣,不管難不難,要知道這個是高薪職業,到這可以參觀學習的
Ⅳ 哪些單位用豪越HYDO智能運維管理大數據平台比較多
需要跨域採集全層級IT數據,包括用戶體驗層、網路層、業務層、服務層、進程層、虛擬化層、系統層和硬體層等,大數據是實現IT智能運維的基礎
Ⅵ 如何設計企業級大數據分析平台
所謂的大數據平台不是獨立存在的,比如網路是依賴搜索引擎獲得大數據並開展業務的,阿里是通過電子商務交易獲得大數據並開展業務的,騰訊是通過社交獲得大數據並開始業務的,所以說大數據平台不是獨立存在的,重點是如何搜集和沉澱數據,如何分析數據並挖掘數據的價值。
我可能還不夠資格回答這個問題,沒有經歷過一個公司大數據平台從無到有到復雜的過程。不過說說看法吧,也算是梳理一下想法找找噴。
這是個需求驅動的過程。
曾經聽過spotify的分享,印象很深的是,他們分享說,他們的hadoop集群第一次故障是因為,機器放在靠窗的地方,太陽曬了當機了(笑)。從簡單的沒有機房放在自家窗前的集群到一直到現在復雜的數據平台,這是一個不斷演進的過程。
對小公司來說,大概自己找一兩台機器架個集群算算,也算是大數據平台了。在初創階段,數據量會很小,不需要多大的規模。這時候組件選擇也很隨意,Hadoop一套,任務調度用腳本或者輕量的框架比如luigi之類的,數據分析可能hive還不如導入RMDB快。監控和部署也許都沒時間整理,用腳本或者輕量的監控,大約是沒有ganglia、nagios,puppet什麼的。這個階段也許算是技術積累,用傳統手段還是真大數據平台都是兩可的事情,但是為了今後的擴展性,這時候上Hadoop也許是不錯的選擇。
當進入高速發展期,也許擴容會跟不上計劃,不少公司可能會遷移平台到雲上,比如AWS阿里雲什麼的。小規模高速發展的平台,這種方式應該是經濟實惠的,省了運維和管理的成本,擴容比較省心。要解決的是選擇平台本身提供的服務,計算成本,打通數據出入的通道。整個數據平台本身如果走這條路,可能就已經基本成型了。走這條路的比較有名的應該是netflix。
也有一個階段,你發現雲服務的費用太高,雖然省了你很多事,但是花錢嗖嗖的。幾個老闆一合計,再玩下去下個月工資發布出來了。然後無奈之下公司開始往私有集群遷移。這時候你大概需要一群靠譜的運維,幫你監管機器,之前兩三台機器登錄上去看看狀態換個磁碟什麼的也許就不可能了,你面對的是成百上千台主機,有些關鍵服務必須保證穩定,有些是數據節點,磁碟三天兩頭損耗,網路可能被壓得不堪重負。你需要一個靠譜的人設計網路布局,設計運維規范,架設監控,值班團隊走起7*24小時隨時准備出台。然後上面再有平台組真的大數據平台走起。
然後是選型,如果有技術實力,可以直接用社區的一整套,自己管起來,監控部署什麼的自己走起。這個階段部署監控和用戶管理什麼的都不可能像兩三個節點那樣人肉搞了,配置管理,部署管理都需要專門的平台和組件;定期Review用戶的作業和使用情況,決定是否擴容,清理數據等等。否則等機器和業務進一步增加,團隊可能會死的很慘,疲於奔命,每天事故不斷,進入惡性循環。
當然有金錢實力的大戶可以找Cloudera,Hortonworks,國內可以找華為星環,會省不少事,適合非互聯網土豪。當然互聯網公司也有用這些東西的,比如Ebay。
接下去你可能需要一些重量的組件幫你做一些事情。
比如你的數據接入,之前可能找個定時腳本或者爬log發包找個伺服器接收寫入HDFS,現在可能不行了,這些大概沒有高性能,沒有異常保障,你需要更強壯的解決方案,比如Flume之類的。
你的業務不斷壯大,老闆需要看的報表越來越多,需要訓練的數據也需要清洗,你就需要任務調度,比如oozie或者azkaban之類的,這些系統幫你管理關鍵任務的調度和監控。
數據分析人員的數據大概可能漸漸從RDBMS搬遷到集群了,因為傳統資料庫已經完全hold不住了,但他們不會寫代碼,所以你上馬了Hive。然後很多用戶用了Hive覺得太慢,你就又上馬交互分析系統,比如Presto,Impala或者SparkSQL。
你的數據科學家需要寫ML代碼,他們跟你說你需要Mahout或者Spark MLLib,於是你也部署了這些。
至此可能數據平台已經是工程師的日常工作場所了,大多數業務都會遷移過來。這時候你可能面臨很多不同的問題。
比如各個業務線數據各種數據表多的一塌糊塗,不管是你還是寫數據的人大概都不知道數據從哪兒來,接下去到哪兒去。你就自己搞了一套元數據管理的系統。
你分析性能,發現你們的數據都是上百Column,各種復雜的Query,裸存的Text格式即便壓縮了也還是慢的要死,於是你主推用戶都使用列存,Parquet,ORC之類的。
又或者你發現你們的ETL很長,中間生成好多臨時數據,於是你下狠心把pipeline改寫成Spark了。
再接下來也許你會想到花時間去維護一個門戶,把這些零散的組件都整合到一起,提供統一的用戶體驗,比如一鍵就能把數據從資料庫chua一下拉到HDFS導入Hive,也能一鍵就chua一下再搞回去;點幾下就能設定一個定時任務,每天跑了給老闆自動推送報表;或者點一下就能起一個Storm的topology;或者界面上寫幾個Query就能查詢Hbase的數據。這時候你的數據平台算是成型了。
當然,磕磕碰碰免不了。每天你都有新的問題和挑戰,否則你就要失業了不是?
你發現社區不斷在解決你遇到過的問題,於是你們架構師每天分出很多時間去看社區的進展,有了什麼新工具,有什麼公司發布了什麼項目解決了什麼問題,興許你就能用上。
上了這些亂七八糟的東西,你以為就安生了?Hadoop平台的一個大特點就是坑多。尤其是新做的功能新起的項目。對於平台組的人,老闆如果知道這是天然坑多的平台,那他也許會很高興,因為跟進社區,幫忙修bug,一起互動其實是很提升公司影響力的實情。當然如果老闆不理解,你就自求多福吧,招幾個老司機,出了問題能馬上帶路才是正道。當然團隊的技術積累不能不跟上,因為數據平台還是亂世,三天不跟進你就不知道世界是什麼樣了。任何一個新技術,都是坑啊坑啊修啊修啊才完善的。如果是關鍵業務換技術,那需要小心再小心,技術主管也要有足夠的積累,能夠駕馭,知道收益和風險。
Ⅶ 大數據分析平台哪個好
國內的BI品牌都能做大數據分析,各有千秋,根據你的實際需求去挑選對比吧,朋友推薦過Smartbi,他家產品的功能和服務都還不錯。
Ⅷ 大數據分析工具
1、日誌管理工具Splunk(http://www.splunk.com/)
<img src="https://pic4.mg.com/_b.png" data-rawwidth="1894" data-rawheight="902" class="origin_image zh-lightbox-thumb" width="1894" data-original="https://pic4.mg.com/_r.png">
面向使用的人群主要有:
<img src="https://pic1.mg.com/_b.png" data-rawwidth="841" data-rawheight="366" class="origin_image zh-lightbox-thumb" width="841" data-original="https://pic1.mg.com/_r.png">
Splunk的功能組件主要有Forwarder、Serch Head、Indexer三種,然後支持了查詢搜索、儀表盤和報表(效果真不是吹的,很精緻呀),另外還支持SaaS服務模式。其中,Splunk支持的數據源也是多種類型的,基本上還是可以滿足客戶的需求。
<img src="https://pic1.mg.com/_b.png" data-rawwidth="554" data-rawheight="389" class="origin_image zh-lightbox-thumb" width="554" data-original="https://pic1.mg.com/_r.png">
目前支持Hadoop1.x(MRv1)、Hadoop2.x(MRv2)、Hadoop2.x(Yarn)三個版本的Hadoop集群的日誌數據源收集,在日誌管理運維方面還是處於一個國際領先的地位,目前國內有部分的數據驅動型公司也正在採用Splunk的日誌管理運維服務。
<img src="https://pic3.mg.com/_b.png" data-rawwidth="834" data-rawheight="396" class="origin_image zh-lightbox-thumb" width="834" data-original="https://pic3.mg.com/_r.png">
可視化部分效果也是很不錯的
<img src="https://pic2.mg.com/_b.png" data-rawwidth="554" data-rawheight="260" class="origin_image zh-lightbox-thumb" width="554" data-original="https://pic2.mg.com/_r.png"><img src="https://pic3.mg.com/_b.png" data-rawwidth="554" data-rawheight="259" class="origin_image zh-lightbox-thumb" width="554" data-original="https://pic3.mg.com/_r.png"><img src="https://pic4.mg.com/_b.png" data-rawwidth="554" data-rawheight="258" class="origin_image zh-lightbox-thumb" width="554" data-original="https://pic4.mg.com/_r.png">
2、EverString(Home - EverString)
<img src="https://pic1.mg.com/_b.png" data-rawwidth="479" data-rawheight="159" class="origin_image zh-lightbox-thumb" width="479" data-original="https://pic1.mg.com/_r.png">
everstring主要是通過大數據的預測分析建模為企業提供業務和客戶推薦的SaaS服務,獲取和積累了兩個數據信息資源庫,一個行業外部的資源庫(公有SaaS收費形式),一個行業自己內部的資源庫(私有),然後再通過機器學習和人工智慧的方法對數據進行相應行業或是領域的建模,最後得到一個比較不錯的結果,優化於人工可以得到的結果,而且Everstring也成為了初創大數據公司裡面估值很高的公司。
3、國外的Tableau(http://www.tableau.com/)
可視化界面還是做得不錯的
<img src="https://pic2.mg.com/_b.png" data-rawwidth="660" data-rawheight="407" class="origin_image zh-lightbox-thumb" width="660" data-original="https://pic2.mg.com/_r.png">
<img src="https://pic1.mg.com/_b.png" data-rawwidth="1272" data-rawheight="754" class="origin_image zh-lightbox-thumb" width="1272" data-original="https://pic1.mg.com/_r.png">
可是對於價格還是按需掏腰包吧。
<img src="https://pic3.mg.com/_b.png" data-rawwidth="1603" data-rawheight="847" class="origin_image zh-lightbox-thumb" width="1603" data-original="https://pic3.mg.com/_r.png">
4、國內的大數據魔鏡分析工具(魔鏡—行業領先的大數據可視化分析平台 6.0)
魔鏡的大數據平台主要提供的還是數據清洗和ETL、Hadoop數據倉庫以及一系列的數據分析服務,可提供的數據分析視圖工具類型豐富:
<img src="https://pic1.mg.com/_b.png" data-rawwidth="1256" data-rawheight="688" class="origin_image zh-lightbox-thumb" width="1256" data-original="https://pic1.mg.com/_r.png">
目前國外還時候有很多從事大數據業務的公司,像協助美國CIA找到本拉登的Panlatir,可以預測未來的Recorded Future和,6sence,ETL方向的Etleap,CRM系統方向的Salesforce等,如果說到可視化工具,它應該是大數據處理流程裡面的最後展現環節。
國內有個不錯的鏈接,實屬干貨呀。
盤點:55個最實用大數據可視化分析工具(http://tech.it168.com/a2015/0318/1712/000001712286.shtml)
就寫到這里吧,分析的不到位的地方,還請指出,謝謝。
補充
----------------------
剛有人問,哪些是目前國內可以用得到的一些數據科學家分析的工具,正好公司有同事是這方面的專家,請教了下,如下:
1、SPSS:主要用於數據建模工作,功能穩定且強大,能夠滿足中小企業在業務模型建立過程中的需求。
2、BitDeli
BitDeli是今年11月份在舊金山成立的一家初創公司。它能衡量出任何使用Python腳本的應用程序的指標,聯合創始人兼CEO Ville Tuulos告訴Derrick,腳本可以很簡單,也可以很復雜——甚至未來可以延伸到機器學習。不過和「重量級選手」Hadoop相比,BitDeli自認為是一個輕量級的Ruby。
3. Continuuity
Continuuity是前Yahoo首席雲架構師Todd Papaioannou和Facebook HBase的工程師Jonathan Gray的心血結晶,Continuuity想讓所有的公司都能像Yahoo、Facebook一樣運營。該團隊創建了一個大數據工具,它可以簡化Hadoop以及HBase集群的復雜性,而且包含一系列開發套件,旨在幫助程序員開發大數據應用,該平台採用Hadoop技術,允許開發者在防火牆內外對大數據應用軟體進行部署、擴展和管理。公司聯合創始人兼首席執行官Todd Papaioannou表示,作為一家初創企業,Continuuity正在試圖掀起下一波大數據應用軟體的浪潮,公司所提供的工具能夠大大提高處於開發狀態的軟體不同部分與階段的擴展性。
4. Flurry
Flurry是移動應用統計分析領域里的標桿,正因為在行業內獨特的優勢,它每年的營收高達一億美元。Flurry擁有非常全面的功能,不僅僅只是幫助開發者構建移動應用,它還幫助開發者分析所有的數據,進而產生更大的效益。其實數據也支撐了該公司的廣告網路,他們通過數據分析可以幫助開發者推送准確的廣告到需要的用戶面前。不過單純從移動應用的數據統計功能來看,Flurry絕對是處於領先地位。其功能模塊設置合理,分析維度全面,分析流程也易於理解。