storm記錄--4--Storm適用場景

Storm適用場景

成都創(chuàng)新互聯(lián)公司主要從事網(wǎng)頁設(shè)計、PC網(wǎng)站建設(shè)(電腦版網(wǎng)站建設(shè))、wap網(wǎng)站建設(shè)(手機版網(wǎng)站建設(shè))、成都響應(yīng)式網(wǎng)站建設(shè)公司、程序開發(fā)、網(wǎng)站優(yōu)化、微網(wǎng)站、微信小程序開發(fā)等,憑借多年來在互聯(lián)網(wǎng)的打拼,我們在互聯(lián)網(wǎng)網(wǎng)站建設(shè)行業(yè)積累了豐富的網(wǎng)站制作、網(wǎng)站設(shè)計、網(wǎng)站設(shè)計、網(wǎng)絡(luò)營銷經(jīng)驗,集策劃、開發(fā)、設(shè)計、營銷、管理等多方位專業(yè)化運作于一體。

  1. 流聚合:

    流聚合就是把兩個或多個數(shù)據(jù)流聚合成一個數(shù)據(jù)流 -- 基于一些共同的tuple字段。

    builder.setBolt(5,new MyJoiner(),parallelism)

     .fieldsGrouping(1,new Fields("joinfield1","joinfield2"))

     .fieldsGrouping(2,new Fields("joinfield1","joinfield2"))

     .fieldsGrouping(3,new Fields("joinfield1","joinfield2"))

  2. 批處理:

    有時候為了性能或者一些別的原因,你可能想把一組tuple一起處理,而不是一個一個單獨處理。

  3. BasicBolt:

    a、讀一個輸入tuple;

    b、根據(jù)這個輸入tuple發(fā)射一個或者多個tuple;

    c、在execute的方法的最后ack那個輸入tuple

    遵循這類模式的bolt一般是函數(shù)或者是過濾器,這種模式太常見,storm為這類模式單獨封裝了一個接口:IbasicBolt。

  4. 內(nèi)存內(nèi)緩存 + Fields grouping組合

    在bolt的內(nèi)存里面緩存一些東西非常常見。緩存在和fields grouping結(jié)合起來之后就更有用了。比如,你有一個bolt把短鏈接變成長鏈接(bit.ly,t.co之類的)。你可以把短鏈接到長鏈接的對應(yīng)關(guān)系利用LRU算分緩存在內(nèi)存里面以避免重復(fù)計算。比如組件一發(fā)射短鏈接,組件二把短鏈接轉(zhuǎn)化成長鏈接并緩存在內(nèi)存里面??匆幌孪旅鎯啥未a有什么不一樣:

    builder.setBolt(2,new ExpandUrl(),parallelism).shuffleGrouping(1);

    builder.setBolt(2,new ExpandUrl(),parallelism).fieldsGrouping(1,new Fields("url"));

  5. 計算top N

    比如你有一個bolt發(fā)射這樣的tuple:"value","count"并且你想一個bolt基于這些信息算出top N的tuple。最簡單的辦法是有一個bolt可以做一個全局的grouping的動作并且在內(nèi)存里面保持著top N的值。

    這個方式對于大數(shù)據(jù)量的流顯然是沒有擴展性的,因為所有的數(shù)據(jù)會被發(fā)到同一臺機器。一個更好的方法是在多臺機器上面并行的計算這個流每一部分的top N,然后再由一個bolt合并這些機器上面所算出來的top N以算出最后的top N,代碼大概是這樣的:

    builder.setBolt(2,new RankObjects(),parallellism).fieldsGrouping(1,new Fields("value"));

    builder.setBolt(3,new MergeObjects()).globalGrouping(2);

    這個模式之所以可以成功是因為第一個bolt的fieldsgrouping使得這種并行算法在語義上是正確的。

  6. 用TimeCacheMap來高效地保存一個最近被更新的對象的緩存:

    有時候你想在內(nèi)存里面保存一些最近活躍的對象,以及那些不再活躍的對象。TimeCacheMap是一個非常高效地數(shù)據(jù)結(jié)構(gòu),它提供了一些callback函數(shù)使得我們在對象不再活躍的時候我們可以做一些事情。

  7. 分布式RPC:CoordinatedBolt和KeyedFairBolt:

    用storm做分布式RPC應(yīng)用的時候有兩種比較常見的模式:它們被封裝在CoordinatedBolt和KeyedFairBolt里面。

    CoordinatedBolt包裝你的bolt,并且確定什么時候你的bolt已經(jīng)接收到所有的tuple,它主要使用Direct Stream來做這個。

    KeyedFairBolt同樣包裝你的bolt并且保證你的topology同時處理多個DRPC調(diào)用,而不是串行的一次只執(zhí)行一個。

分享標(biāo)題:storm記錄--4--Storm適用場景
標(biāo)題URL:http://muchs.cn/article12/geedgc.html

成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián),為您提供企業(yè)建站、網(wǎng)站維護(hù)、網(wǎng)站設(shè)計、云服務(wù)器、App開發(fā)、網(wǎng)站收錄

廣告

聲明:本網(wǎng)站發(fā)布的內(nèi)容(圖片、視頻和文字)以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主,如果涉及侵權(quán)請盡快告知,我們將會在第一時間刪除。文章觀點不代表本網(wǎng)站立場,如需處理請聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載,或轉(zhuǎn)載時需注明來源: 創(chuàng)新互聯(lián)

微信小程序開發(fā)