第346章 雲服務

投票推薦 加入書籤 小說報錯

  盧為冰走回白板前,在搜索和廣告聯盟之間畫了一組箭頭,然後在箭頭交匯處寫了兩個字:數據算法。

  「深藍系統現在的用戶量接近三千萬,每一台深藍手機每天都在產生數據。用戶裝了哪些應用、在什麼時段使用、搜索了什麼關鍵詞、在應用商店下載了什麼遊戲、在美團點了哪家外賣、在理財寶買了什麼產品。

  這些數據如果全部打通、清洗、建模,就能形成一張極其精細的用戶畫像網絡。」

  「你的意思是,我們拿這些數據做精準廣告匹配,廣告主投放之後發現ROI比投谷歌還高,自然就會有更多的廣告商願意來我們這裡投錢?」

  「對,谷歌的AdMob為什麼強?因為它有谷歌十幾年搜索的數據做支撐,用戶搜過什麼、看過什麼、點過什麼,谷歌都知道,所以它給用戶推的廣告精準度很高。

  但谷歌有一個天然的盲區,它拿不到用戶在非谷歌應用里的行為數據。用戶用微信聊天、用美團點餐、用理財寶轉帳,這些行為谷歌一概不知。

  而我們,全知道。」

  林辰的目光落在白板上那張越來越複雜的結構圖里。

  搜索、瀏覽器、廣告聯盟、數據、用戶畫像,五條線慢慢匯聚成了一個完整的閉環。

  「老盧,你剛才說的這套東西,歸根到底需要一個底層基礎設施。數據存儲、計算、建模、分發,這些都需要伺服器和算法平台,我們現在的伺服器架構能撐得住嗎?」

  盧為冰翻到筆記本前面幾頁,找到之前記錄的技術調研數據:「目前深藍系統的後端架構還是基於S2時代搭建的,主要支撐應用商店、遊戲、娛樂這三塊。

  日活大概兩千萬,峰值並發在百萬級別。

  如果再加一套搜索和廣告推薦系統,現有架構肯定撐不住。搜索需要實時索引,廣告需要實時競價,這兩塊的算力消耗比應用商店高一個量級。」

  「那就要升級,你跟我去一趟雲服務部門,看看那邊什麼進度了。」

  兩人出了會議室,坐電梯下到十七樓。

  這一層是深藍系統研發中心的雲服務部門,整層樓被分成了三個區域:伺服器機房在走廊盡頭,隔著玻璃能看到一排排黑色機櫃。

  中間是開發工位,幾十個工程師正對著屏幕敲代碼,靠窗的區域是會議室和測試間。

  張婷正站在工位區的白板前,給幾個工程師講解架構圖。

  她三十出頭,來自IBM,個子不高,戴著一副圓框眼鏡,頭髮紮成利落的馬尾,工牌上印著雲服務部門總監。

  看到林辰和盧為冰走過來,她愣了一下,隨即放下記號筆迎上來。

  「林總,盧總,你們怎麼來了?」

  「過來看看雲服務的進度,老盧那邊在規劃一些新業務,需要底層支撐。」林辰掃了一眼她身後的白板,上面畫著密密麻麻的架構圖和服務分層。

  張婷把他們領進旁邊的小會議室,順手拉上門,然後打開電腦投影出一張服務架構全景圖。

  「林總,雲服務從去年十月立項,目前整體進度大概完成百分之七十。架構已經全部搭建完畢,分布式存儲、負載均衡、容器調度、數據同步、多租戶隔離,這些核心模塊都跑通了。

  現在還在做壓力測試和穩定性驗證,主要測高並發場景下的數據一致性和故障恢復能力。」

  「伺服器呢?現在有多少台?」

  「首批採購的一千台伺服器已經全部上架了,在深城和東莞兩個機房,足夠支持三千萬用戶的雲存儲需求。但按照規劃,S4發布之後如果用戶量按預期增長,這個數量肯定不夠,後續至少要再擴容兩到三倍。」

  本書首發 看書就上 TW 看書網,ⓢⓗⓤ.ⓣⓦ超讚 ,提供給你無錯章節,無亂序章節的閱讀體驗

  林辰點了點頭,目光落在架構圖中間的一個模塊上,上面標註著數據管道幾個字。


  張婷推了推眼鏡,在架構圖上快速標註了幾筆:「可行,但需要新增幾個模塊。搜索需要全文索引和倒排索引,廣告需要實時競價和用戶畫像計算。

  這兩個系統的算力消耗很大,尤其廣告競價是毫秒級的實時計算,對延遲極其敏感。如果都放在同一套集群里,會互相搶資源。」

  「那怎麼解決?」

  「兩種方案。第一種,物理隔離。搜索和廣告各自獨立部署一套集群,互不影響。好處是穩定性高,壞處是成本高。

  第二種,邏輯隔離。在同一套物理集群上做資源池劃分,搜索和廣告各占固定配額,通過調度器分配算力。好處是成本低,壞處是極端情況下可能互相干擾。」

  林辰想了想後說道:「先按邏輯隔離做,資源池各占三分之一,剩下三分之一留給現有業務。後續如果廣告量起來了,再考慮獨立部署。」

  張婷在架構圖上記了一筆:「明白。另外還有一個問題,用戶畫像的計算需要大量的離線批處理和實時流處理。我們目前的Spark集群規模偏小,如果要支撐三千萬用戶的畫像建模,至少需要擴容三倍。」

  盧為冰這時候插了一句:「張婷,你剛才說的用戶畫像,具體能畫到什麼程度?」

  張婷翻到架構圖的另一頁,指著上面的用戶標籤體系:「目前規劃的畫像體系分四層。基礎層是設備信息和網絡環境。行為層是應用使用習慣、搜索歷史、下載記錄。

  興趣層是通過算法對行為數據做聚類分析,得出用戶的興趣偏好。商業層是結合理財寶和美團的數據,分析用戶的消費能力和消費偏好。

  四層疊加,理論上可以做到千人千面的精準廣告匹配。」

  盧為冰點點頭,轉頭看向林辰:「林總,如果這套畫像體系和搜索、廣告聯盟打通,那我們的廣告精準度完全可以超過谷歌的AdMob。

  谷歌拿不到用戶在微信里的聊天記錄、拿不到用戶在美團的外賣訂單、拿不到用戶在理財寶的資產狀況。

  這些數據我們全都有,而且是同一個生態內的閉環數據,質量比谷歌從外部抓取的數據高得多。」

  林辰沒有立刻接話,他腦子裡在快速推演這套系統的潛在價值。

  三千萬用戶,每人每天產生幾十條行為數據,一年下來就是上百億條。

  這些數據經過清洗、建模、畫像之後,如果用在廣告匹配上,意味著廣告主在我們這裡投一萬塊錢,能觸達的目標用戶比投谷歌精準得多。

  而更關鍵的是,這些數據全部在自己的生態里流轉,不經過任何第三方伺服器。

  谷歌、Facebook、亞馬遜拿不到,也不存在跨境傳輸的合規風險。

  他看向張婷:「雲服務本身,什麼時候能正式上線?」

  「架構已經跑通了,壓力測試大概還需要一個月,主要是測故障切換和數據恢復。如果一切順利,除去春節的時間,三月中旬可以開始小範圍灰度發布,先在公司內部和部分開發者試用。

  正式對用戶開放,可以跟隨S4的發布時間一起推。」


章節目錄