Reddit 每日千億請求背後的故事

原創

Reddit工程博客

2021-06-08 17:38

{"type":"doc","content":[{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"多年來，Reddit已經發展成互聯網世界一片廣闊而多樣化的土地。Reddit的核心是衆多社區組成的網絡。從你時間線的內容到整個站點的無數討論中反映的文化，社區猶如Reddit 流動的血液，讓它變成今天這個模樣。Reddit多年來的增長給一直以來爲我們服務的數據處理和服務系統帶來了極大壓力。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"本文介紹了我們構建適應Reddit規模系統的歷程，並會談到爲什麼這一歷程是尋找更佳途徑的必要之路。"}]},{"type":"heading","attrs":{"align":null,"level":2},"content":[{"type":"text","text":"需求"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"探索新去處從來不是什麼舒舒服服就能做到的事情。無論是學習新主題，還是探索不一樣的環境，我們都曾在某種程度上體驗過那種喘不過氣的感覺。這種感受讓我們退縮，直到我們找到了合適的路徑來幫助我們探索新的地域。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"Reddit具備的龐大規模和多樣性，一開始可能很容易讓人頭暈。如果Reddit是一個城市，則r\/popular頁面就會是市政廳，你可以在其中看到那些吸引最多討論的內容。這裏是新用戶首次體驗Reddit的去處，也是我們的核心用戶偶然發現新社區，進而添加到他們豐富收藏中的地方。reddit.com上的home feed相當於一個社區公園，每位用戶都可以根據他們訂閱的內容獲得個性化的推薦內容。對我們用戶來說，這些feed是重要的指南，可幫助他們瀏覽Reddit並發現與他們的興趣相關的內容。"}]},{"type":"heading","attrs":{"align":null,"level":2},"content":[{"type":"text","text":"挑戰"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"在2016年，我們的機器學習模型開始向用戶推薦與他們相似的人們所喜歡的討論和內容。這促進了新內容和社區的發展，進而讓人們意識到Reddit彼時還應該提供哪些事物。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"隨着更多多樣化的內容被髮布到平臺上，我們一開始採用的方法開始不堪重負。今天，Reddit上的內容在幾分鐘之內就會完全改變；而與某位用戶相關的內容可能會根據他們最近訪問的內容而改變。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"Reddit上的用戶羣體比以往任何時候都更加多樣化。具有各種各樣的背景、信仰和處境的人們每天都會訪問Reddit。此外，我們用戶的興趣和態度會隨着時間而改變，並期望他們的Reddit體驗能反映出這種變化。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"我們的傳統方法並沒有提供個性化的Reddit體驗以適應這種動態環境。考慮到正在發生的變化，我們意識到我們正在迅速接近一個轉折點。"}]},{"type":"heading","attrs":{"align":null,"level":2},"content":[{"type":"text","text":"重構"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"要構建我們用戶所喜歡的東西："}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"bulletedlist","content":[{"type":"listitem","attrs":{"listStyle":null},"content":[{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"我們的feed需要在每個用戶加載時爲他們送上量身定製的內容"}]}]},{"type":"listitem","attrs":{"listStyle":null},"content":[{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"我們的系統需要適應用戶興趣、態度和消費方式的變化"}]}]},{"type":"listitem","attrs":{"listStyle":null},"content":[{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"我們必須迅速接收用戶的反饋並改進底層系統"}]}]}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"爲此，我們將用戶個性化實現細分爲一系列有監督的學習子任務。這些子任務讓我們的系統能學習一套通用的個性化策略。爲幫助我們迭代地學習這一策略，我們建立了一個閉環系統（如下圖所示），其中每個實驗都基於先前的學習："}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"image","attrs":{"src":"https:\/\/static001.geekbang.org\/infoq\/3c\/3c50e746ed4679dac98b245c768cc7f9.webp","alt":null,"title":null,"style":[{"key":"width","value":"75%"},{"key":"bordertype","value":"none"}],"href":null,"fromPaste":true,"pastePass":true}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"這一系統由四大關鍵組件組成。這些組件可以共同爲每位Reddit用戶生成個性化的feed體驗。進一步來看每個組件的細節："}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","marks":[{"type":"strong"}],"text":"用戶活動庫（User Activity Library）"},{"type":"text","text":"：該組件可幫助我們清理和構建數據集。這些數據集用於訓練多任務深度神經網絡模型，這些模型學習個性化實現所需的一個子任務集合"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"image","attrs":{"src":"https:\/\/static001.geekbang.org\/infoq\/df\/df42c6dc9374df0de4fd134e95caa26b.webp","alt":null,"title":null,"style":[{"key":"width","value":"75%"},{"key":"bordertype","value":"none"}],"href":null,"fromPaste":true,"pastePass":true}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"這些數據集包含一些在有限的時間範圍內按每個用戶、每個帖子彙總的特徵（如上圖所示）。在這些數據集上，訓練的模型會同時嵌入用戶、subreddit、帖子和用戶上下文，從而使它們能針對特定情況預測用戶操作。例如，對於每位Reddit用戶，模型都可以分配一個用戶對任意新帖子投票的概率，同時還可以分配一個用戶訂閱某個subreddit的概率，以及他們是否會對帖子發表評論的概率。這些概率可用於估計一些長期度量，例如留存率。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"在Reddit中，多任務模型變得尤爲重要。用戶以多種方式與多種類型的內容互動，而互動水平（engagement）則告訴我們他們重視哪些內容和社區。這種類型的訓練還能隱式地捕獲了負面反饋——用戶選擇不參與的內容、投出的反對票或他們退訂的社區。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"我們使用簡單的梯度下降式優化（像TensorFlow提供的那樣）訓練我們的多任務神經網絡模型（如下所示的示例架構）。在Reddit，我們將順序蒙特卡洛算法放在最上面，以在給定子任務集合的情況下搜索模型拓撲。這讓我們可以輕裝上陣，並系統地探索搜索空間，以證明深度和多任務結構的相對價值。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"image","attrs":{"src":"https:\/\/static001.geekbang.org\/infoq\/9b\/9bcbd884570d074545a8d9cd5a7bfdd2.webp","alt":null,"title":null,"style":[{"key":"width","value":"75%"},{"key":"bordertype","value":"none"}],"href":null,"fromPaste":true,"pastePass":true}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","marks":[{"type":"strong"}],"text":"Gazette——特徵存儲和模型預測引擎"},{"type":"text","text":"：鑑於時間限制和預測所需的數據規模，我們的特徵存儲和模型位於同一微服務中。該微服務負責協調在每個GET請求期間進行預測所涉及的各個步驟。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"我們有一個系統，使Reddit的任何員工都可以輕鬆創建新的機器學習特徵。這些特徵被創建後，該系統將負責以高效的方式更新、存儲這些特徵並將其提供給我們的模型。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"對於實時特徵，一套基於Kafka管道和Flink流處理的事件處理系統直接實時消費每個關鍵事件來計算特徵。與批量特徵類似，我們的系統會以高效的方式將這些特徵供模型使用。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"該組件可保持99.9％的正常運行時間，並以p99\/不足100毫秒的速度構建一條feed。這意味着這套設計在我們擴展到處理每天萬億計的推薦時性能依舊穩定。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","marks":[{"type":"strong"}],"text":"模型評估和監視"},{"type":"text","text":"：當你每天需要做出數十億次預測時，出現錯誤是肯定的。鑑於Reddit的規模，一些顯而易見的事情（記錄每個預測、實時分析模型行爲並確定漂移）變得非常具有挑戰性。擴展系統的這個組件時我們需要考慮很多事情，並且正在積極研究中。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","marks":[{"type":"strong"}],"text":"計劃"},{"type":"text","text":"：在每個實驗週期中，我們都在尋找改進方法，以讓每個迭代都比過去更好。我們會查看來自模型的數據，以便更好地回答以下問題："}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"bulletedlist","content":[{"type":"listitem","attrs":{"listStyle":null},"content":[{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"我們可以在模型中添加哪些新任務，以更好地瞭解用戶策略？"}]}]},{"type":"listitem","attrs":{"listStyle":null},"content":[{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"我們可以在當前系統中添加或刪除哪些新組件，以使當前系統更加成熟？"}]}]},{"type":"listitem","attrs":{"listStyle":null},"content":[{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"我們可以發起哪些新的實驗，以便更多地瞭解我們的用戶？"}]}]}]},{"type":"heading","attrs":{"align":null,"level":2},"content":[{"type":"text","text":"下一步計劃"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"隨着世界的不斷變化，我們對Reddit平臺做出了很多改進："}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"bulletedlist","content":[{"type":"listitem","attrs":{"listStyle":null},"content":[{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"爲每位用戶提供更相關的內容。"}]}]},{"type":"listitem","attrs":{"listStyle":null},"content":[{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"加入可能會增強用戶體驗的實時更改。"}]}]},{"type":"listitem","attrs":{"listStyle":null},"content":[{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"爲了提高迭代速度，我們改進了底層系統。"}]}]}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"“演變（Evolve）”是Reddit所有員工推崇的一項核心價值。該系統不僅使我們能夠應對平臺不斷增長的規模，而且能夠以更快的速度嘗試不同的方法。接下來的計劃將涉及更大規模的實驗，讓我們可以更好地瞭解這片虛擬地域對我們的用戶而言爲什麼如此特別。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"我們相信我們只是邁出了第一步，而我們最重要的變革尚未到來。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"原文鏈接："}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"https:\/\/www.reddit.com\/r\/RedditEng\/comments\/neknjg\/evolving_beyond_100_billion_recommendations_a_day\/?fileGuid=TtYJ6HHHq9VQpT9Y"}]}]}

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

AI從入門到入門之手寫數字識別模型java方式Dense全連接神經網絡實現

前言：授人以魚不如授人以漁.先學會用，在學原理，在學創造，可能一輩子用不到這種能力，但是不能不具備這種能力。這篇文章主要是介紹算法入門Helloword之手寫圖片識別模型java中如何實現以及部分解釋。目前大家對於人工智能-機器學習-神經網

2024-04-19 23:17:21

Pinecone: 大模型時代的智能索引與搜索解決方案

隨着人工智能技術的飛速發展，大模型（Large Models）已成爲衆多領域的重要工具。無論是自然語言處理、圖像識別還是其他複雜任務，大模型都展現出了強大的性能。然而，隨着模型規模的不斷擴大，數據量的激增，如何有效地管理、索引和搜索這些模型

2024-04-19 11:29:43

軟件測試從自動化到智能化，大模型開始加入

隨着科技的飛速發展，軟件行業也在不斷地演進和創新。作爲軟件行業的關鍵環節之一，軟件測試行業也在經歷着前所未有的變革。從最初的手動測試，到自動化測試，再到如今的智能化測試，軟件測試行業正在經歷一場深刻的技術革命。在這場革命中，Testin雲測

2024-04-19 00:53:25

裁員了！別錯過2024年大數據工程師必備的10項技能

在當今快速發展的世界中，數據被視爲新的石油。隨着對數據驅動洞察的日益依賴，大數據工程師的角色比以往任何時候都更爲關鍵。這些專業人員在管理和優化組織內的數據操作中扮演着至關重要的角色。在本文中，我們將探索2024年大數據工程師必須具備的十

2024-04-16 11:00:53

DevOps已死？2024年的DevOps將如何發展

隨着我們進入2024年，DevOps也隨之發生變化。新興的技術、變化的需求和發展的方法正在重新定義有效實施DevOps實踐。 IDC預測顯示，未來五年，支持DevOps實踐的產品市場繼續保持健康且快速增長，2022年-2027年的複合年增長

2024-04-08 12:51:44

從模型到部署，教你如何用Python構建機器學習API服務

本文分享自華爲雲社區《Python構建機器學習API服務從模型到部署的完整指南》，作者：檸檬味擁抱。在當今數據驅動的世界中，機器學習模型在解決各種問題中扮演着重要角色。然而，將這些模型應用到實際問題中並與其他系統集成，往往需要構建API

2024-04-08 10:33:17

測試左移已經開始影響DevOps的發展？

在軟件開發的早期，該過程通常是開發人員編寫代碼，再將其交給質量保證（QA）進行測試。這種瀑布開發方法可能會導致質量問題和延遲，因爲問題是在週期後期發現的。一、瞭解DevOps和測試左移 DevOps是Development和Operati

2024-04-07 12:48:37

黑盒Prompt優化：提升大模型反饋效果的新思路

隨着人工智能技術的快速發展，大模型在各種應用場景中發揮着越來越重要的作用。然而，如何提升大模型的反饋效果，使其更加準確、高效地爲用戶提供服務，一直是研究者和開發者關注的焦點。本文提出了一種新的思路——黑盒Prompt優化，旨在通過改進輸入提

2024-03-29 00:01:17

分佈式數據庫技術的演進和發展方向

這些年大家都在談分佈式數據庫，各大企業也紛紛開始做數據庫的分佈式改造。那麼，所謂的分佈式數據庫到底是什麼？採用什麼架構？優勢在哪？爲什麼越來越多企業選擇它？分佈式數據庫技術會向什麼方向發展？帶着這些疑問，一探究竟吧！參與文末的話題互動

2024-03-26 11:34:43

利用RAG技術打破大模型幻覺

隨着人工智能技術的不斷進步，大模型在各個領域中發揮着越來越重要的作用。然而，大模型幻覺問題一直是制約其進一步發展的瓶頸。爲了解決這一問題，研究者們不斷探索新的技術和方法。近年來，一種名爲RAG（檢索增強生成）的技術備受關注，它通過結合知識圖

2024-03-21 00:28:34

與 NVIDIA 再次合作、深度參與 GTC，Zilliz 與全球頂尖開發者共迎 AI 變革時刻！

Zilliz 與全球的頂尖開發者齊聚 GTC 2024。近日，備受關注的 NVIDIA GTC 2024 已拉開序幕，來自世界各地的頂尖 AI 開發者齊聚美國加州聖何塞會議中心，共同探索行業未來。作爲去年被 NVIDIA CEO 黃仁

2024-03-19 21:26:53

多模態+大模型會帶來哪些“化學反應”？

導語：沒人懷疑，2024 年，AI 依然將是科技界的主角。上個月，OpenAI 推出了可以生成 60 秒高清視頻的視頻生成模型 Sora，掀起了對多模態模型的進一輪討論。多模態大模型技術的最新進展如何？這一波新技術，對於行業和消費者的體驗會

2024-03-15 13:45:01

婦女節：打開 AI 視界，成就“她力量”

根據國內招聘平臺獵聘發佈的《2024 女性人才數據洞察報告》，從 2023 年 3 月到 2024 年 2 月，女性在 AIGC 領域的求職人次同比增長了 190.49%。隨着人工智能時代的降臨，女性正以前所未有的姿態，在技術的助力下，蛻變

2024-03-09 01:06:57

AI安全白皮書 | “深度僞造”產業鏈調查以及四類防禦措施

以下內容，摘編自頂象防禦雲業務安全情報中心正在製作的《“深度僞造”視頻識別與防禦白皮書》，對“深度僞造”感興趣的網友，可前往頂象留言，在該白皮書完成後，會爲您免費寄送一份電子版。 “深度僞造”就是創建高度逼真的虛假視頻或虛假錄音，然

2024-03-08 00:45:22

深入學習NumPy庫在數據分析中的應用場景

在數據科學與機器學習領域，NumPy（Numerical Python）是一個經常被提及的重要工具。它是Python語言中一個非常強大的庫，提供了高性能的多維數組對象以及用於處理這些數組的工具。NumPy不僅僅是一個用於數值計算的庫，它還

2024-03-02 00:30:28

24小時熱門文章

最新文章

Reddit 每日千億請求背後的故事

最新評論文章