【Graph Embedding】: node2vec算法

原創

2020-06-01 00:10

論文“node2vec: Scalable Feature Learning for Networks”發表在kdd2016，文章提出了一個新的graph embedding

論文地址：https://www.kdd.org/kdd2016/papers/files/rfp0218-groverA.pdf

作者提供的代碼地址：http://snap.stanford.edu/node2vec/

微信將node2vec用於廣告lookalike的應用：微信的廣告投放策略

算法“node2vec”。算法定義了一個圖中節點鄰域的靈活概念，並設計了一個帶偏置的隨機遊走過程，用於有效的探索不同的鄰域。作者認爲在探索鄰域時的靈活性是學習出更豐富節點表示的關鍵。

其實node2vec算法算是deepwalk的一個擴展，如果將節點採樣問題看成一種局部搜索的形式的話，那麼deepwalk中的隨機遊走，有點類似於鄰域的深度優先搜索。而node2vec通過引入兩個參數來控制隨機遊走，做到來相當於深度優先搜索和廣度優先搜索的結合，可以自由控制鄰域探索的方式，再針對提取的鄰域利用SGD進行優化。。

本文提出了一個用於大尺度網絡特徵表示的半監督算法node2vec。利用二階的隨機遊走策略來採樣節點的鄰域節點。

特徵學習框架（Feature learning framework）

將特徵學習問題定義爲最大似然優化問題，定義網絡G(V,E)，令 $f: V\rightarrow R^d$ 是我們要學習的函數f，表示節點到特徵表示的一個映射函數。d是embedding的維度。f就是我們學習出來的embedding矩陣。對於每個節點 $u\in V$ ,定義 $N_S(u)\subset V$ 作爲節點u通過鄰域採樣策略S生成的鄰域節點。

優化目標：最大化在節點u的條件下，出現其鄰域節點的對數概率，節點u用其由函數f生成的embedding向量表示，所以優化目標爲：

爲了簡化優化問題，做了兩個標準假設：

1.條件獨立。假設節點u的鄰域節點之間出現的概率相互獨立，那麼優化目標就可以變成：

2.特徵空間對稱性。即節點與節點之間是對稱，所有的節點都在同一個空間下面。既然在同一個特徵空間下面，那麼我們可以把節點與其鄰域節點的條件似然概率定義成softmax形式，如：

有了寫兩個假設，再把這兩個公式帶回原來的優化目標中，就能得到新的目標函數：

這裏的 $Z_u=\sum_{v\in V}exp(f(u)\cdot f(v))$ 是歸一化因子，這裏就可以用上神經網絡裏面針對softmax的常用套路了，做負採樣。

然後根據這個目標函數，直接利用skip-gram來學習embedding向量。其實這裏和deepwalk的後半部是一樣的，關鍵是怎麼從graph中採樣session出來給skip-gram訓練。

採樣策略

爲了比較不同的抽樣策略S，限制節點的鄰域Ns爲k個節點，然後爲節點u採樣多個集合。常用的鄰域節點採樣方法：

廣度優先採樣（BFS）：鄰域節點的採樣限制爲和目標節點直接鏈接的節點。

深度優先採樣（DFS）:鄰域節點的採樣按從源節點距離越來越遠的順序進行採樣。

nodel2vec

文章設計了一個靈活的採樣策略用於平衡BFS和DFS，即利用帶偏置的隨機遊走策略來，該方式可以BFS和DFS的方式探索鄰近區域。

隨機遊走（Random Walks）

先給出定義：給定一個源節點u，確定好隨機遊走的長度爲l。用表示隨機遊走中的第i個節點，以開始，那麼節點生成方式爲：

其中 $\pi_{vx}$ 是節點v和節點x之間的未歸一化的轉移概率，Z是歸一化因子。

搜索偏置

最簡單的隨機遊走方法就是讓 $\pi_{vx}=w_{vx}$ ,就是按邊的權重分配等價的概率來選擇下一個節點。但是這樣就沒發做鄰域探索。所以作者提出了一個二階的隨機遊走策略，利用兩個參數p和q來控制遊走。

如上圖，假設現在經過隨機遊走，節點從t經過邊(t,v)到來v，那麼當前節點爲v，遊走策略需要確定下一個節點走哪裏，這裏設置未歸一化轉移概率爲 $\pi_{vx}=\alpha_{pq}(t,x)\cdot w_{vx}$ ,其中

這裏的 $d_{tx}$ 指的是節點t和節點x的最短路徑距離，且 $d_{tx}$ 的範圍是{0,1,2}中的一個，因此這兩個用於知道遊走的參數是十分必要的。

返回參數p(Return parameter p).返回參數p，參數p是控制下一個節點是否選擇上一節點的概率，所以該參數的需要設置一個較大的值，確保我們小概率的採樣一個已經訪問過的節點，除非下一個節點沒有其他鄰域節點了。

內外參數q(In-out parameter q).參數q控制下一個遊走的節點是靠近原來的節點還是遠離原來的節點。如果q>1,那麼隨機遊走偏向於靠近原始節點t，q<1則相反。

隨機遊走的優勢。隨機遊走在空間和時間上都是比較有效的

算法的整個流程

這裏預先計算了轉移概率，並用alias採樣算法可以在O(1)時間內完成採樣。

完

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

GPU 硬件指標說明

流處理器：也叫渲染管、着色器。畫面都是由一個又一個像素點組成的，而流處理器就負責這些像素點的渲染工作； RT核心：光追核心，用作於光線追蹤效果； CUDA 核心和Tensor 核心：CUDA Core和Tensor Core，爲G

2024-05-13 22:35:43

舌尖上的AI：人工智能技術正在被“端上”餐桌

來源 | 人民數字FINTECH 責編 | 晉兆雨頭圖 | CSDN 下載自視覺中國 #人工智能技術正在被“端上”餐桌四方食事，不過一碗人間煙火。人工智能作爲一門新的技術科學，正在被人間煙火氣“端”上餐桌。人工智能“洗手”

2024-05-13 21:17:25

攻擊者正在利用AI，對保險公司發起大規模欺詐

保險欺詐一直是保險行業面臨的重要挑戰之一，尤其隨着技術的進步，欺詐者也在不斷更新其手段，利用AI技術，包括生成式模型、機器學習和數據分析工具等欺騙保險公司，而AI技術的應用正成爲他們的新工具，使其犯罪行爲更加隱蔽和複雜，挑戰保險行業的防欺詐

2024-05-10 00:55:17

AIGC在京東廣告創意的技術應用

一、前言電商廣告圖片不僅能夠抓住消費者的眼球，還可以傳遞品牌核心價值和故事，建立起與消費者之間的情感聯繫。然而現有的廣告圖片大多依賴人工製作，存在效率和成本的限制。儘管最近AIGC技術取得了卓越的進展，但其在廣告圖片的應

京東雲開發者

2024-05-08 23:24:18

AI繪圖新選擇：Fooocus工具發佈，小顯存助力大模型運行

隨着人工智能技術的飛速發展，AI繪圖工具已經成爲了衆多創作者們的得力助手。它們能夠基於深度學習算法，快速生成高質量的圖像，爲設計、藝術等領域注入了新的活力。然而，傳統的AI繪圖工具往往對硬件要求較高，使得許多擁有較低配置設備的用戶望而卻步。

2024-05-07 23:30:10

GLM國產大模型訓練加速：高效性能與成本優化的實踐

隨着人工智能技術的不斷進步，大模型的訓練成爲了推動深度學習領域發展的重要力量。然而，傳統的訓練方式往往面臨着性能瓶頸和高昂的成本問題，這使得許多研究者和開發者望而卻步。爲了解決這一難題，我們探索了使用OneFlow框架對GLM國產大模型進行

2024-05-07 23:30:09

LoRA微調語言大模型的實用技巧

一、引言隨着深度學習技術的快速發展，語言大模型在自然語言處理領域取得了顯著的進展。然而，傳統的微調方法通常需要大量的計算資源和時間，對於實際應用來說並不友好。爲了解決這個問題，LoRA微調技術應運而生。LoRA（Low-Rank Adap

2024-04-28 11:30:13

京東廣告研發——效率爲王：廣告統一檢索平臺實踐

1、系統概述實踐證明，將互聯網流量變現的在線廣告是互聯網最成功的商業模式，而電商場景是在線廣告的核心場景。京東服務中國數億的用戶和大量的商家，商品池海量。平臺在兼顧用戶體驗、平臺、廣告主收益的前提推送商品具有挑戰性。京東廣告檢索平臺

2024-04-25 23:17:47

Stable Diffusion中的embedding

Stable Diffusion中的embedding 嵌入，也稱爲文本反轉，是在 Stable Diffusion 中控制圖像樣式的另一種方法。在這篇文章中，我們將學習什麼是嵌入，在哪裏可以找到它們，以及如何使用它們。什麼是嵌入embe

2024-04-25 21:31:13

大模型區域落地再加速！百度“文心中國行”西部首站落地成都錦江

4 月 24 日，“文心中國行”西部地區首站落地成都錦江。成都市錦江區白鷺灣新經濟總部功能區、錦江區投資促進局與百度飛槳攜手合作，打造成都人工智能的新產業、新模式、新業態。來自成都政產學研各界的領導、專家、企業嘉賓，共同探討如何降低 AI

2024-04-25 11:41:53

文心中國行走進成都！4 月 24 日一起把握大模型時代的產業新機遇

4 月 24 日，文心中國行將走進成都。屆時，政府、企業與高校的相關專家和業界同仁將現場分享生成式人工智能與大模型最新進展，從人工智能政策解讀、大模型技術，到產業創新應用的實踐案例，讓參會者全方位瞭解大模型時期的發展與創新機遇。大會還特別

2024-04-23 11:41:07

文心大模型“你說我畫”：PaddleHub與PaddleSpeech的協同實踐

在人工智能領域中，自然語言處理和計算機視覺是兩個非常活躍的研究方向。隨着深度學習技術的發展，這兩個領域之間的交叉融合產生了許多令人興奮的應用場景。其中，“你說我畫”就是這樣一個結合自然語言處理和計算機視覺技術的創新應用。 “你說我畫”的核心

2024-04-22 11:29:20

探索時間序列大模型：TimeGPT的魅力與實踐

在數據科學的各個領域中，時間序列分析一直扮演着重要角色。無論是預測股票價格、氣候變化，還是分析醫療數據，時間序列模型都發揮着不可或缺的作用。然而，傳統的時間序列分析方法在處理複雜數據時常常面臨諸多挑戰，如數據稀疏性、非線性關係等。爲了應對這

2024-04-22 11:29:17

京東廣告研發——AIGC在京東廣告創意的技術應用

一、前言電商廣告圖片不僅能夠抓住消費者的眼球，還可以傳遞品牌核心價值和故事，建立起與消費者之間的情感聯繫。然而現有的廣告圖片大多依賴人工製作，存在效率和成本的限制。儘管最近AIGC技術取得了卓越的進展，但其在廣告圖片的應用還存在缺乏

2024-04-22 11:16:30

京東廣告研發 —— 京東推薦廣告排序機制演化

1、序言：廣告排序機制的前世今生 1.1、簡介：廣告排序機制在線廣告是國內外各大互聯網公司的重要收入來源之一，而在線廣告與傳統廣告最大的區別就在於其超大規模的實時競價環境：數以萬計的廣告主在一天內可以參與億級別的流量競拍。在這複雜的實

2024-04-24 23:17:14

24小時熱門文章

最新文章

最新評論文章