【Graph Embedding】: LINE算法

原創

2020-06-01 00:10

論文“LINE: Large-scale Information Network Embedding”發表在WWW‘15上，提出了一個適用於大規模網絡embedding算法“LINE”。

論文下載地址：https://arxiv.org/pdf/1503.03578.pdf

作者公佈的代碼：https://github.com/tangjianpku/LINE

介紹

本篇文章提出的算法定義了兩種相似度：一階相似度和二階相似度，一階相似度爲直接相連的節點之間的相似，二階相似度爲存不直接相連單存在相同鄰近節點的相似。還提出來一個針對帶權圖的邊採樣算法，來優化權重大小差異大，造成梯度優化的時候梯度爆炸的問題。

該方法相比於deepwalk來說，deepwalk本身是針對無權重的圖，而且根據其優化目標可以大致認爲是針對二階相似度的優化，但是其使用random walk可以認爲是一種DFS的搜索遍歷，而針對二階相似度來說，BFS的搜索遍歷更符合邏輯。而LINE同時考慮來一階和二階相似度，一階相似度可以認爲是局部相似度，直接關聯。二階相似度可以作爲一階相似度的補充，來彌補一階相似度的稀疏性。

定義

信息網絡（Information Network）信息網絡被定義爲G(V,E),其中V是節點集合，E表示邊的集合。其中每條邊定義一個有序對：e=(u,v)，並分配一個權重值 $w_{uv}$ 用於表示點u和點v之間聯繫的強弱。如果爲無向圖的話，, $w_{uv}=w_(vu)$ 。

一階相似性（First-order Proximity）一階相似性定義爲兩個節點之間的局部成對相似性。對於由邊(u,v)鏈接的節點對，其鏈接權重 $w_{uv}$ 用於表示節點u和節點v之間的一階相似性，如果兩個節點之間沒有邊相連，那麼他們的一階相似性爲0。

一階相似性固然可以直接表示節點之間的相似性，但是在真實環境下的信息網絡往往存在大量的信息缺失，而許一階相似度爲0的節點，他們本質上相似度也很高。自然能想到的是那些擁有相似鄰近節點的節點可能會存在一定的相似性。比如在真實環境中，擁有相同朋友的兩個人也很可能認識，經常在同一個詞的集合中出現的兩個詞也很有可能很相似。

二階相似性(Second-order Proximity) 兩個節點的二階相似性是他們的鄰近網絡結構的相似性。如 $p_u = (w_{u,1},...,w_{u,|V|})$ 表示u對全部節點的一階相似性。那麼節點u和節點v的二階相似性由和決定。如果沒有節點同時鏈接u和v，那麼u和v的二階相似度爲0。

LINE with First-order Proximity

定義兩個點之間的聯合概率：

其中 $\vec{u}_i$ 和 $\vec{u}_j\in R^d$ 是節點i和j的低緯embedding向量，直接利用sigmoid來度量兩個節點的相似度。而對應的需要擬合的經驗概率爲

$\hat{p}_1(i,j)=\frac{w_{ij}}{W}$ ,即爲全部權重的歸一化後的佔比，這裏的 $W=\sum_{(i,j)\in E}w_{i,j}$ ,所以對應的優化目標爲：

最小化該優化目標，讓預定義的兩個點之間的聯合概率儘量靠近經驗概率。 $d(\cdot ,\cdot )$ 用於度量兩個分佈之間的距離，作者選用來KL散度來作爲距離度量。那麼使用KL散度並忽略常數項後，可以得到：

這就是最終的優化目標，這裏需要注意，一階相似度只能用於無向圖。

LINE with Second-order Proximity

二階相似度同時適用於有向圖和無向圖。

二階的含義可以理解爲每個節點除了其本身外還代表了其所對應的上下文，如果節點的上下文分佈接近那麼可以認爲這兩個節點相似。

以有向邊爲例，有向邊(i,j),定義節點的上下文（鄰接）節點的概率爲：

其中|V|是上下文節點的數量。其實和一階的思路類似，這裏用softmax對鄰接節點做了一下歸一化。優化目標也是去最小化分佈之間的距離：

其中 $d(\cdot ,\cdot )$ 用於度量兩個分佈之間的差距。因爲考慮到圖中的節點重要性可能不一樣，所以設置了參數 $\lambda_i$ 來對節點進行加權。可以通過節點的出入度或者用pagerank等算法來估計出來。而這裏的經驗分佈則被定義爲：

$\hat{p}_2(v_i|v_j)=\frac{w_{ij}}{d_i}$

其中， $w_{ij}$ 是邊(i,j)的權重，是節點i的出度，即而N(i)就是節點i的出度節點的集合。同樣採樣KL散度作爲距離度量，可以得到如下優化目標：

Combining first-order and second-order proximities

文章提到暫時還不能將一階和二階相似度進行聯合訓練，只能將他們單獨訓練出embedding，然後在做concatenate。

負採樣

這個算是一個常見的技巧來，在做softmax的時候，分母的計算要遍歷所有節點，這部分其實很費時，所以在分母較大的時候，經常會使用負採樣技術。

邊採樣

也是訓練的一個優化，因爲優化函數中由一個w權重，在實際的數據集中，因爲鏈接的大小差異會很大，這樣的話會在梯度下降訓練的過程中很難去選擇好一個學習率。直觀的想法是把權重都變成1，然後把w權重的樣本複製w份，但是這樣會佔用更大的內存。第二個方法是按w權重佔比做採樣，可以減少內存開銷。

完。

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

GPU 硬件指標說明

流處理器：也叫渲染管、着色器。畫面都是由一個又一個像素點組成的，而流處理器就負責這些像素點的渲染工作； RT核心：光追核心，用作於光線追蹤效果； CUDA 核心和Tensor 核心：CUDA Core和Tensor Core，爲G

2024-05-13 22:35:43

舌尖上的AI：人工智能技術正在被“端上”餐桌

來源 | 人民數字FINTECH 責編 | 晉兆雨頭圖 | CSDN 下載自視覺中國 #人工智能技術正在被“端上”餐桌四方食事，不過一碗人間煙火。人工智能作爲一門新的技術科學，正在被人間煙火氣“端”上餐桌。人工智能“洗手”

2024-05-13 21:17:25

攻擊者正在利用AI，對保險公司發起大規模欺詐

保險欺詐一直是保險行業面臨的重要挑戰之一，尤其隨着技術的進步，欺詐者也在不斷更新其手段，利用AI技術，包括生成式模型、機器學習和數據分析工具等欺騙保險公司，而AI技術的應用正成爲他們的新工具，使其犯罪行爲更加隱蔽和複雜，挑戰保險行業的防欺詐

2024-05-10 00:55:17

AIGC在京東廣告創意的技術應用

一、前言電商廣告圖片不僅能夠抓住消費者的眼球，還可以傳遞品牌核心價值和故事，建立起與消費者之間的情感聯繫。然而現有的廣告圖片大多依賴人工製作，存在效率和成本的限制。儘管最近AIGC技術取得了卓越的進展，但其在廣告圖片的應

京東雲開發者

2024-05-08 23:24:18

AI繪圖新選擇：Fooocus工具發佈，小顯存助力大模型運行

隨着人工智能技術的飛速發展，AI繪圖工具已經成爲了衆多創作者們的得力助手。它們能夠基於深度學習算法，快速生成高質量的圖像，爲設計、藝術等領域注入了新的活力。然而，傳統的AI繪圖工具往往對硬件要求較高，使得許多擁有較低配置設備的用戶望而卻步。

2024-05-07 23:30:10

GLM國產大模型訓練加速：高效性能與成本優化的實踐

隨着人工智能技術的不斷進步，大模型的訓練成爲了推動深度學習領域發展的重要力量。然而，傳統的訓練方式往往面臨着性能瓶頸和高昂的成本問題，這使得許多研究者和開發者望而卻步。爲了解決這一難題，我們探索了使用OneFlow框架對GLM國產大模型進行

2024-05-07 23:30:09

LoRA微調語言大模型的實用技巧

一、引言隨着深度學習技術的快速發展，語言大模型在自然語言處理領域取得了顯著的進展。然而，傳統的微調方法通常需要大量的計算資源和時間，對於實際應用來說並不友好。爲了解決這個問題，LoRA微調技術應運而生。LoRA（Low-Rank Adap

2024-04-28 11:30:13

京東廣告研發——效率爲王：廣告統一檢索平臺實踐

1、系統概述實踐證明，將互聯網流量變現的在線廣告是互聯網最成功的商業模式，而電商場景是在線廣告的核心場景。京東服務中國數億的用戶和大量的商家，商品池海量。平臺在兼顧用戶體驗、平臺、廣告主收益的前提推送商品具有挑戰性。京東廣告檢索平臺

2024-04-25 23:17:47

Stable Diffusion中的embedding

Stable Diffusion中的embedding 嵌入，也稱爲文本反轉，是在 Stable Diffusion 中控制圖像樣式的另一種方法。在這篇文章中，我們將學習什麼是嵌入，在哪裏可以找到它們，以及如何使用它們。什麼是嵌入embe

2024-04-25 21:31:13

大模型區域落地再加速！百度“文心中國行”西部首站落地成都錦江

4 月 24 日，“文心中國行”西部地區首站落地成都錦江。成都市錦江區白鷺灣新經濟總部功能區、錦江區投資促進局與百度飛槳攜手合作，打造成都人工智能的新產業、新模式、新業態。來自成都政產學研各界的領導、專家、企業嘉賓，共同探討如何降低 AI

2024-04-25 11:41:53

文心中國行走進成都！4 月 24 日一起把握大模型時代的產業新機遇

4 月 24 日，文心中國行將走進成都。屆時，政府、企業與高校的相關專家和業界同仁將現場分享生成式人工智能與大模型最新進展，從人工智能政策解讀、大模型技術，到產業創新應用的實踐案例，讓參會者全方位瞭解大模型時期的發展與創新機遇。大會還特別

2024-04-23 11:41:07

文心大模型“你說我畫”：PaddleHub與PaddleSpeech的協同實踐

在人工智能領域中，自然語言處理和計算機視覺是兩個非常活躍的研究方向。隨着深度學習技術的發展，這兩個領域之間的交叉融合產生了許多令人興奮的應用場景。其中，“你說我畫”就是這樣一個結合自然語言處理和計算機視覺技術的創新應用。 “你說我畫”的核心

2024-04-22 11:29:20

探索時間序列大模型：TimeGPT的魅力與實踐

在數據科學的各個領域中，時間序列分析一直扮演着重要角色。無論是預測股票價格、氣候變化，還是分析醫療數據，時間序列模型都發揮着不可或缺的作用。然而，傳統的時間序列分析方法在處理複雜數據時常常面臨諸多挑戰，如數據稀疏性、非線性關係等。爲了應對這

2024-04-22 11:29:17

京東廣告研發——AIGC在京東廣告創意的技術應用

一、前言電商廣告圖片不僅能夠抓住消費者的眼球，還可以傳遞品牌核心價值和故事，建立起與消費者之間的情感聯繫。然而現有的廣告圖片大多依賴人工製作，存在效率和成本的限制。儘管最近AIGC技術取得了卓越的進展，但其在廣告圖片的應用還存在缺乏

2024-04-22 11:16:30

京東廣告研發 —— 京東推薦廣告排序機制演化

1、序言：廣告排序機制的前世今生 1.1、簡介：廣告排序機制在線廣告是國內外各大互聯網公司的重要收入來源之一，而在線廣告與傳統廣告最大的區別就在於其超大規模的實時競價環境：數以萬計的廣告主在一天內可以參與億級別的流量競拍。在這複雜的實

2024-04-24 23:17:14

24小時熱門文章

最新文章

最新評論文章