【Graph Embedding】: SDNE算法

原創

2020-06-01 00:10

論文“Structural Deep Network Embedding”發表在kdd2016

論文下載地址：https://www.kdd.org/kdd2016/papers/files/rfp0191-wangAemb.pdf

論文利用深度自編碼器來學習圖中節點的embedding向量，結合一階和二階相似度進行聯合訓練，將二階相似度作爲無監督信息，捕獲全局網絡結構信息，一階相似度作爲有監督信息，用於捕獲局部網絡結構。

提出問題

文章提出 graph embedding存在一下幾個問題：

1.高非線性(high non-linearity)：圖的潛在結構是高非線性的，因此淺層模型很難捕獲全面的非線性結構。

2.結構保持(structure-preserving): 學習出來的節點embedding需要能保留住圖的全局和局部結構信息。

3.稀疏性(sparsity): 真實環境下，網絡通常都是稀疏的，會有大量合理的鏈接丟失。

如何解決問題

解決高非線性問題：淺層模型很難學習好高非線性結構，所以本文采用深度模型來擬合非線性結構。

解決結構保持和稀疏性問題：聯合訓練一階和二階相似性，一階指的是直接有邊相連的鄰近節點，用於學習局部網絡結構。但是真實的網絡往往都是稀疏的，缺失了大量合理鏈接，所以一階相似性節點的數據少，需要利用二階相似度來做擴展，二階相似度表示不同定點之間的鄰域結構的相似性，以捕獲全局網絡結構。

問題定義

圖

定義圖爲G=(V,E),其中 $V= \{v_1,...,v_n\}$ 表示n個節點， $E=\{e_{i,j}\}^n_{i,j=1}$ 表示節點i和j之間的邊。每條邊 $e_{i,j}$ 分配有一個權重 $s_{i,j}\geqslant 0$ ,如果節點i和j沒有邊相連的話，那麼 $s_{i,j}=0$ ，否則的話，無權圖 $s_{i,j}=1$ ，加權圖 $s_{i,j}>0$

一階相似度(First-Order Proximity)

一階相似其實就是指的節點的鄰域節點，對於任意一對節點，如果 $s_{i,j}>0$ ,那麼節點i和j之間就存在正的一階相似度，否則爲0。

二階相似度(Second-Order Proximity)

二級相似描述的是兩個節點，它們的鄰域節點相似的情況。令 $N_u=\{s_{u,1},...,s_{u,|V|}\}$ 表示節點u和其他所有節點的所有一階相似度。

那麼兩個節點的二階相似度就由和表示。

圖embedding(Network Embedding)

給定一個圖G=(V,E),圖embedding 的目標是學習每個節點的映射函數，使得將節點映射到一個d維的低緯空間。即學習一個映射函數 $f:v_i\mapsto y_i\subset R^d$ ，而優化的目標就是利用一階和二階相似度優化和的相似度。

模型

整個模型的框架如圖所示，是一個雙通道的自編碼器，兩個通道共享全值。具體的一階相似和二階相似在損失函數中體現。

損失函數

上圖爲文章定義的表示符號，其中帶^的帽子的符號是網絡重建的輸出結構。

1.自編碼器重建二階相似度，即輸入當前節點和其他所有節點的鏈接權重，沒有鏈接則權重爲0。然後用自編碼器重建所有數據。那麼正常的自編碼器損失函數爲：

但是鄰域鏈接的節點很稀疏，這樣的話輸入數據,即的大部分維度上都是0，那樣網絡只要輸出全0，也能達到很好的效果，所以這裏損失函數對非零項做了加權。

這裏的⊙表示哈達馬乘積（即對應元素相乘）， $b_i=\{b_{i,j}\}^n_j=1$ ,如果 $s_{i,j}=0$ ,即節點i和j沒有邊連接，那麼 $b_{i,j}=1$ ，否則 $b_{i,j}=\beta >1$ 這樣就起到來加權的效果。

2.損失函數引入一階相似度限制，如果兩個節點有邊直接相連，那麼讓兩個節點的embedding向量儘量的靠近，所以可以直接最小化兩個embedding向量的最小二乘：

這裏的 $y^{(K)}_i$ 和 $y^{(K)}_j$ 就是自編碼器中間編碼出來的向量，也就是最後要提取出來的節點embedding。因爲網絡結構是雙通道的，所以可以直接在損失函數中加入這項損失。

3.加入L2正則，這個就不多說了。

那麼將上面的三項合併起來就可以獲得最終的損失函數：

然後就可以訓練自編碼器了，把訓練好的中間向量提取出來就是最終的節點embedding啦。

完

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

探索大語言模型：理解Self Attention| 京東物流技術團隊

一、背景知識在ChatGPT引發全球關注之後，學習和運用大型語言模型迅速成爲了熱門趨勢。作爲程序員，我們不僅要理解其表象，更要探究其背後的原理。究竟是什麼使得ChatGPT能夠實現如此卓越的問答性能？自注意力機制的巧妙融入無疑是關鍵因素

2024-05-14 23:57:26

GPU 硬件指標說明

流處理器：也叫渲染管、着色器。畫面都是由一個又一個像素點組成的，而流處理器就負責這些像素點的渲染工作； RT核心：光追核心，用作於光線追蹤效果； CUDA 核心和Tensor 核心：CUDA Core和Tensor Core，爲G

2024-05-13 22:35:43

舌尖上的AI：人工智能技術正在被“端上”餐桌

來源 | 人民數字FINTECH 責編 | 晉兆雨頭圖 | CSDN 下載自視覺中國 #人工智能技術正在被“端上”餐桌四方食事，不過一碗人間煙火。人工智能作爲一門新的技術科學，正在被人間煙火氣“端”上餐桌。人工智能“洗手”

2024-05-13 21:17:25

攻擊者正在利用AI，對保險公司發起大規模欺詐

保險欺詐一直是保險行業面臨的重要挑戰之一，尤其隨着技術的進步，欺詐者也在不斷更新其手段，利用AI技術，包括生成式模型、機器學習和數據分析工具等欺騙保險公司，而AI技術的應用正成爲他們的新工具，使其犯罪行爲更加隱蔽和複雜，挑戰保險行業的防欺詐

2024-05-10 00:55:17

AIGC在京東廣告創意的技術應用

一、前言電商廣告圖片不僅能夠抓住消費者的眼球，還可以傳遞品牌核心價值和故事，建立起與消費者之間的情感聯繫。然而現有的廣告圖片大多依賴人工製作，存在效率和成本的限制。儘管最近AIGC技術取得了卓越的進展，但其在廣告圖片的應

京東雲開發者

2024-05-08 23:24:18

AI繪圖新選擇：Fooocus工具發佈，小顯存助力大模型運行

隨着人工智能技術的飛速發展，AI繪圖工具已經成爲了衆多創作者們的得力助手。它們能夠基於深度學習算法，快速生成高質量的圖像，爲設計、藝術等領域注入了新的活力。然而，傳統的AI繪圖工具往往對硬件要求較高，使得許多擁有較低配置設備的用戶望而卻步。

2024-05-07 23:30:10

GLM國產大模型訓練加速：高效性能與成本優化的實踐

隨着人工智能技術的不斷進步，大模型的訓練成爲了推動深度學習領域發展的重要力量。然而，傳統的訓練方式往往面臨着性能瓶頸和高昂的成本問題，這使得許多研究者和開發者望而卻步。爲了解決這一難題，我們探索了使用OneFlow框架對GLM國產大模型進行

2024-05-07 23:30:09

LoRA微調語言大模型的實用技巧

一、引言隨着深度學習技術的快速發展，語言大模型在自然語言處理領域取得了顯著的進展。然而，傳統的微調方法通常需要大量的計算資源和時間，對於實際應用來說並不友好。爲了解決這個問題，LoRA微調技術應運而生。LoRA（Low-Rank Adap

2024-04-28 11:30:13

京東廣告研發——效率爲王：廣告統一檢索平臺實踐

1、系統概述實踐證明，將互聯網流量變現的在線廣告是互聯網最成功的商業模式，而電商場景是在線廣告的核心場景。京東服務中國數億的用戶和大量的商家，商品池海量。平臺在兼顧用戶體驗、平臺、廣告主收益的前提推送商品具有挑戰性。京東廣告檢索平臺

2024-04-25 23:17:47

Stable Diffusion中的embedding

Stable Diffusion中的embedding 嵌入，也稱爲文本反轉，是在 Stable Diffusion 中控制圖像樣式的另一種方法。在這篇文章中，我們將學習什麼是嵌入，在哪裏可以找到它們，以及如何使用它們。什麼是嵌入embe

2024-04-25 21:31:13

大模型區域落地再加速！百度“文心中國行”西部首站落地成都錦江

4 月 24 日，“文心中國行”西部地區首站落地成都錦江。成都市錦江區白鷺灣新經濟總部功能區、錦江區投資促進局與百度飛槳攜手合作，打造成都人工智能的新產業、新模式、新業態。來自成都政產學研各界的領導、專家、企業嘉賓，共同探討如何降低 AI

2024-04-25 11:41:53

文心中國行走進成都！4 月 24 日一起把握大模型時代的產業新機遇

4 月 24 日，文心中國行將走進成都。屆時，政府、企業與高校的相關專家和業界同仁將現場分享生成式人工智能與大模型最新進展，從人工智能政策解讀、大模型技術，到產業創新應用的實踐案例，讓參會者全方位瞭解大模型時期的發展與創新機遇。大會還特別

2024-04-23 11:41:07

文心大模型“你說我畫”：PaddleHub與PaddleSpeech的協同實踐

在人工智能領域中，自然語言處理和計算機視覺是兩個非常活躍的研究方向。隨着深度學習技術的發展，這兩個領域之間的交叉融合產生了許多令人興奮的應用場景。其中，“你說我畫”就是這樣一個結合自然語言處理和計算機視覺技術的創新應用。 “你說我畫”的核心

2024-04-22 11:29:20

探索時間序列大模型：TimeGPT的魅力與實踐

在數據科學的各個領域中，時間序列分析一直扮演着重要角色。無論是預測股票價格、氣候變化，還是分析醫療數據，時間序列模型都發揮着不可或缺的作用。然而，傳統的時間序列分析方法在處理複雜數據時常常面臨諸多挑戰，如數據稀疏性、非線性關係等。爲了應對這

2024-04-22 11:29:17

京東廣告研發 —— 京東推薦廣告排序機制演化

1、序言：廣告排序機制的前世今生 1.1、簡介：廣告排序機制在線廣告是國內外各大互聯網公司的重要收入來源之一，而在線廣告與傳統廣告最大的區別就在於其超大規模的實時競價環境：數以萬計的廣告主在一天內可以參與億級別的流量競拍。在這複雜的實

2024-04-24 23:17:14

24小時熱門文章

最新文章

最新評論文章