Policy Distillation

原創

2022-06-07 13:43

發表時間：2016（ICLR 2016）
文章要點：這篇文章考慮的情形是從一個RL的policy網絡提取策略，遷移到另一個policy網絡。其實就是知識遷移（Distillation is a method to transfer knowledge from a teacher model T to a student model），只是這裏用到強化裏面了。目的是可以用來做模型壓縮，multiple task-specific的策略融合到一個policy裏，以及一定程度提升泛化性。
具體的做法就是，用teacher policy和環境交互，收集數據，然後用監督學習的方法訓練一個新的policy網絡。作者以DQN爲例提出了三種loss function。第一種直接學Q value最大值對應的動作，loss爲negative log likelihood loss (NLL)

第二種是用mean-squared-error loss (MSE)來學Q value

第三章是用Kullback-Leible divergence (KL)來學用Q value構成的概率分佈

得出的結論是MSE最差，KL最好

總結：一篇很老的文章了，算是policy distillation的開端吧，其實主要就是監督學習，修改的就是loss function。
疑問：裏面p4說policies are inherently lower variance than value functions，這是爲啥？因爲value是unbounded嗎？

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

即刻放大鏡。跟隨鼠標，屏幕任意位置放大

特徵：支持熱鍵放大位置跟隨縮放比例隨時調整高亮放大鏡區域記住上一次設定操作說明：啓動程序，托盤顯示圖標Ctrl+Q熱鍵開啓放大鏡放大位置跟隨鼠標移動鼠標滾輪調整縮放比例常見問題：視頻播放的時候能否實時放大不支持。放大期間，

2024-04-19 14:35:10

GPG4win 加解密使用筆記

簡介： Gpg4win是一套文件或email加密解密的安全方案。 Gpg4win - a secure solution for file and email encryption. Gpg4win (GNU Privacy Guard f

2024-04-19 14:33:30

視頻講解如何構建surging微服務調用

surging 是一款優秀的微服務引擎，包括了社區版，標準版，異構版，平臺版本來解決公司的業務場景需求，如果你是初學者，或者是技術狂熱者，社區版完全可以符合你們的要求來學習或者構建起微服務體系的引擎框架，如果你沒信心去把控構建

2024-04-19 14:32:59

【面試準備】項目經驗——接口自動化項目

Java junit 項目的接口就很簡單，只支持本地運行，結構就是這樣了。 REST_TEMPLATES

金大鑫要堅持

2024-04-19 14:29:29

【面試準備】【SQL】數據庫有哪些約束？

數據庫中的約束（constraints）是用來確保數據庫中數據的準確性和可靠性的一種規則。以下是一些常見的數據庫約束： PRIMARY KEY（主鍵）：確保列的值是唯一的，並且不能爲NULL。 FOREIGN KEY（外鍵）：用於在

金大鑫要堅持

2024-04-19 14:29:29

【面試準備】跨域問題解決方法

跨域是什麼瀏覽器對於javascript的同源策略的限制，是一種安全策略舉例：用戶登陸某個網站後，服務器在客戶端寫了一些cookie，如果cookie被其他網站讀取，那麼隱私信息就會泄漏，包含用戶的登錄狀態等。跨域情況說明：域名不

金大鑫要堅持

2024-04-19 14:29:29

遞歸處理複製變量目錄按原路徑複製到新目錄的腳本

腳本如下: 1 # coding: utf-8 2 3 """ 4 該腳本主要做把源目錄下所有文件，照搬原路徑基礎上覆制文件 5 """ 6 7 import os 8 # import shutil

2024-04-19 14:26:19

我的個人博客上線開源啦，歡迎圍觀！

博客地址：https://yanyunfeng.com 其實很早就有開發一個自己個人博客的想法，但是一直沒有付諸行動，如今大家能看到這篇文章，說明我的博客終於是上線啦，撒花～～在開發這個博客之前，我都是在各大平臺上寫些東西，但是吧，平臺規

2024-04-19 14:23:08

golang開發深入理解 context

context的歷史 context包在Go 1.7版本正式加入Go標準庫。在加入之前我們看看Go團隊核心成員Sameer Ajmani在2014年發表的一篇關於context介紹博客，地址：https://go.dev/blog/cont

2024-04-19 14:22:38

南方公園完整破碎

被魅惑了,就用自己人打一下自己即可解除. 手機女俠大招和減防攻擊很好用.

張博的博客

2024-04-19 14:20:58

BGE M3-Embedding 模型介紹

BGE M3-Embedding來自BAAI和中國科學技術大學，是BAAI開源的模型。相關論文在https://arxiv.org/abs/2402.03216，論文提出了一種新的embedding模型，稱爲M3-Embedding，它在多

2024-04-19 14:20:18

【百川大模型】RediSearch在python中的應用場景

[本文出自天外歸雲的博客園] RediSearch是一個非常強大的全文搜索引擎，它可以與Python一起使用，爲你的應用程序提供快速的搜索能力。以下是一些使用RediSearch的場景示例：場景一：商品搜索假設你正在開發一個電子商務網站

2024-04-19 14:16:58

CXF WebService wsdl2java

下載 apache-cxf-3.3.1 並解壓到bin 目錄下，輸入生成命令 wsdl2java -encoding utf-8 -d D:\Software\Webservice\ws http://XXX.XXX.XXX.XXX:X

2024-04-19 14:15:57

keycloak~jwt的rs256簽名的驗證方式

接口地址 keycloak開放接口地址：/auth/realms/fabao/.well-known/openid-configuration rsa算法相關術語 RSA算法是一種非對稱加密算法，其安全性基於大整數分解的困難性。在RS

2024-04-19 14:13:27

通過Java修改consul配置（保留註釋、保留縮進）

　　直接上代碼了，找了很久也沒找到保留註釋的三方包，snakeyaml 的縮進一直也有問題，就自己寫了個正則方式的　　consul也沒有相關接口，只接受整個的　　傳key和value，替換相應value值，　　大佬

2024-04-19 14:08:07

24小時熱門文章

最新文章

最新評論文章