为什么大型机器学习模型必须缩小？

原創

2021-05-12 10:03

{"type":"doc","content":[{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"更大的规模不一定更适合机器学习。但是，随着研究人员相互竞争追求最先进的基准，深度学习模型和训练它们的数据集不断扩展。不管它们如何突破，更大的模型都会对预算和环境产生严重的影响。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"比如 GPT-3，一个在去年夏天推出的大受欢迎的自然语言处理模型，据说花了"},{"type":"link","attrs":{"href":"https:\/\/venturebeat.com\/2020\/06\/01\/ai-machine-learning-openai-gpt-3-size-isnt-everything\/?fileGuid=W7n6QtTkCpYUnzp6","title":"","type":null},"content":[{"type":"text","text":"1200 万美元"}]},{"type":"text","text":"用于训练。更有甚者，马萨诸塞大学阿默斯特分校（UMass Amherst）的"},{"type":"link","attrs":{"href":"https:\/\/arxiv.org\/abs\/1906.02243?fileGuid=W7n6QtTkCpYUnzp6","title":"","type":null},"content":[{"type":"text","text":"研究人员发现"}]},{"type":"text","text":"，训练大型人工智能模型所需的计算能力能够产生 60 多万磅的二氧化碳排放——是普通汽车寿命周期排放量的 5 倍。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"目前，没有迹象表明，以机器学习行业的发展速度，计算密集型工作将会放缓。OpenAI 的研究显示，深度学习模型的计算能力在 2012 到 2018 年间增长了惊人的 30 万倍，超过了摩尔定律。这个问题不仅仅是训练这些算法，而是要在生产环境下运行它们，或者说在推理阶段。对很多团队而言，由于纯粹的成本和资源的限制，深度学习模型的实际应用仍然遥不可及。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"幸好，研究人员发现了一些新的方法来缩小深度学习模型，并通过更智能的算法来优化训练数据集，使得模型在生产环境下运行得更快，计算量也更少。就连业界的一个峰会也专门讨论低功耗、"},{"type":"link","attrs":{"href":"https:\/\/www.tinyml.org\/summit\/?fileGuid=W7n6QtTkCpYUnzp6","title":"","type":null},"content":[{"type":"text","text":"微型机器学习"}]},{"type":"text","text":"。剪枝（Purning）、优化（Quantization）和迁移学习（Transfer Learning）就是三种具体的技术。这些技术可以让那些无法投资数百万美元把模型转换成生产环境的组织实现机器学习的民主化。对“边缘”用例来说，这一点尤为重要，因为大型专用人工智能硬件在物理上并不切实际。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"第一种技术，即剪枝，是近几年来研究的热点之一。包含“"},{"type":"link","attrs":{"href":"https:\/\/arxiv.org\/abs\/1510.00149?fileGuid=W7n6QtTkCpYUnzp6","title":"","type":null},"content":[{"type":"text","text":"深度压缩"}]},{"type":"text","text":"”（Deep Compression）和“"},{"type":"link","attrs":{"href":"https:\/\/arxiv.org\/abs\/1803.03635?fileGuid=W7n6QtTkCpYUnzp6","title":"","type":null},"content":[{"type":"text","text":"彩票假说"}]},{"type":"text","text":"”（Lottery Ticket Hypothesis）在内的高引用文献表明，可以在不损失正确性的情况下消除神经网络中“神经元”之间一些不必要的连接，有效地使模型更小、更容易在资源有限的设备上运行。"},{"type":"link","attrs":{"href":"https:\/\/arxiv.org\/abs\/2004.14340?fileGuid=W7n6QtTkCpYUnzp6","title":"","type":null},"content":[{"type":"text","text":"最新的论文"}]},{"type":"text","text":"进一步验证并完善了早期的技术，以开发出更小的模型，使其达到更高的速度和正确度。对某些模型，比如"},{"type":"link","attrs":{"href":"https:\/\/www.geeksforgeeks.org\/residual-networks-resnet-deep-learning\/?fileGuid=W7n6QtTkCpYUnzp6","title":"","type":null},"content":[{"type":"text","text":"ResNet"}]},{"type":"text","text":"，可以在不影响正确性的情况下剪枝 90% 左右。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"第二种技术，即优化，也正在逐步普及。"},{"type":"link","attrs":{"href":"https:\/\/www.qualcomm.com\/news\/onq\/2019\/03\/12\/heres-why-quantization-matters-ai?fileGuid=W7n6QtTkCpYUnzp6","title":"","type":null},"content":[{"type":"text","text":"优化"}]},{"type":"text","text":"涉及许多不同的技术，它们可以将大的输入值转换为小的输出值。换句话来说，在硬件上运行神经网络可以产生上百万次乘和加运算。减少这些数学运算的复杂性有助于减少内存需求和计算成本，这将大大提高性能。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"最后，虽然这不是一种缩小模型的技术，但是"},{"type":"link","attrs":{"href":"https:\/\/www.amazon.science\/blog\/when-does-transfer-learning-work?fileGuid=W7n6QtTkCpYUnzp6","title":"","type":null},"content":[{"type":"text","text":"迁移学习"}]},{"type":"text","text":"能够在有限的数据中帮助训练一个新模型。迁移学习以预训练模型作为起点。通过有限的数据集，模型的知识可以“迁移”到一个新的任务中，而无需从头再来训练原始模型。在训练模型时，这是一种减少计算能力、能源和资金的重要方法。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"最重要的启示是，模型可以（也应该）尽可能地优化，使其在较少的计算量下运行。在不牺牲性能和正确性的情况下，寻找减小模型大小和相关计算能力的方法将是机器学习的下一大突破。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"如果能有更多人在生产环境中低成本地使用深度学习模型，我们就能真正看到现实世界中创新的新应用。这些应用可以在任何地方运行，甚至是在最小的设备上，以达到做出即使决定所需的速度和正确性。或许，小型模型最好的效果是整个行业能够减少其环境硬件，而不是每六年增加 30 万倍。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","marks":[{"type":"strong"}],"text":"作者介绍："}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"Sasa Zelenovic，Neural Magiic 团队成员，帮助数据科学家发现开源、廉价的硬件加速器替代品，以实现深度学习性能。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","marks":[{"type":"strong"}],"text":"原文链接："}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"https:\/\/www.datasciencecentral.com\/profiles\/blogs\/honey-i-shrunk-the-model-why-big-machine-learning-models-must-go"}]}]}

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

2024年DataOps趋势预测：AI不会取代数据工程师

APM digest收集了多位行業專家對DataOps在2024的發展形勢及對IT和業務的影響的預測，這些技術最高管理者，包括Confluent技術戰略負責人Andrew Sellers的深刻洞見可能與你的感覺一致嗎？快來探討一下。數據可

2024-04-30 11:49:29

数字化转型新篇章：企业通往智能化的新范式

早在十多年前，一些具有前瞻視野的企業以實現“數字化”爲目標啓動轉型實踐。但時至今日，可以說尚無幾家企業能夠在真正意義上實現“數字化”。在實現“數字化”的征途上，人們發現，努力愈進，彷彿終點愈遠。究其原因，還在於轉型一直落後於技術邊界的拓展

2024-04-29 21:22:20

Stable Diffusion中的embedding

Stable Diffusion中的embedding 嵌入，也稱爲文本反轉，是在 Stable Diffusion 中控制圖像樣式的另一種方法。在這篇文章中，我們將學習什麼是嵌入，在哪裏可以找到它們，以及如何使用它們。什麼是嵌入embe

2024-04-25 21:31:13

AI从入门到入门之手写数字识别模型java方式Dense全连接神经网络实现

前言：授人以魚不如授人以漁.先學會用，在學原理，在學創造，可能一輩子用不到這種能力，但是不能不具備這種能力。這篇文章主要是介紹算法入門Helloword之手寫圖片識別模型java中如何實現以及部分解釋。目前大家對於人工智能-機器學習-神經網

2024-04-19 23:17:21

Pinecone: 大模型时代的智能索引与搜索解决方案

隨着人工智能技術的飛速發展，大模型（Large Models）已成爲衆多領域的重要工具。無論是自然語言處理、圖像識別還是其他複雜任務，大模型都展現出了強大的性能。然而，隨着模型規模的不斷擴大，數據量的激增，如何有效地管理、索引和搜索這些模型

2024-04-19 11:29:43

软件测试从自动化到智能化，大模型开始加入

隨着科技的飛速發展，軟件行業也在不斷地演進和創新。作爲軟件行業的關鍵環節之一，軟件測試行業也在經歷着前所未有的變革。從最初的手動測試，到自動化測試，再到如今的智能化測試，軟件測試行業正在經歷一場深刻的技術革命。在這場革命中，Testin雲測

2024-04-19 00:53:25

裁员了！别错过2024年大数据工程师必备的10项技能

在當今快速發展的世界中，數據被視爲新的石油。隨着對數據驅動洞察的日益依賴，大數據工程師的角色比以往任何時候都更爲關鍵。這些專業人員在管理和優化組織內的數據操作中扮演着至關重要的角色。在本文中，我們將探索2024年大數據工程師必須具備的十

2024-04-16 11:00:53

DevOps已死？2024年的DevOps将如何发展

隨着我們進入2024年，DevOps也隨之發生變化。新興的技術、變化的需求和發展的方法正在重新定義有效實施DevOps實踐。 IDC預測顯示，未來五年，支持DevOps實踐的產品市場繼續保持健康且快速增長，2022年-2027年的複合年增長

2024-04-08 12:51:44

从模型到部署，教你如何用Python构建机器学习API服务

本文分享自華爲雲社區《Python構建機器學習API服務從模型到部署的完整指南》，作者：檸檬味擁抱。在當今數據驅動的世界中，機器學習模型在解決各種問題中扮演着重要角色。然而，將這些模型應用到實際問題中並與其他系統集成，往往需要構建API

2024-04-08 10:33:17

测试左移已经开始影响DevOps的发展？

在軟件開發的早期，該過程通常是開發人員編寫代碼，再將其交給質量保證（QA）進行測試。這種瀑布開發方法可能會導致質量問題和延遲，因爲問題是在週期後期發現的。一、瞭解DevOps和測試左移 DevOps是Development和Operati

2024-04-07 12:48:37

黑盒Prompt优化：提升大模型反馈效果的新思路

隨着人工智能技術的快速發展，大模型在各種應用場景中發揮着越來越重要的作用。然而，如何提升大模型的反饋效果，使其更加準確、高效地爲用戶提供服務，一直是研究者和開發者關注的焦點。本文提出了一種新的思路——黑盒Prompt優化，旨在通過改進輸入提

2024-03-29 00:01:17

分布式数据库技术的演进和发展方向

這些年大家都在談分佈式數據庫，各大企業也紛紛開始做數據庫的分佈式改造。那麼，所謂的分佈式數據庫到底是什麼？採用什麼架構？優勢在哪？爲什麼越來越多企業選擇它？分佈式數據庫技術會向什麼方向發展？帶着這些疑問，一探究竟吧！參與文末的話題互動

2024-03-26 11:34:43

利用RAG技术打破大模型幻觉

隨着人工智能技術的不斷進步，大模型在各個領域中發揮着越來越重要的作用。然而，大模型幻覺問題一直是制約其進一步發展的瓶頸。爲了解決這一問題，研究者們不斷探索新的技術和方法。近年來，一種名爲RAG（檢索增強生成）的技術備受關注，它通過結合知識圖

2024-03-21 00:28:34

与 NVIDIA 再次合作、深度参与 GTC，Zilliz 与全球顶尖开发者共迎 AI 变革时刻！

Zilliz 與全球的頂尖開發者齊聚 GTC 2024。近日，備受關注的 NVIDIA GTC 2024 已拉開序幕，來自世界各地的頂尖 AI 開發者齊聚美國加州聖何塞會議中心，共同探索行業未來。作爲去年被 NVIDIA CEO 黃仁

2024-03-19 21:26:53

多模态+大模型会带来哪些“化学反应”？

導語：沒人懷疑，2024 年，AI 依然將是科技界的主角。上個月，OpenAI 推出了可以生成 60 秒高清視頻的視頻生成模型 Sora，掀起了對多模態模型的進一輪討論。多模態大模型技術的最新進展如何？這一波新技術，對於行業和消費者的體驗會

2024-03-15 13:45:01

24小時熱門文章

最新文章

爲什麼大型機器學習模型必須縮小？

最新評論文章