阿里雲 MaxCompute 行業級應用（優酷、鬥魚）及 MaxCompute SQL 調優

原創

2020-05-21 07:01

一、Maxcompute在優酷的應用

1.1 優酷業務的特點

1.2 Maxcompute 簡單易用

1.3 Maxcompute 生態完善

1.4 Maxcompute 性能強悍

1.5 MaxCompute 資源彈性

1.6 大數據整體方案

1.7 數據分層

數據中臺，從ODS層 ——> CDM層 ——> ADS層

1.8 業務賦能

1.9 計算優化

1.10 存儲優化

二、鬥魚 MaxCompute + Hadoop 混搭大數據架構實踐

2.1 自建集羣的發展瓶頸

2.2 大數據上雲的挑戰

Hive 窗口函數，像 rank() ，MaxCompute 不支持，需要確定哪些業務可以遷到雲上，哪些不可以。

2.3 混合雲模式帶來的變化

三、MaxCompute SQL 優化

3.1 SQL 成本計算

計算成本 <- 讀取IO數據量 * SQL複雜度
SQL 複雜度：Join / Group By / Order By / Distinct / window func / Insert into

因此，優化SQL的過程，實際上就是要儘可能減少IO讀取，儘可能減少計算資源使用，儘可能降低SQL複雜度，儘可能提升運行速度。

3.2 SQL IO 讀取優化

3.2.1 表分區優化

建立分區表

Create Table t1 (...) partitioned by (pt string,region string)

分區層數不要太多

分區裁剪

避免全表掃描，減少資源浪費

Case:where pt = xxx and region = xxx

分區儘量按層級順序剪裁

分區值儘量常量化，避免不可確定值，如UDF

分區值儘量避免引用列的表達式計算或者子查詢

寫分區

寫入靜態分區，優化數據存儲

避免動態分區，防止小文件過多和計算長尾

3.2.2 列裁剪、條件過濾

只引用有效列

避免 select * from xxx

常量代替引用列，如count© -> count(1) // c not null

儘可能 pushdown 過濾條件

where a > 10 and (b > 1 or c < 1)

Limit N

3.2.3 源表用戶

合併不同SQL，一讀多計算

讀取相同源表可合併，節省IO和計算資源

對源表統計多種指標計算或者篩選不同數據處理

避免規模過大，運行時間過長

Multi Insert ，動態分區，一讀多寫

同一SQL讀取相同源表，系統會優化只讀取一次

資源足夠，也可以考慮拆分SQL，讀取和計算更好並行，資源換時間

子查詢合併

對於SQL中相同的子查詢也會合併成一個源

儘可能保持子查詢語句一樣，觸發合併

3.3 SQL 計算優化

3.4 SQL 整體優化

3.4.1 關鍵路徑優化

3.4.2 長週期指標統計優化

3.5 總結

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

ClickHouse內幕（1）數據存儲與過濾機制

本文主要講述ClickHouse中的數據存儲結構，包括文件組織結構和索引結構，以及建立在其基礎上的數據過濾機制，從Part裁剪到Mark裁剪，最後到基於SIMD的行過濾機制。數據過濾機制實質上是構建在數據存儲格式之上的算法，所以在介紹過濾

2024-06-07 23:54:51

一文搞懂DevOps、DataOps、MLOps、AIOps：所有“Ops”的比較

引言近年來，"Ops"一詞在 IT 運維領域的使用迅速增加。IT 運維正在向自動化過程轉變，以改善客戶交付。傳統的應用程序開發採用 DevOps 實施持續集成（CI）和持續部署（CD）。但對於數據密集型的機器學習和人工智能（AI）應用，精

2024-06-07 14:08:38

JimuReport 積木報表 v1.7.5 版本發佈，免費的JAVA報表工具

項目介紹一款免費的數據可視化報表工具，含報表和大屏設計，像搭建積木一樣在線設計報表！功能涵蓋，數據報表、打印設計、圖表報表、大屏設計等！ Web 版報表設計器，類似於excel操作風格，通過拖拽完成報表設計。秉承“簡單、易用、專業”

2024-06-07 01:13:43

營銷系統黑名單優化：位圖的應用解析

背景營銷系統中，客戶投訴是業務發展的一大阻礙，一般會過濾掉黑名單高風險賬號，並配合頻控策略，來減少客訴，進而增加營銷效率，減少營銷成本，提升營銷質量。營銷系統一般是通過大數據分析建模，在CDP（客戶數據平臺，以客戶爲核心，圍繞數據融

京東雲開發者

2024-06-06 11:54:12

跨越雲端，華爲雲技術專家分享高效跨雲遷移實踐

本文分享自華爲雲社區《【華爲雲Stack】【大架光臨】第18期：跨越雲端，華爲雲Stack的高效跨雲遷移實踐》，作者：大架光臨。 1 背景在企業雲化的浪潮中，混合多雲已經是企業IT部署的新常態，虛擬機承載的業務佔據很大的比重。在上雲

2024-06-06 10:56:54

高效啓動DolphinScheduler工作流：Java URL調用詳解

轉載自牛肉胡辣湯在大數據分析和處理的領域中，DolphinScheduler是一個開源的分佈式工作流調度系統，可以用於調度和管理複雜的工作流任務。本文將介紹如何使用Java中的URL類來調用DolphinScheduler的API，實現啓

2024-06-04 21:21:59

【數智化人物展】白鯨開源CEO郭煒：大模型時代下DataOps驅動企業數智化升級

本文由白鯨開源CEO郭煒投遞並參與由數據猿聯合上海大數據聯盟共同推出的《2024中國數智化轉型升級先鋒人物》榜單/獎項評選。隨着大數據、人工智能技術的飛速發展，我們已邁入了一個全新的時代------大模型時代。在這個時代背景下，企業提高

2024-06-04 21:21:58

Opal 機器學習平臺：愛奇藝數智一體化實踐

01 綜述 Opal 是愛奇藝大數據團隊研發的機器學習平臺，包含特徵生產、樣本構建、模型訓練、模型部署在內的多環節 Bigdata + AI 開發服務，內置多種訓練鏡像、

愛奇藝技術產品團隊

2024-06-01 02:21:16

基於對比稀疏擾動技術的時間序列解釋框架 ContraLSP

開篇近日，由阿里雲計算平臺大數據基礎工程技術團隊主導，與南京大學、賓夕法尼亞州立大學、清華大學等高校合作，解釋時間序列預測模型的論文《Explaining Time Series via Contrastive and Locally

2024-06-01 00:25:50

向量數據庫引領 AI 創新——Zilliz 亮相 2024 亞馬遜雲科技中國峯會

2024年5月29日，亞馬遜雲科技中國峯會在上海召開，此次峯會聚集了來自全球各地的科技領袖、行業專家和創新企業，探討雲計算、大數據、人工智能等前沿技術的發展趨勢和應用場景。作爲領先的向量數據庫技術公司，Zilliz 在本次峯會上展示了最新的

2024-05-30 21:25:17

金融反欺詐指南：車險欺詐爲何如此猖獗？

青島市人民檢察院在其官方微信公衆號上發佈的梁某保險詐騙案顯示，2020 年以來，某汽修廠負責人梁某、某汽車服務公司負責人孫某，與保險公司的趙某等人相互勾結，收購二手北汽等品牌新能源汽車，併爲這些車輛購買車損險。隨後，他們利用暴雨天氣，故意製

2024-05-30 00:16:51

智能測試持續加碼，大模型引領軟件測試新生態

在軟件行業日新月異的今天，智能測試已成爲提升軟件質量的關鍵環節。大模型的崛起，更是爲軟件測試帶來了前所未有的變革。隨着AI和ML技術的突飛猛進，智能測試得到了快速發展，實現了對測試過程的自動化和智能化管理，顯著提高了測試效率和質量。如今，智

2024-05-25 02:07:17

圖表控件LightningChart JS v5.2正式發佈 - 全新的開發體驗

LightningChart JS是Web上性能特高的圖表庫，具有出色的執行性能 - 使用高數據速率同時監控數十個數據源。 GPU加速和WebGL渲染確保您的設備的圖形處理器得到有效利用，從而實現高刷新率和流暢的動畫，常用於貿易，工程，航空

2024-05-23 12:20:12

風控指南：國內車險欺詐呈現四大趨勢

2024年4月11日，國家金融監督管理總局官網發佈國家金融監督管理總局關於《反保險欺詐工作辦法（徵求意見稿）》公開徵求意見的公告。《徵求意見》共6章、37條，明確反保險欺詐工作目標是建立“監管引領、機構爲主、行業聯防、各方協同”四位一體的

2024-05-23 12:16:45

安全分析：國內一些常見的汽車保險欺詐案件

2024年3月，北京警方打掉一個故意製造事故實施騙保的專業保險詐騙犯罪團伙。此案中，某保險公司在職員工與離職員工、定點汽修廠內外勾連，通過虛構、故意製造車輛事故或對事故擴損等手段騙取理賠款。不久前，遼寧警方也破獲一起自導自演僞造車禍騙保的案

2024-05-22 00:17:52

24小時熱門文章

lightdb hash index的性能和限制

最新文章

最新評論文章