Apache Flink之架構概述和環境(章節一)

原創

麦田里的守望者·

2020-06-21 08:57

作者：jiangzz 電話：15652034180 微信：jiangzz_wx 微信公衆賬號：jiangzz_wy

背景介紹

繼Spark之後第三代內存計算框架Flink應運而生，Flink作爲第三代計算框架Flink吸取了二代大數據Spark計算的設計的精華，依然採用DAG模型做任務拆分，但是Spark在流處理領域上因爲微觀批處理實時性不高甚至在性能上還不能和一代流處理框架Storm匹敵。因此第三代計算引擎Flink誕生了，主要原因是Flink是一個純流式計算引擎，而類似於Spark這種微批的引擎，只是Flink流式引擎的一個特例。在這一點上Flink的設計思路恰恰和Spark的實現相反。
如下圖所示，Spark的模塊和架構棧是基於RDD批處理實現的核心計算引擎，然後是在批處理之上實現了 DStream （微觀批處理），所以導致了Spark Streaming在流處理的領域避免不了批處理延遲較高的詬病。

Apache Flink是一個框架和分佈式處理引擎，用於對無界和有界數據流進行狀態計算。因此可以看出針對有界數據的計算其實本質就是批處理，對於無界數據就是Flink中的流處理。所以對於Flink而言在實現上是站在流處理的概念上實現批處理，但是Spark計算卻是站在批處理的視角上實現流處理。

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

Apache DolphinScheduler支持Flink嗎？

隨着大數據技術的快速發展，很多企業開始將Flink引入到生產環境中，以滿足日益複雜的數據處理需求。而作爲一款企業級的數據調度平臺，Apache DolphinScheduler也跟上了時代步伐，推出了對Flink任務類型的支持。 Flink

2024-04-30 11:49:27

利用 Amazon EMR Serverless、Amazon Athena、Apache Dolphinscheduler 以及本地 TiDB 和 HDFS 在混合部署環境中構建無服務器數據倉庫

引言在數據驅動的世界中，企業正在尋求可靠且高性能的解決方案來管理其不斷增長的數據需求。本系列博客從一個重視數據安全和合規性的 B2C 金融科技客戶的角度來討論雲上雲下混合部署的情況下如何利用亞馬遜雲科技雲原生服務、開源社區產品以及第三方

2024-04-25 21:18:23

2024 開源數據工程生態系統全景圖

點擊藍字關注我們作者 | ALIREZA SADEGHI翻譯 | Debra Chen 01 簡介

2024-04-23 21:30:36

【案例+PPT】普元信息臧一超：海量數據下“流批一體”的數據平臺演進路線

“數據中臺新範式”雲端峯會，深入解析湖倉一體、批流一體、治理與運營“三位一體”的數據中臺新範式特徵，普元信息數智研究院副院長臧一超在峯會發表演講《海量數據下的高性能流批一體數據開發平臺》。 18分鐘完整回放視頻見文末，拎幾個特別精彩的內

2024-04-23 11:43:51

GaussDB(DWS)基於Flink的實時數倉構建

本文分享自華爲雲社區《GaussDB(DWS)基於Flink的實時數倉構建》，作者：胡辣湯。大數據時代，廠商對實時數據分析的訴求越來越強烈，數據分析時效從T+1時效趨向於T+0時效，爲了給客戶提供極速分析查詢能力，華爲雲數倉GaussDB

2024-04-18 10:32:57

MaxCompute 近實時增全量處理一體化新架構和使用場景介紹

隨着當前數據處理業務場景日趨複雜，對於大數據處理平臺基礎架構的能力要求也越來越高，既要求數據湖的大存儲能力，也要求具備海量數據高效批處理能力，同時還可能對延時敏感的近實時鏈路有強需求，本文主要介紹基於 MaxCompute 的離線近實時一體

2024-04-15 23:41:52

海豚調度任務類型Apache SeaTunnel部署指南

Apache DolphinScheduler已支持Apache SeaTunnel任務類型，本文介紹了SeaTunnel任務類型如何創建，任務參數，以及任務樣例。一、Apache SeaTunnel SeaTunnel 任務類型，用於

2024-04-02 21:18:16

探索GaussDB(DWS)湖倉融合：Hudi與元數據打通的深度解析

華爲雲數倉GaussDB(DWS)研發專家高若嶽老師，深入解析GaussDB(DWS)數據倉庫如何與大數據生態快速對接。隨着智能數據時代的到來，數據量爆發式增長，數據形態呈海量化和多樣化發展，不再是單一的結構化數據。從海量和多樣化的數

2024-04-01 22:33:07

hive 、spark 、flink之想一想

hive 1：hive是怎麼產生的？ 2：hive的框架是怎麼樣的？ 3：hive 執行流程是什麼？ 4：hive sql是如何把sql語句一步一步到最後執行的？ 5：hive sql任務常用參數調優做過什麼？ spark 6：sp

2024-03-27 01:22:41

Flink內存參數調優

背景 Flink作業設置內存參數後發現不是自己預期的資源分配方式，比如分配了4G內存結果只用了2G，其餘2G都是閒置的，導致Flink作業內存上限不夠用，內存超用時TaskManager容器會被Yarn集羣殺死。另外並行度與slot槽數在

2024-03-23 00:20:41

5分鐘教你使用idea調試SeaTunnel自定義插件

在用Apache SeaTunnel研發SM2加密組件過程中，發現社區關於本地調試SeaTunnel文章過於簡單，很多情況沒有說明，於是根據自己遇到問題總結這篇文檔。SeaTunnel本地調試官方文檔，希望對大家有所幫助！

2024-03-20 21:21:09

數據湖三大框架

一、數據湖框架目前市面上流行的三大開源數據湖方案分別爲：Delta Lake、Apache Iceberg和Apache Hudi 1、Delta Lake：DataBricks公司推出的一種數據湖方案，官網 2、Apache Iceb

2024-03-14 00:16:55

Flink自建集羣作業優化

1、如何消除流查詢的不確定性影響 set 'table.optimizer.non-deterministic-update.strategy' = 'TRY_RESOLVE'; 流查詢中的不確定更新(NDU)問題通常不是直觀的，可能較複雜

2024-03-13 12:20:17

05-快速理解SparkSQL的DataSet

1 定義一個數據集是分佈式的數據集合。Spark 1.6增加新接口Dataset，提供 RDD的優點：強類型、能夠使用強大lambda函數 Spark SQL優化執行引擎的優點可從JVM對象構造Dataset，然後函數式轉換（map

2024-03-25 02:48:38

YOLOX 訓練自定義數據 - VOC2007數據集

官方文檔 - Train Custom Data 環境說明 Windows11 Git，可選 Python 3.10.9 [下載地址] GTX 1050Ti CUDA Toolkits 12 先決條件安裝 Nvidia 顯卡驅動

2024-03-22 22:22:28

24小時熱門文章

最新文章

最新評論文章