Flink使用（二）——Flink集群资源规划

时间：2019-12-03 01:52:40 阅读：240 评论：0 收藏：0 [点我收藏+]

前言

　　本文主要译自Flink Forward 2017的柏林站中Robert Metzger的有关集群规划的How to size your flink cluster一文。该文中主要是考虑网络资源，博主结合自己的使用经验对文中省略的做了一定补充，同时也非常欢迎大伙留言补充。

　　本文非直译，原文链接如下：https://www.ververica.com/blog/how-to-size-your-apache-flink-cluster-general-guidelines

　　文中拿捏不准的地方，均附有英文原文。若是有表述不合适的，欢迎大伙留言指出。

1、关键参数与资源

　　为估算Flink集群所需资源，首先我们需要根据Flink任务中的指标给出集群的最低资源需求（baseline）。

　　1.1 指标（metric）：

　　　　1）每秒的record数和每个record的大小；

　　　　2）不同key的个数和每个key产生state的大小；

　　　　3）state的更新方式以及state的访问模式

　　此外还需考虑SLA（服务级别协议）。例如，可能愿意接受的停机时间，可接受的延迟或最大吞吐量，因为此类SLA会对Flink群集的大小产生影响。

　　1.2 资源

　　　　在给Flink集群做规划时，我们需要考虑集群的资源，但这里的资源一般指什么呢？一般有以下几种：

　　　　1）网络容量。在考虑网络容量时，我们也需要考虑到可能使用网络的其他服务，如Kafka、HDFS等；

　　　　2）磁盘带宽。当我们的容错机制是基于磁盘的，如RockDB、HDFS，此时也有可能需要考虑到Kafka，因为其也是将数据存在磁盘的；

　　　　3）节点数量以及能提供的CPU和内存；

2、例子

　　Flink例子的拓扑图1如下：

技术图片

　　该例子从kafka消费message，以用户id（userId）做keyBy后，经过window算子聚合（window算子为sliding window，其窗口大小为5min，间隔是1min），处理后的消息写入到kafka中。

　　2.1 任务metrics

　　从kafka消费的record平均大小为2KB，吞吐量为1百万/s，userId的个数为5亿(5*10^9）。该任务的关键指标（key metric）如下：

技术图片

　　2.2 硬件

　　1）5个节点，每个节点有一个TaskManager；2）万兆网；3）磁盘通过网络连接（本例中集群部署在云上，物理机得另外考虑）；此外，kafka是单独的集群。如下图2：

技术图片

　　每个节点是16核，为简化，文中暂不考虑CUP和内存的需求。在实际的生产中需要根据任务逻辑和容错方式去考虑内存。本例的状态是通过RockDB的方式存储，该方式对内存的要求较小。

　　2.3 单节点资源需求

　　　　为方便分析，我们先考虑单节点上的资源需求，集群整体的需求可以大致通过乘以节点数得到。例子中，每个算子的并行度相同且没有其他特殊调度限制，每个节点拥有流任务的所有算子，即每个节点上都有Kafka source、window、Kafka sink算子，如下图3：

技术图片

　　为方便计算资源，上图中KeyBy算子单独给出，但在实际中KeyBy是Kafka算子和window算子之间链接的配置属性。下面将结合图3从上往下分析网络资源的需求（network resource requirement）。

　　2.3.1 Kafka Source

　　为计算从单个Kafka Source的拿到的数据，我们先计算从Kafka拿到数据的综合，计算过程如下：

　　1）每秒1,000,000条，每条大小为2KB ，每秒获得总数据为：

　　　　2KB×1,000,000/s=2GB/s

　　2）Flink集群中每个节点每秒获得数据为

　　　　2GB/s÷5=400MB/s

　　2.3.2 Shuffle过程（KeyBy）

　　经过KeyBy后，具有相同userId的数据将会在一个节点上，但是Kafka可能根据不同的元数据进行分区（partitioned according to a different partitioning scheme），因此对一个key（userId），单个节点直接从Kafka得到的数据为400MB/s÷5=80MB/s，这样就有320MB/s的需要通过shuffle获得。

　　2.3.3 window emit和Kafka sink

　　　　window会发送多少数据，有多少数据会到Kafka sink？分析如下：

　　　　window算子为每个key（userId）聚合生成4个long数，每分钟发射一次，这样window每分钟为每个key会发射2个int字段（userId、window_ts）和4个long字段，总的数据量如下：

　　　　(2 x 4 bytes) + (4 x 8 bytes) = 40 bytes per key

　　这样5个节点，每个节点的数据量为：

　　　　500,000,000 keys x 40 bytes÷5 = 4GB

　　每秒的数据量为4GB/min ÷ 60 = 67MB/s，因为每个节点上都有Kafka sink，不需要额外的重分区，因此从Flink到Kafka的数据为67MB/s。在实际中，算子不会以67MB/s的恒定速度发送数据，而是每分钟最大限度地利用可用带宽几秒钟。

　　单节点数据总流向总结如下：

Data in: 720MB/s (400 + 320) per machine
Data out: 387MB/s (320 + 67) per machine

　　整个过程可以总结如下：

技术图片

　　2.3.4 获取state和checkpointing

　　　　到目前为止，我们只考虑Flink处理的数据。实际上，还需考虑到state存储和checkpoint过程中所需要的网络资源。

　　　　1）state消耗的网络带宽

　　　　为弄清window算子的state大小，我们需要从另外一个角度去分析该问题。Flink的计算窗口大小为5min，滑动尺度为1min，为此Flink通过维持五个窗口实现“滑动窗口”。如在2.3.3节中提到，每个窗口Flink需要维持40Bytes的数据。每当一个event到达时，Flink将会从已有state中获得数据（40Bytes）去更新聚合值，然后将更新后的数据写入state（磁盘），如下图：

技术图片