详解Flink同步Kafka数据到ClickHouse分布式表-PingCAP

详解Flink同步Kafka数据到ClickHouse分布式表

网友投稿 1132 2023-04-18

详解Flink同步Kafka数据到***分布式表

引言

业务需要一种OLAP引擎，可以做到实时写入存储和查询计算功能，提供高效、稳健的实时数据服务，最终决定***

什么是***？

***是一个用于联机分析(OLAP)的列式数据库管理系统(DBMS)。

列式数据库更适合于OLAP场景(对于大多数查询而言，处理速度至少提高了100倍)，下面详细解释了原因(通过图片更有利于直观理解)，图片来源于***中文官方文档。

行式

列式

我们使用Flink编写程序，消费kafka里面的主题数据，清洗、归一，写入到clickhouse里面去。

这里的关键点，由于第一次使用，无法分清应该建立什么格式的clickhouse表，出现了一些问题，最大的问题就是程序将数据写入了，查询发现数据不完整，只有一部分。我也在网上查了一些原因，总结下来。

为什么有时看不到已经创建好的表并且查询结果一直抖动时多时少？

常见原因1：

建表流程存在问题。***的分布式集群搭建并没有原生的分布式DDL语义。如果您在自建***集群时使用create table创建表，查询虽然返回了成功，但实际这个表只在当前连接的Server上创建了。下次连接重置换一个Server，您就看不到这个表了。

解决方案：

常见原因2：

ReplicatedMergeTree存储表配置有问题。ReplicatedMergeTree表引擎是对应MergeTree表引擎的主备同步增强版，在单副本实例上限定只能创建MergeTree表引擎，在双副本实例上只能创建ReplicatedMergeTree表引擎。

解决方案：

在双副本实例上建表时，请使用ReplicatedMergeTree(‘/clickhouse/tables/{database}/{table}/{shard}’, ‘{replica}’)或ReplicatedMergeTree()配置ReplicatedMergeTree表引擎。其中，ReplicatedMergeTree(‘/clickhouse/tables/{database}/{table}/{shard}’, ‘{replica}’)为固定配置，无需修改。

这里引出了复制表的概念，这里介绍一下，只有 MergeTree 系列里的表可支持副本：

ReplicatedMergeTree ReplicatedSummingMergeTree ReplicatedReplacingMergeTree ReplicatedAggregatingMergeTree ReplicatedCollapsingMergeTree ReplicatedVersionedCollapsingMergeTree ReplicatedGraphiteMergeTree

副本是表级别的，不是整个服务器级的。所以，服务器里可以同时有复制表和非复制表。副本不依赖分片。每个分片有它自己的独立副本。

创建复制表

先做好准备工作，该建表的建表，然后编写程序。在表引擎名称上加上 Replicated 前缀。例如：ReplicatedMergeTree。

首先创建一个分布式数据库

麒麟v10 上部署 TiDB v5.1.2 生产环境优化实践

1132 2023-04-18

详解Flink同步Kafka数据到ClickHouse分布式表

麒麟v10 上部署 TiDB v5.1.2 生产环境优化实践

高成本云服务？TiDB 帮你省钱

零售业数据库选型与迁移ToC系统实践大规模场景应用

推荐文章

HTAP 还可以这么玩？丨TiDB 在 IoT 智慧园区的应用

新特性解析丨TiDB 资源管控的设计思路与场景解析

TiDB赋能保险业-首个全栈自主核心保单系统成功投产

首个云原生、分布式、全栈国产化银行核心业务系统投产上线丨TiDB × 杭州银行

TiDB 在社交场景的解决方案实践

电商数据技术栈，在海量数据增长下如何实现实时与全量兼得？

金融行业数据库的选择

TiDB 在智能制造中的应用实践

TiDB 在全球头部物流企业计费管理系统的应用实践

PingCAP与教育部教育管理信息中心合作，推动普惠教育数字化转型

友情链接

热评文章

TiDB 中标杭州银行核心系统数据库项目

TiDB 首批通过信通院 HTAP 数据库基础能力评

PingCAP 与 Wisconsin-Madiso

PingCAP 成为中国唯一入选 Forrester

TiDB 走进东软集团，共建医疗数字化基石

共享开源技术，共建开放生态丨平凯星辰余梦杰出席 20

详解Flink同步Kafka数据到ClickHouse分布式表

微信扫一扫：分享

推荐文章

友情链接

热评文章