Flink SQL+Hudi数据入湖与分析实践

🕗 发布于 2024-10-19 02:03 flink 大数据

数据湖构建（Hudi）可以结合实时计算Flink版，以及Flink CDC相关技术，实现灵活定制化的数据入湖。并利用DLF统一元数据管理、权限管理等能力，实现数据湖多引擎分析、数据湖管理等功能。本文为您介绍Flink+DLF数据湖方案具体步骤。

背景信息

操作流程

步骤一：准备MySQL数据

CREATE DATABASE testdb;
CREATE TABLE testdb.student (
  `id` bigint(20) NOT NULL,
  `name` varchar(256) DEFAULT NULL,
  `age` bigint(20) DEFAULT NULL,
  PRIMARY KEY (`id`)
);

INSERT INTO testdb.student VALUES (1,'name1',10);
INSERT INTO testdb.student VALUES (2,'name2',20);

步骤二：创建Flink入湖作业

-- 创建数据源表
CREATE TABLE IF NOT EXISTS student_source (
  id INT,
  name VARCHAR (256),
  age INT,
  PRIMARY KEY (id) NOT ENFORCED
)
WITH (
  'connector' = 'mysql-cdc',
  -- hostname替换为RDS的连接地址
  'hostname' = 'rm-xxxxxxxx.mysql.rds.aliyuncs.com',
  'port' = '3306',
  'username' = '<RDS user name>',
  'password' = '<RDS password>',
  'database-name' = '<RDS database>',
  -- table-name为数据源表，本例中填步骤二创建的student表
  'table-name' = 'student'
);

-- catalog名为步骤二创建的dlf catalog name，本例中填dlf
CREATE DATABASE IF NOT EXISTS dlf.dlf_testdb;

-- 创建目标表
CREATE TABLE IF NOT EXISTS dlf.dlf_testdb.student_hudi (
  id    BIGINT PRIMARY KEY NOT ENFORCED,
  name  STRING,
  age    BIGINT
) WITH(
  'connector' = 'hudi'
);

-- 创建流SQL作业
INSERT INTO dlf.dlf_testdb.student_hudi SELECT * FROM student_source  /*+ OPTIONS('server-id'='123456') */;

步骤三：使用DLF数据湖分析

select * from dlf_testdb.student_hudi;

原文地址：https://blog.csdn.net/u010739163/article/details/143053944

免责声明：本站文章内容转载自网络资源，如本站内容侵犯了原著者的合法权益，可联系本站删除。更多内容请关注自学内容网（zxcms.com）！

上一篇：SpringBoot框架下的智能人事管理平台：开发与实践
下一篇：tomcat catalina log 出现乱码（SpringMvc）

大数据治理：构建数据驱动的智能决策体系
随着大数据时代的到来，企业和组织面临着海量数据的挑战和机遇。大数据治理作为一种核心思想，旨在通过规范化、整合和优化数据资源，构建一个可信、高效、安全的数据环境，为智能决策提供支持。本文将介绍大数据治理
阅读更多2024-10-19
【Mysql/xtrabackup】主从恢复（高端操作）
xtrabackup恢复主从，用于mysql数据量大情况
阅读更多2024-10-19
大数据-178 Elasticsearch Query - Java API 索引操作 & 文档操作
通过 Java API，可以向特定索引插入单个文档，并指定文档的 ID（如果不指定，Elasticsearch 会自动生成一个 ID）。获取文档：Java API 可以根据文档 ID 从索引中获取单个
阅读更多2024-10-19
Laravel|Lumen项目配置信息config原理
laravel config 配置原理
阅读更多2024-10-19
玄机平台-应急响应-webshell查杀
玄机靶场，适合应急响应的学习
阅读更多2024-10-19
从Apple Intelligence到远程机器人手术：更快、更安全的网络成企业业务关键
：以苹果公司的Apple Intelligence以及医疗界革命性的远程机器人手术为例，探讨更快、更安全网络对企业的重要性。
阅读更多2024-10-19
【RV1126】板子adb 调试流程
I 0 选择的摄像头序号，可以选择0或1。1. 连接电源线，网线。
阅读更多2024-10-19
【网络】HTTPS协议
本文主要介绍了HTTPS的加密过程，以及其如何保证数据的安全
阅读更多2024-10-19
LeetCode 145.二叉树的后序遍历
给你一棵二叉树的根节点root，返回其节点值的。[0, 100]递归算法很简单，你可以通过迭代算法完成吗？
阅读更多2024-10-19
vue3中使用element-plus的组件，编辑器检查警告爆红找不到名称相关的element组件
在tsconfig.json中，增加标红框文件配置，目的就是将根目录下包含.d.ts的文件中的匹配项，应用于整个项目的匹配项检查，去除代码检查爆红警告。按照以上配置完之后，当在代码中使用element
阅读更多2024-10-19