草庐IT

CloudCanal实战-五分钟搞定Oracle到StarRocks数据迁移与同步

clougence 2023-03-28 原文

简述

CloudCanal当前最新版本已经支持源端Oracle、SqlServer等主流传统数据库作为源端迁移同步数据到StarRocks来构建实时数仓。本文简要介绍如何快速构建一条Oracle->StarRocks数据链路。

技术要点

基于StreamLoad的导入方式

CloudCanal 采用了 StreamLoad 的方式进行导入,源端的消息会转成字节流,最后会以批量发送的形式通过 HTTP 协议发往 StarRocks。
CloudCanal 默认采用 json 格式来进行StreamLoad导入,如果用户内容特殊字符较少,也可以开启 csv 格式导入,分隔符可以通过参数 columnSeparator 和 lineSeparator 设置。
基于 StreamLoad 的写入方式,实际写入对端的操作均为 INSERT,CloudCanal 同步时会自动将 UPDATE / DELETE 转成 INSERT 语句,并修改 __op 值,StarRocks会自动进行数据合并。

支持常用DDL实时同步

Oracle -> StarRocks 支持新增列、删除列DDL。DDL实时同步到对端时会自动转换成StarRocks兼容的语法,数据类型也会根据映射关系进行自动转换。

编辑订阅功能

CloudCanal 提供了便利的修改订阅能力。对于一个已经创建好的正在运行的增量同步任务,如果由于业务需求有新增表需要订阅,可以在原有任务的基础上新增需要订阅的表,生成子任务,自动完成全量、增量迁移同步,在完成后会子任务会自动与原有的任务合并。

数据类型映射

CloudCanal结构迁移和数据迁移同步时会自动进行数据类型映射。类型映射见下表:

Oracle类型 StarRocks类型
CHAR VARCHAR
NCHAR VARCHAR
VARCHAR2 VARCHAR
NVARCHAR VARCHAR
NVARCHAR2 VARCHAR
LONG STRING
NUMBER_BIGINT BIGINT
NUMBER_DECIMAL DECIMAL
FLOAT FLOAT
BINARY_FLOAT DECIMAL
BINARY_DOUBLE DECIMAL
CLOB STRING
NCLOB STRING
DATA DATETIME
TIMESTAMP DATETIME
TIMESTAMP_WITH_TIME_ZONE DATETIME
TIMESTAMP_WITH_LOCAL_TIME_ZONE DATETIME
INTERVAL_YEAR_TO_MONTH DATETIME
INTERVAL_DAY_TO_SECOND DATETIME
ROWID STRING
PLSQL_BOOLEAN BOOLEAN
XMLTYPE STRING
HTTPURITYPE STRING

操作示例

准备CloudCanal

  • 安装好CloudCanal
  • 准备好源端和目标端数据库及对应数据

Oracle源端前置准备

CloudCanal在做Oracle作为源端的数据迁移同步时,需要做一些前置准备。具体可以参考 ORACLE LogMiner同步准备

添加数据源

  • 登录CloudCanal平台
  • 数据源管理->添加数据源

  • 创建源端数据源:选择自建数据源,选择Oracle,并填写相关数据库信息,点击新增数据源确定创建Oracle数据源。
    • logminerUser:ORACLE源端增量任务使用redo解析(logminer)方式时使用的账号,需要CDB类型用户
    • logminerPasswd:ORACLE源端增量任务使用redo解析(logminer)方式时使用的账号密码
    • logminerConnectType:ORACLE源端增量任务使用redo解析(logminer)方式时使用的连接方式,目前支持ORACLE_SID或ORACLE_SERVICE模式
    • logminerSidOrService:ORACLE源端增量任务使用redo解析(logminer)方式时使用的连接标识符,和logminerConnectType参数配合使用,ORACLE_SID连接方式,则填写sid,ORACLE_SERVICE连接方式,则填写service name

  • 创建目的端数据源:选择自建数据源,选择StarRocks,并填写相关数据库信息,点击新增数据源确定创建StarRocks数据源

  • Client地址:StarRocks提供的MySQLClient服务端口,CloudCanal主要用其查询库表的元数据信息,对应StarRocks的QueryPort,默认端口为9030
  • Http地址:Http地址主要用于接收streamload的http请求。此处可以填写StarRocks BE节点的端口,默认为8030;如需负载均衡也支持直接填写FE的地址和端口,StarRocks的FE会自动处理stream load的http请求
  • 查看数据源是否创建成功

任务创建

  • 任务管理->创建任务

  • 选择集群
  • 源端选择刚添加的Oracle数据源,目标端选择StarRocks数据源,分别点击测试连接按钮以测试数据库连通性和获取schema级别元信息,显示连接成功后,设置数据库映射关系
  • StarRocks的结构迁移支持用户自定义分桶数等自定义建表信息
  • 点击下一步

  • 选择增量同步,并且勾选全量初始化
  • 点击下一步

  • 选择订阅的表
  • 点击下一步

  • 配置列映射
  • 点击下一步

  • 点击创建任务

  • 任务创建成功并启动后,会自动执行结构迁移、全量迁移、增量同步

总结

本文简单介绍了如何使用CloudCanal进行Oracle->StarRocks 数据迁移同步。各位读者朋友,如果你觉得还不错,请点赞、评论加转发吧。

有关CloudCanal实战-五分钟搞定Oracle到StarRocks数据迁移与同步的更多相关文章

  1. ruby-on-rails - Ruby on Rails 迁移,将表更改为 MyISAM - 2

    如何正确创建Rails迁移,以便将表更改为MySQL中的MyISAM?目前是InnoDB。运行原始执行语句会更改表,但它不会更新db/schema.rb,因此当在测试环境中重新创建表时,它会返回到InnoDB并且我的全文搜索失败。我如何着手更改/添加迁移,以便将现有表修改为MyISAM并更新schema.rb,以便我的数据库和相应的测试数据库得到相应更新? 最佳答案 我没有找到执行此操作的好方法。您可以像有人建议的那样更改您的schema.rb,然后运行:rakedb:schema:load,但是,这将覆盖您的数据。我的做法是(假设

  2. ruby - 解析 RDFa、微数据等的最佳方式是什么,使用统一的模式/词汇(例如 schema.org)存储和显示信息 - 2

    我主要使用Ruby来执行此操作,但到目前为止我的攻击计划如下:使用gemsrdf、rdf-rdfa和rdf-microdata或mida来解析给定任何URI的数据。我认为最好映射到像schema.org这样的统一模式,例如使用这个yaml文件,它试图描述数据词汇表和opengraph到schema.org之间的转换:#SchemaXtoschema.orgconversion#data-vocabularyDV:name:namestreet-address:streetAddressregion:addressRegionlocality:addressLocalityphoto:i

  3. ruby - 使用 Vim Rails,您可以创建一个新的迁移文件并一次性打开它吗? - 2

    使用带有Rails插件的vim,您可以创建一个迁移文件,然后一次性打开该文件吗?textmate也可以这样吗? 最佳答案 你可以使用rails.vim然后做类似的事情::Rgeneratemigratonadd_foo_to_bar插件将打开迁移生成的文件,这正是您想要的。我不能代表textmate。 关于ruby-使用VimRails,您可以创建一个新的迁移文件并一次性打开它吗?,我们在StackOverflow上找到一个类似的问题: https://sta

  4. ruby - Ruby 有 `Pair` 数据类型吗? - 2

    有时我需要处理键/值数据。我不喜欢使用数组,因为它们在大小上没有限制(很容易不小心添加超过2个项目,而且您最终需要稍后验证大小)。此外,0和1的索引变成了魔数(MagicNumber),并且在传达含义方面做得很差(“当我说0时,我的意思是head...”)。散列也不合适,因为可能会不小心添加额外的条目。我写了下面的类来解决这个问题:classPairattr_accessor:head,:taildefinitialize(h,t)@head,@tail=h,tendend它工作得很好并且解决了问题,但我很想知道:Ruby标准库是否已经带有这样一个类? 最佳

  5. ruby - 我如何添加二进制数据来遏制 POST - 2

    我正在尝试使用Curbgem执行以下POST以解析云curl-XPOST\-H"X-Parse-Application-Id:PARSE_APP_ID"\-H"X-Parse-REST-API-Key:PARSE_API_KEY"\-H"Content-Type:image/jpeg"\--data-binary'@myPicture.jpg'\https://api.parse.com/1/files/pic.jpg用这个:curl=Curl::Easy.new("https://api.parse.com/1/files/lion.jpg")curl.multipart_form_

  6. 世界前沿3D开发引擎HOOPS全面讲解——集3D数据读取、3D图形渲染、3D数据发布于一体的全新3D应用开发工具 - 2

    无论您是想搭建桌面端、WEB端或者移动端APP应用,HOOPSPlatform组件都可以为您提供弹性的3D集成架构,同时,由工业领域3D技术专家组成的HOOPS技术团队也能为您提供技术支持服务。如果您的客户期望有一种在多个平台(桌面/WEB/APP,而且某些客户端是“瘦”客户端)快速、方便地将数据接入到3D应用系统的解决方案,并且当访问数据时,在各个平台上的性能和用户体验保持一致,HOOPSPlatform将帮助您完成。利用HOOPSPlatform,您可以开发在任何环境下的3D基础应用架构。HOOPSPlatform可以帮您打造3D创新型产品,HOOPSSDK包含的技术有:快速且准确的CAD

  7. FOHEART H1数据手套驱动Optitrack光学动捕双手运动(Unity3D) - 2

    本教程将在Unity3D中混合Optitrack与数据手套的数据流,在人体运动的基础上,添加双手手指部分的运动。双手手背的角度仍由Optitrack提供,数据手套提供双手手指的角度。 01  客户端软件分别安装MotiveBody与MotionVenus并校准人体与数据手套。MotiveBodyMotionVenus数据手套使用、校准流程参照:https://gitee.com/foheart_1/foheart-h1-data-summary.git02  数据转发打开MotiveBody软件的Streaming,开始向Unity3D广播数据;MotionVenus中设置->选项选择Unit

  8. 使用canal同步MySQL数据到ES - 2

    文章目录一、概述简介原理模块二、配置Mysql使用版本环境要求1.操作系统2.mysql要求三、配置canal-server离线下载在线下载上传解压修改配置单机配置集群配置分库分表配置1.修改全局配置2.实例配置垂直分库水平分库3.修改group-instance.xml4.启动监听四、配置canal-adapter1修改启动配置2配置映射文件3启动ES数据同步查询所有订阅同步数据同步开关启动4.验证五、配置canal-admin一、概述简介canal是Alibaba旗下的一款开源项目,Java开发。基于数据库增量日志解析,提供增量数据订阅&消费。Git地址:https://github.co

  9. ruby-on-rails - 创建 ruby​​ 数据库时惰性符号绑定(bind)失败 - 2

    我正在尝试在Rails上安装ruby​​,到目前为止一切都已安装,但是当我尝试使用rakedb:create创建数据库时,我收到一个奇怪的错误:dyld:lazysymbolbindingfailed:Symbolnotfound:_mysql_get_client_infoReferencedfrom:/Library/Ruby/Gems/1.8/gems/mysql2-0.3.11/lib/mysql2/mysql2.bundleExpectedin:flatnamespacedyld:Symbolnotfound:_mysql_get_client_infoReferencedf

  10. STM32读取串口传感器数据(颗粒物传感器,主动上传) - 2

    文章目录1.开发板选择*用到的资源2.串口通信(个人理解)3.代码分析(注释比较详细)1.主函数2.串口1配置3.串口2配置以及中断函数4.注意问题5.源码链接1.开发板选择我用的是STM32F103RCT6的板子,不过代码大概在F103系列的板子上都可以运行,我试过在野火103的霸道板上也可以,主要看一下串口对应的引脚一不一样就行了,不一样的就更改一下。*用到的资源keil5软件这里用到了两个串口资源,采集数据一个,串口通信一个,板子对应引脚如下:串口1,TX:PA9,RX:PA10串口2,TX:PA2,RX:PA32.串口通信(个人理解)我就从串口采集传感器数据这个过程说一下我自己的理解,

随机推荐