Parquet开源软件适配GaussDB开源开发任务

举报
yd_281947290 发表于 2024/10/28 17:04:43 2024/10/28
【摘要】 在大数据分析领域应用广泛,许多企业和组织在其大数据平台中使用 Parquet 格式来存储和处理海量数据。 本任务的主要目的是构建Parquet与GuassDB数据库的连接桥梁,使Parquet融入华为云生态体系,让原本使用Parquet的用户可以选择使用华为云服务。

背景介绍

开源for Huawei(参考:https://developer.huaweicloud.cn/programs/opensource/contributing/)  通过和公司、高校、社区的开发者合作,完成鲲鹏、昇腾、欧拉、鸿蒙、高斯、云服务等与开源软件的适配开发,帮助繁荣Huawei的基础生态,同时让开源软件能够更加简单、高效的运行于华为云上。

开始之前,开发者可以下载 开源for Huawei Wiki(参考:https://gitcode.com/HuaweiCloudDeveloper/OpenSourceForHuaweiWiki/overview) 了解详细的开发步骤,技术准备,以及开发过程需要的各种资源。

 

1 需求分析

1.1   项目影响力

Parquet 起源于 2013 年,它是由 Twitter 和 Cloudera 合作开发的一种开源文件格式,其诞生的主要目的是为了解决大数据环境下传统行式存储格式的局限性,与一些传统的列式存储系统(如 C-Store、MonetDB 等)相比,Parquet 最大的贡献是支持嵌套格式数据的列式存储。嵌套格式可以很自然地描述互联网和科学计算等领域的数据,Parquet“原生”的支持嵌套格式数据减少了规则化、重新组合这些大规模数据的代价。

由于 Parquet 具有列式存储、高效压缩、支持复杂数据结构等优点,它在大数据分析、数据仓库、数据湖等领域得到了广泛的应用。如今,它已经成为 Hadoop 大数据生态圈列式存储的事实标准。

项目数据:Fork 1.4k,Star 2.6k,Contributors 228

主要开发语言:

官网: https://parquet.apache.org/

源代码仓库:https://github.com/apache/parquet-java

star历史(https://star-history.com/):

 

1.2   任务目的和范围

在大数据分析领域应用广泛,许多企业和组织在其大数据平台中使用 Parquet 格式来存储和处理海量数据。例如,互联网公司用于存储用户行为数据、日志数据等,金融机构用于存储交易数据、风险数据等。

本任务的主要目的是构建Parquet与GuassDB数据库的连接桥梁,使Parquet融入华为云生态体系,让原本使用Parquet的用户可以选择使用华为云服务。同时,该任务也可以为当前使用华为云服务的用户提供数据输出到Parquet的选项,丰富个性化定制的多样性。

 

  • 适配任务清单

生态

生态细类

是否需要验证

验证逻辑说明

是否需要适配

适配场景说明

昇腾生态

指令

否

使用昇腾处理器运行应用。

否

使用昇腾指令实现适配逻辑。

CANN

否

应用功能依赖于CANN运行。

否

使用CANN实现适配逻辑。

MindSpore

否

应用功能依赖于MindSpore运行。

否

在鲲鹏云ECS中部署Parquet服务及本任务中涉及的相关服务和DEMO

鲲鹏生态

指令

是

使用鲲鹏处理器运行应用。

否

使用鲲鹏指令实现适配逻辑。

Euler

是

使用Euler系统运行应用

否

使用Euler系统调用实现适配逻辑。

数据库生态

GaussDB

是

使用GaussDB功能。

是

使用GaussDB的驱动和SQL实现适配逻辑。

 

GaussDB(DWS)

否

使用GaussDB(DWS)功能。

否

使用GaussDB(DWS)的驱动和SQL实现适配逻辑。

存储生态

OBS

否

使用OBS功能。

否

基于OBS API访问实现适配逻辑。

鸿蒙生态

HarmonyOS

否

使用HarmonyOS系统运行应用。

否

使用HarmonyOS系统调用实现适配逻辑。

 

2 工作量评估和任务分解

2.1   工作量评估

任务

人/天

基于华为云ECS完成

Parquet安装和部署

1

完成GuassDB数据库适配功能开发完成

5

完成DEMO设计和验证

1

输出开发资料和博客

2

代码推送上游社区和更新社区资料

1

总计

10人天

2.2   基于华为云ECS完成Parquet安装和部署

华为云部署参考:

Parquet系统架构图:

 

参考:

  • 代码仓库:https://github.com/apache/parquet-java

2.3      完成GuassDB数据库适配功能开发

  • 申请开通华为云GuassDB服务,并获取相应的配置信息。
  • 安装Parquet,若已经安装Parquet,则直接生成Parquet镜像
  • 在GitCode完成项目Fork,并完成GuassDB数据库服务适配需要的脚本和代码开发。
  • 使用Parquet镜像对接GuassDB数据库服务,开启联调验证并修改适配脚本及代码

2.4   DEMO设计和验证

Parquet和GaussDB数据互通测试

操作一:使用第三方抽数工具,从Parquet中采集数据文件写入GaussDB数据库

预期结果:采集并写入成功,GaussDB中生成采集到的数据文件

操作二:使用第三方抽数工具,从GaussDB数据库中采集数据文件写入Parquet

预期结果:采集并写入成功,Parquet中生成采集到的数据文件

结论: Parquet和GaussDB达成数据互通

2.5   在华为云开发者论坛输出博客

在华为云开发者论坛发表博客,介绍完成这些任务的过程和心得。

内容包括不限于如下内容:

  • 开源for Huawei的背景
  • 开源软件的功能介绍
  • 开发适配过程及碰到和解决的问题
  • DEMO设计、开发、部署过程
  • 代码推送开源社区及互动过程

博客打上如下标签:

  • 开源(必选)
  • 开发者(必选)
  • GaussDB数据库(可选)
  • 云数据库 GaussDB(可选)
  • 鲲鹏(可选)

2.6   代码推送上游社区

将代码合并到Parquet官网主干代码,更新Parquet官网资料,包括版本说明、开发指南等。

3 验收材料

    验收细则

    评分说明

    是否为验收必选项

    结果(通过/不通过)

    开发者举证

    功能开发:完成与华为三大根技术生态(鲲鹏云、昇腾云、鸿蒙)适配的功能开发

    完成GaussDB数据库适配功能开发。举证提供PR链接。

    是

    代码质量:适配华为三大根技术生态的代码质量经过工具检测达标

    推送给开源社区的代码符合开源社区关于代码风格、功能、自动化测试等要求。

    是

    提供相关文档,比如部署文档、使用文档、配置文档等

    根据社区要求,完善相关的开发指南和部署指导

    否

    合入到开源项目主仓:代码推送上游社区

    代码合并到当前主干分支。举证提供代码仓库链接。

    是

    Deomo设计&开发:完成功能演示Demo的开发

    举证提供DEMO仓库地址和DEMO开发提交记录。

    是

    Demo部署&验证:完成功能演示DEMO基于华为云鲲鹏环境的部署和功能验证

    提供DEMO部署验证结果的关键截图进行举证。提供DEMO运行环境和资源的规格清单。

    是

    发布博客:发布博客介绍适配心得。

    提供博客的地址。

    是

    制作单机版无高危开源镜像。

    上架云商店。

    否

    单机版镜像上架时支持模板部署。

    否

    制作集群版无高危开源镜像

    上架云商店。

    否

    集群版镜像上架时支持模板部署

    否

     

    4 参考资料

    开源for Huawei介绍、环境搭建、示例项目、开发和部署指南:https://gitcode.com/HuaweiCloudDeveloper/OpenSourceForHuaweiWiki/overview

    【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
    • 点赞
    • 收藏
    • 关注作者

    评论(0)

    0/1000
    抱歉,系统识别当前为高风险访问,暂不支持该操作

    全部回复

    上滑加载中

    设置昵称

    在此一键设置昵称,即可参与社区互动!

    *长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

    *长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。