数据仓库HIVE存储数据一般采用parquet格式,但Alibaba datax开源版不支持parquet格式,在网上查了很多资料,写的大多不完整,特此总结出完整版记录一下,供大家参考。
操作步骤
1.从gitee 拉取datax代码,对hdfsreader模块进行改造,主要改造以下几个类。

pom里面添加parquet支持依赖
<dependency>
<groupId>org.apache.parquet</groupId>
<artifactId>parquet-avro</artifactId>
<version>1.12.0</version>
</dependency>
<dependency>
<groupId>org.apache.parquet</groupId>
<artifactId>parquet-common</artifactId>
<version>1.12.0</version>
</dependency>
<dependency>
<groupId>org.apache.parquet</groupId>
<artifactId>parquet-protobuf</artifactId>
<version>1.12.0</version>
</dependency>
<dependency>
<groupId>org.apache.parquet</groupId>
<artifactId>parquet-protobuf</artifactId>
<version>1.12.0</version>
</dependency>
<dependency>
<groupId>org.apache.parquet</groupId>
<artifactId>parquet-hadoop</artifactId>
<version>1.12.0</version>
</dependency>
<dependency>
<groupId>org.apache.hadoop</groupId>
<artifactId>hadoop-common</arti

文章介绍了如何对AlibabaDataX开源版的HdfsReader模块进行改造,以支持HIVE中常用的parquet格式数据读取。改造包括在pom文件中添加parquet相关的依赖,修改Constant类和HdfsFileType枚举,以及在DFSUtil中添加读取parquet文件的方法,解决了DataX不支持parquet格式的问题。
2864

被折叠的 条评论
为什么被折叠?



