Spark 数据导入时的类型检测相关问题

时间：2017-05-21 21:48:22 阅读：228 评论：0 收藏：0 [点我收藏+]

Spark 可以读取文本，csv和rmdb中的数据，并且带有类型自动检测功能

public final static String DATA_SEPARATOR_TAB = "\t";

session.read().format("csv").option("delimiter", Constants.DATA_SEPARATOR_TAB).option("inferSchema", "true").option("header", "true").option("encoding", charset).csv(path).toDF(columnNames).write().mode(mode).saveAsTable(tempTable);

红色属性决定spark是否自动探测数据类型，如果不开启自动探测，默认都是string

rdbms导入到spark中默认会类型探测和对应，但是在处理sqlserver的时间类型有问题

如上图所示

只有datetime可以被spark识别并存储为日期类型，其他的都落地成了String类型，所以在执行data_formate时因为要多做一步转换所以性能会差很多

Spark 数据导入时的类型检测相关问题

标签：spark 大数据 hadoop sqlserver

原文地址：http://xk0230.blog.51cto.com/11859350/1927897

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行