码迷,mamicode.com
首页 > 其他好文 > 详细

大数据项目——互联网精准营销——数据清洗

时间:2019-09-08 09:36:01      阅读:224      评论:0      收藏:0      [点我收藏+]

标签:组件   用户   效果   符号   image   信息   排序   正则表达式   img   

使用kettle进行数据清洗:

 1.新建转换去除手机销售信息表的重复记录
  要求:去除该字段中的所有空格,方便后续聚合统计,字母统一大小写,去除该字段中的所有特殊字符(各种标点符号)

      这里可选用排序加去重组件,也可用哈希去重。然后用字符串操作去括号,大小写统一。字符串替换的正则表达式去除特殊字符。

技术图片

技术图片

 

技术图片

 

 

 

 

 2.新建转换去除用户评论信息表的重复记录

  和上面的操作差不多,一个去重

技术图片

 

 

3. 新建转换处理用户信息表中出生日期字段(将 2019 年 5 月 20 日转换为 2019-5-20)
这个我仍然用的正则,把年月(填写为“(年|月)”)改成“-”   把 日 替换为空

技术图片

 

 效果:技术图片

 

 技术图片

 

 

 技术图片

 

大数据项目——互联网精准营销——数据清洗

标签:组件   用户   效果   符号   image   信息   排序   正则表达式   img   

原文地址:https://www.cnblogs.com/zhaochenguang/p/11484272.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!