Apache Pig字符串截取实战小例子

时间：2015-03-13 19:12:07 阅读：310 评论：0 收藏：0 [点我收藏+]

标签：

记录一个Pig字符串截取的实战小例子：

需求如下，从下面的字符串里提取出第2列（冒号后面）的值：

Java代码

1 2  3 4
a:ab#c#d
a:c#c#d
a:dd#c#d
a:zz#c#d

如果是在java里，方法可能有很多种，比如substring，或者split多次等，在pig也大致如此，可以使用SUBSTRING内置函数来完成，但散仙推荐使用下面的方式，这种方式比较灵活，适合大部分场景的数据提取，需要用到的2个函数如下：

（1）REGEX_EXTRACT（‘原始字符串‘,‘正则式‘,int类型的返回索引）

（2）STRSPLIT(‘原始字符串‘, ‘正则式‘, 限制返回的个数)

pig脚本写法：

Java代码

a = laod ‘/tmp/data‘ as (data:chararray)
//注意逻辑是，先获取冒号后面的数据，然后split成tuple，再通过$1（下标访问元素）获取我们需要的数据即可。
b = foreach a generate STRSPLIT (REGEX_EXTRACT (data, ‘(.*):(.*)‘, 2) ,‘#‘,5).$0;

dump b;

Apache Pig字符串截取实战小例子

标签：

原文地址：http://my.oschina.net/u/1027043/blog/386782

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行