码迷,mamicode.com
首页 > 编程语言 > 详细

使用python操作hdfs,并grep想要的数据

时间:2018-11-11 11:51:12      阅读:252      评论:0      收藏:0      [点我收藏+]

标签:\n   ada   app   cmd   sub   pre   lin   range   data-   

代码如下:

import subprocess


for day in range(24, 30):
    for h in range(0, 24):
        filename = "tls-metadata-2018-10-%02d-%02d.txt" % (day, h)
        cmd = "hdfs dfs -text /data/2018/10/%02d/%02d/*.snappy" % (day, h)
        print(cmd)
        #cmd = "cat *.py"
        cmd = subprocess.Popen(cmd, shell=True, stdout=subprocess.PIPE)
        f = open(filename, "w")
        for line in cmd.stdout:
            try:
              arr = line.split("^")
              if len(arr) >= 120 and arr[6] == "6" and arr[25] == "SSL" and arr[107]:
                #print(line)
                f.write("^".join(arr[:32]) + "^" + arr[95] + "^" + "^".join(arr[105:119])+ "\n")
            except Exception as e:
                print(e, "fuck error", line)
        f.close()
        #import sys
        #sys.exit(0)

 

使用python操作hdfs,并grep想要的数据

标签:\n   ada   app   cmd   sub   pre   lin   range   data-   

原文地址:https://www.cnblogs.com/bonelee/p/9941559.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!