码迷,mamicode.com
首页 > 其他好文 > 详细

Spark直接读入fastq格式的数据

时间:2019-05-24 14:34:03      阅读:121      评论:0      收藏:0      [点我收藏+]

标签:pre   通过   col   tom   range   ted   数据   order   foreach   

  • 输入文件: fastq格式
  • 输出结果: kmer的频数和对应的kmer类型
  • 系统环境Ubuntu单机版17.01
  • spark版本2.7
    此次测试主要用到了RDD的函数foreachzipWithIndex,zipWithIndex这个函数是可以直接对gz文件进行操作的
  • python的主要通过lambda函数来进行操作
  • 测试代码如下
fastq=‘/home/yueyao/Spark/00.data/reads.left.fq.gz‘
fq_rdd = sc.textFile(fastq)
fq=fq_rdd.zipWithIndex()
def printa(a):
    print a
fq.foreach(lambda line:printa(line))

Spark直接读入fastq格式的数据

标签:pre   通过   col   tom   range   ted   数据   order   foreach   

原文地址:https://www.cnblogs.com/raisok/p/10917693.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!