码迷,mamicode.com
首页 > 其他好文 > 详细

使用R完成字符串的子字符串频率统计

时间:2014-07-22 23:02:52      阅读:288      评论:0      收藏:0      [点我收藏+]

标签:blog   http   使用   os   strong   io   

整理自统计之都论坛


方法一   使用strsplit函数

a <- "aggcacggaaaaacgggaataacggaggaggacttggcacggcattacacggagg"
b <- strsplit(as.character(a),"ag")
length(b[[1]]) - 1  ##子字符串"ag"的出现个数

方法二   使用正则式函数

a <- "aggcacggaaaaacgggaataacggaggaggacttggcacggcattacacggagg"
b <- strsplit(as.character(a),"ag")
regexpr("ag",a)
gregexpr("ag",a)
gregexpr("a.g",a)
attr(gregexpr("a.g",a)[[1]], "match.length")   #提取子模式长度

方法三  使用str_count函数

library(stringr)
str_count("1212345", c("12", "23", "00"))


一个使用实例

计算a*g中间有0-5个任意字母的频率

library(stringr)
str <- "aggcacggaaaaacgggaataacggaggaggacttggcacggcattacacggagg"
n <- 0:5
patterns <- sapply(n,function(i) {
  paste0("a\\w{",i,"}g")
})
counts <- str_count(str,patterns)
names(counts) <- n
counts




使用R完成字符串的子字符串频率统计,码迷,mamicode.com

使用R完成字符串的子字符串频率统计

标签:blog   http   使用   os   strong   io   

原文地址:http://blog.csdn.net/yucan1001/article/details/24742871

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!