关联分析原理小结

时间：2019-01-14 18:57:53 阅读：257 评论：0 收藏：0 [点我收藏+]

1. 关联

关联, 指的是关联分析, 这里引用百度百科的定义.

关联分析又称关联挖掘，就是在交易数据、关系数据或其他信息载体中，查找存在于项目集合或对象集合之间的频繁模式、关联、相关性或因果结构。

通过关联分析, 可以挖掘出"由于某些事件的发生而引起另外一些事件的发生"之类的规则, 比如说"炸鸡>>啤酒", 其中炸鸡被称为规则的前项, 而啤酒则被称为规则的后项.
常用于关联分析的算法有Apriori算法, FP-growth算法, Eclat算法, 灰色关联法等, 下面将着重介绍Apriori算法.

2. Apriori算法

在介绍Apriori算法之前, 我们先来了解几个概念:
1.事务: 一条交易记录称为一个事务
2.项: 交易中的每一个物品称为一个项
3.项集: 包含0个或多个项的集合
4.支持度计数: 项集在所有事务中出现的次数.
5.支持度: 支持度计数除于总的事务数.
6.频繁项集: 支持度大于等于某个阀值的项集.
关联规则的挖掘通常分为两步: 第一步, 找出所有的频繁项集; 第二步, 由频繁项集产生强关联规则. 而Apriori算法则是挖掘频繁项集的基本算法.

Apriori的主要思想是找出存在于事务数据集中的频繁项集, 再利用得到的频繁项集与预先设定的最小置信度阀值生成强关联规则. 其过程大致可以描述为: 首先, 根据最小支持度扫描所有候选项集, 从而找出频繁1-项集的集合. 然后, 再使用频繁1-项集的集合找出频繁2-项集的集合, 如此下去, 直到不能找出频繁k-项集.

可以看到以上每个过程均需要扫描一次数据, 为了提高频繁项集逐层迭代产生的效率, 需要利用一条重要性质, 其称为先验性质: