本文介绍了如何利用Hadoop平台高效地实现Apriori算法,探讨了其分布式计算的优势及具体应用。
Hadoop的Apriori算法实现采用蛮力方法。该算法不会继续生成关联规则。
使用说明如下:
家庭输入输出路径:迭代状态文件每次迭代都会被写入。
输入交易数据路径:包含事务的数据文件所在位置。
为每轮迭代输出设定的路径,即 output/n
minsup - 视作频繁项集的最小支持度阈值。
max - 算法运行的最大迭代次数。
命令行参数如下:
hadoop jar HadoopApriori.jar com.jgalilee.hadoop.apriori.driver.Driver input/apriori.state input/transactions.txt output 3 10 2
其中,minsup和number分别为:被视为频繁项集的最小支持度候选项集;向Hadoop作业建议的减速器数量。