
基于线性表与二叉排序树的低频词过滤机制
5星
- 浏览量: 0
- 大小:None
- 文件类型:None
简介:
本研究提出了一种利用线性表和二叉排序树相结合的方法,有效识别并移除文本数据中的低频词汇,优化信息检索与处理效率。
实习内容:对于一篇给定的英文文章,使用线性表和二叉排序树来实现单词频率统计,并且过滤低频词,比较两种方法的效率。
具体要求如下:
1. 读取一个名为InFile.txt的英文文件,识别其中的所有单词。
2. 使用线性表和二叉排序树分别构建存储结构。每当识别到一个新的单词时,如果该单词不在数据结构中,则将其插入适当位置;若已在数据结构中,则增加其出现次数。
3. 统计完成后,删除频率低于五次的单词,并显示这些被移除的单词及其对应的频数。
4. 其余所有单词按照出现频率从高到低排序后输出至名为OutFile.txt的文件。同时记录并比较使用两种方法完成任务所消耗的时间。
5. 计算查找表的平均成功查找长度(ASL),分析和对比这两种数据结构在处理此类问题时效率上的差异。
全部评论 (0)
还没有任何评论哟~


