
基于纯C语言的中文分词系统,每秒处理约1万汉字,仅100K大小(免费、开源、含86万词库及操作说明和测试案例)
5星
- 浏览量: 0
- 大小:None
- 文件类型:None
简介:
这是一款高效的纯C语言编写的中文分词工具,支持每秒处理大约一万汉字,代码量仅为100KB,并包含丰富的词库与详细的文档。免费开源且易于集成。
我开发了一个使用纯C语言编写的中文分词系统,该系统的速度约为每秒处理1万字,并且大小仅为100K(免费、开源、包含86万个词汇的词库及操作示意图与测试用例)。使用方法相当简单:只需将解压后的文件保存至D:\路径下,在命令行中输入“d:\cfenci.exe”,然后回车即可启动,无需任何额外参数。
在经过大规模分词测试后,系统性能如下:
- 1000字以内文章的完全切分时间不超过10毫秒;
- 5000字以内文章的完全切分时间不超过500毫秒;
- 对于最多一万个汉字的文章,其完全切分数值为大约一秒。
此版本是简易版,具有91.8%左右的准确率和极高的稳定性(约99.99%),符合工业级标准。该系统支持中英文混合分词及全角、半角标点符号过滤功能,并且自带超过86万个中文词汇的大规模词库。
此外,用户可以动态添加新词汇并持久化保存至文件中。如需获取动态链接库(dll)版本或Linux平台下的版本,请与我联系。
特别说明:
1. 请将词库文件cangzhuo.dat与分词程序cfenci.exe放置在同一目录下,并且不得更改其名称,否则系统无法正常加载;
2. 测试用例文件测试内容.txt仅供参考使用,无其他功能意义。
另外,在遇到换行符时藏拙简易分词器会自动进行切分操作。因此输入含有回车换行字符即视为结束输入并开始处理文本。
如果对我的系统感兴趣的朋友请回复“好”,当有200人反馈后我将正式开源此项目!
全部评论 (0)
还没有任何评论哟~


