
AMIE提供在知识库不完整的情况下进行关联规则挖掘的功能(包含代码和文档)。
5星
- 浏览量: 0
- 大小:None
- 文件类型:None
简介:
近年来,诸如YAGO和DBpedia等大规模知识库领域取得了显著的进步。这些知识库汇集了大量不同类型的实体信息,涵盖了人物、国家、河流、城市大学等诸多类别,同时还包含着大量的实体间事实关系。当前知识库所存储的数据量通常十分庞大,往往包含数百万个实体以及描述实体间关系的数亿条事实数据。尽管现有知识库拥有如此巨大的实体和事实数据量,但其完整性仍然存在局限性。目前构建知识库的主要途径有两种:一种是通过从海量文本中提取事实;然而,这种方法不可避免地会产生大量的噪声数据;另一种则是人工扩展知识库,但这种方法耗费的时间成本非常高昂。为了确保一个知识库的完整性,必须投入大量精力去抽取大量的事实并验证其准确性,因为只有正确的事实才能真正融入到知识库中并发挥作用。此外,由于知识库中拥有充足的信息,可以推导出更多新的事实。例如,如果一个知识库包含“孩子c有一个妈妈m”的事实,那么可以推断出“孩子妈妈的丈夫f很可能是孩子的父亲”这一结论。该逻辑规则的形式化描述如下:motherof(m,c) ∧ marriedTo(m,f) → fatherof(f,c)。通过挖掘此类规则能够实现以下四种目的:1、利用这些规则进行推理,从而补充完善知识库;2、检测知识库中潜在的错误信息,例如“一个与男孩无关的人是这个男孩的父亲”这样的陈述极有可能是错误的;3、许多推理工具依赖于其他工具提供的规则进行推理操作;4、这些规则描述了普遍规律,有助于我们理解和分析知识库中的数据,例如识别那些通常与使用相同语言的国家进行贸易的国家或识别结婚作为一种对称关系以及使用相同乐器的音乐家之间通常存在相互影响等现象。AMIE的目标是从RDF格式的知识库中挖掘如上所述的逻辑规则。在语义网领域(Semantic Web),存在大量的RDF知识库,例如YAGO、Freebase和DBpedia等。这些知识库采用RDF三元组(S,P,O)来描述二元关系。由于RDF知识库通常只包含正例(S,P,O),而缺乏反例(S,¬P,O),因此在RDF上的操作必须基于开放世界假设(OWA)。在开放世界假设下,如果一个事实没有出现在知识库中,我们不能断定它是错误的,只能认为该陈述是未知的。这与标准数据库基于封闭世界假设的不同之处在于:在封闭世界假设下,“如果知识库中没有包含marry(a,b),我们可以得出a没有和b结婚”;而在开放世界假设下,“如果知识库中没有包含marry(a,b),我们只能说a可能结婚了也可能单身”。压缩包内包含了AMIE的可运行源代码以及相应的文档资料供您下载参考。
全部评论 (0)


