论文 | 面向语言模型的高效知识图谱构建 AutoKG: Efficient Automated Knowledge Graph Generation for Language Models
论文 | 面向语言模型的高效知识图谱构建 AutoKG: Efficient Automated Knowledge Graph Generation for Language Models

摘要
传统的通过语义相似性搜索将大型语言模型( Large Language Models,LLMs )与知识库链接的方法往往无法捕获复杂的关系动态。为了解决这些局限性,我们引入了AutoKG,一种轻量且高效的自动知识图谱( KG )构建方法。**对于给定的由文本块组成的知识库,AutoKG首先使用LLM提取关键词,然后使用图拉普拉斯学习评估每对关键词之间的关系权重。**我们采用了一种结合向量相似度和基于图的关联的混合搜索方案来丰富LLM响应。初步实验表明,与语义相似搜索相比,AutoKG提供了一种更全面、更互联的知识检索机制。
论文创新点
1)Auto KG框架,一种基于有文本块组成的知识库自动生成的创新方法。Auto KG不需要训练或微调神经网络,使用预训练的LLMs提取关键词来作为知识图谱的节点,并且使用图拉普拉斯学习来评估节点之间的权重。最后输出的是一个简化的KG,其中的边没有属性和方向性,只有节点之间的权重。
2)提出了一种与提示工程相结合的混合搜索策略,它使大语言模型能够有效利用生成KG的信息。同时,该方法还基于嵌入向量和知识图谱中最相关的相邻信息来搜索语义相关的语料库。
自动构建知识图谱
A. 关键词抽取
令外部知识库表示为X = {x1 , x2 , … ,xN},其中每个xi是一个文本块,最大长度为T个tokens,表示为一个字符串。这些文本块对应的嵌入向量对应表示为V = {v(x1), v(x2), … , v(xN)} ⊂Rd,其中v是字符串到Rd的嵌入投影。通过无监督聚类算法和LLMs的辅助,从知识库X中提取关键词。算法过程概括如下:

该算法将所有文本块及其对应的嵌入向量X和V作为输入,并预先指定参数:n为聚类个数,c为待选文本块个数,l1,l2为关键词提取参数。此外,该算法还使用了一个参数m来指定先前采样的关键字的数量。两种无监督聚类算法K - means聚类,和spectral聚类被应用于知识库的聚类。对于识别出的每个聚类,采样2c个文本块,其中c个距离聚类中心最近,c个随机选取,以捕获全局和中心信息。
该算法两次使用LLM。首先,在参数l1和l2的引导下,从选择的2c个文本块中提取关键词,同时避免采样前m个关键词。其次,使用相同的LLM对提取的关键词进行过滤和精炼。
抽取关键词的提示词严格按照下表规定的格式。具体来说,每条提示语都是由任务信息、输入信息、附加要求和输出信息串联而成。需要说明的是,在每个任务内,任务信息和附加要求对应的提示部分的长度是固定的。
B.构建图结构
首先,建立一个图Gt = ( X , Wt),其中X是作为图Gt的节点的文本块的集合,Wt是边的权重矩阵。Wtij由相应的嵌入向量vi和vj之间的相似度决定。定义相似度函数:

其中∠( vi , vj) =
arccos
(
\arccos (
arccos(
v
i
T
v
j
∥
v
i
∥
∥
v
j
∥
\frac{v^T_iv_j}{\Vert v_i\Vert \Vert v_j\Vert }
∥vi∥∥vj∥viTvj)是特征向量vi和vj之间的夹角。归一化常数
τ
i
\tau_i
τi 根据与i (即
τ
i
\tau_i
τi=∠( vi , viK)的第K个最近邻的相似性来选择,其中viK是与vi的第K个最近邻)。
为了提高计算效率,只考虑每个顶点的K个近邻来构造稀疏权重矩阵Wt。
令xik, k = 1,2,…,K。K为xi根据角度相似度的K近邻,由此定义稀疏权重矩阵为:

K的选取是为了保证相应的图Gt是连通的,经验上K = 30。将稀疏权重矩阵对称化,通过重新定义得到最终的权重矩阵Wt。Wtij=(
W
i
j
t
‾
\overline{W_ij^t}
Wijt+
W
j
i
t
‾
\overline{W_ji ^t}
Wjit)/2。注意最终的稀疏矩阵是非负的,对称的。
接下来,利用在文本块上构造的图Gt = ( χ \chi χ, Wt),建立关键词KG Gk = ( κ \kappa κ , Wk)。这里, κ \kappa κ是关键词的集合,Wk是边的权重矩阵。在该矩阵中,Wkij量化了关键词ki和kj之间的关联强度。重要的是,这种关联不是语义上的,而是反映在知识库的整个语料库中。具体地,Wkij对应于同时与关键词ki和kj相关联的文本块的数量。
算法2建立了关键词和文本块之间的关系。其核心思想是选择与关键词距离最近的文本块子集作为正数据,距离最远的文本块子集作为负数据。然后,使用图拉普拉斯学习,基于之前为文本块构造的图结构Gt = ( χ \chi χ , Wt)。图拉普拉斯学习是一种图上的半监督学习方法,利用解函数u:X→[ 0,1 ]的调和性质对标签值进行扩散从标记节点的子集到图中的其他未标记节点。向正侧(节点函数值u≥0.5)分类的文本块被认为与关键词相关联。
ki和kj之间的关联权重Wkij定义如下:
在此基础上,已经完成了基于关键词的KG Gk的构建,它是建立在文本块图Gt上的。
整个过程如下图所示:

结合KG和LLM的混合搜索
对于给定的查询,使用这种混合搜索策略的搜索结果不仅包括与查询语义相关的文本块,还包括来自KG的额外关联信息。这些补充数据为模型的进一步分析提供了更为详细和深入的推理。KG的引入使得我们可以捕获不同实体之间的复杂关系,从而丰富对查询的上下文理解。
在本文提出的混合搜索方法中,设计了一个多级搜索过程,该过程既包括直接的文本块搜索,也包括由KG指导的基于关键字的搜索。这个过程在算法3中详细说明。最初,通过计算与给定查询嵌入向量最接近的文本块来执行初始搜索。然后转向搜索KG,找出最接近查询的关键词,查询,以及与这些关键字相关联的文本块。最后,基于KG中的权重矩阵,我们识别出与先前识别出的关键词具有最强关联的其他关键词,并据此搜索相关的文本块。该算法不仅返回与查询高度相关的文本块集合,还返回与查询紧密相关的关键字集合。
实验以及结果
文章的主要目标是通过实验证明,本文提出的Auto KG方法与基于语义向量相似度的检索增强生成( RAG )方法相比,在保持相当效率的同时提供了显著更好的响应。我们的方法结合了Auto KG和混合搜索,为模型提取了比依赖语义向量相似性搜索的RAG更有价值的信息。
不幸的是,作者在确定一个合适的数据集来进行这些实验时遇到了挑战。他们尝试使用WikiWhy数据集,该数据集旨在评估模型的推理能力。该数据集包括约9000个条目。每个词条包含一段内容,跨度在100 ~ 200字之间。基于这一内容,每个条目都提供了一个"为什么"的问题及其相应的因果关系和解释。当作者使用基于Auto KG的混合搜索或RAG的语义向量相似性搜索时,可以很容易地检索出给定问题对应的内容,并根据该内容指导模型进行回答。在两种方法中,模型的响应几乎完全相同。由于9000个词条之间是相对独立的,文章的方法提供的石门数据检索对回答问题没有显著贡献。
因此,作者采用定性的方法,而不是使用数值度量来评估本文的方法的实验性能。首先,作者提供了一个简单的例子来解释为什么AutoKG混合搜索方法与基于语义向量相似性搜索的方法相比具有优势。具体例子不在这里列举。
结论
本文讨论了将LLMs与知识库链接时,语义相似性搜索方法所面临的固有挑战。我们的方法Auto KG为自动化KG的构建提供了一种精致高效的策略。与传统的KG相比,AutoKG的创新架构提供了一个轻量级和简化的KG版本,将焦点从具体的实体转移到更抽象的关键词,并利用加权无向边来表示关键词之间的关联。基于生成的KG,我们的方法利用了这些能力,通过混合搜索策略为LLMs提供了更互联和更全面的知识检索机制。通过这样做,我们可以确保模型的响应不仅在质量上更加丰富,而且可以从更加多样化的信息节点集合中获得见解。
在实验评估中,作者采用混合搜索的方式对Auto KG进行了测试。由于数据集的限制,作者的测试大多是定性的。该结果突出了本文的方法相比于典型的基于语义相似性搜索的RAG方法的好处。总之,Auto KG为知识库和LLMs的结合提供了一个有价值的步骤。它在计算上是轻量级的,并为LLM应用中更详细的交互铺平了道路。此外,本文的混合搜索与语义向量相似性搜索具有相同的时间复杂度。
对Auto KG方法的进一步分析需要识别或创建合适的数据集来评估其与LLMs的集成。Wang等人开发了自己的数据集来评估与本文相似的想法。虽然评价标准应该与RAG相似,但需要一个结构更复杂和复杂的数据集。另一种改进方法围绕关键词提取展开。目前,该方法采用提示工程方法;然而,未来的工作可以探索微调更大的模型,甚至训练专门的模型,以达到增强的效果。
魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。
更多推荐




所有评论(0)