Experimental Scheme Recommendation Based on Knowledge Graph: A Case Study of Organic Solar Cells

  • Kai Zhang , 1, 2 ,
  • Qi Shi , 3
Expand
  • 1National Science Library, Chinese Academy of Sciences Beijing 100190
  • 2Department of Information Resources Management,School of Economics and Management,University of Chinese Academy of Sciences Beijing 100190
  • 3 National Science Library (Chengdu), Chinese Academy of Sciences Chengdu 610299

Zhang Kai, master candidate, E-mail: zhangkai@mail.las.ac.cn;

Shi Qi, master candidate.

Received date: 2024-03-04

  Online published: 2025-04-28

Supported by

National Social Science Fund of China titled “Supporting AI4Science Science Library Knowledge Service Content Research”(22BTQ019)

Chinese Academy of Sciences Literature and Information Capacity Building Project titled “‘Smart data +AI’ Supporting Scientific Innovation Experimental Method Inference Discovery Research”(E329090905)

Abstract

[Purpose/Significance] Currently, the paradigm of data-intensive scientific discovery in scientific research is evolving towards intelligence. AI-driven scientific research (AI4Science) is becoming the engine of technological innovation and a new paradigm for scientific research. This study will delve into the experimental schemes within AI4Science, revealing the application of AI technology in research methods, tools, and means through the analysis of experimental schemes in scientific literature, providing new research perspectives for scientific researchers. [Method/Process] ① Knowledge extraction and modeling of the experimental scheme. Ontology modeling technology was used to realize the unified knowledge modeling of experimental methods and experimental principles in different subject areas. The domain knowledge graph of organic solar cells was constructed on the basis of ontology modeling. ② Research on intelligent recommendation of the experimental scheme based on the knowledge graph. The relationship between entities was mined in the domain knowledge graph to realize the intelligent recommendation of the experimental scheme. [Result/Conclusion] On the basis of Graph2vec representation technology and GPT embedding representation, GraphGPT Net is proposed as a new algorithm for knowledge graph semantic integration of the experimental scheme. The best performance is achieved on Recall@20 with a score of 0.0299, which proves its remarkable ability to recommend experimental schemes.

Cite this article

Kai Zhang , Qi Shi . Experimental Scheme Recommendation Based on Knowledge Graph: A Case Study of Organic Solar Cells[J]. Knowledge Management Forum, 2024 , 9(5) : 448 -459 . DOI: 10.13266/j.issn.2095-5472.2024.033

数百年以来,科学研究的发现都是基于科学假设生成与验证的循环过程产生的,在科研全流程中,科学知识的获取、科学假设的提出和实验方案的推荐生成都可以由AI来完成[1]。因此在当前AI4Sicence的大背景下,知识服务机构如何利用人工智能的方法更好地加速科研流程、助力科学发现、推动科研进展,成为当下知识服务机构的研究热点。
在目前的实验科学研究范式中,科研人员一般采用“试错法”逐条探索实验的合成条件,科研效率低下。科研人员需要付出巨大的时间成本阅读大量的论文以获取其中的实验方法,且对整个实验的流程和细节掌握不充分,需要反复阅读论文才能复现实验结果。因此,实验方法的推荐系统对科研人员而言具有很大的作用,能够帮助他们快速获取实验方法的思路,组织实验设计的流程,极大地缩短科研实验设计阶段的时间。
本文旨在以科技文献为数据源,基于AI技术助力实验学科高效筛选、推荐最具有可行性的实验方案,力图缩小科研人员的查找范围,节省科研人员的实验准备时间,进而提高科研效率。

1 研究综述/Literature review

知识图谱(knowledge graph, KG)最早由谷歌在2012年提出,用于增强其搜索引擎的功能。知识图谱$G=\left(V,E\right) $是一个有向图,其节点是实体,边是$\left(headentity,relation,tailentity\right)$的三元组。每一条边表示为$<{e}_{h},r,{e}_{t}>$,揭示了从头实体到尾实体的关系r[2]。例如,$\left(\mathrm{Y}\mathrm{a}\mathrm{o}\mathrm{M}\mathrm{i}\mathrm{n}\mathrm{g},\mathrm{ }\mathrm{l}\mathrm{i}\mathrm{v}\mathrm{e}_\mathrm{i}\mathrm{n},\mathrm{S}\mathrm{h}\mathrm{a}\mathrm{n}\mathrm{g}\mathrm{h}\mathrm{a}\mathrm{i}\right)$ 表示了姚明居住在上海这一事实。知识图谱的本质是一种解释实体之间关系的语义网络,可以对现实世界的事物及其相互关系进行形式化的描述[3]。目前,知识图谱已经被广泛应用在搜索引擎、问答系统、推荐系统[4]等多个领域,用来降低信息的粒度,帮助人们更精准地获取所需要的知识。
为了解决信息过载(information overload)的问题,人们提出了推荐系统(recommendation system),通过用户的历史行为或者用户的兴趣偏好来生成推荐算法,再运用推荐算法来产生用户可能感兴趣的项目列表。
推荐算法的任务是向给定的用户推荐一个或一系列未观察过的项目,其过程可以表述为如下步骤:首先,系统学习目标用户${u}_{i}$和候选项${v}_{j}$的向量化表征${u}_{i}\mathrm{ }$和$\mathrm{ }{v}_{j\mathrm{ }}$;然后,系统学习一个评分函数,对${u}_{i}$对${v}_{j\mathrm{ }}$的偏好进行建模;最终,通过用户对项目的偏好分数进行排序来生成推荐结果。推荐系统作为解决信息过载问题的有效手段,已经被广泛应用在兴趣点(point of interest, POIs)[5]、新闻[6]、交通[7]、教育[8]等多个领域。
传统的协同过滤算法认为,为特定用户找到其真正感兴趣的内容的方法是首先找到与此用户有相似兴趣的其他用户,然后将他们感兴趣的项目推荐给此用户[9]。协同过滤一般采用最近邻技术,利用用户的历史喜好信息计算用户之间的距离,然后利用目标用户的最近邻用户对商品评价的加权评价值来预测目标用户对特定商品的喜好程度,从而根据这一喜好程度来对目标用户进行推荐。一种常见的做法是将用户与商品一起转化为通用的向量,并将其输入到有监督学习(supervised learning, SL)模型中,具有代表性的模型有因子分解机(factorization machines,FM)[10]、中性因子分解机(neutral factorization machines,NFM)[11]等。
尽管这些方法提供了强大的性能,但其不足之处在于没有考虑项目之间的关联关系,从而无法准确表达用户的偏好。为了解决协同过滤算法的局限性,将知识图谱作为辅助信息引入到推荐算法逐渐成为众多学者关注的研究热点。知识图谱中的节点表示实体,有向边表示实体之间的关系,包含了用户和项目的信息和关联关系,可以更好地捕获用户偏好。此外,还可以将用户和用户侧信息集成到图谱中,构建协同知识图谱(collaborative knowledge graph, CKG),从而更精准地捕获用户与项目之间的关系以及用户的偏好。
基于知识图谱的推荐系统算法主要可以分为:基于嵌入的方法、基于路径的方法和基于传播的方法。①基于嵌入的方法使用知识图谱中的信息来丰富用户或项目的表示,如基于知识图谱的协同过滤(collaborative filtering with knowledge-graph,CFKG)[12]、协同知识嵌入(collaborative knowledge base embedding,CKE)[13]等。这种方法通过知识图谱嵌入将知识图谱中的实体和关系表征为低维向量,保留了知识图谱原有的结构。知识图谱嵌入的方法主要是基于平移距离模型,包括TransE[14]、TransH[15]、TransR[16]、TransD[17]和TranSparse[18],进行特征表示。②基于路径的方法(如RKGE[19])通过构建用户项目图并利用图中实体的连接关系,学习用户到项目的路径之间的连接相似性进行推荐。这种方法主要的挑战是如何设计合理的路径和如何为实体间的连接关系建模。③基于传播的方法整合实体和关系的语义表示以及连接信息,聚合知识图谱中多跳邻居节点的嵌入来深化实体表示,如Ripple Net[20]、KGAT(knowledge graph attention network)[21]等。然后,获得用户和项目的丰富表示,并预测用户的偏好。
在先前研究的基础上进行综合评估,笔者提出了一种创新性算法——GraphGPT Net,旨在改进现有基于知识图谱的推荐算法在深层语义表达上的不足。具体而言,该算法整合知识图谱和大规模模型的语义嵌入技术,通过结合图嵌入方法Graph2vec与大规模模型的GPT embedding,有效实现实验方案的向量化描述。进而,应用余弦相似度计算为每位用户推荐与其历史浏览实验方案高度相关的Top5实验方案。本研究实现了基于图语义融合的推荐机制,可以为识别相似实验方案提供有效的方法。

2 研究路线/Research route

本文的研究框架见图1,主要分为以下两个部分:
(1)实验方案知识抽取与建模。在论文和专利数据的基础上,首先进行有机太阳能电池领域Schema本体建模获取相关本体Schema[22]。按照知识抽取、知识融合、知识校验和知识存储的构建流程,利用实体抽取、实体消歧、关系抽取、知识链接、本体及实体对齐等技术,将文献数据中抽取出的实验方法知识表示为三元组形式,并建立“概念—实体—属性—关系”等数据模型,进而形成有机太阳能电池实验方案知识图谱。
(2)基于知识图谱的实验方案智能推荐研究。笔者聚焦于基于知识图谱的有机太阳能电池实验方案智能推荐机制的开发,利用协同过滤[11]、基于路径[19]、基于传播[20]的推荐算法在知识图谱中挖掘实体之间的关联关系;通过将实体之间的关联关系与用户数据进行融合,实现实验方案智能化推荐。在现有算法框架的基础上,进一步结合图嵌入技术Graph2vec与大规模模型语义嵌入GPT embedding,提出了创新的实验方案推荐算法——GraphGPT Net。该算法通过图语义融合技术,可以有效推进实验方案推荐系统的发展。
图1 研究框架

Figure 1 Research framework

3 实验方案知识抽取与建模/Experimental scheme knowledge extraction and modeling

笔者基于科技文献构建一个知识抽取—建模—服务的智能化系统,利用AI驱动的知识自动抽取技术从科技文献中解析出大量细粒度创新方法,利用知识图谱技术对不同类型和来源的方法知识进行组织和建模以形成创新方法知识图谱,作为推理发现的底层知识基础设施。

3.1 科学实验本体建模

首先,将科学实验定义为研究问题和实验方案两大部分,而核心的实验方案下分实验方法、实验步骤、实验元素、实验结果共4个大类,同时将科学实验核心的实验目标、实验原理和实验来源等设置为实验方案对应的属性,实验元素下分实验涉及的材料、试剂、仪器、条件和数据 ,具体如图2所示:
图2 科学实验知识图谱本体设计

Figure 2 Ontology design of scientific experiment knowledge graph

3.1.1 实验方法

有机太阳能电池(organic solar cell, OSC)的实验方法分为五大类,其中器件的制备方法可进一步细分为活性层的制备方法、界面层的制备方法和电极的制备方法,每种方法的属性都包括方法类型、方法描述,器件结构经过咨询专家只设定类型,而无具体的方法描述,如图3所示:
图3 有机太阳能电池实验方法

Figure 3 Experimental methods of organic solar cells

3.1.2 实验元素

实验元素建模为材料、试剂、仪器和数据,其中材料包括电极材料、活性层材料和界面层材料,而活性层材料又分为给体材料和受体材料,界面层材料包括空穴传输层材料和电子传输层材料,数据分为数据描述和光伏性能测试结果,该结果包括OSC性能测试最核心的4个指标[23],即能量转换效率(power conversion efficiency, PCE)、开路电压(open circuit voltage, ${V}_{oc}$)、短路电流密度(Short-circuit current density, ${J}_{sc}$)和填充因子(Fill factor, FF) ,如图4所示:
图4 有机太阳能电池实验元素

Figure 4 Experimental elements of organic solar cells

3.1.3 实验步骤

有机太阳能电池(OSC)的实验步骤分为器件制备类和性能测试类两种实验步骤,其中器件制备类又分为正置器件制备和倒置器件制备 ,具体如图5所示:
图5 有机太阳能电池实验步骤

Figure 5 Experimental steps of organic solar cells

3.2 科学实验知识图谱构建

选取的OSC领域的数据包括期刊论文和专利。经过专家咨询,笔者将OSC分为五大类,分别是单质结有机太阳能电池、异质结有机太阳能电池和染料敏化太阳能电池,并在专家指导下分别构建期刊论文检索式(见表1),共计获取期刊论文3 369篇,均来自材料领域的英文顶刊,将在Web of Science平台上下载的PDF原文作为待标数据集;专利来自IncoPat专利数据库,包括中国、德国、日本等14个国家和组织的421篇三方专利。经过专家遴选,最终确定1 810篇论文和123篇专利共1 933篇文献作为人工标注数据集。
表1 科学实验知识图谱数据来源

Table 1 Data sources of scientific experiment knowledge graph

类别 检索式 检索时间 检索结果
/篇
有机太阳能电池 TI=((organic solar cell$) OR (organic photovoltaic$) OR (organic photovoltaic$ cell$)) AND PY=(2010-2022) AND SO=((ADVANCED ENERGY MATERIALS) OR (NANO ENERGY) OR (ACS NANO) OR (ADVANCED MATERIALS) OR (CHEMICAL COMMUNICATIONS) OR (ADVANCED SCIENCE) OR (ADVANCED FUNCTIONAL MATERIALS) OR (SCIENCE CHINA CHEMISTRY) OR (NATURE COMMUNICATIONS) OR (ENERGY ENVIRONMENTAL SCIENCE) OR (ACS ENERGY LETTERS) OR (SMALL)) 2022年8月6日 1 914
单质结有机太阳能电池 TI=((Single-Junction AND Solar Cell$) OR (photovoltaic$ cell$) OR (conduct* polymer$ AND Solar cell$) OR (organic photovoltaic$ AND Solar cell$)) AND PY=(2010-2022) AND SO=((ADVANCED ENERGY MATERIALS) OR (NANO ENERGY) OR (ACS NANO) OR (ADVANCED MATERIALS) OR (CHEMICAL COMMUNICATIONS) OR (ADVANCED SCIENCE) OR (ADVANCED FUNCTIONAL MATERIALS) OR (SCIENCE CHINA CHEMISTRY) OR (NATURE COMMUNICATIONS) OR (ENERGY ENVIRONMENTAL SCIENCE) OR (ACS ENERGY LETTERS) OR (SMALL)) 2022年8月6日 333
异质结有机太阳能电池 TI=((heterojunction solar AND cell$) OR (bulk heteroiunction AND cell$) OR (cascade battery AND cell$)) AND PY=(2010-2022) AND SO=((ADVANCED ENERGY MATERIALS) OR (NANO ENERGY) OR (ACS NANO) OR (ADVANCED MATERIALS) OR (CHEMICAL COMMUNICATIONS) OR (ADVANCED SCIENCE) OR (ADVANCED FUNCTIONAL MATERIALS) OR (SCIENCE CHINA CHEMISTRY) OR (NATURE COMMUNICATIONS) OR (ENERGY ENVIRONMENTAL SCIENCE) OR (ACS ENERGY LETTERS) OR (SMALL)) 2022年8月6日 447
染料敏化太阳能电池 TI=((dye-sensitized solar cell$) OR ((dye OR dyestuff) AND cell$ coordination) OR (compound AND Solar Cell$) OR (complex AND Solar Cell$)) AND PY=(2010-2022) AND SO=((ADVANCED ENERGY MATERIALS) OR (NANO ENERGY) OR (ACS NANO) OR (ADVANCED MATERIALS) OR (CHEMICAL COMMUNICATIONS) OR (ADVANCED SCIENCE) OR (ADVANCED FUNCTIONAL MATERIALS) OR (SCIENCE CHINA CHEMISTRY) OR (NATURE COMMUNICATIONS) OR (ENERGY ENVIRONMENTAL SCIENCE) OR (ACS ENERGY LETTERS) OR (SMALL)) 2022年8月6日 692
经过本体建模、实例构建和知识图谱创建,最终获得34类节点和7类关系(见图6和图7),在Neo4j中导入数据后,共有24 348个节点和123 642个关系。
图6 有机太阳能电池实验图谱的34类节点

Figure 6 34 nodes in experimental graph of organic solar cells

图7 有机太阳能电池实验图谱的7类关系

Figure 7 7 relationships in the experimental graph of organic solar cells

4 基于知识图谱的实验方案智能推荐研究/Research on intelligent recommendation of experimental scheme based on knowledge graph

笔者在构建出的有机太阳能电池实验方案知识图谱基础上,基于AI技术助力实验学科高效筛选、推荐最具有可行性的实验方案,力图缩小科研人员的查找范围,节省科研人员的实验准备时间,进而提高科研效率。

4.1 实验方案推荐数据集

本文所用的数据集如下:SolarCell_KG包含1 810个有机太阳能领域论文中的实验方案项目和1 000个与这些实验方案交互过的用户信息。用户与实验方案的交互为隐性反馈,对于其中每个实验方案,标签为1表示用户对该项目很感兴趣,并对每个用户的未交互集进行抽样,选取等量实验方案;标记为0表示该用户对该项目不感兴趣。
笔者构建的有机太阳能电池知识图谱融合用户与实验方案的交互数据后得到SolarCell_KG,其具体的数据量如表2所示:
表2 SolarCell_KG数据

Table 2 SolarCell KG data

用户数 实体数 交互数 实体数 关系数 三元组数
1 000 1 810 23 148 22 148 7 123 652

4.2 对比实验

将用户与项目的交互数据分为训练集和测试集。对于测试集中的每个用户,将用户未与之交互的所有项视为负项。然后,每个算法输出用户除了训练集中的正例外项目的偏好分数。为了评估Top-K推荐和偏好排序的有效性,笔者采用了两种常用的评价指标[24]:前K项召回率(Recall@K)和前K项归一化折损累计增益(NDCG@K)。默认情况下,设置K = 20,计算得到测试集中所有用户的平均指标得分,使用以下模型进行实验对比:
(1)FM[10]:一个标准的因式分解模型,其中考虑了输入之间的二阶特征交互。将用户的id、物品及其知识(即与之相关的实体)视为输入特征。
(2)NFM[11]:一种最先进的因式分解模型,它将FM包含在神经网络中。特别地,该方法在输入特征上使用了一个隐藏层。
(3)BPRMF[25](Bayesian personalized ranking matrix factorization):通过学习用户和物品的潜在特征向量,来建模用户对物品的偏好,进而进行个性化推荐。BPRMF 的独特之处在于,它采用了基于排名的训练方法,旨在优化模型使用户感兴趣的内容排名更高。。
(4)ECFKG[26](enhanced collaborative filtering for knowledge graphs):结合协同过滤和知识图谱嵌入技术,以改善推荐的准确性和个性化程度。其旨在解决传统协同过滤算法在处理冷启动问题、数据稀疏性和推荐的解释性方面的不足。
(5)CKE[27](collaborative knowledge enhanced recommendation):一种典型的基于正则化的方法,它利用TransR派生的语义嵌入来增强矩阵分解。
(6)KGAT[21]:一种基于图神经网络的推荐模型,具有图注意力网络的特性。KGAT 将知识图谱和用户—物品图的混合结构作为协同知识图谱,引入注意力机制,用于区分图中不同邻居节点的重要性。
(7)Graph2vec[28]:一种用于学习图表示的算法,旨在将整个图映射到一个向量空间中。通过考虑图的子结构来捕获图的全局属性,类似于词嵌入技术(如Word2Vec)在文本处理中的应用。Graph2vec算法首先识别出图中的重要子结构,然后使用这些子结构作为序列来训练神经网络,从而生成图的低维度、密集向量表示。
(8)GPT词嵌入[29]技术:通过预训练的生成式预训练变换器(GPT)模型为文本数据生成密集的向量表示。该技术利用GPT模型的深层语义理解能力,将文本转换为固定长度的向量。这些向量捕获了文本的上下文信息和语义特征,使得文本数据可以被应用于各种下游机器学习任务,包括文本分类、情感分析和文本相似性比较,提高了处理效率和效果。
对于FM与NFM,设置隐藏层为[64, 32, 16];对于ECFKG,设置训练集 batch_size = 2 048,测试集 batch_size = 10 000;对于 CKE,设置 L2正则器权重 lambda = e -5;对于KGAT,设置深度为2,卷积层为[64, 32, 16], agg = bi-interaction, lap = random-walk。所有模型的向量维度为128,学习率为 0.000 1, 训练epoch = 1 000。此外,执行早停(early stopping)策略,如果验证集上的Recall@20在连续10个epoch中没有增加,则执行早停策略。
实验的硬件与软件设置如下:
$\bullet$ Operation System:Linux
$\bullet$ RAM:32G
$\bullet$ CPU:Intel(R) Xeon(R) CPU E5-2683 v4
$\bullet$ GPU:Nvidia RTX 3090 - 24G
$\bullet$ SSD:50G
$\bullet$ Software:NVIDIA CUDA 11.7, Python 3.8, Pytorch 1.13.1, Numpy 1.18
实验方案推荐实验结果如表3所示:
表3 实验方案推荐实验结果

Table 3 Recommended experimental results

推荐算法 Recall@20 NDCG@20
FM 0.022 0 0.041 9
NFM 0.025 4 0.058 7
BPRMF
ECFKG
0.013 7
0.019 8
0.021 2
0.021 5
CKE 0.019 3 0.022 8
KGAT 0.012 8 0.018 9
GraphGPT Net 0.029 9 0.029 6
从表3可以得出如下结论:
(1)协同过滤算法:NFM算法在Recall@20和NDCG@20方面表现出色,分别为0.025 4和0.058 7,FM算法也表现良好,分别为0.022 0和0.041 9。这表明这两种传统的协同过滤算法在推荐任务中具有良好的性能,尤其是在Recall@20指标上。
(2) BPRMF算法:在Recall@20和NDCG@20上表现一般,分别为0.013 7 和0.021 2。这表明BPRMF在推荐任务中表现一般。
(3)基于知识图谱的算法:KGAT算法在Recall@20和NDCG@20上表现较差,分别为0.012 8和0.018 9。这表明基于知识图谱的方法在这两个指标下的性能较低,可能需要进一步改进。CKE算法在Recall@20和NDCG@20方面表现较好,分别为0.019 3和0.0228,这表明它在推荐任务中具有较高的性能。ECFKG算法在Recall@20和NDCG@20上都表现良好,分别为0.019 8和0.021 5。
(4)GraphGPT Net:在Recall@20上表现最为出色,达到了0.029 9,超越了基线算法中表现最好的算法NFM。这表明知识图谱与实验方案语义融合的推荐算法在推荐任务中具有更好的效果,尤其在提高Recall@20方面表现出色,在NDCG@20上优于所有基于知识图谱的算法,但与协同过滤算法相比还有一定的差距。
综合考虑,本实验结果强调了不同推荐算法在不同指标下的性能差异。传统的协同过滤算法(如FM、NFM)在多数情况下表现出色。基于知识图谱的算法总体来看表现不佳,这可能是由于知识图谱中的实体和关系稀疏,算法可能难以捕捉足够的上下文信息来进行有效的推荐。CKE和KGAT在Recall@20和NDCG@20方面都表现良好。选择最适合特定推荐任务的算法取决于具体情况,可能需要进一步的研究和实验。
针对基于知识图谱的推荐算法存在的限制,笔者提出了一种知识图谱与实验方案语义融合的推荐算法。该算法旨在克服现有方法的局限性,通过更深层次的语义融合技术,优化推荐结果的准确性和相关性。实验结果显示,相比传统算法和基于知识图谱的算法,笔者提出的GraphGPT Net算法在Recall@20关键性能评估指标上展现出更优的效果。笔者对GraphGPT Net在不同推荐个数下的表现结果进行实验(见图8),发现随着推荐个数K值的增加,算法的Recall和NDCG指标持续提升。这证明了笔者提出的知识图谱与实验方案语义融合的推荐算法的优越性,强调了为特定推荐任务精心选择和设计算法的重要性,同时也指出通过进一步的研究和实验来不断完善推荐系统的必要性。
图8 不同推荐个数下GraphGPT Net的表现结果

Figure 8 Performance results of GraphGPT Net with different recommended numbers

5 研究总结与展望/Research summary and prospects

笔者首先在论文和专利数据的基础上,进行有机太阳能电池领域Schema本体建模。在本体框架的基础上,按照知识抽取、知识融合、知识校验和知识存储的构建流程,利用实体抽取、实体消歧、关系抽取、知识链接、本体及实体对齐等技术,将文献数据中抽取出的实验方法知识表示为三元组形式,并建立“概念—实体—属性—关系”等数据模型,进而形成有机太阳能电池实验方案知识图谱。
基于有机太阳能电池实验方案知识图谱,笔者利用协同过滤、基于路径、基于传播的推荐算法在知识图谱中挖掘实体之间的关联关系;通过将实体之间的关联关系与用户数据进行融合,实现实验方案智能化推荐。推荐算法对比实验的结果显示笔者提出的GraphGPT Net在Recall@20指标上表现最为出色,可以有效地对实验方案进行推荐。本文的创新点如下:①图嵌入技术与大模型语义嵌入的融合。通过结合图嵌入表征技术Graph2vec和大模型语义嵌入表征GPT embedding,本文提出了一种新的实验方案推荐算法——GraphGPT Net。这种融合不仅优化了实验方案的向量化表示,而且通过融合图语义和大模型的深度学习能力,提升了推荐系统的智能化水平。②知识图谱语义融合的实验方案推荐。本文提出的GraphGPT Net算法实现了知识图谱语义融合的实验方案推荐。不同于传统的论文和专利推荐,本文构建了实验方案的本体架构;在此基础上不仅能够识别出与特定实验方案相似的方案,还能够更准确地理解和处理复杂的实验方案推荐问题,从而提供更为精确和个性化的推荐结果。
本文的局限性在于:①只标注了1 933篇论文专利,得到的知识图谱实体和关系数量较少,知识图谱有待进一步扩充。后续考虑通过大语言模型,对文本中显性与隐性的知识进行分析、推理,从中抽取出实验方法、实验原理、研究问题和解决方案等不同类型的知识元素,进一步扩充有机太阳能电池实验方案知识图谱。②只讨论了基于知识图谱的推荐,还可以基于大语言模型按照有机太阳能电池实验步骤,根据提示学习设计prompt推荐实验方案,并通过微调或者注入本地知识库的方法,进一步优化推荐结果。

张 凯:撰写论文,基于论文数据进行技术分析;

石 栖:构建数据库,提出修改意见。

感谢中国科学院成都文献情报中心胡正银老师的团队对本研究在数据和技术上的大力支持。

[1]
孙蒙鸽, 黄雨馨, 韩涛, 等. 科研智能化新趋势下知识服务的挑战与机遇[J]. 情报杂志, 2022, 41(6): 173-181,107.(SUN M G, HUANG Y X, HAN T, et al. Challenges and opportunities of knowledge service under the new trend of intelligent scientific research [J]. Journal of information technology, 2022, 41(6): 173-181,107.)

[2]
GUO Q, ZHUANG F, QIN C, et al. A survey on knowledge graph-based recommender systems[J]. IEEE transactions on knowledge and data engineering, 2022, 34(8): 3549-3568.

[3]
徐增林,盛泳潘,贺丽荣,等. 知识图谱技术综述[J]. 电子科技大学学报,2016,45(4):589-606.( XU Z L, SHENG Y P, HE L R. Review on knowledge graph techniques[J].Journal of University of Electronic Science and Technology of China, 2016,45(4): 589-606.)

[4]
DIOMEDI D, HOGAN A. Question answering over knowledge graphs with neural machine translation and entity linking[EB/OL].[2024-06-19].https://doi.org/10.48550/arXiv.2107.02865.

[5]
XI D, ZHUANG F, LIU Y, et al. Modelling of bi-directional spatio-temporal dependence and users’ dynamic preferences for missing POI check-in identification[EB/OL].[2024-06-19]. https://doi.org/10.48550/arXiv.2112.15285.

[6]
WANG H, ZHANG F, XIE X, et al. DKN: deep knowledge-aware network for news recommendation[EB/OL].[2024-06-19]. https://doi.org/10.48550/arXiv.1801.08284.

[7]
LIU H, TONG Y, HAN J, et al. Incorporating multi-source urban data for personalized and context-aware multi-modal transportation recommendation[J]. IEEE transactions on knowledge and data engineering, 2022, 34(2): 723-735.

[8]
HUANG Z, LIU Q, ZHAI C, et al. Exploring multi-objective exercise recommendations in online education systems [C]//Proceedings of the 28th ACM international conference on information and knowledge management. New York: Association for Computing Machinery, 2019:1261-1270.

[9]
SHI Y, LARSON M, HANJALIC A. Collaborative filtering beyond the user-item matrix: a survey of the state of the art and future challenges[J]. ACM computing surveys, 2014, 47(1): 1-45.

[10]
RENDLE S. Factorization machines [C]// Proceedings of IEEE international conference on data mining. Sydney: IEEE, 2010: 995-1000.

[11]
HE X , CHUA T S .Neural factorization machines for sparse predictive analytics[J].ACM SIGIR forum, 2017, 51(cd):355-364.

[12]
ZHANG Y , AI Q , CHEN X,et al. Learning over knowledge-base embeddings for recommendation[EB/OL].[2024-06-19]. https://doi.org/10.48550/arXiv.1803.06540.

[13]
ZHANG F, YUAN N J, LIAN D, et al. Collaborative knowledge base embedding for recommender systems[C]// Proceedings of the 22nd ACM SIGKDD international conference on knowledge discovery and data mining(KDD '16)., New York: Association for Computing Machiner, 2016, 353-362.

[14]
BORDES A, USUNIER N, GARCIA-DURAN A, et al. Translating embeddings for modeling multi-relational data[C]//Proceedings of the 26th international conference on neural information processing systems - Volume 2 (NIPS'13).New York: Curran Associates Inc, 2016: 2787-2795.

[15]
WANG Z, ZHANG J, FENG J, et al. Knowledge graph embedding by translating on hyperplanes[C]//Proceedings of the 28th AAAI conference on artificial intelligence(AAAI'14). Quebec: AAAI Press, 2014: 1112–1119.

[16]
LIN Y, LIU Z, SUN M, et al. Learning entity and relation embeddings for knowledge graph completion[C]//Proceedings of the 29th AAAI conference on artificial intelligence. Austin: AAAI Press, 2015: 2181-2187.

[17]
JI G, HE S, XU L, et al. Knowledge Graph Embedding via Dynamic Mapping Matrix[C]//Proceedings of the 53rd annual meeting of the Association for Computational Linguistics and the 7th international joint conference on natural language processing (Volume 1: Long Papers). Beijing: Association for Computational Linguistics, 2015: 687-696.

[18]
JI G, LIU K, HE S, et al. Knowledge graph completion with adaptive sparse transfer matrix[C]//Proceedings of the 30th AAAI conference on artificial intelligence. Phoenix: AAAI Press, 2016: 985-991.

[19]
SUN Z, YANG J, ZHANG J, et al. Recurrent knowledge graph embedding for effective recommendation[C]//Proceedings of the 12th ACM conference on recommender systems. Vancouver: ACM, 2018: 297-305.

[20]
WANG H, ZHANG F, WANG J, et al. RippleNet: propagating user preferences on the knowledge graph for recommender systems[C]//Proceedings of the 27th ACM international conference on information and knowledge management (CIKM '18). New York: Association for Computing Machinery, 2018: 417-426.

[21]
WANG X, HE X, CAO Y, et al. KGAT: knowledge graph attention network for recommendation[C]//Proceedings of the 25th ACM SIGKDD international conference on knowledge discovery & data mining (KDD '19). New York: Association for Computing Machinery, 2019: 950-958.

[22]
吕爽. 基于叙词表的医学领域本体的构建研究[D]. 长春:吉林大学, 2011.(LÜ S. Research on the construction of medical domain ontology based on thesaurus[D]. Changchun: Jilin University, 2011.)

[23]
严婷婷. 高效三元有机太阳能电池的制备及性能研究[D]. 宁波:中国科学院大学(中国科学院宁波材料技术与工程研究所), 2022.(YAN T T. Preparation and properties of high efficiency terpolymer solar cells[D]. Ningbo: University of Chinese Academy of Sciences (Ningbo Institute of Materials Technology and Engineering, Chinese Academy of Sciences), 2022.)

[24]
HE X, LIAO L, ZHANG H, et al. Neural collaborative filtering[C]//Proceedings of the 26th international conference on World Wide Web (WWW '17). Perth: International World Wide Web Conferences Steering Committee, 2017: 173-182.

[25]
RENDLE S, FREUDENTHALER C, GANTNER Z, et al. BPR: bayesian personalized ranking from implicit feedback[C]//Proceedings of the 25th conference on uncertainty in artificial intelligence (UAI '09). Arlington: AUAI Press, 2019, 452-461.

[26]
AI Q, AZIZI V, CHEN X, et al. Learning heterogeneous knowledge base embeddings for explainable recommendation[J]. Algorithms, 2018, 11(9),132-137.

[27]
ZHANG F , YUAN N J , LIAN D ,et al. Collaborative knowledge base embedding for recommender systems[C]//Proceedings of the 22nd ACM SIGKDD international conference on knowledge discovery and data mining (KDD '16). New York: Association for Computing Machinery, 2016, 353-362.

[28]
NARAYANAN A, CHANDRAMOHAN M, VENKATESAN R, et al. Graph2vec: learning distributed representations of graphs[EB/OL].[2024-06-19]. https://doi.org/10.48550/arXiv.1707.05005.

[29]
DAI D, SUN Y, DONG L, et al. Why can GPT learn in-context? language models implicitly perform gradient descent as meta-optimizers[EB/OL].[2024-06-19]. https://doi.org/10.48550/arXiv.2212.10559.

Outlines

/

〈 〉