AI赋能知识管理与服务的拓荒探索专题

学者高分主题标签在小同行学者精准画像中的应用

  • 伍军红 ,
  • 郑新宇 ,
  • 汤丽云 ,
  • 孙隽
展开
  • 同方知网数字科技有限公司 北京 100084

作者贡献声明 /Author contributions:

伍军红:评价指标计算方法的主要提出人,论文修改;

郑新宇:评价指标计算方法的主要研究人员,数据处理;

汤丽云:评价指标计算方法的主要研究人员,论文修改;

孙 隽:评价指标计算方法的主要研究人员,文献调研与初稿撰写。

孙隽,研究员,硕士,E-mail: 。

伍军红,评价中心主任,编审,本科

郑新宇,研究员,硕士

汤丽云,评价中心副主任,副编审,硕士

收稿日期: 2026-02-04

  网络出版日期: 2026-02-28

Application of Scholars' High-Score Topic Tags in Precision Profile Building of Small-Peer Scholars

  • Wu Junhong ,
  • Zheng Xinyu ,
  • Tang Liyun ,
  • Sun Jun
Expand
  • Tongfang Knowledge Network Digital Technology Co. , Ltd. , Beijing 100084
Sun Jun, Research Fellow, Master's Degree, E-mail: .

Wu Junhong , Director of China Scientometrics and Bibliometrics Research Center, Senior Editor, Bachelor's Degree

Zheng Xinyu, Research Fellow, Master's Degree

Tang Liyun, Deputy director of China Scientometrics and Bibliometrics Research Center, Associate Editor, Master's Degree

Received date: 2026-02-04

  Online published: 2026-02-28

摘要

【目的/意义】 学者画像被广泛运用于学术领域的各项精准服务,如论文评审、项目评审、精准推送、人才引进等。在“小同行”学者的识别中,主题标签起着关键性作用。对学者主题标签计算方法进行优化,可以更准确找到各细分学科领域的“小同行”学者。 【方法/过程】 提出一种理论框架,即学者领域画像应综合考虑学者研究兴趣与学术能力等评价信息,同时呈现学者的研究领域及其在该领域的学术水平。将主题标签与评价数据相结合,以评价数据作为主题标签权重的考量要素,提出一种计算学者高分主题标签的算法,包含发表文献量、学者署名位次、论文被引频次3个维度。 【结果/结论】 从学者本人画像来看,通过学者高分主题标签可以刻画该学者主要的细分研究领域;从学科领域找专家的需求出发,通过学者高分主题标签可找出该领域的高影响力学者。

本文引用格式

伍军红 , 郑新宇 , 汤丽云 , 孙隽 . 学者高分主题标签在小同行学者精准画像中的应用[J]. 知识管理论坛, 2026 , 11(1) : 61 -67 . DOI: 10.13266/j.issn.2095-5472.2026.006

Abstract

[Purpose/Significance] Scholar profiles are widely applied in various precision services within the academic field, such as paper review, project evaluation, targeted recommendations, and talent recruitment. Topic tags play a critical role in identifying scholars in the same specialized subfield. This paper optimizes the method for calculating scholar topic tags to more accurately identify scholars within specific subdisciplines. [Method/Process] This paper proposed a theoretical framework: scholar profiles should comprehensively incorporate evaluation information such as scholars' research interests and academic capabilities, while also reflecting their research fields and academic standing within those fields. This paper integrated topic tags with evaluation data, using the latter as a factor for weighting topic tags. An algorithm was proposed for calculating high-scoring topic tags for scholars, incorporating three dimensions: the quantity of published papers, the author's position in the author list, and the citations of the papers. [Result/Conclusion] From the perspective of individual scholar profiling, high-score topic tags can delineate the main specialized research areas of a scholar. For the need to identify experts within a discipline, high-score topic tags can help pinpoint the most outstanding and core scholars in that field.

1 引言/Introduction

学者画像是指从海量的学术数据中勾画出学者研究概貌,主要用于学术行为分析、学者推荐以及学者评价等。学者画像在数据来源、标签体系设计以及应用等方面与普通的用户画像存在一定差异。当前,有不少研究从不同视角和不同层次阐述了用户画像的构建流程。根据文献调研结果,基于大数据的学者画像构建研究框架主要包含4个部分,分别为学者多源数据搜集、数据预处理、学者标签构造和学者画像可视化展示[1]。学者画像的标签可分为个人属性标签、研究兴趣属性标签、学术能力标签以及学者社交标签四大类别[2-3]。
研究兴趣属性标签是学者标签体系的核心。研究兴趣标签主要来自学者的科研成果数据,最直接的方法是将学者发表论文的关键词作为兴趣标签,然而关键词数量众多且质量不一,所以有很多学者探讨从相关研究成果中挖掘学者研究兴趣标签的算法[4-6]。
学者学术能力标签亦是学者画像标签体系的重要组成部分。学者的学术能力可以从学者的学术成果质量和学术影响力两个方面来反映。其中,学术成果的质量可以用论文发表期刊的级别、主持基金的级别、所属机构权威度等指标来表示。学者的学术影响力常用h指数及g指数等衍生指数来表示[7-8]。
从目前研究来看,大多数学者倾向于将研究兴趣标签与学术能力标签分开考量。然而,就学术研究而言,学者在特定领域的研究“专深”程度在很大程度上决定了其研究能力和发展潜力。已有部分学者尝试从多维度进行综合考察。例如,陈翀等[9]提出,成果的内容信息和学者对成果的贡献度这两类信息对揭示学者的专长非常重要;张洋等[10]从基础属性、研究方向、学术生产力、学术影响力、创新潜力和合作能力6个维度构建了青年科技人才画像与标签体系;范晓玉等[11]则提出融合多源数据的科研人员画像构建方法,分别从基础属性、科研偏好和科研关系3个维度对科研人员信息进行形式化描述,并提取各维度标签,以可视化方式展示其画像。
基于此,本研究提出一种综合考虑学者研究兴趣与学术能力等评价信息的学者领域画像构建与鉴别方法,旨在同时揭示学者的研究领域及其在该领域的学术水平。

2 理论框架/ Theoretical framework

本研究的理论框架的核心概念为“高分主题标签”,其内涵在于将学者的研究主题与其在该主题上的学术能力表现进行有机融合。高分主题标签并非单纯的主题词频统计结果,而是将研究兴趣(广度、覆盖度)与学术能力(深度、影响力)的二维信息进行融合。其中,研究兴趣维度反映学者在特定领域的研究广度与主题覆盖范围,学术能力维度则体现其在该领域的研究深度、成果影响力及个人贡献程度。学者的研究专长本质上是一个“主题—水平”二元结构,仅揭示研究领域而忽视学术水平,或仅评价学术能力而不明确具体领域,均难以完整刻画学者领域画像。
该框架的理论基础可以从科学中的马太效应理论进行解释。默顿于1968年首次提出马太效应概念,“相对于那些不知名的研究者,声名显赫的科学家通常得到更多的声望,即使他们的成就是相似的”[12]。这一理论揭示了学者在某一研究主题上的持续产出与被引积累,将形成学术声誉的自我强化循环,使其在该主题上的影响力不断放大。即学者在其长期深耕的主题领域,通过持续的成果产出与学术积累,逐渐形成具有标识意义的“专长标签”;而随着学术声誉的建立,其后续成果更易获得关注与引用,进一步提升其在该主题上的影响力。本研究所提出的“高分主题标签”,正是对这种累积优势在主题层面具象化呈现的量化表达,即高分值标签恰恰体现了马太效应作用下学术影响力在特定主题上的集聚特征。换言之,学者在其核心研究主题上的“高分”,既是其过去持续投入的成果体现,也是其未来学术影响力持续放大的基础。

3 研究设计与方法/Research design and methods

3.1 数据来源

学者研究兴趣与学术能力的评价维度通常较为多元,可纳入考量的因素包括学术成果、科研项目、专利、科技奖励、学术任职等。然而,综合考虑数据源的可获取性、评价指标的统一性以及算法在产品化落地中的可行性,本研究暂不构建涵盖多源信息的综合性学者画像,而聚焦于学术论文这一成果形式,探讨对学者高分主题标签进行构建的方法。
本研究所用数据源自学者近10年发表的期刊论文,该时间窗口的选取主要基于以下两方面考量:第一,学者近期的研究成果更能代表其研究重点方向;第二,本算法要开展影响力评价,影响力数据主要基于被引频次,被引频次具有一定的滞后性,所以选取相对较长时间的论文,可以更准确刻画研究成果的影响力。因此,选取近10年的论文数据,既能有效体现学者当前的研究重点,又能为被引频次的积累提供充分的时间窗口,从而更准确地刻画其研究成果的学术影响力。

3.2 学者高分主题标签计算方法设计

基于学者近10年发表论文及评价数据,本研究提出一种学者高分主题标签计算方法。该算法的核心思想是对学者所涉及的主题词进行加权评价,以评价结果作为主题标签的权重依据,最终识别出学者最具代表性的研究主题。算法的具体实现路径如下:首先,从学者发表的论文中提取主题词(包括作者关键词以及机标关键词);其次,对每个主题词进行综合加权评分。评分维度包括:①发表论文数量,反映学者在该主题上的研究活跃度与产出规模;②学者署名位次,反映学者在该主题研究中的参与程度与贡献度,其中第一作者、通信作者等位次赋予更高权重;③论文被引频次,反映学者在该主题上的研究成果所获得的学术关注度与影响力。通过上述3个维度的加权融合,算法为每个主题词生成一个综合评分,并按评分高低排序,最终得到学者的高分主题标签列表。
(1)主题词提取。本研究选取学者近10年发表的期刊论文,并从中提取两类主题词:作者关键词和机标关键词。作者关键词由作者自行标定,能够直接反映学者对其研究成果的主题认知与研究意图;机标关键词则基于计算机算法从标题、摘要、全文等字段中自动抽取,并根据学科词表进行规范与上下位词的合并,可在一定程度上补充作者关键词未覆盖的研究视角。两类主题词的结合使用,有助于更全面地覆盖学者的研究内容,提升主题标签的完整性与客观性。
(2)多维加权评价指标设计。在完成主题词提取的基础上,本研究从3个维度对每个主题词进行加权评价,综合衡量学者在该主题上的研究活跃度、贡献程度与学术影响力。
第一,发表论文数量。该指标反映学者在特定主题上的研究活跃度与产出规模。学者在某一主题发表的论文数量越多,表明其对该主题的关注程度越高,研究投入越持续。该指标的计算方式为:统计学者在近10年内发表的、包含该主题词的论文篇数。设任一学者近10年发表的论文集合为 P = { p 1 , p 2 , … … p n },任一篇论文 p i的研究主题词集合为 T = { t 1 , t 2 , … … t m },学者发表一篇 t i为主题的论文,其得分为1。可见,若不考虑权重指标,主题词 t i的得分是发表相同主题词的论文数量,其得分小于等于n。
第二,学者署名位次。该指标反映学者在具体研究成果中的参与程度与学术贡献度。根据多数学科的署名习惯,署名位次与作者贡献相关,通常署名越靠前的作者对研究成果贡献越大。一般认为第一作者对成果贡献最大,通信作者在学术惯例中亦被视为同等贡献。本研究参考T. Tscharntke等[13]提出的SDC方法(sequence-determines-credit),定量处理每位作者在一篇论文的贡献。即学者对论文贡献可简单化处理为根据作者署名位次的定量化表示,将署名位次的倒数作为对论文的贡献值,即第一作者的贡献值为1,第二作者的贡献值为1/2,第三作者的贡献值为1/3,以此类推[14]。
第三,论文被引频次。该指标反映学者在特定主题上的研究成果所获得的学术关注度与影响力。被引频次作为评价学术成果影响力的传统指标,被长期广泛应用,但直接使用被引频次在跨年度与跨学科比较方面存在显著局限。为综合评价不同时期、跨学科学术成果的相对影响力,本研究选用论文引证标准化指数(paper citation standardized index,PCSI)[15]作为论文学术影响力的衡量指标。PCSI通过对被引频次进行标准化处理,消除了因发表年度和学科差异带来的不可比性,能够更客观地反映论文的相对影响力。论文PCSI值越高,即表明其相对影响力越大。
(3)综合评分与高分主题标签遴选。基于上述3个维度的指标设计,本研究对学者每个主题词进行综合加权评分,见公式(1)。
S ( t ) = ∑ i = 1 n w i * f j
其中, S ( t )表示主题词 t的综合评分; n表示学者发表的包含主题词 t的论文总数; w i表示第 i篇论文体现作者贡献的加权系数,基于署名位次计算得出, w = 1 x , x 为作 者位 次; f i表示第 i篇论文体现学术影响力的加权系数, f = l n   P C S I + 1 + 1。
通过上述模型,可计算得到每个主题词的综合评分,将学者所有研究主题词按评分降序排序,根据应用场景需求选取排名前 c个主题词作为该学者的专长标签。即 { t 1 , S ( t 1 ) , t 2 , S ( t 2 ) , … … , t c , S ( t c ) },其中 c为根据需求自定义主题词个数,可以是具体的数值(如前10个)或根据普赖斯定律确定(如根据主题词总数的平方根来确定)。每一个主题词都与其分值成对出现。
从功能定位来看,高分主题标签具有双重应用价值:一方面,从学者领域画像的精准度出发,高分主题标签能够刻画学者主要的细分研究领域,呈现其研究兴趣的聚焦方向与研究深度的分布特征;另一方面,从学科领域专家识别的需求出发,通过高分主题标签可快速定位特定领域的高影响力学者,为科研评价、项目评审、合作者发现等应用场景提供数据支撑。

4 实证研究/Empirical research

4.1 学者高分主题标签实证研究

本研究选取学者A为实证研究对象,主要考虑以下两点:①学者A的研究领域与本研究所关注的学术出版主题高度契合,其研究方向涵盖战略管理、数字化转型、国际影响力提升等出版学科前沿领域,具有较强的代表性;②学者A入选中国知网“全国高被引学者TOP 1%”名单,作为出版学科的高被引学者,其学术成果具有较高的显示度和影响力。以学者A为案例研究对象,能够有效验证本研究提出的高分主题标签计算方法在识别学者核心研究主题方面的适用性与有效性。
在中国知网检索到学者A于近10年(2015—2024年)发表的学术期刊论文35篇,并获取论文的作者关键词、机标关键词、学者A在每篇论文的署名顺序(作者位次)及论文的PCSI数值等信息。首先,对学者A发文的作者关键词、机标关键词进行数据整理,去重后主题词共163个。然后,根据本研究设计的学者高分主题标签计算方法,计算学者A每个主题词的综合分值。最后,取 S ( t )分值排名前10的主题词作为学者A的高分主题标签集合,结果见表1。
表1 学者A高分主题标签集合

Table 1 Set of high-scoring topic labels for scholar A

排名 主题词 主题词分值 S ( t )  
1 科技期刊 14.111
2 期刊评价 8.271
3 学术影响力 7.637
4 文献大数据 6.152
5 学术期刊 6.062
6 出版创新 6.061
7 哲学社会科学 5.759
8 双语出版 5.129
9 综合能力 4.694
9 引领作用 4.694
9 世界一流科技期刊 4.694
9 发展策略 4.694
以“世界一流科技期刊”“发展策略”“引领作用”及“综合能力”为核心的关键词集群,明确指向学者A研究方向中学术出版的战略管理维度。“文献大数据”与“出版创新”等标签,揭示了其对出版数字化转型深度关注。“双语出版”“学术影响力”“期刊评价”等关键词,共同印证了其对国际影响力提升这一议题的深入研究。通过学者A的样例研究,可以验证本研究设计的学者A的高分主题标签能够清晰地识别学者的核心研究方向。

4.2 “小同行”领域专家推荐实证研究

本研究以“数据要素”“智慧法治”两个新兴领域为例进行实证研究。通过文献调研与专家咨询,确定“数据要素”领域密切相关的主题词共33个,以及“智慧法治”领域相关主题词共151个。中国知网“学术评价支撑平台”已基于学者近10年发表期刊论文,构建了每位学者的高分主题标签,并完成了数据的向量化部署。本研究以上述两个研究领域的主题词在学者高分主题标签中进行语义匹配,计算学者在“数据要素”“智慧法治”两个领域相关主题词 S ( t )值总分(记为 S 总),按 S 总进行降序排序,最终获得集中程度最高的前20位学者。
以2024年“数炬计划——中国数据要素新锐学者项目”所发布的获奖学者作为“数据要素”领域学者参照,对筛选出的前20位学者进行验证分析。该项目是面向45周岁以下青年学者,经学者自荐、大数据筛选、专家评审等环节,最终评选出特等奖、一等奖、二等奖、三等奖以及提名奖共99名青年学者。经公开信息检索核实,在前20名学者中,有13位年龄超过45周岁,剩余7位年龄符合要求的学者中,有5位为该项目的获奖学者,重合率高达71%。如表2所示。
表2 数据要素领域45周岁及以下相关主题词部分学者

Table 2 Partial list of scholars aged 45 and under in the data element field

序号 作者 高分主题标签 S 总 获奖情况
1 学者DXD (个人信息保护,23.105),(数据权利,18.156),(个人信息保护法,6.359),(《个人信息保护法》,5.634),(数据共享,4.692),(数据产权,4.594),(数据治理,3.661),(数据市场,3.508),(数据交易,2.791) 72.500 特等奖
2 学者XK (个人信息保护法,14.706),(数据共享,9.015),(数据权利,6.824),(数据安全,6.789),(个人信息保护,5.644),(数据治理,4.192),(数据流通,4.183),(个人信息保护机构,3.153),(数据开放,2.439),(《个人信息保护法(草案)》,1.521),(数据安全管理,1.307) 59.773 三等奖
3 学者LGF (数据治理,15.783),(数据共享,12.215),(数据安全,6.379),(数据平台,3.717),(科学数据安全内容,3.434),(数据开放平台,3.134),(《中华人民共和国数据安全法(草案)》,2.144),(科学数据共享,2.078),(大数据产业,1.505),(政府数据开放,0.55) 50.939 三等奖
4 学者ZHP (数据资源,5.13),(数据要素,4.954),(数据市场化,3.61),(政府数据共享,3.593),(数据治理,3.539),(数据开放,2.944),(数据交换共享,2.841),(大数据价值链,2.819),(跨部门数据共享,2.76),(数据产权制度,2.288),(数据共享,2.168),(政府数据开放,1.683),(大数据产业,1.472),(数据财政,0.646),(公共数据治理,0.508) 40.955 一等奖
5 学者CCB (政府数据开放,25.036),(政府数据开放质量,2.654),(数据开放,2.625),(数据开放监管,2.454),(公共数据资源,2.397),(数据开放体系,1.781),(数据隐私风险,1.365) 38.312
6 学者WWL (数据治理,7.817),(数据安全,7.487),(数据共享交换,4.006),(数据开放,3.682),(大数据产业,3.33),(数据要素市场,3.081),(数据交易,2.375),(全球数据治理,1.878),(工业数据治理,1.867),(跨境数据流通,1.724),(数据资源,0.781) 38.028
7 学者LK (数据安全,7.231),(数据共享,6.956),(数据治理,4.806),(数据隐私,3.417),(数据价值,2.913),(《大数据安全管理指南》,2.793),(《信息安全技术大数据安全管理指南》,1.802),(《中华人民共和国数据安全法》,1.751),(个人信息保护,1.751),(大数据隐私,1.426) 34.846 提名奖
表2中的前3位学者,其公开资料显示的研究方向分别为:“法理学、社会法、网络法与信息法、规制与治理研究”“网络法、公司法、法律经济学、私法基础理论”“科研数据管理、大数据分析、专利分析”。进一步考察三人的高分主题标签,可以发现其分别对应数据要素的“治理与安全”“流通与市场”等细分方向,与公开资料介绍的研究领域基本吻合。此外,这3位学者分别获得了特等奖与三等奖,表明其学术水平已达到所在学科领域的高影响力学者标准。
以2024年“智慧法治学术影响力TOP100入选作者”作为“智慧法治”领域学者参照样本,对本研究筛选出的前20位学者进行验证分析。该榜单基于2019—2023年间国内期刊公开发表的法学领域学术论文遴选产生,入选学者需以第一或通信作者身份发表篇名、主题词或摘要中包含“智慧法治”相关词汇的论文。经过定量评价、“智慧法治学术共同体”初审、专家终审等环节,最终确定100位学者。对比分析结果显示,本研究筛选出的前20位学者均入选2024年“智慧法治学术影响力TOP100入选作者”,具体名单详见表3。
表3 智慧法治领域相关主题词部分学者

Table 3 Partial list of scholars in the smart rule of law field

序号 作者 高分主题标签 S 总

是否

入选

1 作者CB (数据,106.584),(互联网,60.2106),(数字经济,40.6409),(数据安全,31.405),(智能,29.6415),(平台经济,28.8284),(人工智能,28.6415),(算法,23.3366),(数据要素,22.0586),(网络,12.9798) 211.114 是
2 作者YD (数据,73.0502),(区块链,52.7441),(互联网,38.0459),(互联网金融,31.4691),(数字经济,29.6547),(数字货币,29.305),(智能,24.2001),(数据要素,19.2958),(网络,16.9433),(人工智能,15.518) 189.212 是
3 作者LXQ (智能,89.8485),(人工智能,85.4153),(网络,50.7787),(机器人,48.2844),(数据,32.5519),(个人信息,22.6087),(生成式人工智能,15.6241),(元宇宙,15.5411),(智能技术,14.2322),(互联网,14.1259) 185.838 是
4 作者DXD (个人信息,61.6106),(数据,55.8116),(个人信息保护,30.2331),(人工智能,28.4471),(智能,28.4471),(网络,22.0866),(算法,19.4068),(大数据,10.4351),(智能立法,8.12819),(互联网,7.77421) 139.123 是
5 作者LYH (网络,62.8588),(数据,34.5479),(人工智能,25.931),(智能,25.931),(大数据,16.5082),(个人信息,15.7143),(数字经济,12.7793),(数据安全,11.652),(个人信息保护,9.73448),(智慧,8.9607) 122.118 是
6 作者DJP (区块链,59.6752),(智能,27.1858),(比特币,24.8278),(人工智能,23.4093),(虚拟,20.5219),(网络,19.4087),(ICO,17.4564),(互联网,15.3475),(互联网金融,15.3475),(生成式人工智能,14.6808) 121.055 是
7 作者CX (个人信息,95.5696),(个人信息保护,72.2278),(数据,35.5831),(网络,10.5756),(大数据,6.26541),(数据财产权,2.81038),(区块链,2.71577),(数据安全,2.61347),(网络安全,2.61347) 117.991 是
8 作者XK (数据,51.0004),(个人信息,35.6888),(个人信息保护,22.7834),(网络,20.9067),(算法,14.2982),(智能,11.1614),(数据安全,9.49611),(互联网,9.39071),(人工智能,8.35461),(虚拟,5.33142) 106.220 是
9 作者ZLH (智能,47.1775),(人工智能,47.1775),(算法,40.4327),(个人信息,14.8885),(网络,13.6955),(数据,13.5333),(算法解释,13.0355),(生成式人工智能,12.7396),(人工智能法,11.0938),(个人信息保护,9.40353) 102.554 是
10 作者ZJW (智能,40.8968),(人工智能,34.4038),(数据,30.8438),(个人信息,22.2469),(网络,17.9354),(数据安全,15.6059),(个人信息保护,15.2313),(算法,7.68914),(人脸识别,6.44065),(网络安全,6.37242) 101.777 是
11 作者GFP (数据,75.2963),(个人信息,47.9103),(个人信息保护,39.1674),(数据要素,11.3626),(数据财产权,6.37967),(大数据,6.27334),(智能,5.51729),(数字经济,3.14326),(网络,1.71888),(人工智能,1.5) 97.816 是
12 作者ZXB (个人信息,61.8171),(个人信息保护,48.8008),(网络,23.167),(互联网,17.1255),(人工智能,14.7396),(智能,14.7396),(数据,13.8946),(数字经济,7.22495),(生成式人工智能,6.38165),(虚拟,4.67946) 96.407 是
13 作者MCS (数字法治,42.0618),(智慧,35.3391),(智能,30.4463),(人工智能,28.7379),(互联网,21.7547),(数据,16.4386),(数字法学,15.6027),(数字人,15.3612),(大数据,9.76672),(算法,9.46989) 92.104 是
14 作者SDC (网络,54.6681),(智能,23.7011),(网络安全,18.8404),(数据,17.2217),(人工智能,16.5094),(智能技术,7.70314),(大数据,7.11608),(互联网,6.75631),(个人信息,3.78787),(数字经济,3.28) 86.282 是
15 作者YLX (网络,47.3571),(个人信息,21.9653),(智能,17.9318),(人工智能,16.1829),(个人信息保护,12.2114),(机器人,7.21971),(自动驾驶,6.51856),(互联网,5.93213),(虚拟,4.48131),(生成式人工智能,2.49723) 84.899 是
16 作者LPX (电子证据,52.4006),(数据,32.3696),(大数据,21.6095),(网络,18.152),(智慧,7.38429),(区块链,6.29185),(数字检察,5.73369),(互联网,4.54214),(智慧司法,4.01633),(算法,3.39757) 82.393 是
17 作者XDK (数据,54.9339),(网络,24.1505),(个人信息,8.21922),(个人信息保护,8.21922),(人工智能,8.01081),(智能,8.01081),(区块链,6.92233),(大数据,4.55705),(互联网,3.29991),(AI,3.24837) 81.367 是
18 作者HL (数据,25.6421),(互联网,17.87),(人工智能,15.414),(智能,15.414),(网络,13.4849),(个人信息,10.8658),(算法,10.5927),(个人信息保护,8.14366),(数字劳动,5.36378),(数据要素,4.55386) 81.085 是
19 作者WLM (个人信息,44.6323),(数据,27.4708),(个人信息保护,21.2249),(智能,13.9285),(人工智能,13.9285),(网络,13.4845),(互联网,6.04387),(生成式人工智能,3.35401),(AI,3.26237),(数据财产权,3.06097) 78.115 是
20 作者PW (网络,52.0246),(数据,27.5041),(个人信息,16.4293),(个人信息保护,9.45365),(大数据,4.30207),(电子证据,4.22651),(数字法治,4.19662),(虚拟,3.26007),(数据安全,1.72442),(算法,1.39408) 77.501 是
表3中的前3位学者,其公开资料显示的研究方向分别为:“经济法学、竞争法学以及数字市场监管”“经济法、金融科技、区块链、数字货币、互联网金融、监管科技、大数据、证券法、金融法、竞争法、反垄断法、企业并购法、企业公司法、亚洲法制一体化”和“人工智能刑法规制、经济犯罪、金融犯罪、涉信息网络犯罪、职务犯罪、数据犯罪、元宇宙空间犯罪”。通过分析可知,3位学者均致力于探究数字技术对传统法律领域带来的挑战及规制创新,其研究取向高度契合“智慧法治”领域的核心议题,符合该领域高影响力学者的入选标准。
结果表明,本研究提出的学者高分主题标签识别方法,能够有效甄别细分领域中具有高影响力的学者,实现基于专长匹配的领域内专家排序。该方法通过融合研究兴趣与学术能力的二维信息,可以准确刻画学者的核心研究主题及其学术水平,从而为精准识别与推荐“小同行”专家提供了可靠的方法论支撑。

5 结语/Conclusion

本研究提出一种学者高分主题标签的构建方法,并在此基础上形成核心理论设想:学者高分主题标签应当同时刻画其研究兴趣与学术能力,形式化表述为 { t 1 , S ( t 1 ) , t 2 , S ( t 2 ) , … … , t c , S ( t c ) },其中 t i表示研究主题, S ( t i )表示该主题的综合得分。通过设计可行的算法,本研究将这一理论设想转化为可操作的实现路径。
具体而言,本研究提出一种将研究兴趣(广度、覆盖度)与学术能力(深度、影响力)进行二维融合的理论框架,该框架选取发表论文数量、学者署名位次、论文被引频次3个核心维度作为评价指标。其中,被引频次采用标准化后的PCSI数值,虽本质上仍属被引属性,但能够更合理地近似反映论文的相对影响力。通过对上述3个维度的加权融合,算法生成学者的高分主题标签,从而实现学者领域画像的精准描绘与“小同行”专家的有效识别。
本文方法在展现有效性的同时,亦存在一定的适用范围与局限性,需在应用时予以关注。首先,数据来源的单一。本文方法主要依赖于公开的学术论文数据,未纳入基金项目、专利、专著、科技奖励、学术任职等其他维度的学者信息。其次,抽取主题词的质量影响。主题词的准确提取是算法有效性的基础。本研究采用作者关键词与机标关键词相结合的方式,但两类关键词均存在一定局限。未来研究可考虑引入大语言模型等技术,进一步提升主题词抽取的准确性与语义丰富度。再次,PCSI的学科特征影响。本研究采用PCSI作为论文学术影响力的衡量指标,该指标通过对被引频次进行标准化处理,能够有效消除发表年度与学科差异带来的不可比性。然而,其本质仍是论文的被引频次,本文方法在引证文化成熟、引用规模较大的学科领域中效果更佳。后续研究可探索引入同行评议、学术奖励等定性评价指标,与定量指标形成互补,提升方法的学科适应性。最后,本研究采用的作者贡献计算方法是一种简单化的处理方法,也存在局限性。例如,在数学等特定学科或者跨机构的合作论文中,署名可能按字母顺序而不代表贡献。若要精确区分每一位作者的贡献比例,则需要更多的数据或信息支撑。
综上所述,本研究提出的学者高分主题标签构建方法,为学者领域画像的精准刻画与“小同行”专家的有效识别提供了新的思路与技术路径。未来研究可在数据源拓展、关键词语义增强、多学科适应性、作者贡献算法优化等方面持续深入,进一步提升方法的普适性与稳健性。
[1]
王世奇, 刘智锋, 王继民.学者画像研究综述[J]. 图书情报工作, 2022, 66(20): 73-81.

WANG S Q, LIU Z F, WANG J M. A review of scholar profiling research[J]. Library and information service, 2022, 66(20): 73-81.

[2]
池雪花.学者精准画像的自动构建研究[D]. 南京:南京理工大学, 2019.

CHI X H. Constructing precise profile of scholars automatically[D]. Nanjing: Nanjing University of Science & Technology, 2019.

[3]
赵刚, 姚兴仁.基于用户画像的异常行为检测模型[J]. 信息网络安全, 2017(7): 18-24.

ZHAO G, YAO X R. Anomaly detection model based on user portrait[J]. Netinfo security, 2017(7): 18-24.

[4]
谢鹏.面向学术文献的学者兴趣标签识别方法[J]. 情报工程, 2019, 5(3): 65-73.

XIE P. Recognition of scholar interest tag for academic literatures[J]. Technology intelligence engineering, 2019, 5(3): 65-73.

[5]
池雪花, 刘丽帆, 章成志.基于学术论文的学者研究兴趣标签发现研究[J]. 情报工程, 2019, 5(2): 28-39.

CHI X H, LIU L F, ZHANG C Z. Analysis of scholars research interest tag discovery based on academic papers[J]. Technology intelligence engineering, 2019, 5(2): 28-39.

[6]
石湘, 刘萍.学者研究兴趣识别综述[J]. 数据分析与知识发现, 2022, 6(4): 16-27.

SHI X, LIU P. Review of studies identifying research interests[J]. Data analysis and knowledge discovery, 2022, 6(4): 16-27.

[7]
熊回香, 杨雪萍, 蒋武轩, 等.基于学术能力及合作关系网络的学者推荐研究[J]. 情报科学, 2019, 37(5): 71-78.

XIONG H X, YANG X P, JIANG W X, et al. Scholars recommend research based on academic competence and collaborative networks[J]. Information science, 2019, 37(5): 71-78.

[8]
熊回香, 杜瑾, 代沁泉, 等.基于主题与多维计量指标的学者学术影响力评价研究[J]. 情报理论与实践, 2021, 44(8): 22-27, 21.

XIONG H X, DU J, DAI Q Q, et al. Scholars academic influence evaluation research based on topics and multi-dimensional metrics[J]. Information studies: theory & application, 2021, 44(8): 22-27, 21.

[9]
陈翀, 李楠, 梁冰, 等.基于成果特征的学者学术专长识别方法[J]. 图书情报工作, 2019, 63(20): 96-103.

CHEN C, LI N, LIANG B, et al. Identifying expertise tags of scholars by multiple features of academic publications[J]. Library and information service, 2019, 63(20): 96-103.

[10]
张洋, 黄子萱, 朱嘉麒.青年科技人才画像及鉴识方法研究[J]. 情报学报, 2024, 43(11): 1283-1296.

ZHANG Y, HUANG Z X, ZHU J Q. Research on the profile and identification method of young scientific and technological talents[J]. Journal of the China Society for Scientific and Technical Information, 2024, 43(11): 1283-1296.

[11]
范晓玉, 窦永香, 赵捧未, 等. 融合多源数据的科研人员画像构建方法研究[J]. 图书情报工作, 2018, 62(15): 31-40.

FAN X Y, DOU Y X, ZHAO P W, et al. Study for the construction method of scientist profile with multi-source data fusion[J]. Library and information service, 2018, 62(15): 31-40.

[12]
MERTON R K. The Matthew effect in science: the reward and communication systems of science are considered[J]. Science, 1968, 159(3810): 56-63.

[13]
TSCHARNTKE T, HOCHBERG M E, RAND T A, et al. Author sequence and credit for contributions in multiauthored publications[J]. PLoS biology, 2007, 5(1): 13-14.

[14]
伍军红, 郑新宇, 孙隽, 等.基于知网数据的高被引学者评价方法[J]. 知识管理论坛, 2025, 10(3): 232-240.

WU J H, ZHENG X Y, SUN J, et al. Evaluation method for highly cited scholars based on CNKI data[J]. Knowledge management forum, 2025, 10(3): 232-240.

[15]
伍军红, 肖宏, 任美亚, 等.PCSI:一种单篇论文被引频次标准化方法[J]. 图书情报工作, 2020, 64(23): 22-30.

WU J H, XIAO H, REN M Y, et al. Paper citation standardized index(PCSI): a new index to quantitatively evaluate scientific articles based on citation[J]. Library and information service, 2020, 64(23): 22-30.

文章导航

/

〈 〉