Quantitative Research on Digital Rural Policy from the Perspective of Text Analysis: Based on FastText and Text Mining Methods

  • Tang Hontao 1, 2 ,
  • Yu Jiapeng , 2 ,
  • Chen Jie 1
Expand
  • 1 School of Economics and Trade, Hunan Technology and Business University Changsha 410205
  • 2 College of Science, Hunan Technology and Business University Changsha 410205

Received date: 2023-11-24

  Online published: 2025-04-28

Abstract

[Purpose/Significance] Digital countryside is the strategic direction of rural revitalization and an important part of the construction of digital China. It is of great significance to quantitatively analyze the policy texts related to digital countryside from the perspective of text analysis and to explore the fields of policy action, the law of evolution, and the logic of development planning, in order to improve the development of the policy. [Method/Process] Firstly, text preprocessing was carried out on the policy text corpus. Second, TF-IDF was used to extract the feature words of the policy text, and the set of feature words was screened. Then, based on the FastText model, the feature words set was trained with a word vector, K-means cluster analysis was carried out and the co-occurrence matrix of feature words was constructed. Finally, the Gephi tool was used to draw the semantic network diagram. [Result/Conclusion] The cluster analysis results show that the previous digital rural policies mainly affect the construction and development of digital rural from five aspects: policy receptors, policy perspectives, policy fields, supporting measures, and policy functions, which shows the important leading role of digital rural policies in promoting the comprehensive construction and development of digital rural. The semantic network diagram reveals that the previous policies radiated various fields of digital rural construction and development with the agricultural products and modern agriculture as important nodes. The new policies have strengthened and supplemented based on the old policies, but the evolution of digital rural policies has a certain lag and exposes some relatively weak areas in the past, such as management systems, information security, and environmental governance. This study provides an important basis for the policy effect analysis and policy direction of the digital countryside.

Cite this article

Tang Hontao , Yu Jiapeng , Chen Jie . Quantitative Research on Digital Rural Policy from the Perspective of Text Analysis: Based on FastText and Text Mining Methods[J]. Knowledge Management Forum, 2024 , 9(3) : 237 -252 . DOI: 10.13266/j.issn.2095-5472.2024.018

1 引言/Introduce

乡村振兴是建设现代化经济体系的重要基础,数字中国是数字经济发展的重要目标。乡村振兴和数字中国是党的十九大提出的两大发展战略,而数字乡村作为两大战略的交汇,既是乡村振兴的战略方向,同时构成了建设数字中国的关键内容。农业农村数字化转型是顺应时代变革的必然趋势[1]。政府高度重视数字乡村建设,2019年中共中央办公厅和国务院办公厅联合发布了《数字乡村发展战略纲要》,明确数字乡村建设为乡村振兴的核心任务,该战略强调数字乡村实质上是网络化、信息化和数字化广泛应用于农业农村经济社会发展中。2020年,《数字农业农村发展规划(2019—2025)》颁布明确了数字农业农村建设发展路线,有力支撑数字乡村战略实施。同年,《数字乡村发展工作要点》提出数字乡村发展的具体工作目标和内容。2021年《数字乡村建设指南1.0》颁布,系统构建了数字乡村建设的总体参考架构。2022和2023年《数字乡村发展工作要点》相继颁布,进一步厘清数字乡村建设的实施步骤、工作目标和政策体系,为引导当下数字乡村建设发展提出最新的重要决策方向。中央和地方政策的相继问世,有助于本文构建出完整的政策文本语料库,使得分析政策施策的重点和方向成为可能,也为数字乡村政策的量化研究创造文本分析条件。
数字经济对乡村振兴的赋能作用需由政策体系作为引导[2],通过政策体系引导数字乡村建设也是助推乡村实现现代化转型和振兴的有效路径[3]。切合实际且科学合理的政策导向有助于推动数字乡村建设和发展,因此,通过挖掘系列政策的关键信息、核心内容,对于进一步明确数字乡村政策的施策重心和方向尤为重要。在信息学角度上,政策通常是自然语言描述的无结构文本,包含丰富的语义信息和上下文关系,一般人工分析不仅效率较低且容易出现遗漏,不适合大批量处理政策文本。因此,运用文本挖掘等信息技术对政策文本进行量化分析是解决这一问题切实可行的方案,为数字乡村、乡村振兴等政策研究提供参考和借鉴,具有重要的实践价值。
现有关于数字乡村战略或政策文本分析的研究较多,但鲜有学者利用文本挖掘方法分析数字乡村政策文本,且现有的政策文本挖掘研究主要集中在词频分析、政策建模一致性指数模型(policy modeling consistency,PMC)、灰色关联度模型等方面,缺乏利用FastText模型对特征词进行向量化以及通过文本挖掘方法进行政策文本的研究工作,而该模型具有训练速度快、精确度高等优点,适合用于文本挖掘研究。本文作为课题研究乡村政策分析的核心环节,综合运用FastText和文本挖掘方法对数字乡村政策文本进行量化研究,将政策文本转化为数值形式的空间向量,从文本数据中提取出有价值的信息,可以发现政策重点特征与不足之处,对于课题组深入探讨政策作用领域、演化规律和发展规划逻辑,以及对地方政府识别政策导向和优化政策布局具有重要的实践意义。

2 文献综述/Literature review

笔者将从数字乡村政策的定性分析、定量分析和政策文本的分析研究方法3个层面展开论述。

2.1 数字乡村政策的定性分析

数字乡村政策的定性分析是对政策文件和相关文本材料的质性研究过程,有助于揭示政策的目标、理念、策略以及可能产生的影响。刘少杰认为数字乡村建设悬浮是一个亟待解决的问题,数字乡村建设离不开政府的领导和推进[4];刘艳红等以数字乡村建设的政策目标为参照系进行分析,基于统计数据及评估报告,对数字乡村战略部署、目标任务以及现存问题与挑战进行客观评价分析,提出下一阶段数字乡村建设的政策着力点和应对重点[5];吴文旭等基于扎根理论分析45份数字乡村相关国家政策,从5个维度厘清数字化建设嵌入乡村振兴,推进数字乡村建设的“嵌构理路”,探究数字乡村建设对乡村振兴的促进机制[6]。
政策信息对于具体环节的实施有着重要引领作用,然而随着数字乡村相关政策的层出不穷,政策的实施效果不佳,面临着诸多挑战。杨志玲等认为推进数字乡村治理的一系列政策措施实施过程中,数字技术嵌入乡村治理过程与传统乡村治理模式没能自然达到耦合,数字乡村治理方面仍存在问题[7];文丰安认为我国数字乡村建设面临政策体系不完善、监管制度存在空白和不确定等实践困境,提出要通过顶层设计“自上而下”地构建系统化的、长远可持续发展的政策体系,为数字乡村建设提供制度保障[8];苏红健提出“1+5(N)”数字乡村建设体系以解决我国数字乡村建设存在的缺乏整体规划、地区发展不平衡等问题[9];王胜等认为数字乡村建设仍面对政策体系不健全的挑战,数字乡村政策体系仍存在统筹协调难度大、立法相对滞后、网络空间有效监管存在空白和不确定性等一系列问题[10];赵成伟等从各省份出台政策文件引领的数字乡村建设实践试点分析,发现乡村产业、治理数字化及公共服务等实践方面仍存在不足之处,阻碍乡村振兴和数字中国战略的实施[11]。随着数字经济快速发展,数字乡村建设发展同样迅猛,其政策文本需要相应迭代,呈现出符合当下情况的明显动态变化特征,而部分政策引导不能够完美拟合现实情况,因此对政策文本进行文本挖掘等定量研究,能够客观有力地解释政策重点,在一定程度上为未来政策制定提供建议。

2.2 数字乡村政策的定量分析

数字乡村政策的定量分析是通过数量和统计方法来研究政策的量化特征及效果的过程。段尧清等通过TF-IDF算法提取特征文本的特征词,构建评价指标体系,并运用数据包络分析(data envelopment analysis,DEA)方法结合DEA的BCC(banker, charnes, and cooper)模型实证分析数字乡村建设的有效性[12],还利用熵值法和耦合协调度模型对2018—2021年中央及四大地区数字乡村政策进行定量测度,并分析政策之间的多级联动效应[13];金梦蕊等利用灰色关联度模型对政策文本编码结果进行计算,比较研究数字乡村政策和数字政府政策的文本内容,挖掘二者的政策关联度、相似性和差异性[14]。此外,现有研究也从不同视角多方面地定量研究数字乡村政策。罗亮等对53份政策文本内容进行分析,发现新时代数字乡村建设的政策内容着手于目标引导、保障要素和行动策略方面,从4个方面、6个层面推进实施数字乡村建设战略[15];秦国伟等基于多重政策关系视角,将数字乡村建设、乡村振兴及高质量发展战略纳入统一框架进行对比分析,挖掘数字乡村建设发展的重点内容[16]。

2.3 政策文本的分析研究方法

当前政策文本分析的研究方法较为成熟,且有着多种自然语言处理方法能够对政策文本进行研究分析。I. Pencheva等认为大数据方法在政策分析方面有着较为成熟的运用,政策分析的重要和关键任务是确定问题并将其概念化[17];M. Poel等提出利用文本挖掘等方法分析政策能够有效提高政府透明度[18];阮霁阳等运用潜在狄利克雷分配(Latent Dirichlet Allocation,LDA)主题模型研究影响数字政府建设的因素,并构建数字政府建设影响因素模型,用决策实验—解释结构模型(decision making trial and evaluation laboratory- interpretive structural model,DEMATEL-ISM)研究各因素重要性及相关性[19];韩剑等通过自然语言文本处理方法,比较分析不同区域的数字贸易条款异质性,并分析各个国家签署数字贸易条款的影响因素[20]。在政策视角上,洪伟达等从政策的强度、目标和工具3个角度提出政策量化标准,分析政策协同度[21];范丽莉等采用政策量化分析方法,从政策的部门、效力、措施和目标4个维度对政策进行系统梳理并进行政策协同演变分析[22]。此外,通过PMC政策评价模型以及文本分析工具等对政策文本进行研究分析也是主流方法之一。S. Z. Ma等通过词频法剖析26个地区、国家以及中国省份的数字贸易相关政策文件,并构建数字贸易指标体系来评估地区数字贸易的发展现状[23];蔡冬松等构建数字经济政策指标体系,利用文本挖掘技术和PMC指数模型量化分析吉林省数字经济政策[24];卜令通等采用词频分析、社会网络分析等文本挖掘技术结合政策内容构建PMC指数模型,厘清数字经济政策的历史沿革即政策特征[25];王伟光等利用ROSTCM6.0软件对政策文本进行本文挖掘,并构建PMC指数模型对数字经济政策进行分析[26]。
当前政策文本分析的研究方法较为成熟,且有着多种自然语言处理方法能够对政策文本进行研究分析。I. Pencheva等认为大数据方法在政策分析方面有着较为成熟的运用,政策分析的重要和关键任务是确定问题并将其概念化[17];M. Poel等提出利用文本挖掘等方法分析政策能够有效提高政府透明度[18];阮霁阳等运用潜在狄利克雷分配(Latent Dirichlet Allocation,LDA)主题模型研究影响数字政府建设的因素,并构建数字政府建设影响因素模型,用决策实验—解释结构模型(decision making trial and evaluation laboratory- interpretive structural model,DEMATEL-ISM)研究各因素重要性及相关性[19];韩剑等通过自然语言文本处理方法,比较分析不同区域的数字贸易条款异质性,并分析各个国家签署数字贸易条款的影响因素[20]。在政策视角上,洪伟达等从政策的强度、目标和工具3个角度提出政策量化标准,分析政策协同度[21];范丽莉等采用政策量化分析方法,从政策的部门、效力、措施和目标4个维度对政策进行系统梳理并进行政策协同演变分析[22]。此外,通过PMC政策评价模型以及文本分析工具等对政策文本进行研究分析也是主流方法之一。S. Z. Ma等通过词频法剖析26个地区、国家以及中国省份的数字贸易相关政策文件,并构建数字贸易指标体系来评估地区数字贸易的发展现状[23];蔡冬松等构建数字经济政策指标体系,利用文本挖掘技术和PMC指数模型量化分析吉林省数字经济政策[24];卜令通等采用词频分析、社会网络分析等文本挖掘技术结合政策内容构建PMC指数模型,厘清数字经济政策的历史沿革即政策特征[25];王伟光等利用ROSTCM6.0软件对政策文本进行本文挖掘,并构建PMC指数模型对数字经济政策进行分析[26]。

3 研究流程及分析框架/Research process and analysis framework

笔者从文本分析视角出发,通过FastText和文本挖掘方法进行数字乡村相关政策文本分析。文本分析的关键环节是文本挖掘方法及流程的设计,笔者提出的关于数字乡村政策文本挖掘的流程如图1所示:
图1 政策文本挖掘流程设计

Figure 1 Policy text mining process design

3.1 文本预处理

在采集政策文本数据后,需要对数字乡村相关政策文本进行预处理,主要通过jieba第三方库中文分词工具对原始政策文本内容进行分词,并加载自定义保留词词表对部分不符合预期的分词进行修正。

3.2 特征提取

在文本预处理后,会生成大量特征词,若直接采用经过预处理的特征词进行后续的向量化和聚类操作,可能引发维度灾难,而且也得不到高质量的聚类结果。因此面对大量特征词时,特征提取尤为重要,提取出好的特征词能够为后续的挖掘以及聚类结果带来更好的效果。
词频—逆文档频率(TF-IDF)是信息检索和文本挖掘中广泛应用的技术,用于度量一个词在某个文档中的重要性。TF-IDF结合了两个因素:词频(term frequency, TF)和逆文档频率(inverse document frequency, IDF)。词频为指定词汇在一篇文档中出现的频率,通常认为在文档中多次出现的词更为重要,TF计算公式如下:
$TF\left(t,d\right)=\frac{count\left(t\right)}{len\left(d\right)}$
其中,t表示词汇,d表示文档,count(t)表示在该文档d中词汇t的总数,len(d)表示文档d中所有词汇总数。逆文档频率即为一个词在整个文档集合中的普遍程度,衡量了一个词的稀有性,可以通过文档集合中包含制定词的文档数量与总文档数的比值的对数计算,IDF计算公式如下:
$IDF\left(t,d,D\right)=\mathit{log}\left(\frac{count\left(D\right)}{count\left({d}_{t}\right)+1}\right)$
其中,D表示总文档集合, ${d}_{t}$表示包含词汇t的文档,count(D)表示总文档数,count(dt) 表示包含词汇t的文档d的总数。TF-IDF是通过将词频和逆文档频率数值的乘积来衡量每个词的权重,以便更好地区分文档中的重要词和普遍词。TF-IDF计算公式如下:
$TFIDF\left(t,d,D\right)=TF\left(t,d\right)×IDF\left(t,d,D\right)$
其中, $TF\left(t,d\right)$代表词汇t的词频, $IDF\left(t,d,D\right)$代表词汇t的逆文档频率。笔者采用TF-IDF计算政策文本集合中特征词的重要性,TF-IDF值越大代表该特征词在某文档中越为重要,提取出文档集合中各特征词TF-IDF值超过指定阈值的特征词作为初始特征词。

3.3 词向量训练

由于文本数据以字符串形式存在,计算机无法直接处理文本数据,文本数据也难以直接参与计算和模型训练,因此在进行后续聚类分析前需要将特征词转化为数值形式。特征词向量化有助于将文本数据转换成适合于机器学习算法和模型的形式,可以充分捕捉词汇的语义信息。
FastText是Facebook于2016年提出的开源模型,该模型运用自然语言处理和机器学习中最成功的理念。FastText的子词嵌入方法,在Word2vec的基础上引入子词这个因素,从而使得词的微变形关系也能映射到嵌入空间中。算法包含隐藏层和输出层,结构简单、训练速度快且准确度较高。以往研究发现:FastText对比SVM、RCNN和TextCNN等传统模型进行词向量训练的准确率、召回率和F1值评价指标等更高[27-28],善于解决文本分类问题[29],运行速度快[30],综合性能最优[31]。
因此,笔者选择FastText模型进行词向量训练,通过模型中Skip-gram训练方法进行特征词向量训练。具体而言,Skip-gram会根据给定中心词,预测固定上下文窗口大小内的词汇。其训练过程通过最大化损失函数实现,通常使用负对数似然来定义损失,目标是最大化给定中心词情况下,预测上下文词汇的概率。假设句子结构为 ${w}_{t-2},{w}_{t-1},{w}_{t},{w}_{t+1},{w}_{t+2}$,Skip-gram通过输入 ${w}_{t}$来预测 ${w}_{t-2},{w}_{t-1},{w}_{t+1},{w}_{t+2}$的词向量,其流程如图2所示:
图2 Skip-gram流程图

Figure 2 Skip-gram flowchart

其中,Input为输入层,Projection为映射层,Output为输出层。训练出来的词向量效果可以通过特征词之间的余弦相似度来查看,余弦相似度计算公式如下:
$\mathit{cos}\left(A,B\right)=\frac{A\bullet B}{\left|\left|A\right|\right|\bullet \left|\left|B\right|\right|}$
其中, $A$和 $B$为两个特征词词向量, $\left|\left|A\right|\right|$为词向量 $A$的范数。余弦相似度的值介于-1和1之间,余弦相似度的值越接近1代表两个词向量的相似性越高。

3.4 文本聚类

K-Means是机器学习中经典的无监督聚类算法,其主要目标是将数据集中的样本分为k个簇,使得同一簇内的样本相似度较高,不同簇之间样本相似度较低。簇类数k需要预先给定,k值的选定可以通过误差平均和的手肘法和轮廓系数来确定。对于每个样本点,计算其到所属簇中心的距离,并将距离的平方和相加即得到误差平方和SSE(sum of squares for error),用于衡量K-Means算法的聚类效果。误差平方和SSE计算公式如下:
$SSE=\sum _{i=1}^{k}\sum _{c\in {C}_{i}}{\left(c-{X}_{i}\right)}^{2}$
其中, ${C}_{i}$为聚类数, $c$为簇中数据点,即 ${C}_{i}$中的所有样本点, ${X}_{i}$为簇 $i$质心,即第 $i$簇中所有数据点的均值。手肘法的核心思想是选择一个使得SSE显著下降,但又不至于选择过大的k值,以避免过拟合。即通过观察不同k值下SSE的变化情况,找到一个“肘部”点,这个点对应的k值通常是一个合适的簇数量。
此外,还可以通过轮廓系数来确定,选择系数值较大时所对应的k值为聚类数。轮廓系数计算公式如下:
$S\left(i\right)=\frac{{b}_{i}-{a}_{i}}{\mathrm{max}\left({a}_{i},{b}_{i}\right)}$
其中, ${a}_{i}$代表样本i到簇内其他样本的平均距离, ${b}_{i}$代表样本i到其他簇中所有样本的平均距离的最小值。轮廓系数值S(i)综合了样本与其所属簇的相似性以及其他簇的相异性,其值域为(-1,1),越接近1表示样本在正确的簇中且与其他簇相异度较大,即样本的聚类效果越好;越接近-1表示样本更适合被分到其他簇,即样本可能被错误地分配到了其他簇;接近0表示样本可能在簇边界上。

4 政策文本挖掘/Policy text mining

4.1 政策文本获取及预处理

笔者通过北大法宝、各地方政府官方网站及百度、谷歌等搜索引擎,采集中央及各地出台的相应政策文本作为政策供给端进行文本挖掘。“数字乡村”战略于2018年中央一号文件首次提出,政策样本较少,而2017年党的十九大报告中“乡村振兴”概念与数字乡村战略息息相关,且2019年中共中央、国务院发布的《关于坚持农业农村优先发展做好“三农”工作的若干意见》指出要全面推进信息进村入户,数字乡村的重点是农村的信息化。因此,基于最大努力采集原则,以“数字乡村”“农业信息化”“农村信息化”“农业农村现代化”等为关键词进行检索,以2017年作为政策文本采集的起始年份,时间区间为2017年1月至2023年7月。对采集到的每份政策文本进行词频统计及人工检查,根据词频统计,删除文本中不包含或只出现一两次“数字乡村”概念的政策,确保政策文本均围绕“数字乡村”或“乡村振兴”为主题而展开,政策之间有较大的趋同性,保存信息完整且相关度较高的政策文本,最终采集到163份相关政策以进行后续的政策量化研究,其中包括17份中央文件和146份地方文件。
采集的政策文本有pdf、doc和txt等不同格式文档,通过数据清洗将所有政策文本文档转换成utf-8编码的txt文档,并利用Python语言对txt格式的政策文本进行文本预处理。考虑到政策文本与基本数据的区别及其具有的特殊性,笔者通过jieba第三方库对政策文本进行中文分词。使用自定义的保留词表保留分词结果中所需词汇,加载自定义中文停用词表,对政策文本进行中文分词的同时过滤不涉及关键信息的词汇。对政策文本进行文本挖掘和词频分析,设置词长为2到6,降序排列出前10个高频词汇,得到高频词汇表,部分结果如表1所示:
表1 前10个高频词汇

Table 1 Top 10 high-frequency words

词汇 词频
农村 30 819
农业 29 132
建设 28 865
发展 25 164
推进 17 496
乡村 15 631
提升 11 596
农产品 11 471
产业 11 378
服务 9 834

4.2 特征词提取

通过计算每份文档的TF-IDF可以发现,部分文档的关键特征词所对应的TF-IDF最高值较低,为了保证每份政策文本都有属于该文档的关键特征词输出且过滤非关键特征词的输出,提取的阈值应该较小而又不能过小。笔者将特征词的TF-IDF值阈值设置为0.005,即每个文档中TF-IDF值大于0.005的特征词会被提取,每个文档的每个词对应一个TF-IDF值,提取全部文档中符合要求的特征词及其TF-IDF值,重复值以TF-IDF值高为标准,部分结果如表2所示:
表2 部分初始特征及TF-IDF值

Table 2 Part of the initial characteristics and TF-IDF values

特征词 TF-IDF值
信息化 0.121 9
数字乡村 0.091 9
数字化 0.074 1
标准化 0.059 0
试点工作 0.060 8
农产品 0.050 1
数字农业 0.043 0
领导小组 0.038 5
示范县 0.038 0
农牧区 0.037 9
从提取的初始特征词及其TF-IDF值可以发现,基于词频角度,政策着力点涉及数字乡村建设发展的多个领域,尤其是农产品的信息化、数字化及标准化等,且通过设立多个示范县、农牧区等,不断尝试探索,进行试点工作。同时注重领导班子的组成,组织一批有能力有远见的领导班子引领数字乡村相关工作的推进。
因为不同政策文本中可能出现同一特征词,因此需要进行去重复处理。利用Python的集合储存特征词,由于计算机程序识别的结果存在无关词汇,故经过人工筛查后,提取特征词247个作为最终的特征词集合。

4.3 词向量训练

在特征词集合的基础上,进一步通过Gensim模块,构建FastText模型对词向量进行训练。借鉴范昊等利用FastText训练的参数设置[32],在此基础上再进行调整,最终模型参数设置如表3所示:
表3 FastText模型参数设置

Table 3 FastText model parameter Settings

参数 参数解义 设置值
vector_size 词向量维度 100
window 上下文窗口大小 5
min_count 最小出现次数的词 1
sg 训练方法(1为Skip-Gram) 1
alpha 学习率 0.025
negative 负采样个数 5
min_alpha 学习率线性减少最小值 0.000 1
根据训练预处理后的政策文本语料库得到语料库词向量表,每个词向量对应一个100维的空间向量,特征词集合中247个特征词则对应语料库词向量表中247个100维的词向量。
利用公式(4)计算相关词余弦相似度。以政策文本中特征词“数字乡村”为例,遍历特征词集合中所有词的相似度,得到与其相似度最高的前10个相关词,如表4所示:
表4 部分相关词及余弦相似度

Table 4 Some related words and cosine similarity

特征词 余弦相似度
数字农业 0.819 4
数字政府 0.793 0
智慧农业 0.708 9
数字经济 0.695 5
数字化 0.665 3
试点工作 0.645 7
金融服务 0.642 4
数字技术 0.638 0
网络安全 0.637 6
信息中心 0.637 0
对类似表的结果进行人工分析比对,从相关特征词的余弦相似度来看,“数字乡村”特征词通常与“数字农业”“数字政府”“智慧农业”“数字经济”等词一起出现,代表它们之间的语境及含义相似或有一定的相关性。数字农业、智慧农业、数字技术、金融服务、网络安全和信息中心等数字经济相关方面的数字化发展和建设助力实现数字乡村。这些特征词的相似性表明了数字乡村在政策文本中与多个数字化、农业农村现代化和技术应用相关词汇相关联,这些词汇共同构成了数字乡村发展的主题。
相关词余弦相似度的处理结果符合认知逻辑,说明通过FastText模型可以训练得到合理的词向量。同样可以对政策文本其他特征词进行相同操作,以判断训练词向量效果是否符合预期。

4.4 文本聚类分析

聚类数k值可以通过误差平方和SSE的手肘法和轮廓系数法来确定,即公式(5)和公式(6)。手肘法通过找到一个拐点来平衡聚类误差的下降与过拟合之间的权衡,即根据误差平方和曲线的曲率变化来确定k值,曲率越大、越明显的拐点处为最佳聚类数。轮廓系数能够描述聚类后各个类别的轮廓清晰度,轮廓系数值越大聚类效果越好。在得到特征词向量后,计算不同k值下的误差平方和和轮廓系数,结果如图3所示:
图3 聚类数选择结果

Figure 3 Results of cluster number selection

根据图3,从误差平方和SSE曲线来看,其曲率最高点即肘部所对应的聚类数k值为3;从轮廓系数曲线来看,聚类数k值可以取5。因此对于本特征词向量表的聚类而言,聚类数可以设置为3或5。然而聚类数为3时聚类数太少,无法很好刻画不同簇类之间的关系,且聚类效果较差;聚类数为5时每个簇类样本能够较好地代表该簇,且簇与簇之间的关系明确,聚类效果较好。因此最终选择基于轮廓系数得到的最佳聚类数,即聚类数k为5。在确定最佳聚类数k后,通过K-means聚类算法对从政策文本中提取的特征词进行聚类。当聚类数k=5时,通过PCA(principal component analysis)降维将词向量降维,绘制二维聚类散点,如图4所示:
图4 聚类散点图

Figure 4 Clustering scatter diagram

对政策文本中提取的特征词进行聚类,每簇中列出部分有代表性的样本特征词、特征数及相应主题,如表5所示:
表5 部分政策特征聚类结果

Table 5 Partial clustering results of policy characteristics

簇类 主题 特征词 特征数
1 数字乡村政策实施重点地区 双柏县、任隆镇、大姚县、桃江县、西夏区、永靖县、南华县、安居区、蓬溪县、永仁县、铁岭县、内黄县、牟定县、赫山区、昌图县、农高区、广河县、船山区、都兰县、临夏县、安化县、康乐县、东乡县、资阳区、柯城区、双阳区等 49
2 政策制定部门及政策标题 体旅局、县政府、浙江省、发展局、北京市、吉林省、管理局、重庆市、科教处、监管局、市政府、财务处、江西省、陕西省、科技局、科技厅、陕西省、规划司、委员会、综合处、人民政府、商务局、领导小组、农村部、办公厅、扶贫办、市政协、山东省、四川省、数字乡村、乡村振兴、数字农业、实施方案、国家标准、数字经济等 99
3 数字乡村发展的农业产业根基 中药材、优质稻、农业产业、养殖场、畜牧业、产业园、养殖业、加工业、产业化、农牧业、特色产业、种植业、现代农业、农产品、示范园、示范区、示范县、特色农业、旅游业、农副产品、农畜产品、产业链、标准化、机械化等 28
4 数字乡村建设的多方面特征 电子商务、管理型、经营型、合作社、管理制度、社会化、公共服务、科研单位、社会效益、便民服务、服务中心、基础设施、高标准、服务型、环境治理、生态效益、生产型、覆盖率、责任制、供销社、农业科技、集体经济等 41
5 建立数字乡村的信息手段及工具 监测数据、互联互通、信息安全、互联网、技术规范、一体化、智能化、信息技术、自动化、物联网、数据资源、数字化、信息化、数据库、人工智能、大数据、信息系统、数字技术、智慧农业、APP、管理系统、原始数据、推广应用等 30
对表5中所列的各个簇类的特征词进行解释归纳,具体如下:
簇类1包含的49个特征词,主要是以政策为导向的数字乡村、农业农村现代化的主要实施重点地区,多为区县级地区;簇类2包含的99个特征词,在所有簇中特征词数最多,主要是出台或实施数字乡村、农业农村现代化等政策落地的制定者或执行者,以及政策标题的主题特征词,如市级以上各政府部门、数字经济、数字乡村等;簇类1和簇类2包含的特征词数最多,地理信息最为明确,由此可以看出各级政府部门及机构非常注重数字乡村、数字农业、乡村振兴建设,多个部门单位不断出台相关政策并在各区县进行试点工作,积极关注和推动数字乡村、数字农业、农业农村现代化的发展建设,争取实现乡村振兴战略目标。
簇类3包含28个特征词,主要包含数字乡村、农业农村现代化建设所涉及的农业和产业相关产品、场地及其标准,如优质稻、农业产业、养殖场与标准化等,这部分特征词反映了实现数字乡村、农业农村现代化的根基以及乡村建设的主要任务,政策引导鼓励多样化农业产业以提高农业农村现代化水平,建设农村产业园区以推动农村产业升级及现代化,积极推动农产品生产的产业化、机械化和标准化生产,把控农产品品控以提高市场竞争力,开发特色农业和农村旅游业以激活农村活力,增加农民收入,促进乡村发展。
簇类4包含41个特征词,主要涉及经济、合作社、服务等一系列与数字乡村建设相关的多方面特征词,代表政策文本中经济发展、合作机制以及社会服务与效益等方面的主题,特征词中包括电子商务、合作社等交易方式相关词汇,表明政策鼓励支持农村地区发展电子商务和农村合作社,以促进农产品上行,提高农民收入,促进合作社模式发展,提高资源利用率。政策特征词还强调与科研单位合作的重要性和农业科技的重要性,鼓励农村地区与科研机构合作,引入先进农业科技,以提高农业生产效率以及农产品品质,同时强调环境治理和生态效率,注重农村地区的生态环境保护和可持续发展,以确保农村现代化发展不会对绿水青山造成负面影响。此外,特征词中还包括集体经济和责任制等词汇,意味着政策鼓励农村地区建立集体经济组织和实行责任制管理模式,以提高农村产业的管理效率和收益。
簇类5包含30个特征词,主要涉及信息技术、互联网、数字化等与数字乡村发展建设的信息手段及工具,表示政策文本中数字化与信息技术的应用与推广方面等主题,反映了政策层面上积极推动数字化和智能化技术在农村地区的应用。其中互联互通、互联网等词汇表明政策层面大力支持农村地区的互联网建设和信息通信基础设施的发展,助力提高农村地区数字化、信息化水平,以推动信息传递和农产品上行,鼓励农村地区采用现代化数字技术和智能化技术提高农业生产、资源管理和农村治理效率,同时注重乡村数字经济的监管,通过建立管理系统提高农村资源的高效管理,保护农村地区的信息和数据安全。
通过聚类特征结果可以发现:①在政策受体上,政策内容涉及各区县、产业园区、政府平台、数据平台、科研单位、示范园区等。②在政策视角上,政策内容包含宏、中、微观层面。从宏观层面,涉及数字乡村建设发展的总体目标及任务。从中观层面,涉及数字乡村建设发展的产业、环境、制度、信息技术及监管体系等。从微观层面,涉及数字乡村建设发展的具体细节,如农产品、标准、服务等。③在政策领域上,涉及知识产权、科技创新、公共安全、数字农业、智慧文旅、新零售等;在支持措施上,涉及财税支持、便民服务、组织领导、法律保障、网络安全等;④在政策功能上,涉及加速建设、监督考核、规范引导、统筹保障等。
近年来数字乡村相关政策制定的内容较为全面且深刻,聚类特征结果符合预期,相关政策能够起到促进数字乡村全面建设发展的引导作用。以我国农村地区互联网普及率为例,随着政策的不断出台及落地,网络化、信息化和数字化逐渐走入我国农村地区,据CNNIC发布的第51次《中国互联网发展状况统计报告》显示,截至2018年12月我国农村地区互联网普及率仅为38.4%,而到2022年12月,我国农村地区互联网普及率达到61.9%,较2018年12月提升23.5个百分点,传统领域应用线上化进程加快,推动农村数字化服务发展转型,客观表现出政策引领作用下数字乡村建设发展的高速发展历程。聚类分析结果显示出近年来以政策为导向推进数字乡村建设发展的重点特征,但无法判断特征聚焦重点及特征之间的联系,鉴于此,通过语义网络分析图作为聚类分析的补充分析。

4.5 语义网络分析

通过语义网络分析图建立及可视化概念之间的语义关系,有助于理解文本中的语义结构,直观了解政策文本中特征词之间所蕴含的关系。选择聚类特征中的特征词,因为簇类1和簇类2中的特征数较多,在政策文本中的作用相似,经过多次调整尝试发现簇类1和簇类2中的特征词在网络分析中处于边缘部分,而过多的特征词会使得网络扩张,难以直观捕捉重点,因此只选择簇类1和簇类2中的部分特征词,同样去除其他簇类中部分不太显著的特征词。设置上下文窗口大小为4,计算出特征词共现矩阵,通过Gephi网络分析工具进行可视化展示,以及度、加权度、亲密中心度、介数中心度等指标的计算。网络统计概述中,网络直径是所有节点对之间的平均图距离,反映网络的完整性;图密度值越大表示网络节点间的联系越紧密,反之则表示节点间联系越疏远。通过社会网络分析绘制共现词矩阵所生成的网络中,网络直径为5,图密度为0.211,得出特征词网络数据的统计结果如表6所示:
表6 部分网络数据统计结果

Table 6 Statistical results of some network data

特征词 度 加权度 亲密中心度 介数中心度 PageRank
农产品 92 876 4 0.768 3 837.870 0 0.021 8
现代农业 79 517 4 0.715 8 726.087 1 0.019 1
乡村振兴 73 224 4 0.684 8 461.184 7 0.017 1
信息化 72 221 8 0.688 5 489.598 9 0.017 2
数字农业 72 140 8 0.684 8 422.612 9 0.017 1
数字化 69 321 4 0.673 8 240.437 6 0.169 6
产业园 69 447 0 0.666 7 299.476 5 0.015 6
基础设施 69 302 8 0.663 2 216.097 9 0.015 9
标准化 66 259 0 0.663 2 164.016 0 0.015 0
一体化 61 107 8 0.646 1 120.715 3 0.014 4
特色产业 60 123 4 0.642 9 167.697 6 0.013 3
大数据 60 204 8 0.646 2 275.517 3 0.013 4
数字乡村 54 153 8 0.617 6 212.798 7 0.013 0
智慧农业 53 100 0 0.620 7 41.830 4 0.011 3
农业科技 51 124 8 0.611 7 74.726 0 0.011 2
其中,度反映一个节点的边的数量;加权度以实际的权重计算节点的度,度和加权度两个指标都用于描述节点的重要性,值越大代表该节点特征词在政策中出现频率高,即政策热点;亲密中心度为节点所能达到的节点的数量除以能够达到节点的最短路径和;介数中心度为所有节点对之间通过该节点的最短路径条数,两者用于描述节点与其他节点之间的联系,节点的亲密中心度和介数中心度越大,流经此节点的数据分组越多,代表该特征词与其他特征词在不同政策文本中出现次数越多;PageRank是基于PageRank算法计算的节点重要性。
选择布局为Fruchterman Reingold,参数默认,调整节点、边等网络图形参数,绘制出语义网络图,如图5所示:
图5 聚类特征词的语义网络图

Figure 5 Semantic network diagram of clustering feature words

图5为一个包含127个节点和1 685个边的无向语义网络图,从图5中可以直观发现:农产品、现代农业、乡村振兴、信息化、数字农业、数字化、产业园、基础设施等特征词在网络图中处于突出的中心位置,属于网络图中的关键节点,是政策文本中较为聚焦的领域。农产品节点与网络中大部分特征词节点相连,说明农产品在数字乡村发展的重要地位,关于乡村的发展建设都离不开农产品,其中与加工业、产业链、互联网、标准化、产业园、电子商务、数字化和现代农业的边权重都大于200,且现代农业节点与产业园、示范区、农业产业等特征词节点相连,尤其与产业园节点的边权重高达2 224,说明农产品的发展需要依托于互联网、数字化,基于产业园、示范区建设,助推现代农业发展,促使产业链形成,加强农产品标准化水平,推动农村电商发展。数字乡村节点与标准化、智慧农业、信息化、数字化、基础设施等特征词节点也有着较高的边权重,说明数字乡村发展离不开基础设施建设,信息化、数字化水平的不断提升能够更加顺利地推动数字乡村发展。物联网节点与信息技术、互联网、智能化、基础设施等特征词节点相连且有着较高的边权重,说明政策中对于物联网的建设发展依托于互联网,即物联网建设离不开基础设施的建设和信息技术水平、智能化水平的提升。标准化节点与农产品、养殖场、产业链、产业化、现代农业、畜牧业、产业园、示范园、农业产业、农牧业、特色产业等特征词节点相连,涉及多个产业及园区,说明政策引导的农业产业发展都需要标准化的生产、包装等过程,需要把关农村农业、产业各个环节,以提升农产品的品质。
语义网络图符合数字乡村战略发展规划逻辑,以2023年中央一号文件为基准,文件中提出的第一点即为抓紧抓好粮食和重要农产品稳产保供,指出全党工作重中之重的工作为“三农”问题,无不彰显着农产品对于数字乡村建设、乡村振兴战略实施的重要程度,过去相关政策的语义网络图中以农产品节点为中心发散至各个节点,印证党和国家一直重视以农产品为核心的相关工作。此外,2023年中央一号文件还提出深入实施数字乡村发展行动,推进数字化应用场景建设及推广,加速农业农村大数据开发及应用以及发展智慧农业等,在语义网络分析图中相关节点同样显著,说明政策坚持不懈地重视数字乡村发展工作,在重点领域不断出台相关政策引领数字乡村发展。以2018年中央一号文件为例,文件指出的农村地区部分发展水平不足的现状,如农村基础设施欠账较多,乡村发展整体水平、乡村治理体系以及治理能力仍待强化等,在2023年中央一号文件中升级为加强乡村、农业基础设施建设,加强高标准农田建设,提升乡村治理效能等,表明在政策的正确引领下,数字乡村各领域在不断完善强化,数字乡村发展建设进程不断加快。
然而,在数字乡村政策实施重点地区与政策制定部门及政策标题两个簇类的特征词之外,语义网络图也显示出特征词中重要程度较低的部分非关键节点:服务型、管理制度、信息安全、技术规范、环境治理、科研单位、生态效益、社会效益等特征词,而在2023年中央一号文件中提出:加速发展现代乡村服务业、健全追溯管理制度、扎实推进乡村治理重点工作、建立农业生态环境保护监测制度等,彰显出上述部分特征词是当下推进乡村振兴战略发展的重点任务,暴露出过去数字乡村相关政策引导相对薄弱的领域,为未来数字乡村相关政策的制定指引方向。特征词的语义网络图从另一个维度体现了数字乡村政策的关注点、重点及联系,可以作为聚类分析的补充。

5 结论/Conclusions

笔者基于FastText模型和文本挖掘方法,对采集到的数字乡村相关政策进行量化分析,得到以下结论:
数字乡村相关政策已能够构建充足的政策语料库。自2017年乡村振兴战略和数字经济发展两个概念提出以来,数字乡村概念应孕而生,各级政府部门不断出台一系列政策文件,通过分类整理能够得到一个较为完善的数字乡村政策数据集。此数据集可以被采集并用于研究和分析,以发现数字乡村的政策特征,深入理解政策背景和内容及未来发展趋势,从而使政策的执行更加高效。
从文本分析视角出发,基于FastText和文本挖掘方法能够为数字乡村政策研究提供新视野。通过聚类分析数字乡村政策的重点、关键内容,挖掘政策作用领域,同时语义网络图从另一维度体现聚类特征词在数字乡村政策中的关联性及重要性,以发现政策不足之处,并探讨政策演化规律以及发展规划逻辑。本文的研究框架有利于分析数字乡村政策文本中的关键特征信息,为数字乡村政策文本量化研究提供新思路。
从聚类分析结果可以看出:①数字乡村政策作用于产业、环境、制度、基础设施、信息技术等多领域,促进数字乡村建设发展;②从政策受体、政策视角、政策领域、支持措施和政策功能5个方面出发,显现出近年来数字乡村相关政策制定的内容对促进数字乡村全面建设发展起到的重要引领作用。
从语义网络图可以看出:①近年来数字乡村相关政策以农产品、现代农业、信息化等重要节点出发,辐射数字乡村建设发展的各个领域,并以2018年和2023年中央一号文件为例,探讨数字乡村政策的发展规划逻辑;②暴露出部分过去政策中被相对弱化的特征词,发现数字乡村政策的演化规律具有滞后性,即地方政府响应中央政策具有一定的时间滞后性。

唐红涛:拟定论文选题和大纲,提出修改意见;

余佳鹏:收集资料,分析数据,撰写初稿及修改论文;

陈 捷:提出修改意见,修改论文。

[1]
殷浩栋,霍鹏,汪三贵.农业农村数字化转型:现实表征、影响机理与推进策略[J].改革,2020(12):48-56.(YIN H D, HUO P, WANG S G. Agricultural and rural digital transformation: realistic representation, impact mechanism and promotion strategy[J]. Reform,2020(12):48-56.)

[2]
张蕴萍,栾菁.数字经济赋能乡村振兴:理论机制、制约因素与推进路径[J].改革,2022(5):79-89.(ZHANG Y P, LUAN J. Digital economy enables rural revitalization: theoretical mechanism, restrictive factors and implementation path[J]. Reform,2022(5):79-89.)

[3]
赵星宇,王贵斌,杨鹏.乡村振兴战略背景下的数字乡村建设[J].西北农林科技大学学报(社会科学版),2022,22(6):52-58.(ZHAO X Y, WANG G B, ZHANG P. Significance and implementation of digital village under the background rural revitalization strategy[J]. Journal of Northwest A&F University(social science edition), 2022,22(6):52-58.)

[4]
刘少杰.数字乡村建设悬浮的成因与对策[J].中国农业大学学报(社会科学版),2022,39(5):5-12.(LIU S J. Causes and countermeasures of the suspension of digital village construction[J]. Journal of China Agricultural University(social sciences),2022,39(5):5-12.)

[5]
刘艳红,吕鹏.数字乡村建设的目标、成效与挑战[J].经济与管理,2022,36(6):25-33.(LIU Y H, LÜ P. Digital village construction: goals, achievements, and challenges[J]. Economy and management,2022,36(6):25-33.)

[6]
吴文旭,吴业苗.数字乡村建设如何促进乡村振兴——基于政策法律文本的扎根理论研究[J].中国农业大学学报(社会科学版),2022,39(5):69-92.(WU W X, WU Y M. How can digital village construction promote rural vitalization: grounded theory research on legal and policy texts[J]. Journal of China Agricultural University(social sciences),2022,39(5):69-92.)

[7]
杨志玲,周露.中国数字乡村治理的制度设计、实践困境与优化路径[J].经济与管理,2023,37(5):16-23.(YANG Z L, ZHOU L. Design of institutional governance, practical challenges, and optimization path of digital rural governance in China[J]. Economy and management,2023, 37(5):16-23.)

[8]
文丰安.数字乡村建设:重要性、实践困境与治理路径[J].贵州社会科学,2022(4):147-153.(WENG F A. The construction of digital villages: significance, practical difficulty and management[J]. Guizhou social sciences,2022(4):147-153.)

[9]
苏红键.我国数字乡村建设基础、问题与推进思路[J].城市,2019(12):13-22.(SU H J. Foundation, challenges and strategies on construction of smart village in China[J]. City, 2019(12):13-22.)

[10]
王胜,余娜,付锐.数字乡村建设:作用机理、现实挑战与实施策略[J].改革,2021(4):45-59.(WANG S, YU N, FU R. Digital rural construction: action mechanism, realistic challenge and implementation strategy[J]. Reform,2021(4):45-59.)

[11]
赵成伟,许竹青.高质量发展视阈下数字乡村建设的机理、问题与策略[J].求是学刊,2021,48(5):44-52.(ZHAO C W, XU Z Q. Mechanisms, problems, and strategies of digital villages construction under the threshold of high-quality development[J]. Seeking truth,2021,48(5):44-52.)

[12]
段尧清,易雨洁,姚兰.政策视角下数字乡村建设的有效性分析[J].图书情报工作,2023,67(6):32-42.(DUAN Y Q, YI Y J, YAO L. An effectiveness analysis of digital village construction from the perspective of policy[J]. Library and information service,2023,67(6):32-42.)

[13]
段尧清,吴瑾,吴江.我国数字乡村政策的多级联动协同研究[J].图书情报工作,2023,67(6):13-21.(DUAN Y Q, WU J, WU J. Research on multi-level linkage and coordination of digital village policies in China[J]. Library and information service,2023,67(6):13-21.)

[14]
金梦蕊,陈玲,段尧清.政策信息视角下的数字乡村政策与数字政府政策关联度挖掘[J].图书情报工作,2023,67(6):22-31.(JIN M R, CHEN L, DUAN Y Q. Mining the correlation between digital village policy and digital government policy from the perspective of policy information[J]. Library and information service,2023,67(6):22-31.)

[15]
罗亮,简文涵.新时代数字乡村建设:目标引领、行动策略与保障要素——基于53份政策文本内容的分析[J].行政与法,2023(8):58-69.(LUO L, JIAN W H. Digital rural construction in the new era: goal guidance, action strategy and guarantee elements——an analysis based on the content of 53 policy texts[J]. Administration and law,2023(8):58-69.)

[16]
秦国伟,李瑶,任克强.数字乡村建设的现实矛盾与优化路径——基于多重政策关系视角[J].云南民族大学学报(哲学社会科学版),2023,40(1):104-113.(QIN G W, LI Y, REN K Q. Actual contradictions and optimization paths of digital rural construction in the perspective of multiple policy relations[J]. Journal of Yunnan Minzu University(philosophy and social sciences edition),2023, 40(1):104-113.)

[17]
PENCHEVA I, ESTEVE M, MIKHAYLOV S J. Big data and ai–a transformational shift for government: so, what next for research?[J]. Public policy and administration,2020,35(1):24-44.

[18]
POEL M, MEYER E T, SCHROEDER R. Big data for policymaking: great expectations, but with limited progress?[J]. Policy & internet,2018,10(3):347-367.

[19]
阮霁阳.数字政府建设影响因素研究——基于127份政策文件的大数据分析[J].西南民族大学学报(人文社会科学版),2022,43(4):185-191.(RUAN J Y. Research on the influencing factors of digital government construction[J]. Journal of Southwest Minzu University(humanities and social sciences edition),2022,43(4):185-191.)

[20]
韩剑,蔡继伟,许亚云.数字贸易谈判与规则竞争——基于区域贸易协定文本量化的研究[J].中国工业经济,2019(11):117-135.(HAN J, CAI J W, XU Y Y. Digital trade negotiation and rule competition: a study based on text quantification of regional trade agreements[J]. China industrial economics, 2019(11):117-135.)

[21]
洪伟达,马海群.我国开放政府数据政策的演变和协同研究——基于2012-2020年政策文本的分析[J].情报杂志,2021,40(10):139-147,138.(HONG W D, MA H Q. Research on the evolution and coordination of open government data policy in China: analysis of policy texts based on 2012-2020[J] Journal of intelligence,2021,40(10):139-147,138.)

[22]
范丽莉,龚心娟.数字经济时代的个人信息保护:政策梳理与协同演变——基于153份政策文本的实证分析[J].重庆理工大学学报(社会科学),2022,36(5):90-104.(FAN L L, GONG X J. Personal information protection in the digital economy era: the policy review and collaborative analysis——an empirical analysis based on 153 policy texts[J]. Journal of Chongqing University of Technology(social science),2022,36(5):90-104.)

[23]
MA S Z,GUO X Y,ZHANG H S. Policy analysis and development evaluation of digital trade: an international comparison[J].China & world economy,2019,27(3):49-75.

[24]
蔡冬松,柴艺琳,田志雄.基于PMC指数模型的吉林省数字经济政策文本量化评价[J].情报科学,2021,39(12):139-145.(CAI D S, CHAI Y L, TIAN Z X. Quantitative evaluation of Jilin province digital economy policy based on PMC index model[J]. Information science,2021,39(12):139-145.)

[25]
卜令通,张嘉伟.基于PMC指数模型的数字经济政策量化评价[J].统计与决策,2023,39(7):22-27.(BU L T, ZHANG J W. Quantitative evaluation of digital economy policy based on PMC index model[J]. Statistics & decision,2023,39(1):22-27.)

[26]
王伟光,宋洪玲.数字经济支持政策工具的量化评价——基于省际层面政策的文本分析[J].中国科技论坛,2023(6):97-107.(WANG W G, SONG H L. Quantitative evaluation of policy tools for digital economy support: text analysis based on inter-provincial level policy[J]. Forum on science and technology in China,2023(6):97-107.)

[27]
康雁,杨其越,李浩,等.基于主题相似性聚类的自适应文本分类[J].计算机工程,2020,46(3):93-98.(KANG Y, YANG Q Y, LI H, et al. Adaptive text classification based on topic similarity clustering[J]. Computer engineering,2020,46(3):93-98.)

[28]
陈翀,程子佳,王传清,等.基于评审意见的科技论文要点识别与利用[J].情报学报,2023,42(5):562-574.(CHEN C, CHENG Z J, WANG C Q, et al. Identification and utilization of key points of scientific papers based on peer review texts[J]. Journal of the China Society for Scientific and Technical Information,2023,42(5):562-574.)

[29]
霍光煜,张勇,孙艳丰,等.基于语义的档案数据智能分类方法研究[J].计算机工程与应用,2021,57(6):247-253.(HUO G Y, ZHANG Y, SUN Y F, et al. Research on archive data intelligent classification based on semantic[J]. Computer engineering and applications,2021, 57(6):247-253.)

[30]
吴震,冉晓燕,苗权,等.基于fastText算法的行业分类技术[J].北京航空航天大学学报,2022,48(2):193-198.(WU Z, RAN X Y, MIAO Q, et al. Industry classification technology based on fastText algorithm[J]. Journal of Beijing University of Aeronautics and Astronautics, 2022, 48(2):193-198.)

[31]
张江石,李泳暾,冒香凝,等.基于NLP的煤矿事故原因分类研究[J].中国安全科学学报,2023,33(6):20-26.(ZHANG J S, LI Y T, MAO X L, et al. Study on classification of coal mine accident causes based on NLP[J]. China safety science journal,2023,33(6):20-26.)

[32]
范昊,李鹏飞.基于FastText字向量与双向GRU循环神经网络的短文本情感分析研究——以微博评论文本为例[J].情报科学,2021,39(4):15-22.(FAN H, LI P F. Sentiment analysis of short text based on FastText word vector and bidirectional GRU recurrent neural network——take the microblog comment text as example[J]. Information science,2021,39(4):15-22.)

Outlines

/

〈 〉