研究论文

国内外大语言模型生成中文论文摘要对比研究——以图书情报领域为例

  • 邢淼 , 1 ,
  • 田丽 , 1, 2
展开
  • 1辽宁师范大学管理学院 大连 116082
  • 2大连市公共文化与社会发展研究中心 大连 116399

邢淼,硕士研究生;

田丽,教授,硕士生导师,通信作者,E-mail: 358879854@qq.com。

收稿日期: 2024-05-23

  网络出版日期: 2025-04-28

Comparative Research on the Abstracts of Chinese Papers Generating Large Language Models at Home and Abroad: Taking the Field of Library and Information as an Example

  • Miao Xing , 1 ,
  • Li Tian , 1, 2
Expand
  • 1Department of Management, Liaoning Normal University Dalian 116082
  • 2Dalian Public Culture and Social Development Research Center Dalian 116399

Xing Miao, master candidate;

Tian Li, professor, master supervisor, corresponding author, E-mail: 358879854@qq.com.

Received date: 2024-05-23

  Online published: 2025-04-28

摘要

[目的/意义] 通过对国内外典型的大语言模型所生成的中文论文摘要进行对比分析,总结归纳两者间的异同点,为大语言模型后续的深度开发和发展研究提供参考。[方法/过程] 选取2023年国家社会科学基金年度项目中“图书馆、情报与文献学”学科的121个课题作为题目,通过ChatGPT4.0与文心大模型4.0分别生成中文摘要,经过数据预处理及文本分析,从高频词特征、词性分布、句子数量以及摘要内容长度等角度探讨国内外大语言模型生成内容的异同。然后,与中文期刊《图书情报工作》中的摘要写作做对比,判断大语言模型生成摘要是否贴合中文论文写作规范。[结果/结论] 文心一言生成摘要篇幅较短,字数较少,更贴合中文论文写作标准,GPT生成摘要的平均字数及句子数量较多,通过对比两个典型大语言模型生成内容的差距及特点,为大语言模型的完善与进一步深度开发提供一定的参考。

本文引用格式

邢淼 , 田丽 . 国内外大语言模型生成中文论文摘要对比研究——以图书情报领域为例[J]. 知识管理论坛, 2024 , 9(5) : 437 -447 . DOI: 10.13266/j.issn.2095-5472.2024.032

Abstract

[Purpose/Significance] By comparing and analyzing the abstracts of Chinese papers generated by typical Large Language Models at home and abroad, we summarize the similarities and differences between the two, and provide references for the subsequent in-depth development of the Large Language Models and the development of research. [Method/Process] 121 topics in the discipline of "Library, Intelligence and Documentation " in the annual project of the National Social Science Foundation of China in 2023 were selected as the topics. The Chinese abstracts were generated by ChatGPT4.0 and ERNIE 4.0 respectively, and were analyzed in terms of the characteristics of high-frequency words, the distribution of words, the number of sentences, and the length of the abstract content to explore the similarities and differences of the content generated by the Large Language Models at home and abroad through the data preprocessing and the text analysis. Then, the comparison was also made with the abstracts written in the Chinese journal “Library and Intelligence Service” to determine whether the abstracts generated by the large language model are in line with the norms of Chinese thesis writing.[Result/Conclusion] The abstracts generated by ERNIE Bot are shorter, with fewer words, and more suitable for Chinese paper writing standards, while GPT generates abstracts with more words and sentences on average. By comparing the gaps and characteristics of the contents generated by the two typical Large Language Models, we can provide certain references for the improvement and further in-depth development of the Large Language Models.

1 引言/Introduction

大语言模型通过大规模的数据集训练来学习、识别、总结、翻译、预测和生成文本以及其他内容,其快速发展也为编程、自然语言处理、搜索引擎、机器人等领域带来了新的机遇。目前大语言模型的应用十分广泛,包括服务商运用咨询服务机器人等AI对话的形式,了解用户多元化的需求及问题反馈;辅助搜索引擎使其搜索结果更匹配用户的需求与提问;使应用与程序的开发实现技术上的突破;智能语音机器人为用户提供多样的便捷服务等[1]。
国外的大语言模型主要包括:OpenAI公司开发的ChatGPT,是目前最受全世界瞩目的大语言模型,也是目前国外应用最广泛的大语言模型;谷歌研发的Meena聊天机器人,拥有海量的数据,是一款多轮开放域对话机器人;Facebook发布的最新大语言模型LLaMA-2,是一款开源模型,能够通过多种渠道获取;微软和英伟达(Nvidia)合作开发的Transformer语言模型MT-NLG能够完成多种自然语言任务,并具有极高的准确性。
国内也开发了多种大语言模型,应用于各行业、各领域。清华大学与智谱AI联合开发的ChatGLM-6B[2]是支持中英双语问答的开源对话语言模型,同时针对中文进行了优化,具有62亿个参数,是世界范围内大热的开源大语言模型之一。科大讯飞推出的星火认知大模型、字节跳动旗下的AI对话类产品Grace、复旦大学自然语言处理实验室发布的MOSS、阿里云推出的通义千问语言模型等众多国内大语言模型均陆续获批上线,是国内人工智能生成技术不断发展的产物,为企业、高校、专业机构提供了技术支撑,大语言模型的出现与广泛应用也为人工智能生成内容(artificial intelligence generated content, AIGC)带来了新的变革。百度开发的全新一代知识增强大语言模型文心一言在国内应用十分广泛。公开数据显示[3],文心一言面向全社会开放一个多月,用户规模达到4 500万,开发者5.4万,场景4 300个,应用825个,插件超过500个,凝聚800万开发者,服务22万家企事业单位,基于飞桨深度学习平台创建了80万个模型。2023年10月,文心大模型4.0宣布上线,是国内与ChatGPT在功能应用上相似的同类型大语言模型。因此,笔者将比较ChatGPT4.0(以下简称GPT)与基于文心大模型4.0研发的文心一言在摘要生成方面的异同。

2 相关研究/Related research

2.1 大语言模型在不同领域的应用研究

对于大语言模型应用领域的研究十分广泛,涉及教育、管理决策、医疗健康等。D. Jungwirth等[4]着重研究ChatGPT对实现可持续发展目标的看法与影响,得出ChatGPT具备在教育、健康和通信等领域为可持续发展目标做出贡献的能力,同时指出ChatGPT通过模仿人类较弱的写作能力来提高自然语言处理能力的潜力;W. Choi等[5]则研究了用户应用ChatGPT的体验与感受,为制定正确运用人工智能等新兴技术的相关政策提供了参考;D. Estau等[6]从处方审查、不良药物反应识别、不良药物反应因果关系评估以及药物咨询等方面,收集并评价ChatGPT给出的方案,从而总结ChatGPT在临床药学中的实践能力与作用;J. H. Kim等[7]探讨了ChatGPT对旅行者作出相关决策的影响,以及旅行者使用ChatGPT的场景及意图,认为ChatGPT能够辅助旅行者作出决策;翟其玲等[8]通过LDA(Latent Dirichlet Allocation)模型方法探析了AIGC应用的热点,包括人工智能概念股、智能数字内容创作、数字经济下的科技股投资趋势、自然语言技术的突破等,总结了AIGC的舆情热点,为AIGC的未来发展研究提供参考;张新新等[9]指出生成式智能出版内容未来会在出版大数据、高维度智能知识服务、出版+智能机器人、生成式智能出版物以及元宇宙出版等新产品、新业态等方面取得实质性突破;马永强等[10]指出,以ChatGPT为代表的人工智能大模型等数智技术为科研创新提供较为准确的信息以及常规的知识聚合服务,为科研人员提供个性化、细粒度的知识和场景化的解决方案,辅助科研人员更好地进行科研创新服务。

2.2 大语言模型辅助学术研究

国内外学者重点对包括ChatGPT在内的大语言模型在学科领域范围内的实践与影响进行研究。陆伟等[11]基于对ChatGPT本质及其系列模型的核心技术特征演进路径进行分析,从支撑算法与技术、信息资源建设、信息组织与信息检索、信息治理、内容安全与评价、人机智能交互与协同6个角度探析大模型对信息资源管理学科研究与实践带来的影响,指出在大语言模型发展的时代下信息资源管理学科机遇与挑战并存;曹树金等[12]表示生成式AI在综合性知识服务、社会信息服务、学术信息服务和决策情报服务4个方面对情报领域的实践有深刻的影响,情报学科能够与AI技术交叉融合以实现学科创新发展;赵浜等[13]在Gpt-3.5-Turbo与ChatGLM-6B大语言模型上进行测试,详细分析了国内外大语言模型在情报领域多方面典型工作中的运用能力水平;张宏玲等[14]指出,大语言模型的应用为图书馆数字人文工作带来新的范式变革,未来数字人文工作的后台支持将向大语言模型进行转型,前台的应用也会广泛采用自然语言交互等形式,从而实现图书馆数字人文工作的智慧化转型;张强等[15]表示,ChatGPT可助力图书馆的信息资源管理建设、智慧空间场景建设、智能咨询服务建设和馆员服务能力建设,从而介入智慧图书馆建设,并为其提供新思路新方向。在医学研究领域,M. Zuckerman等[16]通过ChatGPT生成医学教育评估项目,将ChatGPT生成的内容与专家编写的项目统计数据进行比较,进一步确定ChatGPT最适合的问题类型,并纳入最终的项目,从而提高了内容的创作效率;H. Alkaissi等[17]通过要求ChatGPT根据提供的病例特征撰写对应疾病的发病机制,来探讨ChatGPT在医学科学写作方面的作用以及影响。

2.3 大语言模型生成内容研究

对大语言模型生成内容的研究主要集中在其特征、价值与创新性方面。王一博等[18]从实证角度分析AI生成与学者撰写的中文论文摘要内容之间的检测与差异性,归纳总结了AI生成的优缺点和写作特征,并对ChatGPT和人类产出论文的引言内容进行分析对比;郭鑫等[19]通过查重测试检验人工生成内容的重复性,总结大语言模型生成内容与模式的特点;王雅琪等[20]探讨了ChatGPT用于论文创新性评价的效果与可行性,在生命科学、细胞免疫等6个学术研究领域进行生成内容创新性测验,认为GPT生成内容的创新性、准确性稍显不足,可以成为学术写作的辅助工具;M. Salvagno等[21]探讨了ChatGPT在科学写作中的应用,认为其生成内容有助于协助研究人员组织资料、生成或校对文章,但在运用生成内容过程中可能会出现剽窃、不准确等道德问题,并且不同国家之间的访问性也存在不平衡等问题。此外,大语言模型生成内容在专利技术应用、医患沟通等场景中都有重要作用。白如江等[22]提到ChatGPT在专利技术生成方面的应用,ChatGPT与技术功效矩阵任务相结合,拓展了ChatGPT与AIGC的应用场景,为AI技术辅助文本挖掘、信息抽取、专利分析提供了新的思路;J.W. Ayers等[23]对比评估公共社交媒体论坛中ChatGPT与医生对于患者提出问题的回答内容,探究ChatGPT对患者问题提供优质和感同身受的回复的能力。
目前,对于大语言模型的研究大致分为人工智能生成与人类生成内容对比分析,AIGC的实际应用、发展与影响研究两大方向,主要关注AIGC的理论与实践应用研究,而针对国内外不同的代表性大语言模型工具各方面运行特征的对比分析较少。因此,笔者以相同主题和条件的指令为控制变量,对国外具有代表性的大语言模型GPT和国内应用广泛、规模较大、功能完善的文心一言的生成内容进行多维度的分析比对,总结两者的异同,探究大语言模型在中文内容生成方面的特点,为大语言模型后续的深度开发和发展研究提供参考。

3 研究设计/Research design

选定特定的大语言模型作为研究对象,并确定要分析的数据源,作为大语言模型生成内容的主题条件。利用Python进行数据预处理,对预处理后的结果进行二次人工筛查,最后对处理后的文本数据进行文本分析,对比并总结分析后的结果。研究设计框架如图1所示:
图1 研究设计框架

Figure 1 Research design framework

3.1 数据准备

3.1.1 大模型选择

GPT作为国外大语言模型的代表之作,问世至今热度仍旧不减,引发不同领域的研究与思考热潮,最新发布的GPT4.0能力更强,应用范围更加广泛,影响力更广,因此选取GPT4.0作为国外大语言模型的代表进行研究。
百度开发的文心一言是国内最早开发、最早启动测试的类GPT大语言模型,是百度在文心大模型的技术基础上研发的对话问答式语言模型。目前文心大模型已全面升级至文心大模型4.0。文心一言全面开放,人人皆可用,在对话功能实现方面与GPT异曲同工。因此,选取基于文心大模型4.0的文心一言作为国内大语言模型代表,对标GPT4.0进行进一步分析研究。

3.1.2 数据源选择

为探究大语言模型的创作能力以及生成内容的可靠性、准确性等要素特征,选取全国哲学社会科学办公室公布的“2023年国家社科基金年度项目立项名单”中,所在学科为“图书馆、情报与文献学”的课题名称作为论文主题,共计121条。分别要求“GPT”和“文心一言”根据所提供的论文主题和指令要求,为每个主题撰写中文论文摘要,再分别将二者生成的摘要内容汇总,作为后续数据处理与文本分析的数据源。以下为向大语言模型提供的指令:“我将提供一个中文学术主题,希望您根据此主题为我撰写字数在250字到300字的中文论文摘要,主题是:…….”。

3.2 数据分析

3.2.1 数据预处理

对大语言模型生成的摘要文本进行数据预处理,主要分为以下4个步骤:①创建自定义词表。根据所选的121条主题条目,结合图书情报领域专业术语,将特定词汇、专有名词、新兴词汇等写入自定义词表,避免后续分词将专业词汇拆分,影响数据分析结果。②设置停用词表。为探究大语言模型对指令输出的真实结果,选取哈工大停用词表中标点符号及特殊符号部分,并添加少量无实际意义的字词(如“的”“了”等),将其作为停用词表,在分词过程中清理不必要的词语。③中文分词及词性标注。运用jieba分词,结合自定义词表与停用词表对大语言模型生成的摘要文本分别进行分词,并标注词性。④数据统计。该过程的主要目的是为文本分析做准备。将分词与词性标注结果分别写入文件,并分别统计高频词占比与词性分布概率。统计大语言模型生成摘要的长度,以CSV文件的格式进行保存,方便后续处理分析。

3.2.2 文本分析

采用文本分析、对比分析方法,包括高频词占比、词性分布统计、句子数量对比、摘要长度分析等,揭示GPT与文心一言之间生成中文摘要的异同点。
分析文本中词语的出现频率,揭示词语的重要性,统计分析大语言模型撰写的摘要中各类词汇的词性,从中总结大语言模型内容生成的特点,发掘其写作特征。在完成数据预处理后,将分词与词性标注结果分别写入文件,并分别统计词频与词性分布概率,分别按照从大到小的顺序进行排列。对比两者生成摘要中句子的数量,分析两个大语言模型生成摘要的长度,对比两者写作的特征,以及是否符合所给指令的要求限制,进一步对比总结出两者的异同。

3.3 对比分析

对文本分析结果进行统计与对比分析,从词、句、篇3个维度对比GPT生成摘要与文心一言生成摘要。此外,选择图书情报领域综合性较强的中文核心期刊《图书情报工作》作为对比对象,统计其2023年最新发布的121篇中文期刊论文摘要,主要从摘要平均字符数、摘要句子总数、摘要平均句子数、每句平均字数4个方面分别与GPT生成摘要与文心一言生成摘要进行对比,从而判断大语言模型生成摘要是否符合中文摘要的形式特征。

4 对比分析结果/Comparative analysis results

4.1 高频词占比分析

高频词体现了文本中词语的重要程度和运用情况,侧面反映了撰写方的侧重点,从而凸显写作特点与用词特征。由于文本篇幅不同,因此通过比较高频词在全部词语中所占的比例,分析两者生成摘要内容的用词特征与习惯。再次对分词结果进行人工筛查后,统计GPT生成和文心一言生成摘要内容的前20个高频词所占比进行对比分析,结果如表1所示:
表1 GPT与文心一言生成中文摘要高频词占比

Figure 1 Research design framework

序号 GPT 文心一言
高频词 占比/% 高频词 占比/%
1 研究 17.57 研究 18.98
2 信息 5.50 本文 13.97
3 通过 5.42 重要 7.79
4 分析 4.82 通过 7.44
5 知识 4.39 发展 6.73
6 文献 4.31 分析 5.87
7 本文 4.20 推动 5.52
8 数据 4.01 文化 5.26
9 技术 3.93 具有 5.26
10 提供 3.93 提供 5.16
11 文化 3.85 知识 4.96
12 提出 3.53 文献 4.66
13 发展 3.53 信息 4.50
14 重要 3.50 对于 4.20
15 包括 3.28 创新 4.00
16 服务 3.25 进行 3.90
17 探讨 3.12 技术 3.85
18 文章 3.09 方法 3.80
19 用户 3.09 意义 3.69
20 历史 3.09 探讨 3.54
数据显示,在GPT生成摘要的高频词中,第一与第二位高频词所占比相差约为12个百分点,差距较大;文心一言生成摘要中第一与第二位高频词所占比相差约5个百分点,且“研究”一词在两个大语言模型生成摘要中,均位于高频词第一位。对比高频词在全部词语中的占比可以发现,文心一言生成摘要的高频词占比均多于GPT生成摘要的高频词所占比,说明文心一言对于论文摘要写作相关词语的运用更为集中。对比前20个高频词语,发现GPT与文心一言生成摘要中有13个共同高频词(占比65%),包括“研究”“文化”“信息”“发展”等。除此之外,各有7个词语(占比35%)非另一方的高频词,即表1中加粗词语。
将大语言模型生成内容中的词语词性分为论文写作中常见的4种类型,即名词、动词、动名词与介词,通过分词词性标注,分别统计GPT与文心一言生成的摘要文本中以上4类词语的数量,如表2所示:
表2 GPT与文心一言生成摘要分词词性统计

Table 2 Segmentation part-of-speech statistics of abstract generated by GPT and ERNIE Bot

词性 GPT分词数量/个 文心一言分词数量/个
名词 8 109 4 448
动词 4 843 2 716
动名词 2 012 1 169
介词 1 163 824
数据显示,GPT与文心一言在中文摘要写作词语运用方面差距仍较大,GPT生成摘要中各词性的词语运用均多于文心一言生成摘要。结合表1可以发现,在GPT与文心一言生成摘要的前20个高频词中,名词数量占比分别为40%、25%;动词分别占比25%、35%;动名词分别占比20%、15%;介词分别占5%、10%。由此可见,GPT生成摘要中名词与动名词运用较多,文心一言生成摘要运用动词与介词较多,GPT与文心一言在中文摘要生成上的差异除词语的含义和词语的用法外,对于词语词性的运用也有明显差别。
在词频对比方面,分析两者生成摘要的高频词及词性分布,可以看出GPT生成摘要中主要包含“通过”“提出”“包括”等与提出观点与方法相关的表达,以及“数据”“用户”“服务”等与提供的主题相关的名词。文心一言生成摘要中主要包括“分析”“推动”“创新”“意义”等论文写作表达常见的词汇,更偏向于常规学术写作的词汇应用习惯。而GPT与文心一言生成摘要中均有“本文”“我们”“文章”等词语字眼的出现,且词频较高,说明在这类词语的运用上不贴合中文论文摘要写作规范。针对生成摘要中学术写作相关词汇运用这一方面,应将中文论文写作的常用词及期刊中普遍列出的不应采用的词语,写入训练集,并加强对大语言模型的训练。

4.2 摘要句子数量对比分析

以生成摘要中的句号为节点,每一句号处记为完整的一句话,据此统计GPT与文心一言生成摘要的句子数量。结果显示,GPT生成摘要句子总数为1 209句,文心一言生成摘要句子总数为675句,因此推算121篇摘要的句子数量分别约为9句/篇和6句/篇,因此将期待平均值分别预设为9和6,生成GPT与文心一言生成摘要句子数量正态分布拟合直方图,如图2所示:
图2 GPT(左)与文心一言(右)生成摘要句子数量正态分布拟合直方图

Figure 2 Histogram of normal distribution fitting for the number of abstracts sentences generated by GPT (left) and ERNIE Bot (right)

统计结果显示,GPT生成摘要句子数量平均值为8.98句,句子数量在9—10句较多;文心一言生成摘要句子数量平均值为6.05句,句子一般分布在6句左右。GPT生成摘要句子数量数据分布均较为集中,说明GPT生成的每一篇摘要之间,句子数量差距较小。此外,句子数量过少的情况出现在文心一言生成的摘要中的频率比GPT生成摘要的频率要高;相反,GPT生成摘要中句子数量过多的频率也大于文心一言生成摘要。
在句子数量对比方面,两者生成摘要的句子总数相差354句,GPT生成摘要每篇句子数量都较多,普遍在9句左右,而文心一言生成摘要一般在6句左右,说明文心一言生成摘要的句子数量普遍不多,更加符合中文摘要简明扼要的标准。

4.3 摘要长度对比分析

摘要是论文写作的第一部分,也是文章的浓缩精华,摘要长度在一定程度上衡量了摘要所包含的信息量以及摘要撰写的详细程度,过长的摘要也容易造成信息的冗余。探讨大语言模型生成的摘要长度,以此分析大语言模型的写作特征以及彼此之间的差异。分别统计GPT和文心一言生成的摘要长度,并据此绘制正态分布拟合直方图(见图3)。
图3 GPT(左)与文心一言(右)生成摘要长度正态分布拟合直方图

Figure 3 Histogram of normal distribution fitting for length of abstracts generated by GPT (left) and ERNIE Bot (right)

结果显示,GPT生成摘要长度的平均值为441.24个字符,均方差值为47.59个字符,文心一言生成摘要长度的平均值与均方差值分别为247.11个字符和18.40个字符。两者生成的摘要长度平均值相差近200个字符,说明文心一言生成摘要的长度远小于GPT生成摘要长度。文心一言生成摘要的正态分布曲线更高更窄,表示文心一言生成的摘要之间的长度差异性较小,分布比较集中,而GPT生成的摘要之间长度存在一定的差距,波动较大,数据分布较分散。
图4 GPT(左)与文心一言(右)生成摘要长度箱线图

Figure 3 Boxplot of length of abstracts generated by GPT (left) & ERNIE Bot (right)

通过绘制两者生成摘要长度的箱线图(见图4),进一步直观地对比分析摘要长度之间的差异。结果显示,GPT生成摘要长度的最大值为565个字符,最小值为335个字符,极差为230个字符;而文心一言生成摘要长度最大值为300个字符,最小值为201个字符,极差为99个字符,GPT与文心一言生成摘要的长度平均字数相差200字符左右。说明在主题与指令相同的情况下,GPT生成的摘要彼此之间的写作长度差异较大,文心一言生成摘要长度整体较短,且差异较小。与所给指令中“字数在250字到300字”的要求相比,GPT生成的121篇摘要均不在指令所给范围内,文心一言生成摘要中有54篇的字数在250-300字之间,占比约为45%,说明文心一言生成摘要更加符合指令要求,大语言模型在指令辨别、读取及执行方面的准确度还应继续加强与改进。

4.4 与中文期刊摘要对比分析

选取《图书情报工作》期刊中2023年第10期至第20期的121篇学术期刊的摘要,将GPT与文心一言生成摘要分别与其进行对比,主要分析大语言模型生成的中文摘要形式是否符合常规中文摘要的写作规范,如表3所示:
表3 GPT与文心一言生成摘要与《图书情报工作》摘要撰写对比

Figure 3 Histogram of normal distribution fitting for length of abstracts generated by GPT (left) and ERNIE Bot (right)

对比项 《图书情报工作》 GPT 文心一言
摘要平均字符数/个 315.08 441.24 247.11
摘要句子总数/句 504 1 029 675
摘要平均句子数/句 4.17 8.98 6.05
每句平均字符数/个 75.64 52.12 44.65
对比结果显示,GPT与文心一言生成摘要的长度与句子数量均多于期刊中学者撰写的摘要,而摘要中每一句的平均字符数却少于学者撰写的,说明大语言模型生成摘要句子数量虽多,但每句字数较少,而学者撰写的摘要句子总数较少,每句字数较多。综合摘要句子数及平均字符数来看,文心一言生成摘要整体上较为贴近中文摘要写作规范,大语言模型也应以更多的期刊论文为训练集训练其写作与创作能力。

5 结语/Conclusions

笔者主要从词、句、篇3个方面分析了GPT与文心一言生成中文摘要内容的特征及异同点,对比两者生成内容的高频词、句子数量、摘要长度等特征,发现大语言模型之间原创能力存在一定差距。最后与《图书情报工作》期刊中收录的学者撰写摘要进行简要对比,判断大语言模型生成摘要是否贴合中文论文摘要写作规范,为日后大语言模型的深度开发提供有益的参考。
经过对GPT与文心一言两个国内外代表性大语言模型生成中文摘要的内容特征进行分析,发现大语言模型虽然在智能问答及学术写作方面有着广泛的应用并在不断更新完善,但其生成的内容仍旧并非完全符合指令的需求,且内容质量有待商榷,对于学术论文写作而言,其生成中文摘要的写作规范与实际学术表达大不相同。大语言模型在学术论文写作中发挥了一定的辅助作用,正确准确地运用其参与学术写作等研究活动,需要学者、大模型开发商共同协作。大语言模型开发商应该更加侧重模型的训练和调试,及时丰富更新训练集,提高大语言模型运行的准确度。
本文基于多维度分析对比了国内外大语言模型生成图情领域中文论文摘要的特点与异同,未来可以针对大语言模型在多领域、多学科、多场景的应用与发展开展更加深入的研究。本文也存在一定的不足,例如仅针对图书情报领域内的中文摘要进行对比研究,仅选择两个具有代表性的国内和国外大语言模型作为研究对象进行分析探讨,对于大语言模型的训练还不充分,不同的提问方式可能会产生不同的研究结果,因此在模型选择、模型训练语句的数量和多领域融合等方面还有待进一步深入探索。

邢 淼:文本分析,论文初稿撰写;

田 丽:研究设计,论文定稿。

[1]
丽台科技.大型语言模型有哪些用途?大型语言模型如何运作呢?[EB/OL].[2024-06-15].https://www.elecfans.com/d/2024516.html.(LEADTEK. What are the uses of large-scale language models? How do large-scale language models work? [EB/OL].[2024-06-15].https://www.elecfans.com/d/2024516.html.)

[2]
清华大学.国产对话模型ChatGLM启动内测[EB/OL].[2024-06-15].https://www.tsinghua.edu.cn/info/1182/102133.htm.(TSINGHUA UNIVERSITY. A domestic dialogue model,ChatGLM has started internal testing[EB/OL].[2024-06-15].https://www.tsinghua.edu.cn/info/1182/102133.htm.)

[3]
百度.最新成果!中国计算机大会现场王海峰揭秘文心大模型4.0[EB/OL].[2024-06-15].https://mp.weixin.qq.com/s/K5WRrfIoDtxPkZIlgXo9xQ.(BAIDU.Latest achievement! Wang Haifeng reveals ERNIE Bot4.0 at China computer conference [EB/OL].[2024-06-15].https://mp.weixin.qq.com/s/K5WRrfIoDtxPkZIlgXo9xQ.)

[4]
JUNGWIRTH D, HALUZA D. Artificial intelligence and the sustainable development goals: an exploratory study in the context of the society domain[J].Journal of software engineering and applications,2023,16(4):91-112.

[5]
CHOI W, ZHANG Y, STVILIA B. Exploring applications and user experience with generative AI tools: a content analysis of reddit posts on ChatGPT[J]. Proceedings of the Association for Information Science and Technology,2023,60(1):543-546.

[6]
HUANG X R , ESTAU D, LIU X N,et al. Evaluating the performance of ChatGPT in clinical pharmacy: a comparative study of ChatGPT and clinical pharmacists[J].British journal of clinical pharmacology,2024,90(1),232-238.

[7]
KIM J H, KIM J, KIM S, et al. Effects of AI ChatGPT on travelers' travel decision-making[J].Tourism review,2024,79(5):1038-1057.

[8]
翟其玲,张佳怡,刘宝瑞,等.基于LDA主题模型对AIGC的影响力分析[J].数据挖掘,2023,13(4):366-375. (ZHAI Q L, ZHANG J Y, LIU B R, et al. Influence analysis of AIGC based on LDA topic model[J].Hans journal of data mining,2023,13(4):366-375.)

[9]
张新新,黄如花.生成式智能出版的应用场景、风险挑战与调治路径[J].图书情报知识,2023,40(5):77-86,27.(ZHANG X X, HUANG R H. Application scenarios, risk challenges and regulatory pathways of generative intelligent publishing[J].Documentation, information&knowledge,2023,40(5):77-86,27.)

[10]
陆伟,马永强,刘家伟,等.数智赋能的科研创新——基于数智技术的创新辅助框架探析[J].情报学报,2023,42(9):1009-1017.(LU W,MA Y Q,LIU J W, et al. Data intelligence empowered innovation: an exploration of the innovation assistance framework based on data intelligence technology[J]. Journal of the China Society for Scientific and Technical Information,2023,42(9):1009-1017.)

[11]
陆伟,刘家伟,马永强,等.ChatGPT为代表的大模型对信息资源管理的影响[J].图书情报知识,2023,40(2):6-9,70.(LU W,LIU J W,MA Y Q, et al. The influence of language models represented by ChatGPT on information resources management[J]. Documentation, information & knowledge,2023,40(2):6-9,70.)

[12]
曹树金,曹茹烨.从ChatGPT看生成式AI对情报学研究与实践的影响[J].现代情报,2023,43(4):3-10.(CAO S J,CAO R Y. Influence of generative AI on the research and practice of information science from the perspective of ChatGPT[J]. Journal of modern information,2023,43(4):3-10.)

[13]
赵浜,曹树金.国内外生成式AI大模型执行情报领域典型任务的测试分析[J].情报资料工作,2023,44(5):6-17.(ZHAO B,CAO S J. Test analysis of typical tasks in the information field performed by generative AI large models at home and abroad[J].Information and documentation services,2023,44(5):6-17.)

[14]
张宏玲,沈立力,韩春磊,等.大语言模型对图书馆数字人文工作的挑战及应对思考[J].图书馆杂志,2023,42(11):31-39,61.(ZHANG H L, SHEN L L, HAN C L, et al. Challenges and reflections on the practical application of large language model in digital humanities work at libraries[J]. Library journal,2023,42(11):31-39,61.)

[15]
张强,高颖,赵逸淳,等.ChatGPT在智慧图书馆建设中的机遇与挑战[J].图书馆理论与实践,2023(6):116-122.(ZHANG Q, GAO Y, ZHAO Y C, et al. The opportunity and challenge of ChatGPT in the construction of intelligent library[J]. Library theory and practice,2023(6):116-122.)

[16]
ZUCKERMAN M, FLOOD R, TAN R J B, et al. ChatGPT for assessment writing[J].Medical teacher,2023,45(11):1224-1227.

[17]
ALKAISSI H ,MCFARLANE S I. Artificial hallucinations in ChatGPT: implications in scientific writing[J].Cureus journal of medical science,2023,15(2):e35179.

[18]
王一博,郭鑫,刘智锋,等.AI生成与学者撰写中文论文摘要的检测与差异性比较研究[J].情报杂志,2023,42(9):127-134.(WANG Y B, GUO X, LIU Z F, et al. Detection and comparative study of differences between AI-generated and scholar-written Chinese abstracts[J].Journal of intelligence,2023,42(9):127-134.)

[19]
郭鑫,王一博,王继民.ChatGPT生成中文学术内容分析——以情报学领域为例[J].图书馆论坛,2024,44(3):134-143.(GUO X,WANG Y B,WANG J M. Feature analysis of Chinese academic content generated by ChatGPT: an example in the field of intelligence[J].Library tribune,2024,44(3):134-143.)

[20]
王雅琪,曹树金.ChatGPT用于论文创新性评价的效果及可行性分析[J].情报资料工作,2023,44(5):28-38.(WANG Y Q,CAO S J. The effect and feasibility analysis of ChatGPT used in paper innovativeness evaluation[J].Information and documentation services,2023,44(5):28-38.)

[21]
SALVAGNO M , TACCONE F S, GERLI A G. Can artificial intelligence help for scientific writing?[J].Critical care,2023,27(1):75-79.

[22]
白如江,陈启明,张玉洁,等.基于ChatGPT+Prompt的专利技术功效实体自动生成研究[J]. 数据分析与知识发现,2024, 8 (4): 14-25.(BAI R J, CHEN Q M, ZHANG Y J, et al. Research on automatic entities generation of patent technology function matrix based on ChatGPT+Prompt[J].Data analysis and knowledge discovery,2024,8(4):14-25.)

[23]
AYERS J W, POLIAK A, DREDZE M, et al. Comparing physician and artificial intelligence chatbot responses to patient questions posted to a public social media forum[J].JAMA internal medicine,2023,183(6):589-596.

文章导航

/

〈 〉