Application of Big Data in Libraries

  • Li Jinlan
Expand

Received date: 2014-06-18

  Accepted date: 2014-07-10

  Online published: 2025-04-28

Cite this article

Li Jinlan . Application of Big Data in Libraries[J]. Knowledge Management Forum, 2014 , 2014(5) : 1 -6 . DOI: 10.13266/j.issn.2095-5472.2014.05.001

1 前言

近年来,继移动互联网、物联网、云计算技术之后,大数据正成为最具有颠覆性的信息科技。互联网技术的发展,尤其是社交网络、电子商务与移动通信的出现,把人类社会带入了一个由以“PB(1024TB)”为单位的结构与非结构数据信息组成的新时代。由于RFID射频数据、传感器数据、社交网络交互数据及移动互联网数据将会成为未来图书馆大数据的几个主要来源[1],如何利用大数据技术挖掘隐含在用户行为背后的半结构化、非结构化数据信息,变革图书馆管理,拓展图书馆业务,已成为摆在图书馆面前的首要问题。大数据纷繁复杂,分布在全球多个服务器上,使得存储和处理这些数据既便宜又容易,善用这些大数据,就可以做很多在少量数据基础上无法完成的事情。

2 大数据对图书馆工作的影响

2.1 改变了图书馆员的思维模式

大数据改变了图书馆员分析读者信息行为的方式方法,过去图书馆员常用随机抽样分析法分析读者的借阅行为,用尽可能少的数据,获得最多的信息及高精度的推断,其缺陷是依赖于采样的绝对随机性。图书馆员传统的思维方式是确保随机采样数据的准确率,因为任意一个随机数据的准确性都对结果至关重要。过去图书馆员为了分析、掌握读者阅读倾向,要向读者发放问卷调查表,而调查对象的选取会对调查结果产生重要的影响。然而在大数据时代,图书馆员用来分析的数据已不是随机样本,而是所有读者的全部借阅行为数据,所收集的数据越来越多,越来越全面,使图书馆员可以从不同角度观察和研究读者数据的方方面面,得出更科学的结论。过去图书馆员的习惯思维是寻找事物的因果关系,找出产生这种结果的原因,而大数据通常是用概率说话,图书馆员对事物的探求也从关心因果关系转化成探求事物之间的相关关系。

2.2 改变了类分网络信息资源的方法

传统图书馆一直用预先设计好的规范化语言来类分文献信息资源,用索引法来帮助进行馆藏资源数据的存储和检索。大数据时代,人们获取的信息资源大部分都是数字信息,随着互联网上的各种数据成几何级增加,已无法再用预先设计好的规范化语言来对网络信息资源进行分类,而是使用一组文本标签来编制和搜索信息资源。任何人都可以为其上传的信息资源建立标签,正是由于标签的存在,使得互联网上的资源变得更加容易找到,同时由于标签没有统一的标准,其随意性也为用户准确检索和获取互联网信息带来了困难。因此,图书馆员必须了解、掌握网络信息的文本标签标注方法,利用传统文献标引的原理和互联网上普遍使用的语义标签方法,对文本标签建立索引,使网络信息资源有序化,便于读者的利用与检索。

2.3 改变了图书馆的竞争方式

大数据不仅改变了人们的思维方式,同时也改变了人们获取信息的途径与方法。在大数据时代,图书馆之间的竞争已经不再是图书馆馆藏资源、空间建筑、借阅服务等方面的竞争,而拥有大数据的总量、对大数据的挖掘和分析能力将成为大数据时代图书馆竞争的一大指标[2]。大数据是结构化数据、半结构化数据与非结构化数据的总和[3]。结构化数据是指行数据,存储在数据库里,可以用二维表结构来逻辑表达的数据[4],如图书馆馆藏书目数据库、期刊、报纸数据库、网络数据库等都是结构化数据。这种数据的主要特征是时效较长、专指性强、有固定的结构和格式、易于整理等[5]。非结构化数据,顾名思义,是存储在文件系统里而不是数据库的信息,包括所有格式的办公文档、文本、图片、XML、HTML、各类报表、图像和音频/视频信息等[4]。对于图书馆而言,读者借阅数据、数据库使用统计数据、网站点击数据、读者查找文献的行为数据等都属于非结构化数据。
随着云计算的到来,图书馆多年来积累的读者借阅数据,如图书文献借阅数据、电子文献阅读模式、读者点击图书馆主页的习惯、查找文献的行为模式等非结构数据的存储、处理与利用都已变为现实。通过对日益增长的大量非结构化数据进行分析研究,可以预测读者的阅读习惯,掌握图书馆资源利用情况,评价图书馆馆藏资源质量,了解读者信息素养情况,掌握读者教育的重点与难点等,有利于图书馆提供个性化的信息服务。谁掌握了存储、分析、挖掘图书馆非结构化数据的技术,谁就能在大数据时代占据有利地位。

3 大数据在图书馆的应用

云计算的实现为图书馆存取大量的信息数据提供了便利,图书馆可以通过云计算对大数据进行存储、分析、预测,使其决策更为精准。

3.1 优化图书馆馆藏资源

大数据时代,馆藏资源的数量、载体形式、读者的借阅习惯、教育水平层次、信息获取方式和途径等都发生了很大的变化,因此对藏书体系规划进行适时修定,才能适应时代的要求。

3.1.1 优化藏书规划

藏书体系规划是指根据图书馆的性质、任务和读者需求等因素,制定藏书建设的目标与原则、文献收藏的范围类型与标准以及相应的藏书体系结构模式。图书馆自动化管理系统一般都有读者预约图书的业务,当读者通过网络查找到自己想要的图书,而该书又不在馆内时,读者可预约该图书;当该书被还回时,系统不仅会告知工作人员该书已被读者预约,还会自动通知预约该书的读者到馆借书。读者预约某图书的次数越多,越能说明该书的库存不足,从而为采购员制定采购计划提供参考依据,并且,通过读者预约图书数据还可以预测读者阅读倾向。在购书经费严重不足的情况下,在购买电子图书时,可将预约最多的图书及相关图书作为首选对象,与馆藏纸质图书形成互补,从而提高电子图书的使用率。图书馆还可在全面了解本馆读者图书借阅情况的前提下,制定下一年度的藏书发展计划,制定新的采购计划[6]。2003-2013年广东石油化工学院图书馆纸本图书借阅册数、电子图书及CNKI中的电子期刊下载量如表1所示:
表1 广东石油化工学院图书馆2003-2013年纸本图书借阅册数、电子图书及电子期刊下载量
年份
项目
2003 2004 2005 2006 2007 2008 2009 2010 2011 2012 2013
纸本图书借阅册数(册) 317 469 401 059 391 203 313 908 270 009 250 235 246 447 245 520 234 943 180 136 174 991
中文电子图书下载量(次) 7 876 21 955 96 673 128 238 142 583 95 061 64 689 65 166
CNKI下载量(次) 142 626 165 025 143 055 368 744 477 875 478 517 513 526 535 001 887 023
将表1中借阅纸本图书的册数用图1表示,电子图书及CNKI下载量用图2表示:
图1 广东石油化工学院图书馆2003-2013年纸本图书借阅量
图2 广东石油化工学院图书馆2003-2013年电子图书与CNKI下载量
从图1、图2容易看出:图书馆外借图书册数在2003-2004年有较大的增幅,2004-2005年变化不大,此后逐年下降,2012-2013年基本持平。借阅量产生变化的主要原因是:首先,2003-2006年学校评估,对图书馆购书经费投入较大,每年的新书进库量分别为19.3万、12.3万、8.5万、6.1万册,大量新书的上架吸引了读者到馆借阅图书;其次,2003-2005年馆内没有电子书,2006年才开始购买,由于电子书的增加,在一定程度上影响了纸质图书借阅量。中文电子图书下载量2006-2010年之间逐年增加,从2011年开始又有所回落。电子书下载量产生变化的主要原因是:电子书符合年轻人的阅读兴趣与习惯,方便读者借阅,故开始时其下载量逐年增加;2010年以后新增电子图书种类减少,特别是新书较少,因此下载量减少。2005年我馆开始购买CNKI系列数据库,刚开始时,数据库宣传培训不到位,影响了其使用率;随着时间的推移,读者了解、掌握了其使用方法,故其下载量逐年上升。从图1、图2可知,读者对电子书刊的需求量在增加,而纸质图书的需求量在下降,因此我们在制定2013、2014年的资源采购计划时,依据2003-2012年的借阅数据及电子资源的下载量,及时调整了经费分配办法,纸质资源购置费保持一定的增长,而电子资源的订购经费有较大幅度的提高。

3.1.2 提供了馆藏资源决策依据

图书馆可以收集读者的馆藏资源利用数据,通过计算机设备、网络通讯工具将借阅数据提供给数据处理商,如新加坡德胜策略有限公司。通过数据处理商对读者借阅大数据进行挖掘、分析,来确定纸质图书、视听资料、电子书刊、多媒体资源的馆藏比例,从而从整体上规划馆藏资源建设,提升馆藏资源的质量,节约图书馆有限的资源购置费,提高馆藏资源的使用率。利用数据挖掘技术分析读者的借阅大数据,如根据图书借阅次数和平均借阅期分析,可预测读者的阅读倾向,预测新书的种类、学科分布、复本量等,从而提高图书馆馆藏资源建设质量。

3.1.3 提高馆藏质量

为了做好图书馆的藏书建设,图书馆一般都在自己的主页上设置了荐购图书的功能,读者在馆藏书目找不到自己想要的图书时,可通过该功能,向图书馆推荐购买自己所需的图书。采购人员在收到读者的荐购信息后,进行书目查重,并对读者所荐购图书是否符合本馆馆藏要求进行论证,然后决定是否将该书添加到馆藏中,从而保证馆藏资源的采购具有较强的针对性,提高馆藏资源质量。
电子资源在图书馆的资源中占有越来越重要的地位,其资源的数量也在不断增加。图书馆在购买电子资源前,一般先要进行试用,然后根据读者点击次数、下载量等决定是否购买。对已购买的电子资源,一般参考其上一年度的点击率、下载量,考虑是否续订。从某种意义上来说,电子资源的点击率、下载量表明其受读者欢迎的程度,同时也是采购人员对电子资源进行调整的依据。从表1可知,我馆中文电子图书需求量从2011年开始有所下降,为此我们在2014年及时调整了电子图书的采购计划,增加了购买超星歌德电子书借阅机及外文电子图书的采购计划。

3.2 提高图书馆服务水平

目前大部分图书馆都实现了计算机管理,读者借阅图书通过计算机来完成,读者的借阅数据会存储在图书馆的服务器上,为保证信息安全,图书馆技术部门每天会对读者的借阅数据进行备份。通过对长期积累的借阅数据的分析,可以掌握读者的阅读倾向、阅读习惯、阅读兴趣等,同时还可以预测读者的研究方向。图书馆可以据此将读者分成若干群,然后针对不同的读者群提供个性化的服务。如图书馆可对学校重点学科带头人、博士、教授等重要读者的借阅数据进行分析,了解他们的阅读倾向,预测他们的研究方向,有针对性地为他们提供课题跟踪、定题服务、文献推送等个性化服务。

3.2.1 有利于改善图书馆主页设计

图书馆主页内容一般包括馆藏资源、馆藏检索、图书馆概况、图书馆信息服务、图书馆新闻公告等。主页设计得科学合理,能吸引读者更多地利用图书馆的资源。图书馆要对读者点击图书馆主页的情况进行分析,了解读者对图书馆主页上的哪一类资源访问量最大,哪一类信息点击次数最少,而后将读者经常访问的内容放在主页一级类目的显要位置,将访问量最少的资源调整到二级类目下,以提高资源的利用率。总之,图书馆主页设计要符合读者阅读习惯,在主页的醒目位置设置读者最想访问、最喜欢、使用次数最多的资源,为读者快速检索、获取其所需资源提供便利。

3.2.2 有利于做好读者教育工作

通过读者搜索查询文献的行为数据不仅可以了解其阅读喜好,而且可以了解其文献信息检索能力及检索技巧。读者在查找文献信息时,输入的检索表达式是否正确?检索出来的文献查全率如何,是否都是读者所需要的文献?读者是习惯用关键词来查询还是用分类导航的方法来查找?分类导航查询的思路是否清晰可行?读者最喜欢的文献资源类目是什么?关键词查询最大的问题是什么?关键词的提取是否正确?多个关键词之间的逻辑组配是否恰当?读者查找文献信息的习惯及做法等行为都被电子资源阅读器准确无误地记录下来,图书馆可通过对这些数据进行分析,了解读者的信息行为、信息素养,掌握读者教育的重点与难点,制定好图书馆读者教育工作方案,有针对性地为读者开设文献信息检索课程、学术讲座与学术沙龙等第二课堂读书活动,从而提高读者教育的针对性。

3.3 对图书馆自动化管理系统提出新要求

大数据时代,图书馆对智能化技术依赖性加强,例如需要利用高智能设备与技术对图书馆非结构化数据进行自动、高级、复杂的采集、挖掘与分析,因而对图书馆自动化管理系统的功能要求提高了——系统不仅需要提供传统的功能,还要提供对非结构数据的采集、存储、挖掘、分析功能。图书馆在为读者服务过程中产生的大量非结构化数据都必须通过图书馆管理系统加以利用,如对收集到的非结构化数据进行筛选、分类、存储,建立数据之间的相关关系,建立主题数据仓库等。目前大部分电子资源的阅读、下载量统计只能由数据商来完成,这给图书馆的管理工作带来了不便。随着大数据时代的到来,图书馆自动化管理系统不仅应增加对各种资源借阅数据及下载量的统计,还应具备文献评价、文献推送功能,否则图书馆自动化管理系统很难适应网络化的发展,甚至会制约图书馆的发展。如读者利用CNKI查找、获取文献信息后,自动化管理系统不仅应自动给出读者对本次文献查找、获取服务的综合评价,而且应根据读者的检索喜好,为其提供个性化文献检索、推送服务。图书馆自动化管理系统只有适应网络化发展要求才能占领图书馆市场,例如:汇文文献服务系统应对网络化发展的要求,实现了异地委托借阅功能,提供灵活多样的读者借阅量控制和个性化网络服务,从而占据了国内“211工程”高校图书馆自动化管理系统的龙头位置[7]。

4 为图书馆创造新价值

随着大数据存储成本继续暴跌,而数据分析工具越来越先进,收集和存储数据的数量及规模也将呈爆发式增长,图书馆可以利用读者借阅行为大数据改善现有的服务。大数据可以帮助我们分析读者的阅读兴趣、阅读习惯、检索能力,创新图书馆的服务模式,提高图书馆的服务质量。图书馆可将自己收集到的大量读者的阅读习惯数据提供给有能力挖掘数据价值的人或公司,使数据产生附加价值,为图书馆创造新的效益,为图书馆资源购置费提供新的增长点,为图书馆创新服务模式提供技术支持。这一阅读习惯数据还可以重复利用,不断产生价值。电子书阅读器将读者阅读一页或一节书所需时间,是泛读、精读还是放弃阅读,是画线强调或做标记等阅读行为都一一记录下来,通过数据分析就能了解读者对电子书的好恶和阅读模式。图书馆可将电子书阅读器收集的阅读情况数据,如在阅读时反复被标注或强调过的内容,反馈给出版社,这样出版社就能知道电子书中最受读者欢迎的内容,从而预测读者阅读兴趣、研究方向,预测最受读者欢迎的图书,进而改变出版策略,提高图书销量。如果作者得到图书馆反馈的读者对其电子书的阅读情况数据,也可以清楚地知道自己作品的哪一部分最能吸引读者,最受读者欢迎。这样,作者也可根据读者的喜好提高自己作品的质量。如此,读者阅读数据就被多次利用,创造出了不同的价值。需要指出的是,图书馆在利用读者借阅数据时,要注意读者个人信息的保密,对大数据的挖掘、分析,要以保护读者个人信息为前提,要在充分尊重读者个人隐私权的基础上,利用读者借阅大数据。如澳大利亚公共服务大数据战略中通过项目设计隐私保护、保护数据的完整性、隐私评估、相关法律法规几个方面来保护读者隐私[8]。

5 结语

大数据时代,谁能收集读者借阅大数据,并对大数据进行挖掘、分析、利用,谁就能占领文献信息提供者的市场。图书馆如果没有对读者借阅行为等非结构化数据进行收集、存储并加于利用,就会失去其原有的为读者提供文献信息服务的优势,读者就会放弃图书馆而选择能为他们提供个性化服务的数据挖掘公司,而图书馆没有其懒以生存的读者,就失去了其存在的前提,更谈不上发展。
[1]
张兴旺.图书馆大数据体系构建的学术环境和战略思考[J].情报资料工作,2013(2):12-17.

[2]
孙琳.大数据时代图书馆服务体系创新研究[J].理论观察,2013(4):99-100.

[3]
韩翠峰.大数据带给图书馆的影响与挑战[J].图书与情报,2012(5):37-40.

[4]
非结构化数据[EB/OL] .[2014-01-12].http://baike.baidu.com/view/2119114.

[5]
李鹏云.大数据与图书馆服务[J].农业图书情报学刊,2013(9):178-181.

[6]
李锦兰.网络环境下高校图书馆的藏书建设[J],图书馆论坛,2001(4):53-55.

[7]
李锦兰.王华春.高校图书馆自动化管理系统的使用情况调查分析[J].图书馆学研究,2011(3):37-41.

[8]
刘兰,闫永君.澳大利亚公共服务大数据战略研究[J].图书馆学研究,2014(5):49-51.

Outlines

/

〈 〉