分类与可视化:知识接口——2013国际UDC研讨会综述

  • 蔡小筱
展开
  • 西南大学计算机与信息科学学院 重庆 400715

收稿日期: 2014-09-03

  录用日期: 2014-09-30

  网络出版日期: 2025-04-28

‌Classification and Visualization: Knowledge Interface——A Review of the 2013 International UDC Seminar

  • Cai Xiaoxiao
Expand

Received date: 2014-09-03

  Accepted date: 2014-09-30

  Online published: 2025-04-28

摘要

基于知识可视化面临的挑战,分类检索、探索及学习,分类、界面与信息构建,知识结构的可视化导航,索引语言、关系和可视化,馆藏搜索和浏览的可视化,分类与馆藏元数据的可视化分析7个方面的主题报告,对2013年国际UDC研讨会的内容进行综述。

本文引用格式

蔡小筱 . 分类与可视化:知识接口——2013国际UDC研讨会综述[J]. 知识管理论坛, 2014 , 2014(6) : 20 -25 . DOI: 10.13266/j.issn.2095-5472.2014.06.004

1 引言

2013年10月24-25日,第4次国际Universal Decimal Classification(UDC)研讨会在海牙荷兰皇家图书馆召开。本次会议由UDC联盟(协会)组织,荷兰国家图书馆承办。来自24个国家的115名人员参加了本次会议。英国UDC联盟成员M.I.Cordeiro和A.Slavic应邀出席了此次会议并致辞。同时,在开幕式上,来自美国伊利诺伊大学的荣誉教授W.B.Rayward作开幕汇报,对UDC研讨会的发展历程做了详细介绍,并概述了19世纪末比利时著名书目专家奥特里特(P.Otlet)提出的知识组织理论,以及知识分类和可视化对于知识的重要性。同时,介绍了奥特里特在创新性知识组织方法上做出的贡献,并提出知识可视化的背景、内涵、流程及相关概念等内容[1]。
本次研讨会围绕“分类与可视化:知识接口(Classification & Visualization: Interfaces to Knowledge )”这一主题,致力于探索各领域知识可视化的进展及相关技术,讨论了可视化对更多主流书目和文献分类发展所产生的潜在影响。来自不同领域的与会学者就以下7个方面分别开展了深入探讨和交流:①知识可视化面临的挑战;②分类检索、探索及学习;③分类、界面与信息构建;④知识结构的可视化导航;⑤索引语言、关系和可视化;⑥馆藏搜索和浏览的可视化;⑦分类与馆藏元数据的可视化分析。

2 知识可视化面临的挑战

在“From trees to Webs: Uprooting knowledge through visualization”的报告中,来自美国印第安纳大学的S.B.Weingart回顾了知识组织的发展历程。他指出传统的知识分类主要是借用“树”的形式,采用层次结构和谱系结构分类法(从而)对知识进行符号化、序化。他认为当知识以简单的线性方式呈现,知识分类的层次结构就开始分离,知识与知识之间相互分离并形成一种相互间完全不相关的研究域,最终将导致知识组织转化为巨大的层次结构嵌套树。在早期的分类系统中,这一理论得到长期的持续发展,形成了早期分类系统的特征。然而,分面分类的问世打破了严格的等级分类,当图表第一次得到广泛运用时,知识不再以层级结构或特定的根目录来表示。随着万维网的发展,网络可视化成为了一种常态,其重要性在知识组织中得到了体现,人们开始采用可视化方式对知识进行序化和组织[2]。S.B.Weingart回顾12世纪以来知识树的发展历程及变化,展示了塞缪尔·泰勒百科全书、书目目录、DDC及P.Otlet等著名的等级列举分类法。同时,还展示了起源于20世纪的知识地图可视化的知识分类方法,介绍了知识地图发展至今所经历的一些变化、特点以及实际运用情况。
在量子物理学和其他科学中,观念符号化的出现和若干重大科学发现的解释打开了一个神话般的自由空间,在这里,过去与现在,科学与自然、艺术、传统、其他知识哲学形态可以进行跨领域的对话。来自荷兰皇家艺术与科学院的C.Heuvel通过主题为“Visualizing knowledge interaction in the multiverse of knowledge”的报告,介绍了P.Otlet为实现多维知识组织和知识互动的可视化而进行的早期实验,指出可视化方式能够弥合不同知识层次之间的差异。同时,还探讨了可视化在未来信息检索中的潜力。报告包含两个内容:
其一,讨论分类理论中反复出现的一个概念“Likeness”。他认为,Likeness有两种意思:①相似性:指两个事物之间的相似性;②可能性:指对事物之间存在的有意义的关系进行组织的可能性。
其二,以各种媒体对艺术的不同表达形式为例,阐释了人们对某个观点的认知力和文化力量对其行为所产生的不同作用。
进而,从实证研究和理论研究两个方面进行了探讨。
(1)实证研究:建立在两种多模态的非语义信息检索实验分析基础之上:①搜索引擎实验:查询不同多媒体表达的相似结构特征(相似性);②协同过滤技术实验:测量相似关联的可能性。
(2)理论研究:在知识互动基本理论的指导下,探讨了知识多元领域中的隐喻知识。此外,报告指出后续研究将是对两种可视化进行分析,旨在创建一套符合量子物理学定律的科学分类法,并探讨在知识领域中将这些方法与UDC结合起来的可能性[3]。
知识结构是知识组织的重要概念之一,知识结构地图是知识组织中可视化的重要工具。运用可视化工具支持有效、有意义的知识结构可视化,深入理解可视化对知识结构普遍特征所产生的影响是必不可少的。通过“Challenges of knowledge structure visualization”这一报告,来自美国宾夕法尼亚州费城德雷克塞尔大学计算机与信息学院的Xia Lin和J.W.Ahn对知识结构相关的基本问题进行了讨论,主要包括:①知识结构的定义及定义时需要考虑的问题;②与知识结构相关的术语概念;③实例:用知识结构地图展示心理学、教育学和工程学3门不同学科的相关文献;④知识结构地图的决定因素:知识组织系统(KOS)、对象、测度、映射算法、使用目的等;⑤知识结构表达的内容;⑥针对不同目的和知识结构,提供3种不同可视化方法对知识进行有效的组织:存在于概念空间中的知识结构可视化、从概念空间中提取和学习到的知识结构可视化、通过视觉隐喻实现的可视化知识结构,基于其团队建立的几个可视化原型,他们讨论比较了这些不同的方法,并将其与知识结构的一些共同特征(如知识的关联、表征、组织与获取等)相互关联起来;⑦在报告的最后,作者总结了知识结构地图的决定性因素,以及可视化在具体知识组织活动中的实际运用[4]。

3 分类检索、探索及学习

来自美国城市大学研究生中心的L. Manovich汇报了大文化数据可视化如何帮助我们忘记文化分类。他提出与之相关的3个研究问题:如何挖掘大文化数据集以质疑我们的文化假设和偏见,从而“忘却”我们所知道的一切?怎样才能运用用户产生的、包含了数十亿图像的大量视觉内容进行研究?需要什么新的理论概念来处理原生数字文化的新范畴?2007年,作者建立softwarestudies.com网站,开始致力于解决前面提到的这些问题。该报告对大量视觉内容的分析技术进行探索,对100万张漫画图片和100万件偏轨艺术作品进行分析,探讨大文化数据集的计算分析和可视化如何用于文化分类(如按“风格”和“时代”分类)的传统离散分类法[5]。
标签云是知识可视化最有效的方式之一,不仅会显示流行主题,也会显示低频率主题。标签云在知识可视化中的作用不可小觑,但仍然存在一些问题,如:哪一种标签云的设计最适用于信息表达?哪一种标签云设计会对用户的认知产生最好的影响?来自法国波多尔理工学院的Véronique Lespinet-Najib针对这两个问题进行了研究,并介绍了其团队实现标签云布局的实证研究:①根据某组织主页上的超文本单元,提出超链接分类法的最初假设;②为了突出数据,根据不同的标准,测试了4种不同标签云布局:按顺序聚合(权重频率/无权重频率)、循环聚合、按主题聚合,针对每一种布局,采用目视跟踪(Toobi系统)测量视觉注意力;③展示了云标签在特定领域中的战略应用,如组织领域,以描述网站的大致情况以及最显著特征[6]。该研究推动了标签云布局设计的发展,对知识的表示和追溯产生了重要影响,但是仍然存在一些不足,如:样本量少;缺少必要的进一步深入分析。因此,采用标签云对知识进行可视化的问题需要进一步深入研究。
目前复杂知识领域中的知识接口得到了很大发展,但在各知识环境中仍然存在着阻碍其发展的因素。伊利诺伊大学香槟分校的K.L.Barre在其汇报中总结了过去10年间复杂知识领域中分面接口的发展,确定了阻碍发展的两个主要限制:元数据质量和界面设计,指出界面设计中存在的最大问题在于工作重点不清晰。笔者从观察语料中得到的结果表明,分面界面在富有成效和创造性的领域会得到最好的发展[7]。

4 分类、界面及信息构建

长尾理论和悖论广泛应用于信息管理。基于此,来自意大利佩鲁贾外国人大学的L.Rosati在“How to design interfaces for choice: The role of classification in information architecture”报告中介绍了如何设计选择界面以及分类在信息建构中的重要作用。他指出,在经济学中,长尾理论支配着市场,无论是网络环境,还是现实世界,用户面对大量的信息时必须做出选择。如果不能放弃选择的多样性,过量的信息将会产生压力,用户无法做出选择和决策,这就是所谓的悖论。然而,有些原理则表明,选择的压力并非取决于可供选择的数量,主要依赖于组织和呈现选择的方式。因此,选择所存在的矛盾是质的问题,而不是量的问题[8]。在汇报中,他通过具体实例,展示了通过作用于选择本身的架构来对菜单、目录和界面进行改善的一些关键原理。
网络空间不是某个具体地方,而是一个将我们周围世界紧密集成的网络层。瑞典谢尔曼国际商学院的A.Resmini教授在“Ghost in the shell: Navigation, meaning and place-making in information space”中介绍了信息空间中导航、释义和场景模拟之间的关系,并对空间(space)与定位(place)是两个不同概念进行阐释,指出空间是我们对事物具体化理解的根源,是客观的、非个人化的和无差别的。定位涉及到记忆经验和行为,是个人的、主观的、社群共有的。导航则是通过语言对知识进行意义构建和场景模拟的具体呈现过程,是一个具有语义的、抽象的、而不是仅仅由文字表面所表达的概念。它将空间和地点相关知识以个人网格形式进行有意义的重组织,将感知到的碎片重新连接到概念模式中。空间理解是我们自然使用的一种模式,定位(地点)是我们了解世界的一种方式。场景模拟是一种跨渠道体验,由语言将其连续起来,其语法不受几何形式控制,而是受意义控制。作者模拟调查了电影和视频游戏中的语言、文学、漫画、流行元素和日本动漫,并使用了大量的例子来解释从数字化到后数字化的转变。他认为,在对现实的文学表现上,陈旧的表现方式将被一种抽象语法所取代,这种抽象语法在场景模拟和复杂信息环境下的导航中起着关键作用[9]。

5 知识结构的可视化导航

“记忆群岛”来源于古代的“记忆艺术”,描述了人们在古代和中世纪时代如何利用空间化这一概念来增强记忆力。法国皮埃尔与玛丽•居里大学的Yang Bin基于“记忆群岛”层次结构知识的概念,提出一种新的自动制图方法,即以“定位”的方法创建一张虚拟地图并将每个实体关联到地图上的指定区域。首先,描述了知识可视化制图(如本体和分类学的框架)新方法。其次,展示了“记忆群岛“的技术是如何通过信息内容为用户导航,以记住它们的位置并进行检索。在汇报中,他还讨论了这种新方法的设计原则,提出了一个实验原型,以评估“记忆群岛”的心理关联。同时,他还展示了初步的实证研究结果,认为“记忆群岛”有利于非经验用户解决实际浏览和可视化任务,并还指出未来工作的目标应当聚焦于知识可视化地图在其他领域中的运用,如生物学本体、分类等协作可视化以及通过可视化进行学习等[10]。
德国GESIS -莱布尼兹研究所的D.Hienert在以“Exploring semantically related concepts from Wikipedia: the case of SeRE”为题的汇报中以SeRE为例探讨了语义相关的概念。他从维基百科和DBpedia中抽取出既定主题相关实体,对其数据源进行了分析。汇报介绍了对语义相关概念进行计算的具体实现步骤,包括5个流程:查找相匹配的文章;查询术语和分类;计算语义相关度;查询分类信息、缩略图和文章片断以描述与查询项的相关性;计算常用分类,并用实例展示具体的用户导航界面。除了对导航界面设计和实体间语义概念进行计算之外,该研究还通过实证测试了SeRE如何用于查找既定主题的实体及其关联关系,以及如何用分类系统过滤相关信息。最后,作者对采用两种不同工具进行实证研究的结果进行了比较,指出当前采用相关性概念设计浏览器所面临的主要挑战为有意义的自然语言概念关系[11]。
由于信息技术的发展和用户信息需求的变化,纸质文本需要转换成可以转接到移动设备的电子书,因此,简单的个性化知识组织已成为信息组织的重要发展趋势之一,这就使得简单化的知识组织形式变得日益重要。法国巴黎学院的 D.Rodighiero探讨了分类列表在平板电脑上知识分类中的运用以及呈现方式,试图对UDC的发展作出创新性研究。平板电脑上的知识分类基于简单化的设计,需要更多地关注用户,以满足用户需求为出发点。列表是最简单的信息表征方式之一,因此,平板电脑上的分类将以列表的形式呈现。在此基础上,他们创建了互动分类的两种新方式:混合导航和双列视图,保证用户以新的方式使用新的分类知识,并搜索相关知识[12]。在该研究中,列表包含着分类法的语义和合成结构中的导航,创建一个能够管理屏幕旋转和分类处理的先进应用。

6 索引语言、关系和可视化

《中国图书分类词典》是中国大陆各图书馆广泛运用的知识组织工具,由《中国图书馆分类法》和《中国分类词典》整合而成。在实践中,它们共享一个公共数据库,由相同的管理系统进行同步更新。在很长一段时期内,中国分类词表在图书馆编目和索引中起着关键作用。然而,其复杂的知识结构和表达知识内在关系的地图对于终端用户来说却具有隐匿性,迫切需要适应语义网络环境。来自四川大学的Fang Wei等学者基于简单知识组织系统模型,讨论了CCT主题规范数据的语义表征。同时,探讨了用于术语服务平台的Web-native动态语义可视化界面。这将有助于用户了解更多显性和隐性的知识结构,体验更有趣的搜索经历[13]。
  用户在进行知识浏览时,常被淹没于目录索引术语的线性表示中。目前,用户在搜索所需信息时,大多通过主题查询。但是对终端用户和图书馆馆员而言,对主题描述的理解差异会引发许多问题。因此,基于运用可视化技术支持索引和检索的本体,设计一个合适的Web应用程序可以解决这些问题。来自斯洛文尼亚国家大学图书馆的Š .Razpotnik致力于通过索引术语的可视化提升用户浏览效果[14]。适当的工具有助于索引,他们通过标签云和与之相似的可视化工具得到大量检索记录为用户导航,以支持用户高效地、有针对性地查询所需信息。首先,是转换主题词表;其次,以UDC分类号为基础建立层级结构和主题间关系。因此,以主标题为检索词将会得到一组记录,要么是书的封面记录,要么是书目参考和期刊论文的摘要。OPAC新成果呈现的浏览和索引新特征将会提高编目员和终端用户的知识检索和浏览的体验。

7 馆藏搜索与浏览的可视化

  分类为信息术语的系统排序提供了强有力的支持,对检索内容及之间相互关系的可视化产生着重要的影响。文献主题通常由多个概念组合而成,因此,表征内容的分类符号必须是表达多个概念的合成分类号。作为连接两个或多个类的复合分类器,各元素的引用次序影响着排序显示中文档的位置。同时,一个文献通常不只含有一个概念,可以将这些概念确定为基本主题和多个特定主题,基本原则是:首先引用表征基本主题的符号,从而生成一个复合分类号的“有用序列”。因此,通过基本主题与合成分类对信息进行整理、归类、序化,可以推动信息查询相关研究。来自意大利波维利来大学的 C.Gnoli研究了基于基本主题与合成分类的双查询法。此研究结合适当的系统显示结果(将表达被搜索概念的分类号置于前,将表达内在含义的分类置于后)的双查询,提出了一个通用的信息检索方法,并且以巴黎大学目前正在开发的ISKO知识组织文献在线检索界面为基础,进一步讨论这一方法的相关原则[15]。
历史和日常生活数据通常都是通过可视化数据而获取。因此,对可视集合资源(如图片集)的理解要求对其进行细致分类,以便揭示预期的、隐含的关系。众所周知,人工分类任务艰巨而繁琐,而自动分类在性能方面仍存在一定的局限性,因此,最优方法是将自动批量分类与详细的专家注释(人工分类)相结合产生一种新的分类方法。荷兰阿姆斯特丹大学的M.Worring采用自动分析和信息可视化对大图像集合的简单分类进行研究,整合了机器控制的自动分类法与人工分类的优点,从而创造了一种对图像资源进行组织的简单分类法[16]。该汇报展示了先进的可视化如何对分类法产生作用以及此研究的后续探索工作及进程。

8 分类与馆藏元数据的可视化分析

可视化已成为知识组织中重要的一部分,但是随着知识基础设施中技术层面和社会层面的改变,各种本体、分类表和知识序化之间形成了一种相互联系又相互矛盾的局面。在图书馆领域,这种现象表现得尤为突出。对于图书馆员和读者而言,新兴技术使得分类表产生了一些局部变化,特别是开放数据格式和对应用程序编程接口(API)的开发使得图书馆信息系统中的元数据程序化的愿望变得更加强烈。美国哈佛大学元实验室的M.Battles和Y.Loukissas在其汇报中展示了DPLA(美国数字公共图书馆)致力于实现全面访问国家数字科学资源和文化资源的项目,以及取得的卓越成效[17]。由于DPLA将不同机构的数字资源聚集在一起,因此,各机构对其收藏的材料进行组织的不同分类原则有可能会产生联系,甚至会产生冲突。为了解决这一问题,他们使用数据可视化和信息提供者的采访数据识别出DPLA项目本体框架时出现冲突的本质和结构,并挖掘出这些动态变化,为我们展示了关于组织结构和网络设置中知识序化的一些实际变化。
UDC不仅仅是一种历史悠久的分类语言,而且也是一个值得复杂理论关注的复杂认知系统。UDC的基本元素(类目、辅助符号及操作说明)组合而成的字符串实质上体现了复杂网络的概念。该复杂网络是知识序化的关键,保证了对不同人类知识产品表达不同的观点。就这一问题,来自美国密尔沃基威斯康辛大学的R.Smiraglia以“UDC in action”为题做了汇报,他们着眼于来自图书馆的UDC字符串,对其进行研究。主要分析了鲁汶大学图书馆的主题词及OCLC WorldCat的UDC分类号。通过对收集到的数据集和主参考文献集进行比较,运用复杂理论的方法和表示法,深入研究了UDC字符串的长度、不同辅助标志的出现以及UDC类目之间的关系。同时,根据复杂理论对图书馆UDC类目的基本统计进行绘制将有助于推动当前UDC相关研究。他们认为,特定馆藏的特征和重心,对特定馆藏的结构部署可以看作是用户对文献资源的整体基本认识[18]。从知识序化系统可以看出,UDC联合分类号直接反映出UDC的复杂性。因此,基于复杂理论视角对UDC进行研究将是未来值得关注的一个方向。

9 结语

可视化以直观方式表达和传递抽象知识,不仅使知识形象化,为我们提供直观的结果,有助于挖掘显性知识,而且还能够充分揭示知识相互间的内在隐性关系,利于挖掘隐性知识和知识的隐含模式及结构。知识的可视化呈现实现了海量知识的快速、准确搜索,让我们能够快速有效地检索到所需信息。因此,面临着海量的网络资源,知识分类可视化是一种更适用、更有效的知识组织方式,目前成为知识组织理论中一个研究热点。
本次研究会就知识分类的可视化进行了探讨,尤其强调了知识分类可视化目前所面临的挑战及其重要性。同时,通过对传统信息资源和网络信息资源进行可视化的知识组织,各研究者探讨了知识分类可视化的作用以及相较于传统分类法所展现出的优势。在研讨会上,各汇报者展示了知识分类可视化现有的研究成果,提出了在研究成果基础上进一步深入研究所需要进行的后续工作,指明了知识分类可视化未来的研究方向,针对现有研究存在的实际问题及分类可视化的现状提出了针对性、启示性、建设性的建议。
[1]
Cordeiro M I, Slavic A. From the index card to the World City: Knowledge organization and visualization in the work and ideas of Paul Otlet[C]//Proceedings of the International UDC Seminar 2013.Würzburg:Ergon Verlag, 2013:1-42.

[2]
Weingart S B. From trees to Webs: Uprooting knowledge through visualization[C]//Proceedings of the International UDC Seminar 2013. Würzburg: Ergon Verlag,2013:43-58.

[3]
Heuvel C, Smiraglia R P. Visualizing knowledge interaction in the multiverse of knowledge[C]//Proceedings of the International UDC Seminar 2013. Würzburg:Ergon Verlag, 2013:59-72.

[4]
Xia Lin, Ahn J W. Challenges of knowledge structure visualization[C]//Proceedings of the International UDC Seminar 2013. Würzburg: Ergon Verlag, 2013:73-88.

[5]
Manovich L. Looking at one million images: How visualization of big cultural data helps us to unlearn our cultural categories[C]//Proceedings of the International UDC Seminar 2013.Würzburg:Ergon Verlag,2013:89-90.

[6]
Pinède N, Véronique L. How can users get the gist of a taxonomy using tag clouds? [C]//Proceedings of the International UDC Seminar 2013. Würzburg: Ergon Verlag, 2013:105-120.

[7]
Barre K L. Sempre avanti? Some reflections on faceted interfaces[C]//Proceedings of the International UDC Seminar 2013. Würzburg: Ergon Verlag, 2013:91-104

[8]
Rosati L. How to design interfaces for choice: Hick-Hyman law and classification for information architecture[C]//Proceedings of the International UDC Seminar 2013.Würzburg: Ergon Verlag, 2013:121-134.

[9]
Resmini A. Ghost in the shell: Navigation, meaning and place-making in information space[C]//Proceedings of the International UDC Seminar 2013. Würzburg:Ergon Verlag, 2013:135-137.

[10]
Yang Bin, Ganascia J-G. Memory islands: An approach to cartographic visualization[C]//Proceedings of the International UDC Seminar 2013.Würzburg:Ergon Verlag, 2013:137-152.

[11]
Hienert D,Wegener D,Schomisch S. Exploring semantically-related concepts from Wikipedia: The case of SeRE[C]//Proceedings of the International UDC Seminar 2013.Würzburg:Ergon Verlag,2013:153-166.

[12]
Rodighiero D,Michelis G D. The Homer’s list or how classifications can be displayed on tablets[C]//Proceedings of the International UDC Seminar 2013. Würzburg: Ergon Verlag,2013:167-176.

[13]
Fang Wei, Bu Shuqing, Zou Qing. Semantic visualization for subject authority data of Chinese Classified Thesaurus[C]//Proceedings of the International UDC Seminar 2013.Würzburg:Ergon Verlag,2013:191-206.

[14]
Razpotnik Š,Šauperl A. Enhancing user browsing success through visualization of indexing terms[C]//Proceedings of the International UDC Seminar 2013.Würzburg:Ergon Verlag,2013:207-224.

[15]
Gnoli C,Cheti A. Sorting documents by base theme with synthetic classification: The double query method[C]//Proceedings of the International UDC Seminar 2013.Würzburg:Ergon Verlag,2013:225-232.

[16]
Worring M. Easy categorisation of large image collections by automatic analysis and information visualization[C]// Proceedings of the International UDC Seminar 2013. Würzburg:Ergon Verlag,2013:233-235.

[17]
Battles M,Loukissas Y. Data artefacts:Tracking knowledge-ordering conflicts through visualization[C]// Proceedings of the International UDC Seminar 2013. Würzburg: Ergon Verlag,2013:236-243.

[18]
Smiraglia R,Scharnhorst A, Salah A A,etal.UDC in action[C]//Proceedings of the International UDC Seminar 2013.Würzburg: Ergon Verlag, 2013:244-259.

文章导航

/

〈 〉