Pioneering Exploration of AI-Empowered Knowledge Management and Services

Practices and Advances in Assessing AI Literacy: A Synthesized Review of 69 Empirical Studies

  • Ma Yunzhe 1 ,
  • Tang Qiong , 1, 2
Expand
  • 1. School of Information Management, Sun Yat-sen University, Guangzhou 510006
  • 2. National Institute of Cultural Heritage and Cultural Development, Sun Yat-sen University, Guangzhou 510006
Tang Qiong, Professor, PhD, Doctoral Supervisor, E-mail:.

Ma Yunzhe, Master’s Candidate

Received date: 2025-12-04

  Online published: 2026-02-28

Abstract

[Purpose/Significance] As AI technologies become deeply embedded in social life, AI literacy has emerged as a fundamental competency for the public in the intelligent era. This study aims to systematically review the progress of empirical research on AI literacy assessment worldwide, providing reference and insights for future studies. [Method/Process] Following the principles of systematic review, this study selected 69 empirical studies on AI literacy assessment as the analytical sample. Through a comprehensive examination of the included literature, descriptive characteristics were summarized, and key elements of AI literacy assessment—including assessment targets, assessment dimensions, development and validation of assessment tools, influencing factors, and research limitations—were systematically analyzed. [Result/Conclusion] Existing research shows that AI literacy assessments primarily target the general public, students, and educators. Core assessment dimensions commonly include cognition, application, evaluation, and ethics. The assessment process generally involves sample selection and the development and validation of assessment tools. Empirical findings indicate that AI literacy levels are influenced by variables such as gender, age, nationality, and educational background. Current studies still exhibit limitations regarding assessment tools, sample characteristics, and assessment methods, suggesting the need for further refinement in future research.

Cite this article

Ma Yunzhe , Tang Qiong . Practices and Advances in Assessing AI Literacy: A Synthesized Review of 69 Empirical Studies[J]. Knowledge Management Forum, 2026 , 11(1) : 50 -60 . DOI: 10.13266/j.issn.2095-5472.2026.005

以智力革命为标志的第四次科技革命是再一次提升社会全要素生产率的重要契机,人工智能(artificial intelligence, AI)依靠其强大的机器学习能力,不仅改变了人们的生产、生活,也深刻影响了人类社会的思维方式与治理模式[1]。在AI席卷而来的浪潮中,人与社会环境互动的能力与角色被改变,社会成员能否正确、合理地理解和使用AI,不仅关系到个人在社会中的学习力、适应力和竞争力,也逐渐成为弥合数字鸿沟、促进社会公平的重要前提,而一个社会所具备的整体AI素养水平则关乎国家在新一轮科技革命和产业变革中的核心竞争力。2023年以来,大量生成式AI以“低门槛”的特点迅速涌入公众视野,随着联合国教育、科学及文化组织(United Nations Educational, Scientific and Cultural Organization, UNESCO)、经济合作与发展组织(Organisation for Economic Co-operation and Development,OECD)等国际专业组织陆续发布AI能力框架[2-3],构建科学、系统的AI素养测评体系已成为学界关注的重要议题。然而,现有研究中AI素养测评的维度与形式、测评工具的开发逻辑、实证调查的结论等仍存在一定差异。鉴于此,有必要对AI素养测评实证研究进行系统梳理与分析,为今后AI素养测评工具的开发与应用提供借鉴。本研究采用系统综述法对该领域的现有研究进行归纳,核心聚焦以下4个问题:AI素养的测评维度为何?AI素养的基本测评流程是什么?AI素养水平的影响因素有哪些?现有研究存在哪些局限性?

1 AI素养的内涵及测评研究的兴起/Emergence of research on the conceptual connotation and assessment of AI literacy

在传统纸质出版物时代,“素养”主要用于描述个体在阅读和写作中所需具备的基本知识与技能[4]。随着数字技术的迅速发展,“素养”的内涵不断拓展,早已超越传统的读写能力,逐渐演变为适应技术变革所需的一系列综合能力[5],信息素养、数字素养和媒介素养等概念曾在不同技术发展阶段成为学界关注的热点。然而,当AI技术不断嵌入人们的生活场景,传统素养框架已难以回应智能时代的能力需求,AI素养的概念应运而生。
学者们对AI素养的认识大致可分为两个流派。一类学者认为AI素养是数字素养的组成部分,将其视为数字素养在AI技术背景下的延伸,认为AI素养是对数字素养内涵的补充与边界的拓展[6-7]。另一类学者则主张将AI素养视为一个相对独立的新概念。数字素养通常被界定为数字时代人们在信息获取、技术使用、伦理判断与创新实践等方面应具备的知识、技能、价值伦理与创造力[8],其内容和结构与AI素养存在一定的相似性,两者之间也存在显著的相互影响关系[9]。从概念发展的逻辑上讲,数字素养可以被视作AI素养的基础或前置条件[10],但AI素养并不等同于数字素养。二者差异的根源在于技术承载的特征不同。与传统数字技术相比,AI技术更具拟人化的特征,在技术的使用和评估过程中表现出了更加复杂的社会化属性[11]。用户与AI系统进行交互时,不仅需要理解设备的软硬件运行逻辑,还要思考交互过程中需遵循的社会规范,平衡人类社会中的伦理观念与AI技术间的关系[12-13]。这些新要求超出了数字素养所能涵盖的范围,体现了将AI素养视作独立概念的必要性。
尽管学界在AI素养的渊源及其与数字素养等概念间的从属关系上存在分歧,但AI素养的基本含义已形成相对明确的共识。AI作为计算机领域的“常青树”议题,其研究起点可追溯至20世纪50年代,但彼时技术尚未成熟,普通人难以接触和使用AI,因此AI素养这一概念并未产生。直到2016年,随着AI技术逐渐渗透至教育、医疗、商业与日常生活等场景[6],“AI素养”一词才逐渐进入学者视野。M. Kandlhofer等率先定义AI素养,认为它是个体理解与AI相关的基本知识和概念所需具备的能力[14]。自此,关于AI素养的定义不断丰富和扩展,呈现出多元发展的趋势。目前被广泛接受的定义来自D. Long和B. Magerko在2020年发表的会议论文What is AI Literacy? Competencies and Design Considerations。他们将AI素养界定为一项能力组[10],即个人能够批判性地评估AI技术,与AI系统能够有效沟通、协作,并在学习、工作、生活等不同情境中合理地使用AI工具。具备AI素养的人应能够回答诸如什么是AI、AI能做什么、AI如何工作、应如何负责任地使用AI、人们应如何看待AI等问题。
AI素养的概念产生于AI渗入人们生活的现实背景,因此AI素养主要面向非专业人群,即那些在学习或工作中并未直接接触AI,也未接受系统AI训练的普通人[15-16]。换而言之,AI素养强调的是公众在智能时代应具备的基础性认知、评估、应用、判断能力,而非AI技术人员所需的算法开发、系统设计等专业能力。
随着AI素养概念的明晰,学者们开始关注不同群体所具备的AI素养水平,并试图探究影响AI素养的关键因素,大量以AI素养测评为主题的实证研究陆续涌现,这些研究为提升公众的AI素养水平、促进个体更好地理解与驾驭AI提供了理论参考,是本研究后续分析所依托的重要样本。

2 研究样本/Research samples

2.1 样本文献的收集

本研究采用系统综述法对AI素养测评领域的实证研究进行全面的梳理与分析,在文献收集阶段主要包含构建检索策略和明确文献遴选标准两个步骤。

2.1.1 检索平台的选择

由于AI素养测评研究分布于教育学、心理学、社会学、图书馆学等多个学科领域,具有明显的跨学科特征,因此本研究选择综合性较强的数据库作为检索平台。中文文献通过中国知网进行检索,外文文献主要从Web of Science数据库进行收集。

2.1.2 检索式的构造

本研究围绕“AI素养”和“测评”两个核心概念选取关键词并构造检索式。AI素养通常被视为个体在理解、使用、评估AI技术时所需的一组综合性能力[10],因此在检索相关研究时,其对应的关键词并非单一固定。例如在特定情境下,研究者会使用“AI胜任力”一词来指代某一领域从业者在专业活动中表现出的、能够促进绩效的AI能力。鉴于此,本研究针对“AI素养”这一核心概念所匹配的中文检索词包括“AI素养”“AI胜任力”“AI能力”“AI素质”(上述检索词均包括AI的中文译文形式“人工智能”),与之对应的英文检索词有“AI literacy”“AI competencies”“AI competence”“AI capability”“AI skills”(上述检索词均包括AI的全称形式“artificial intelligence”)。关于核心概念“测评”,本研究选取的中文检索词为“测评”“测量”“评估”“评价”“测试”“量表”“问卷”,与之对应的英文检索词有“assessment”“measurement”“scale”“questionnaire”“evaluation”“survey”“instrument”。两核心概念内的检索词使用布尔逻辑运算符“OR”连接,核心概念间使用“AND”连接,检索方式选择主题检索。

2.2 文献的筛选

截至2026年1月5日,依照检索式,排除重复文献,本研究首轮共检索出相关文献10 612篇,其中外文文献10 571篇,中文文献41篇。之后依据研究目的,从文献主题、内容相关性、研究方法及数据可获取性等方面制定文献筛选标准。
(1)文章需要发表在同行评议期刊或国际会议论文集中,外文文献收录于Web of Science核心集以确保文献质量,由于中文文献数量较少,故不设限期刊等级,并包括博、硕士学位论文。
(2)研究主题应与AI素养密切相关,侧重AI素养水平的测量,至少报告一项AI素养测评工具的测量学属性[17]。
(3)研究类型应为实证类研究,AI素养的测评工具需要被验证使用,理论性文章与综述类文章需被排除。
(4)文献数据需完整、可获取,外文文献的撰写语言为英文。
依据文献筛选标准,本研究对检索结果的标题和摘要进行了逐一遍历,详细筛选流程见图1,最终确定69篇文献作为述评的分析样本,其中外文文献42篇、中文文献27篇。
图1 样本文献的筛选流程

Figure 1 Screening process of the sample papers

2.3 样本文献的描述性特征

2.3.1 时空分布

样本文献的时空分布见表1。从发表时间来看,纳入本研究的中英文文献均最早发表于2022年,整体数量呈持续递增趋势。从外文样本文献通信作者的地域分布来看,研究力量主要集中于亚洲(17篇)和欧洲(12篇)。
表1 样本文献的时空分布

Table 1 Spatiotemporal distribution of sample papers

时间 外文文献篇数 中文文献篇数
2022年 1 1
2023年 5 6
2024年 16 2
2025年 20 18

2.3.2 测评对象

已有文献的测评对象主要可分为3类:①社会公众(8篇),主要指成年人中的非专家群体;②学生(42篇),主要包括中小学生、大学生和高职院校学生;③教育工作者(9篇),涵盖中小学教师和高校教师。此外,部分研究还涉及其他特定群体,如幼儿(3—6岁)、医护工作者、图书馆员等。

2.3.3 测评形式

在已有研究中,AI素养测评主要采用受访者填写自陈式量表的方式进行,共涉及59篇文献,接近样本总量的85.51%。此类量表均为李克特量表,量表级数存在差异,其中以五分制和七分制最为常见。部分研究因加入“完全不了解”或“无法作答”等选项(通常赋值为0),量表呈六分制[18]。此外,也有学者使用包含“是/否”两类选项的二分制量表,以减少受访者的填答负担,然而测评结果表明,与传统的五分制量表相比,二分制量表的可靠性较低[19]。
其余研究的测评方式主要分为两类。①他人代填问卷。例如在调查幼儿的AI素养水平时[20],由于幼儿尚不具备独立完成量表的能力,需要由父母代为填答。尽管填答者不同,这类研究本质上仍是通过量表对受测者的AI素养进行评估。②采用客观知识类测评工具评估AI素养[21]。这类测评工具的开发难度更大,设计过程更为复杂,在明确测评维度的基础上,需要设计与各维度相对应的试题。在测评工具的验证阶段,除信效度检验外,还需进一步评估试题的难度、区分度等特征,以确保测评结果的准确性。

3 AI素养的测评工具开发与验证路径/Development and validation approaches of AI literacy assessment tools

3.1 测评对象的选取

现有研究的测评对象主要包括社会公众、学生和教育工作者3类。在明确报道抽样方法的文献中,研究对象的选取以便利抽样和整群抽样为主。例如J. Delcker等采用便利抽样,选取了480名职业学校教师作为AI素养的测评对象[22];C. C. Cheng等则以班级为抽样单位,在4所小学中随机抽取若干五年级班级,对班级内所有学生的AI素养水平进行评估[23]。此外,亦有学者采用滚雪球抽样,在便利抽样的基础上进一步拓展样本。例如E. Hobeika等通过Google创建了一个可分享的在线量表链接,研究者首先邀请其社交网络中的大学生作为便利抽样的样本,随后再由这些学生将链接转发给亲友,以扩大样本规模。滚雪球抽样的模式依托社交关系中的信任机制,有助于提升潜在受访者的参与意愿,在非资助类研究中往往能够取得较好的招募效果[24]。
在本研究收集的69项实证研究中,AI素养测评的样本规模差异显著。样本数量不足100的研究共有5项,占比约7.25%。这类研究通常聚焦于特定群体,如图书馆员[25]、医学生等[26],考虑测评对象的招募难度,样本规模相对较小。样本数量超过1 000的大型实证研究共有13项,占比18.84%,主要来自亚洲和欧洲地区,测评对象多为社会公众和学生群体。由于样本量较大,这类研究往往将样本分为两部分:一部分用于测评工具的开发与预测试;另一部分用于正式测评[20]。其余研究的样本规模主要集中在300—700人区间。

3.2 测评维度的确定

在开展AI素养测评前,必须构建与测评对象特征相匹配、契合测评目的的AI素养框架。通过明确AI素养的核心要素和不同要素之间的层级关系,将AI素养这一抽象概念有效转化为可测量的具体构念。后续AI素养测评工具的开发将与该框架内容相呼应,使得测评题项能够准确、真实地反映研究者预期的AI能力结构。
研究者们在构建AI素养框架时普遍参考具身认知理论、情境学习理论、布鲁姆学习目标分类法等[27-28],但本研究在系统梳理样本文献后发现,不同研究者由于文化环境、研究目的和学科背景的不同,其构建的AI素养框架在维度表述上存在显著差异。例如有学者将“技术理解”作为一个综合维度,以概括个体与AI在协作过程中需要具备的知识性与理解性能力[29],但部分学者将这一概念拆解为“AI知识”和“AI态度”两个细分维度[30];此外也有学者用“思维”这一相对广义的概念概括“AI评估”“AI伦理”“AI态度”等方面的内容[31]。鉴于此,本研究对样本文献中涉及的AI框架要素进行提取、归纳与整合,对概念内涵高度相似的维度予以合并,对外延过于宽泛的维度进行适当拆解,形成更加清晰的AI素养框架体系。经整理发现,现有研究所遵循的AI素养框架大多围绕4项基本核心维度展开:AI认知、AI应用、AI评估和AI伦理,各核心维度对应的代表性量表题项如表2所示。
表2 核心维度对应的代表性题项

Table 2 Representative items corresponding to the core dimensions

核心维度 代表性题项
AI认知 我认为AI有能力提高教学质量和效果[32]
AI应用 我可以评估所在领域的问题是否适合以及是否有必要采用AI方法加以解决[27]
AI评估 我可以指出AI在解决问题过程中存在的弱点和不足[26]
AI伦理 我认为人们在使用AI系统时应对其输出结果负责[23]

3.2.1 AI认知

认知维度强调个体对AI的基本理解,通常指在使用AI产品或服务时识别并理解AI技术的能力[33]。这一维度要求用户具备一定的AI基础知识,能够感知AI的存在并识别AI工具及其生成内容,对其运行逻辑形成基本认知。同时,用户还应能够发掘AI在现实生活中的典型应用场景并洞察其使用影响[34]。

3.2.2 AI应用

应用维度强调个体能否在学习、工作、生活场景中有效使用AI工具以解决实际问题。这一维度是将理论性的AI知识融入真实场景的重要步骤[27],是AI素养中最具操作性的部分。具体而言,个体应具备挑选使用合适AI工具的能力、与AI沟通协作的能力、优化提示词的能力以及管理和整合AI系统的能力等[33,35]。

3.2.3 AI评估

评估维度强调个体在面对AI生成内容时的判断力,随着ChatGPT、Gemini等大语言模型的出现[6],生成式AI已成为人们日常生活中最常接触的AI类型。然而由于算法黑箱、AI幻觉、算法歧视等问题的存在[33],关于AI使用风险的报道不断涌现,这使得用户必须具备对AI生成结果进行评价的能力,以便批判性地使用AI生成内容[36]。

3.2.4 AI伦理

伦理维度强调个体使用AI时应具备的责任意识、价值判断,是负责任开发和使用AI工具的道德准则[37],也有学者将伦理维度解释为个体在使用AI时应遵循社会规范[21],避免破坏既有的社会规制或价值秩序。与传统数字技术相比,AI技术最大的区别在于其拟人化的技术特点与社会属性,因此伦理维度的要素也成为区分AI素养与传统数字素养的重要特征,证明其并非数字素养的一个子集[38-39]。

3.2.5 其他维度

除上述4项核心维度外,部分学者还将一些非普遍性的AI素养要素纳入框架。例如A. Carolus等将“自我管理”单独列为一个维度,强调在与AI交互时对自身情绪状态的调节能力,以及持续学习前沿技术的能力[40]。T. K. F. Chiu等在测评教师AI素养时参考UNESCO发布的AI Competency Framework for Teachers,引入人本思维和专业参与,对伦理维度进行补充的同时,强调使用AI工具发展自身专业能力的重要性[41]。S. Grassini在构建感知AI素养测评框架时引入了“创新”维度,用于衡量个体在新情境下使用AI技术时的创新思维与适应能力,旨在评估其对自身捕获AI新机遇的能力与信心[5]。此外,亦有学者在沿用知识、认知、应用等通用维度的基础上,结合不同专业领域的特定需求,增设“专业AI素养”维度,形成适用于医学、工程、教育领域的综合测评矩阵[6]。

3.2.6 核心维度的逻辑关系分析

AI素养测评研究中的维度设置与AI素养的概念内涵相呼应,在逻辑构成上并非简单并列,而是呈现螺旋上升式的层级结构,凸显了从认知理解到实践应用,再到伦理反思的递进体系。认知是技能应用的前提,当用户理解了AI的原理、概念、可能性与限制,具备驾驭AI的思维方式,才有能力应用AI帮助自己解决现实中的问题,AI应用维度正是认知理解向实践领域的延伸。而评估维度既是对AI应用成效的判断,也是一种更高层次的认知要求。用户除了要掌握在实践中使用AI的方法,更需要具备辨识错误、偏差与风险的能力,从而避免对AI的盲目依赖。这种基于实践的评估判断过程,会进一步加深用户对AI能力、价值、适用场景的认知。伦理维度则在整体结构中发挥着统摄与规范的作用,其贯穿应用与评估的全过程,在具体操作中用户将不断面临着伦理抉择。最后,人们对AI的认知并非单纯的技术学习,而是被个体所持有的伦理立场所牵引着的,人们在使用AI时变化的伦理反思会进一步引导其对AI的认知,这是价值取向驱动的AI再认识的过程,这种伦理反思在未来会不断影响人们对AI的学习和使用。

3.3 测评工具的开发

学者们通常根据所采用的AI素养框架确定测评维度,并据此开发相应题项以构建AI素养测评工具。分析样本文献发现,不同研究在工具开发阶段的侧重点存在差异。早期研究主要侧重题项的编制,即从无到有地开发测评工具;而在后期研究中,由于已经出现了经过信效度检验的成熟测评工具,研究者往往不再需要从零开始开发题项,只需要选用或参考已有工具测评目标群体的AI素养水平即可。这两类研究在测评工具的开发流程上有所不同,前者需要在借鉴既有文献的基础上生成题项,随后进行测试以验证其可用性。后者主要关注如何对成熟量表的题项进行调整,包括语言翻译和措辞修正,以适应本土文化需求。

3.3.1 自编测评工具的开发

自编测评工具的开发主要包括初始题库建立、基于专家经验的题项筛选和基于受访者感知的题项筛选3个步骤。
(1)初始题库的建立。研究者通过系统梳理已有文献,收集可直接迁移使用的题项[42],同时多位研究者通过头脑风暴的方法,结合自身研究经验,参照AI素养框架中的内容要素进行启发式联想,在充分考虑题项相关性、歧义性与可解释性的基础上,生成一批新题项[31],进而形成AI素养测评工具的初始题库。此外,少数研究还尝试借助生成式AI辅助题项的生成与扩展[35]。
(2)基于专家经验的题项筛选。多数研究采用德尔菲法对初始题库进行评估,通常邀请两名以上相关领域的专家参与。研究者通过发放专家咨询问卷、开展结构化访谈或组织焦点小组讨论的方式,要求专家从重要性、代表性、明晰性、一致性和充分性等维度对题项进行审查。在充分听取专家意见的基础上,对题项进行删改,进一步提高测评工具的内容效度[19,27,43]。
(3)基于受访者感知的题项筛选。部分研究在专家咨询后还会邀请一定数量的潜在受访者审阅题项,并反思自身在相关情景中的代表性事件[44],就题项所属维度或测评内容提出修改建议。该步骤尤其强调从受访者视角对题项的可读性进行检验[42,45],要求题项表述言简意赅,避免使用晦涩的专业术语,使题目符合受访者的认知状况,尽可能减轻受访者的答题负担,提高测评工具的可用性。

3.3.2 成熟测评工具的本土化

由于成熟测评工具的题项语言可能与受访者的母语不一致,因此在跨文化迁移测评工具时,首要任务是对题项进行准确、规范的翻译,进而开展本土化应用。研究者常参考国际测验委员会(International Test Commission, ICT)发布的《语言与文化多样化人群大规模测评指南》来组织翻译工作[46-47]。以一项来自土耳其的研究为例,A. D. Topal等使用M. C. Laupichler等开发的非专家AI素养测评量表评估当地一所大学本科生和研究生的AI素养水平。在工具迁移过程中,研究者首先邀请4位精通土耳其语和英语的专家将英文原版量表翻译为土耳其语,并就存在分歧的部分充分讨论、达成一致。随后,再邀请两位教育学领域专家审阅译本,针对措辞不当或表达不清之处进行修正。翻译工作初步完成后,研究者又邀请两位双语专家进行回译,将土耳其语版本重新翻译为英文,并与原始英文量表进行逐项比对,以确认译文未偏离原意。最后,研究者组织一定数量的潜在受访者对量表进行试答,收集他们对难以理解或表述不明确的题项的反馈,结合意见进行最终修订,完成测评工具的本土化处理[29]。

3.4 测评工具的验证

研究者通常会使用初步开发的测评工具开展预调研,以检验其测评成效[48]。对于量表类工具而言,主要是对其聚合效度、区分效度、模型拟合程度进行检验[49]。检验过程通常包括探索性因子分析和验证性因子分析两个步骤[35-36,50]。前者首先计算KMO值并进行Bartlett球形检验,以验证变量间的相关性,随后采取主成分分析法进行因子抽取并完成因子旋转。后者基于结构方程模型,帮助研究者判断量表结构和数据的拟合程度,常通过标准化因子载荷、平均方差提取量(AVE)、潜变量相关系数等判断量表的聚合效度和区分效度,进一步验证测评工具的结构合理性。
客观知识类测评工具通常以单选题或判断题的形式呈现,每个题目仅设置一个正确答案,不同题目间的排列组合对应AI素养框架中的不同维度。这类工具在进行结构效度检验之外,还需评估题目的难度与区分度,以判断其有效性。在现有研究中,研究者多采用项目反应理论(item response theory, IRT)中的两参数逻辑模型(two-parameter logistic model, 2PL)对题目的质量进行分析[21,45]。项目特征曲线(item characteristic curve, ICC)可以有效反映题目的难度和区分度:曲线向右偏移意味着难度增加,曲线越陡峭题目的区分度越好。此外,部分研究还会参考信息函数和项目信息曲线(item information curve, IIC)评估题目在不同能力水平上的测量精度[51]。

4 AI素养的关键影响因素与作用机制剖析/Analysis of key influencing factors and mechanisms of AI literacy

研究者在使用经过验证的AI素养测评工具时,通常还会同步收集受访者的人口学特征资料,并通过多元统计分析检验这些变量是否对AI素养水平产生影响。

4.1 性别的影响

关于性别是否影响AI素养水平,现有研究尚未形成统一结论。部分研究显示,男女之间存在显著差异。例如,S. Ma等针对中国大学生的调查发现,男性整体AI素养水平高于女性,且在认知、应用与评估维度差异更为明显[50]。类似的结论也在其他年龄阶段和文化背景的研究中得到支持[23-24]。
学者们普遍认为,AI素养中的性别差异与社会环境和个体自我认知密切相关。长期以来,数字技术、AI技术被打上“男性优势”的标签,成为一种社会刻板印象。这种观念也会逐渐影响女性的自我认知,使其自我效能感不断降低,在使用AI工具时缺乏自信,进而削弱持续学习意愿,阻碍女性在AI环境中的成长与发展[52-53]。在自陈式量表测评中,这种刻板印象还可能影响男性作答的真实性,他们可能为了符合社会期望而倾向于高估自己的AI能力,导致测评结果发生偏差[5]。另一方面,教育机会的不均衡也是造成性别差异的重要因素[54]。在部分地区,由于经济水平、教育政策或文化传统等影响,女性接触新技术或接受技术教育的门槛显著高于男性,这导致其在学习AI知识、技能的过程中处于劣势[46]。
然而也有研究表明,性别并非AI素养水平的显著影响因素[19,26,41,46],甚至在态度、认知等维度上女性的表现要优于男性[25],在低年龄组(如幼儿和小学生)中,也存在女性AI素养整体水平高于男性的情况[51,55]。更进一步研究显示,尽管男性在初始阶段的AI素养水平通常较高,但随着AI培训课程的推进,两性之间的差距会逐渐缩小[56]。而女性在信息细节感知、知识分享等方面的优势,使其在某些学习情境中的学习效果优于男性[31]。

4.2 年龄的影响

部分研究验证了年龄对于AI素养水平的影响。在儿童阶段,AI素养水平与年龄通常呈正相关关系。例如,J. Su在评估中国香港地区幼儿园儿童的AI素养水平时发现,6岁儿童的评分(13.33分)显著高于4岁(5.63分)和5岁(8.56分)儿童[51],E. Uluğ等在土耳其的研究也得到了类似结论[46]。在成年群体中,H. M. H. Mansoor等发现30岁以上学生的AI使用意愿显著高于25—30岁学生[18];E. Uluğ等对医护工作者的调查表明,21—26岁群体的AI素养水平显著高于38—55岁群体。从世代视角来看,Z世代对AI的熟悉度明显高于X世代和Y世代[46]。

4.3 国籍的影响

部分跨区域研究表明,不同国家和地区的受访者在AI素养水平上存在显著差异。M. Rožman等对克罗地亚、斯洛文尼亚和印度三国大学生的比较发现,克罗地亚学生在AI基础知识方面表现最佳,印度学生在AI操作技能上更为熟练,而斯洛文尼亚学生在上述两个方面均略逊一筹[57]。H. M. H. Mansoor等的研究显示,在马来西亚、埃及、印度和沙特阿拉伯的大学生样本中,马来西亚学生的AI素养水平最高,印度和沙特阿拉伯次之,埃及学生的AI素养水平相对较低[18]。在阿拉伯语地区的样本比较中,E. Hobeika等发现摩洛哥大学生的AI素养水平最高,其次为巴勒斯坦、沙特阿拉伯和黎巴嫩[24]。

4.4 教育背景的影响

在大学生群体中,不同专业背景的学生往往表现出差异化的AI素养水平。通常理工科学生在AI知识、技能及使用意愿方面优于人文社会科学专业的学生[56]。此外,一些研究还探讨了学业成绩对AI素养的影响。AI使用意愿与学业成绩通常呈正相关,但成绩低迷的学生可能更依赖AI完成学业任务,因此在操作技能层面的表现可能更优。然而,这些学生往往缺乏结构化或批判性的交互方式,这使得他们在评估与伦理等维度上的表现可能较差。相比之下,成绩较好的学生使用AI工具更为谨慎,将AI视为辅助资源而非完成学业任务的主要手段,具有更强的批判性思维,这有助于他们未来AI素养水平的持续发展[18]。
其他群体的研究表明,受教育水平是影响AI素养的重要因素。M. T. Soto-Sanfiel等发现,公众受教育程度越高,AI素养测评得分越高[19]。S. R. Sharifabadi等的研究也表明,硕士学历的图书馆员在认知、技能和使用态度等维度均高于学士学历的图书馆员[25]。此外,父母的教育程度也会影响子女的AI素养,但现有研究结论并不一致。E. Uluğ等认为,父母受教育程度越高,孩子的AI素养水平越高[46]。但X. B. Xiong等则发现,受教育程度较低的父母出于补偿心态,反而使子女在幼儿阶段更频繁地接触智能设备;相反,受教育程度较高的父母往往会更严格地控制子女接触智能设备的时间,这可能导致孩子早期阶段的AI素养水平相对落后[20]。

4.5 其他影响因素

(1)数字素养水平。I. Tenberga等的研究发现,教师的数字素养水平与其AI素养水平显著正相关。能够系统、有效地使用数字资源与设备的教师,往往也能熟练运用AI工具[58]。
(2)使用经验。L. Xu的研究表明,AI使用经验对学生在外语写作中发展AI素养具有关键作用[30]。A. T. Gokce等同样证实,对于大学生而言,AI技术的使用频率会显著提升其AI素养水平,尤其在“评估”和“应用”维度的影响更为明显[56]。
(3)工作岗位。B. Y. Kiremit在医护工作者中的调查显示,放射科医生的AI素养水平显著高于其他科室的医生[59]。S. R. Sharifabadi则发现,高校图书馆员在AI技能、态度和认知等方面的表现优于公共图书馆员,但公共图书馆员在对AI优势的理解方面表现得更为突出[25]。

5 现有研究存在的局限性分析/Analysis of the limitations in existing research

5.1 测评工具的局限性

部分学者指出,开发测评工具时,难以确保全面覆盖AI素养的内涵,因此测评维度或要素存在遗漏的可能[7,50]。这一问题的产生往往与研究者在界定AI素养内涵时所采用的方法密切相关。当前研究多通过借鉴既有文献并结合专家共识,以“滚雪球”的方式构建AI素养的内涵维度,该方法在一定程度上能够适配当下AI技术的主要特征与典型应用场景。然而AI技术本身仍处于快速发展、迭代的阶段,使用场景亦在不断拓展,这种基于既有经验的构建方法难以及时回应技术发展所催生的新的能力要求,从而导致测评工具存在一定的理论局限。此外,在采用德尔菲法生成题项时,专家自身经验与知识结构的局限也可能影响维度构建的完整性[36]。迁移成熟量表时,题项翻译不准确同样会影响受访者对题意的理解,从而影响测评结果的可靠性[57]。

5.2 测评样本的局限性

测评样本层面,一些研究受制于现实条件,样本规模较小,调查对象多集中于单一地区或单一文化背景,研究结论的准确性与多元文化背景下的代表性受到制约[20,48,60]。未来需扩大调查范围,尤其加强跨区域、跨文化的样本采集,提升测评工具在不同制度与文化背景下的外推性。另一方面,样本结构失衡亦是现有研究中存在的普遍问题,包括性别比例不均[59]、国籍或文化背景单一[43]、年龄跨度过大或过小[27,48]、职业分布单一[59]、受教育程度过于集中等[46]。此外,亦有学者反思便利抽样与滚雪球抽样代表性不足的问题[24],例如I. Tenberga等建议采用分层抽样以覆盖不同受教育程度与学科背景的教师,从而提升研究结论的代表性[58]。

5.3 测评形式的局限性

当前研究多采用自陈式量表测评AI素养,但其结果容易受主观意识、社会期望等因素的影响,可能导致受访者高估自身AI素养水平或按照社会期望作答,进而导致数据真实性受到质疑[24,35-36,50]。未来研究需要通过参与观察、访谈等方式获取定性资料[23],以弥补单一量表数据在解释效力上的不足[20]。客观知识类测评可以在一定程度上弥补自陈式量表的局限性,使获取的数据更加客观,但也存在对高水平或低水平受访者能力识别乏力的问题,未来需要开发更多适配不同AI素养水平群体的测评工具[31]。

6 结语/Conclusion

随着AI技术不断融入人们的工作、生活与学习场景中,AI素养已成为智能时代每个社会成员不可或缺的关键能力。本研究基于69篇国内外实证文献,从测评维度、测评流程、影响因素、研究局限等方面进行了系统梳理,旨在呈现AI素养测评研究的整体进展并为未来发展提供参考。
在测评维度方面,现有研究普遍围绕认知、应用、评估和伦理四大核心维度构建AI素养框架,同时在特定情境下扩展出创新、自我管理等维度作为补充。测评流程主要涉及样本选取和测评工具的开发与验证。研究样本多通过整群抽样、便利抽样及在此基础上的滚雪球抽样获得。测评工具开发方面,自编工具主要包括初始题库建立、基于专家经验的题项筛选、基于受访者感知的题项筛选;而迁移成熟量表则重点关注翻译准确性与跨文化测评的适配性。对于客观知识类测评工具的验证,除传统内容效度与结构效度检验外,还要重点关注题项的难度与区分度。影响因素方面,有研究验证了性别、年龄、国籍、教育背景等变量对AI素养水平的影响,但结论并不统一。此外,现有研究仍存在若干局限:其一,AI素养框架要素并未形成共识,研究可能遗漏关键维度;其二,样本规模与结构存在局限,研究结论存在代表性不足的问题;其三,测评形式相对单一,过度依赖自陈式量表,易受社会期望及主观意识影响。
总体而言,AI素养测评研究正在经历快速发展阶段,自2023年起,研究文献数量增长迅速,但在此基础上,仍有若干问题亟待进一步深入探讨。
(1)构建适应AI技术演进的动态测评体系。当前AI素养测评多以静态的既有文献和专家共识作为测评工具开发所依靠的能力框架,但AI技术的迭代与适用情景的拓展将不断产生新的AI素养需求,未来研究有必要探索可动态更新的AI素养测评框架,以提升测评工具对技术发展的适应性。
(2)提升研究样本的多元性、代表性与动态性。除进一步扩大测评样本规模外,还需要将样本类型延伸向更多社会群体,如公务员,企业员工等;在同一群体内部尽可能实现精细分层,开发适用于不同领域与人群的针对性测评工具,探索AI技术使用者在能力结构、水平上的差异特征。测评样本的选取方面,需要有更多的实证研究构建覆盖不同国家、地区与制度环境的样本体系,加强跨文化背景的验证,关注价值观、教育制度、经济水平、技术基础设施等因素对AI素养的影响。同时应加强对被测者的纵向追踪,观察其AI素养水平在时间维度上的变化。
(3)实现测评结果的有效应用。现有研究的落脚点多为测量数据的比较,测评结果向提升策略的横向转化效率不足,未来有必要加强测评与教育干预之间的联动,检验不同类型AI素养提升策略的实际成效,并将测评成果应用于公共政策制定、教育战略规划、人才考核与培训、各层次教育内容拓展之中[47]。通过构建更加科学、包容、更具前瞻性与针对性的AI素养测评体系,推动人类智慧与AI智能的协同发展。
[1]
赵益民, 彭雪琴, 寸国美. 人工智能素养的内涵、结构和评价体系[J]. 图书情报工作, 2025, 69(13): 83-93.

ZHAO Y M, PENG X Q, CUN G M. Artificial intelligence literacy: connotation, framework, and evaluation system[J]. Library and information service, 2025, 69(13): 83-93.

[2]
OECD, Commission European. Empowering learners for the age of AI[EB/OL]. [2026-01-04].

[3]
UNESCO. Artificial intelligence and digital transformation: competencies for civil servants[EB/OL]. [2026-01-04].

[4]
McMILLAN S. Literacy and computer literacy: definitions and comparisons[J]. Computers & education, 1996, 27(3/4): 161-170.

[5]
GRASSINI S. A psychometric validation of the PAILQ-6: perceived artificial intelligence literacy questionnaire[C]//Proceedings of the 13th Nordic conference on human-computer interaction. New York: ACM, 2024:1-10.

[6]
KNOTH N, DECKER M, LAUPICHLER M C, et al. Developing a holistic AI literacy assessment matrix–Bridging generic, domain-specific, and ethical competencies[J]. Computers and education open, 2024, 6:100177.

[7]
NG D T K, WU W, LEUNG J K L, et al. Design and validation of the AI literacy questionnaire: the affective, behavioural, cognitive and ethical approach[J]. British journal of educational technology, 2024, 55(3): 1082-1104.

[8]
CALVANI A, FINI A, RANIERI M. Digital competence in K-12. Theoretical models, assessment tools and empirical research[J]. Anàlisi, 2010(40): 157-171.

[9]
CELIK I. Exploring the determinants of artificial intelligence(AI) literacy: digital divide, computational thinking, cognitive absorption[J]. Telematics and informatics, 2023, 83:102026.

[10]
LONG D, MAGERKO B. What is AI literacy? competencies and design considerations[C]// Proceedings of the 2020 CHI conference on human factors in computing systems. New York: ACM, 2020:1-16.

[11]
BLUT M, WANG C, WÜNDERLICH N V, et al. Understanding anthropomorphism in service provision: a meta-analysis of physical robots, chatbots, and other AI[J]. Journal of the Academy of Marketing Science, 2021, 49(4): 632-658.

[12]
BRUCE A, NOURBAKHSH I, SIMMONS R. The role of expressiveness and attention in human-robot interaction[C]//Proceedings 2002 IEEE international conference on robotics and automation. New York: IEEE, 2002:4138-4142.

[13]
VOSSEN S, HAM J, MIDDEN C. What makes social feedback from a robot work? disentangling the effect of speech, physical appearance and evaluation[C]//PLOUG T, HASLE P, OINASKUKKONEN H. International conference on persuasive technology. Heidelberg: Springer Berlin Heidelberg, 2010:52-57.

[14]
KANDLHOFER M, STEINBAUER G, HIRSCHMUGL-GAISCH S, et al. Artificial intelligence and computer science in education: from kindergarten to university[C]//2016 IEEE frontiers in education conference. New York: IEEE, 2016:1-9.

[15]
LAUPICHLER M C, ASTER A, SCHIRCH J, et al. Artificial intelligence literacy in higher and adult education: a scoping literature review[J]. Computers and education: artificial intelligence, 2022, 3:100101.

[16]
NG D T K, LEUNG J K L, CHU S K W, et al. Conceptualizing AI literacy: an exploratory review[J]. Computers and education: artificial intelligence, 2021, 2:100041.

[17]
林燕, 孙海霞, 蒲思樾, 等.国内外人工智能素养测评工具综述[J]. 医学信息学杂志, 2025, 46(10): 25-36.

LIN Y, SUN H X, PU S Y, et al. A systematic review of domestic and international artificial intelligence literacy assessment tools[J]. Journal of medical informatics, 2025, 46(10): 25-36.

[18]
MANSOOR H M H, BAWAZIR A, ALSABRI M A, et al. Artificial intelligence literacy among university students—a comparative transnational survey[J]. Frontiers in communication, 2024(9): 1478476.

[19]
SOTO-SANFIEL M T, ANGULO-BRUNET A, LUTZ C. The scale of artificial intelligence literacy for all (SAIL4ALL): assessing knowledge of artificial intelligence in all adult populations[J]. Humanities and social sciences communications, 2025, 12(1): 1-14.

[20]
XIONG X B, CAO S, GAO T, et al. AI literacy in Chinese preschoolers: evidence from scale validation study[J/OL]. Early education and development, 1-19[2026-01-04].

[21]
DING L, KIM S, Allday R A. Development of an AI literacy assessment for non-technical individuals: what do teachers know?[J]. Contemporary educational technology, 2024, 16(3): ep512.

[22]
DELCKER J, HEIL J, IFENTHALER D. Evidence-based development of an instrument for the assessment of teachers’ self-perceptions of their artificial intelligence competence[J]. Educational technology research and development, 2025, 73(1): 115-133.

[23]
CHENG C C, WANG J S, ZHAI X, et al. AI literacy and gender equity in elementary education: a quasi-experimental study of a STEAM–PBL–AIoT course with questionnaire validation[J]. International journal of STEM education, 2025, 12(1): 50.

[24]
HOBEIKA E, HALLIT R, MALAEB D, et al. Multinational validation of the Arabic version of the artificial intelligence literacy scale (AILS) in university students[J]. Cogent psychology, 2024, 11(1): 2395637.

[25]
SHARIFABADI S R, Shamsi A, Heidari H. AI literacy among librarians in Qom: a case study in Iran[J]. AIB studi, 2025, 65(1): 99-114.

[26]
SI J. Exploring AI literacy, attitudes toward AI, and intentions to use AI in clinical contexts among healthcare students in Korea: a cross-sectional study[J]. BMC medical education, 2025, 25(1): 1233.

[27]
DONG Y, XU W, HUANG J, et al. Validating and refining a multi-dimensional scale for measuring AI literacy in education using the Rasch Model[J]. Humanities and social sciences communications, 2025, 12(1): 1-13.

[28]
HAN S, ZHANG Y. Developing a validated assessment of artificial intelligence literacy for Chinese university students based on educational objectives taxonomy[J/OL]. Journal of research on technology in education, 1-16[2026-01-04].

[29]
TOPAL A D, GÖKÇE A T, EREN C D, et al. Artificial intelligence literacy scale: a study of reliability and validity in Turkish university students[J]. Journal of learning and teaching in digital age, 2025, 10(1): 58-67.

[30]
XU L, ZHANG L, OU L, et al. The development and validation of a scale on student AI literacy in L2 writing: a domain-specific perspective[J]. Journal of second language writing, 2025, 69:101227.

[31]
ZHONG B, LIU X. Evaluating AI literacy of secondary students: framework and scale development[J]. Computers & education, 2025, 227:105230.

[32]
NING Y, ZHANG W, YAO D, et al. Development and validation of the artificial intelligence literacy scale for teachers (AILST)[J]. Education and information technologies, 2025, 30:17769-17803.

[33]
WANG B, RAU P L P, YUAN T. Measuring user competence in using artificial intelligence: validity and reliability of artificial intelligence literacy scale[J]. Behaviour & information technology, 2023, 42(9): 1324-1337.

[34]
郭亚军, 寇旭颍, 冯思倩, 等.人工智能素养:内涵剖析与评估标准构建[J]. 图书馆论坛, 2025, 45(2): 42-50.

GUO Y J, KOU X Y, FENG S Q, et al. Artificial intelligence literacy: connotation analysis and evaluation criteria[J]. Library tribune, 2025, 45(2): 42-50.

[35]
LIU X, ZHANG L, WEI X. Generative artificial intelligence literacy: scale development and its effect on job performance[J]. Behavioral sciences, 2025, 15(6): 811.

[36]
LAUPICHLER M C, ASTER A, HAVERKAMP N, et al. Development of the “Scale for the assessment of non-experts’ AI literacy”–an exploratory factor analysis[J]. Computers in human behavior reports, 2023, 12:100338.

[37]
CELIK I. Towards Intelligent-TPACK: an empirical study on teachers’ professional knowledge to ethically integrate artificial intelligence (AI)-based tools into education[J]. Computers in human behavior, 2023, 138:107468.

[38]
WAELEN R, WIECZOREK M. The struggle for AI’s recognition: understanding the normative implications of gender bias in AI with Honneth’s theory of recognition[J]. Philosophy & technology, 2022, 35(2): 53.

[39]
SIMS R R. Business ethics teaching for effective learning[J]. Teaching business ethics, 2002, 6(4): 393-410.

[40]
CAROLUS A, KOCH M J, STRAKA S, et al. MAILS-Meta AI literacy scale: development and testing of an AI literacy questionnaire based on well-founded competency models and psychological change-and meta-competencies[J]. Computers in human behavior: artificial humans, 2023, 1(2): 100014.

[41]
CHIU T K F, AHMAD Z, ÇOBAN M. Development and validation of teacher artificial intelligence (AI) competence self-efficacy(TAICS) scale[J]. Education and information technologies, 2025, 30(5): 6667-6685.

[42]
YUAN C W, TSAI H S, CHEN Y T. Charting competence: a holistic scale for measuring proficiency in artificial intelligence literacy[J]. Journal of educational computing research, 2024, 62(7): 1455-1484.

[43]
HUANG Z, NAZAR N, ABBAS G, et al. Assessing AI literacy in second language writing: a scale development and validation study[J]. Education and information technologies, 2025, 30(18): 25909-25935.

[44]
EYAL L. Rethinking artificial-intelligence literacy through the lens of teacher educators: the adaptive AI model[J]. Computers and education open, 2025, 9:100291.

[45]
ZHANG H, PERRY A, LEE I. Developing and validating the artificial intelligence literacy concept inventory: an instrument to assess artificial intelligence literacy among middle school students[J]. International journal of artificial intelligence in education, 2025, 35(1): 398-438.

[46]
ULUĞ E, ÖNER K, ARSLANTAŞ S, et al. Adaptation of the artificial intelligence literacy scale into Turkish: a cross-sectional application among healthcare workers, students, and children[J]. Education and information technologies, 2025, 30:21041-21077.

[47]
ITC. ITC guidelines for the large-scale assessment of linguistically and culturally diverse populations[J]. International journal of testing, 2019, 19(4): 301-336.

[48]
LEE SC, BABY T, VONGVIT R, et al. Development and validation of generative AI competence scale (GenAIComp) among university students[J]. Technology in society, 2025, 84:103059.

[49]
刘明, 郭烁, 苏逸飞, 等.大学生生成式人工智能素养测评工具开发与应用[J]. 现代远程教育研究, 2025, 37(6): 24-33, 70.

LIU M, GUO S, SU Y F, et al. Development and application of the assessment tool for college students' generative artificial intelligence literacy[J]. Modern distance education research, 2025, 37(6): 24-33, 70.

[50]
MA S, CHEN Z. The development and validation of the artificial intelligence literacy scale for Chinese college students (AILS-CCS)[J]. IEEE access, 2024, 12:146419-146429.

[51]
SU J. Development and validation of an artificial intelligence literacy assessment for kindergarten children[J]. Education and information technologies, 2024, 29(16): 21811-21831.

[52]
AYDINLAR A, MAVI A, KÜTÜKÇÜ E, et al. Awareness and level of digital literacy among students receiving health-based education[J]. BMC medical education, 2024, 24(1), article number:38.

[53]
BEROÍZA-VALENZUELA F. Implicit gender stereotypes in STEM: measuring cognitive bias and group differences through reaction times[J]. International journal of STEM education, 2025, 12(1), article number:20.

[54]
ABOALSHAMAT K, ALHUZALI R, ALALYANI A, et al. Medical and dental professionals readiness for artificial intelligence for Saudi Arabia vision 2030[J]. International journal of pharmaceutical research and allied sciences, 2022, 11(4): 52-59.

[55]
CHUNG K, KIM S, JANG Y, et al. Developing an AI literacy diagnostic tool for elementary school students[J]. Education and information technologies, 2025, 30(1): 1013-1044.

[56]
GOKCE A T, TOPAL A D, GEÇER A K, et al. Investigating the level of artificial intelligence literacy of university students using decision trees[J]. Education and information technologies, 2025, 30(5): 6765-6784.

[57]
ROŽMAN M, OREŠKI D, ELIAS A, et al. AI literacy among university students: a comparative study of three countries-Slovenia, Croatia, and India[J]. IEEE access, 2025, 13:110671-110688.

[58]
TENBERGA I, DANIELA L. Artificial intelligence literacy competencies for teachers through self-assessment tools[J]. Sustainability, 2024, 16(23): 10386.

[59]
KIREMIT B Y. Validation and reliability of the Turkish adaptation of the artificial intelligence literacy scale (AILS) for healthcare professionals[J/OL]. Journal of research on technology in education, 1-12[2026-01-04].

[60]
PINSKI M, BENLIAN A. AI literacy-towards measuring human competency in artificial intelligence[C]//Proceedings of the 56th annual Hawaii international conference on system sciences. Honolulu: HICSS, 2023:165-174.

Outlines

/

〈 〉