研究论文

基于元分析的网络用户评论表达真实性研究

  • 张鑫众 ,
  • 徐健 ,
  • 张雯昕 ,
  • 王玥瑄 ,
  • 李文睿 ,
  • 盛清泉
展开
  • 中山大学信息管理学院 广州 510006
徐健,教授,博士,博士生导师,E-mail:

张鑫众,本科生

张雯昕,本科生

王玥瑄,本科生

李文睿,本科生

盛清泉,本科生。

收稿日期: 2025-04-02

  网络出版日期: 2025-08-31

基金资助

广东省自然科学基金项目“基于科技文献大数据的跨学科类比知识发现研究”(2024A1515011778)

Research on the Authenticity of Online User Comment Expression Based on Meta Analysis

  • Zhang Xinzhong ,
  • Xu Jian ,
  • Zhang Wenxin ,
  • Wang Yuexuan ,
  • Li Wenrui ,
  • Sheng Qingquan
Expand
  • School of Information Management, Sun Yat-sen University, Guangzhou 510006
Xu Jian, Professor, PhD, Doctoral Supervisor, E-mail:

Zhang Xinzong, Undergraduate;

Zhang Wenxin, Undergraduate;

Wang Yuexuan, Undergraduate;

Li Wenrui, Undergraduate;

Sheng Qingquan, Undergraduate.

Received date: 2025-04-02

  Online published: 2025-08-31

Supported by

Guangdong Provincial Natural Science Foundation Project titled "Research on Interdisciplinary Analogous Knowledge Discovery Based on Scientific and Technological Literature Big Data"(2024A1515011778)

摘要

【目的/意义】 随着网络用户数量快速增长,网络评论对用户的影响越来越大并在一定程度上影响人们在网络上的选择和行为。针对当前网络评论研究中真实性评估不足的问题,通过元分析量化评估网络评论真实性,揭示不真实评论的分布规律,为相关研究的数据可靠性判断提供依据。 【方法/过程】 在相关领域对于评论真实性相关因素研究较少的客观情况下,创新性地提出利用不真实评论比例这一差异类变量进行元分析。采用异质性检验、发表偏倚检验和随机效应模型进行元分析,结合可视化工具解析不同平台、不同类型评论的不真实情况。 【结果/结论】 各类网络评论平台普遍存在超过15%的不真实评论且占比持续上升,结果根据平台类型、国内外环境等因素产生一定的差异性。学界较多选取的评论平台中,独立于商家、客户的第三方评论平台(如大众点评、Yelp等)中不真实评论最少存在15%左右;独立于用户的卖家平台(如京东、亚马逊等)中不真实评论较多,占比达到20%左右;而不具备商业属性的用户自建平台(如微博、博客等)中不真实评论数量最多,占比超过25%以上,其中大多数为谣言和垃圾评论。

本文引用格式

张鑫众 , 徐健 , 张雯昕 , 王玥瑄 , 李文睿 , 盛清泉 . 基于元分析的网络用户评论表达真实性研究[J]. 知识管理论坛, 2025 , 10(4) : 321 -334 . DOI: 10.13266/j.issn.2095-5472.2025.021

Abstract

[Purpose/Significance] With the rapid growth of online users, online comments increasingly influence users’ choices and behaviors on the internet. To address the insufficient assessment of authenticity in current online comment research, this study employs meta-analysis to quantitatively evaluate the authenticity of online comments, revealing the distribution patterns of online comments, revealing the distribution patterns of inauthentic comments, and providing a reference for data reliability judgment in related studies. [Method/Process] Given the limited research on factors related to comment authenticity, this study innovatively proposed to use the proportion of inauthentic comments as a differential variable for meta-analysis. Heterogeneity tests, publication bias tests, and random-effects models were applied, combined with visualization tools to analyze inauthenticity across different platforms and comment types. [Result/Conclusion] There are generally over 15% of untrue comments, and the proportion continues to rise. The results vary depending on factors such as platform type and domestic and international environment. Among the review platforms widely selected by academia, there are at least 15% of untrue reviews on third-party review platforms (such as Dianping, Yelp, etc.) that are independent of merchants and customers; There are many untrue reviews on seller platforms independent of users (such as JD.com, Amazon, etc.), accounting for about 20%; In user built platforms without commercial attributes (such as Weibo, blogs, etc.), the number of untrue comments is the highest, accounting for more than 25%, most of which are rumors and junk comments.

1 引言/Introduction

随着互联网技术的发展和移动智能终端的普及,网络用户生成的在线评论数量急速增长,网络评论也成为一种重要的数据分析资源。目前,已有大量研究基于网络评论开展情感分析、舆情监测、趋势预测等,或基于评论数据进行用户需求分析、产品痛点分析,从而促进产品和服务的优化升级。然而,这些研究成果预设的前提都是网络评论数据真实可信且存在分析价值。近年来,各大网络平台普遍出现不真实评论泛滥的情况,网络水军、好评奖励、商家控评等现象都有可能导致评论的不真实。例如,根据学者M. Luca和G. Zervas的研究,美国最大的点评网站Yelp上至少有16%的酒店评论被认定为是虚假评论[1];虚假评论监测网站ReviewMeta分析了2.03亿条亚马逊评论,发现其中11.3%的评论真实性存疑[2];Z. Jin等学者分析了2016年美国总统选举时通过FaceBook和Twitter传播的近529条网络谣言造成的舆论倾斜,证实了网络评论对选民产生了较大的影响[3]。
网络上的评论信息是否真实可信,决定着其能否作为可靠的研究资料供学者分析研究,或相关研究结果在多大程度上具有可信度,该痛点问题也越来越成为学界乃至全社会关注和讨论的热门话题。只有作为输入的评论信息具有真实性和代表性,输出的研究成果才具有可靠性和准确性,否则容易对相关研究造成阻碍,甚至得出偏颇错误的结论,不利于理论和实践的进一步发展。
由于目前学界对于网络用户评论真实性的考量主要表现在样本数据的处理上,再加上元分析方法能够大规模定量化分析数据的优势,因此本研究采用元分析方法对网络用户评论进行分析。根据现有的实证研究,定量检验各类型不真实评论和各大网络平台上的不真实评论,得出不真实评论相关的量化结果,并横向比较国内外不真实评论的占比情况,为网络用户评论相关研究提供一定参考。

2 相关研究/Related research

本研究将元分析的方法运用到网络用户评论表达的真实性研究当中,因此为了更好理解该领域的研究背景和动态,本部分从不真实评论的研究现状和元分析方法的应用两个关键方面进行综述,对不真实评论的定义、研究范围以及学界相关研究路径和现状进行简单概述,对元分析方法进行简单介绍并对图情领域应用现状以及不足进行总结。

2.1 不真实评论相关研究

评论真实性指用户评论基于真实体验且未被操纵的程度[1],包括事实准确性和表达自主性。关于网络平台用户评论的研究多集中于垃圾评论、虚假评论、网络谣言研究。N. Jindal和B. Liu团队最先对垃圾评论进行了较为详细的定义:垃圾评论通常是指与事件、事物事实不符的评论信息,包含虚假评论、无关评论[4]。虽然虚假评论属于垃圾评论的一个子集,但相较于无关评论,其具有的欺骗性特征使之易被误认为真实评论,不易鉴别[5],因而学界围绕垃圾评论的识别、筛除等进行了大量实证研究,同时也产生了许多针对虚假评论的实证研究论文,如对虚假评论形成的诱因进行探讨[6],对虚假评论检测办法进行研究[7],对虚假评论产生的影响进行论证[8],对虚假评论形成路径进行思考讨论[9],等等。而网络谣言则是较为特殊的一种不真实评论类型,长期以来人们对谣言存在一种误解,认为谣言必定是虚假的。但较为权威的定义往往都表示网络谣言更多被定义为不能确定真假的网络评论[10-11]。因此,本研究将研究重点放在垃圾评论及其分类下学界研究最多的虚假评论、较为特别但学界近些年热门讨论的网络谣言这3类评论。
总之,有关在线评论本身属性的研究主要关注评论的数量、评论的质量、评论的效价3个方面[12]。有关网络用户评论表达真实性和代表性的研究主要集中在两个方面:一是通过技术手段对用户评论进行自动检测和分类,以识别不真实评论,如基于机器学习和自然语言处理的方法;二是从社会学和心理学等角度出发,探讨用户为什么会发表不真实的评论,如动机、心理状态等,探究不真实评论产生的影响。

2.2 元分析方法的应用

元分析(meta-analysis)又称荟萃分析、整合分析,由英国教育心理学家G. V. Glass于1976年首次提出,是一种“以综合一系列单个研究结果为目的的统计分析”[13]方法。该方法提供了一种定量化分析相似研究结果的可能,通过对研究结果间差异的来源进行检验,并对具有足够相似性的结果进行定量合成来解决相关实证研究结果不一致的问题,统计得出一个准确客观的结果。其过程主要包括研究主题确定、文献检索与筛选、文献编码与整合、数据处理和统计分析4个步骤[14]。与传统的定性文献综述方法不同,元分析通过定量的方式比较不同研究结果,可以有效避免仅凭个人经验及主观看法将文献纳入综述的问题,能够尽量全面、合理地纳入文献,从而得出更具概括性和普适性的结论。同时通过综合该领域内的研究合并分析,增大了研究的样本量,克服了小样本的局限性,利用已有的实证研究避免了因扩大样本量而带来的人力物力成本。
虽有学者已经尝试在网络评论研究领域采用元分析的方法进行量化综述,但受限于各种实际问题(如相关文献效应值报道不规范,可进行元分析的文献数量较少等),仍停留在评论有用性等用户感知层面的影响因素相关分析,对于客观的评论数据并没有进行深入探讨和分析[15]。当前研究对于网络用户评论真实性缺乏定量化、总体性的分析,这种研究现状导致学界对其研究选取的评论样本数据没有可靠的评价标准。具体来说,如果不真实评论的问题没有引起足够的重视并得到有效的解决,那么基于这些评论的分析的可重复性和结论准确性、可靠性就会存疑。甚至得到的结论还可能会误导学界相关研究,在指导实践中会损害网络用户、消费者以及商家的利益。但是在该领域的实证研究往往都会有一定的样本数据集,那么如果将效应值选取确定为比例效应值则可以得到大量的数据集,而比例型效应值的选取和操作已经有较为完整的研究途径[16]。因此,本研究旨在通过以下解决思路来弥补这一研究空白:采用元分析方法,对不真实评论的类别、所处平台、环境等进行比例效应模型选取下的定量化综述分析。预期能够解决以下问题:①小样本研究的局限性,单一实证研究受样本量限制(如某文献仅分析1万条微博评论),而元分析合并223篇研究(样本总量超100万条评论),提升统计功效,避免偶然性结论。②量化不一致性,现有文献对不真实评论比例的报道差异极大(如Yelp虚假评论占比从5%到30%不等)。元分析通过异质性检验证实这种差异并非随机误差,而是源于平台类型等调节变量,从而揭示深层规律。③避免“叙述性综述”的主观性,若仅定性总结文献(如“多数研究认为卖家平台虚假评论较多”),无法客观量化差异。元分析提供效应值、置信区间和显著性检验(如卖家平台虚假评论占比显著高于第三方平台,p<0.001),结论更具说服力。
为解决如上问题,研究需要设立如下几个目标:①揭示不同平台不真实评论的类型、占比和分布差异,为今后的在线评论研究提供数据参考;②分析不真实评论在不同平台上的分布特征,以及这些特征对网络评论环境的影响;③探讨不真实评论占比的上升趋势,以及这一趋势对网络评论真实性的潜在影响;④为构建更加健康、真实的网络评论环境提供理论依据和策略建议。

3 研究框架和研究模型/Research framework and model

本研究研究框架和模型见图1。
图 1 研究框架和模型

Figure 1 Research framework and model

本研究是基于元分析研究框架展开的综合性定量分析,在传统元分析的基础上增加了数据的抽取整合以及一定的可视化操作,以求更加形象地展现网络评论中不真实评论的表现情况。

4 研究内容与研究过程/Research content and process

4.1 收集和筛选样本数据

笔者于2023年6—9月在CNKI中国知网全文数据库、Web of Science(WoS)数据库中进行检索,并通过谷歌学术对检索结果进行补充。
利用CNKI提供的专业检索进行中文文献检索,检索式为(TKA='评论检测' OR TKA='虚假评论'OR TKA='垃圾评论' OR TKA = '谣言检测' NOT TKA='恶意评论'),得到初步检索结果919条。考虑到本研究主要关注评论内容的真实性,而恶意评论侧重于评论的负面性质(如侮辱、诽谤等),与研究主题关系不大,因此将恶意评论相关的文献筛除,确保研究范围的准确性并提高检索效率。
利用Web of Science数据库的高级检索进行英文文献检索,检索式为TI=(Fake review) or TI=(opinion spam) or TI=(rumor detection) or AB=(Fake review) or AB=(opinion spam) or AB=(rumor detection) or AK=(Fake review) or AK=(opinion spam) or AK=(rumor detection),得到开放获取文献检索结果1 245条。
在检索完成后对所得文献进行进一步筛选,采用的文献筛选标准如下:①文献研究的对象必须是互联网在线评论,排除其他类型的评论形式;②文献必须为实证研究,排除综述和理论性文章;③文献必须报告了能反映其评论真实性代表性的数据,如虚假评论的数量和占比、有用评论的占比等。
具体筛选步骤如下:①浏览标题和摘要,筛选与研究对象相关的中文文献196篇、英文文献263篇;②通读文章内容,筛选非综述和纯理论研究文献,得到实证研究中文文献163篇、英文文献212篇;③基于本研究元分析标准筛选数据资料完整、样本量明确的文献,最终得到可纳入元分析(即报告了元分析所需数据)的中文文献122篇、英文文献101篇。

4.2 文献编码与整合

对筛选后的文献进行逐篇编码,编码信息包括研究平台、研究对象(领域)、评论类型、样本量、虚假评论(谣言)数量。对于采用多个样本数据进行实证研究的文献,笔者将其视为多项不同的研究纳入分析。由于垃圾评论包含虚假评论和无关评论[5],而根据评论真实性的事实准确性和表达自主性的标准,垃圾评论均可认为是不真实评论的一类。而网络谣言因其不能确定真假的特性也会有可能归纳于不真实评论,因此针对网络谣言的样本数据,研究成员通过手工编码样本来源的原文献所明确报道认定为网络谣言的样本量数值并将其归为不真实评论,对于未能明确报道真假的网络谣言样本则不纳入研究范围。最终归纳得出不真实评论的类型编码大致分为3类,即虚假评论、谣言和垃圾评论。评论类型分类的具体规则解释如下:
(1)虚假评论仅保留明确符合以下条件的文献数据:研究标注为“人为编造”(如商家付费撰写);检测方法包含欺骗性语言特征分析或行为证据链(如同一用户ID批量发布五星评价)。
(2)垃圾评论合并两类子定义:无关内容(广告、重复文本)和低质量内容(无意义字符、纯表情),均需满足被纳入分析的研究明确标注为“无信息量”。虚假评论,当文章仅仅将垃圾评论作为研究对象而不单独考虑虚假评论时归为垃圾评论一类。
(3)网络谣言仅纳入:被事实核查平台(如Snopes、腾讯较真)标记为虚假的信息。研究使用传播结构分析(如转发网络异常)或语义矛盾性检测。
对评论平台进行编码划分时考虑到初步数据集呈现出卖家平台显著多于其他两类平台,说明学界有关网络用户评论相关的研究在消费决策场景下更为成熟,样本量更多,而社交媒体评论更加碎片化且一些评论属性较弱的媒体(如QQ、微信)等所能得到的数据样本量过少。综合考虑后笔者根据评论平台的所有权和控制权归属分3类对其进行编码:卖家平台、第三方评论平台和用户自建平台[17]。相较于基于平台功能或者设计目的划分为社交媒体平台、电子商务平台、新闻论坛平台[18]的方式,该分类通过控制权差异直接关联评论操纵动机(如商家利益驱动、用户群体传播),更有利于揭示偏差根源及明确治理责任主体。平台分类类型的具体含义解释如下:
(1)卖家平台(如卖家官网、京东自营):评论功能由商品/服务提供方直接控制,存在利益关系关联性明显(如删除差评、好评返现),其真实性可能受商业目标驱动。
(2)第三方评论平台(如大众点评、Yelp):由独立的第三方平台运营,主要通过算法和规则管控评论,利益关系关联性一般,其真实性治理更为中立。
(3)用户自建平台(如微博、豆瓣、Twitter):评论由用户社群自发组织,缺乏商业利益和三方平台的干预,但容易受到群体极化和谣言传播等影响。
为保证编码的一致性,避免人工编码产生的误差,由两名成员按照文献编码框架进行单独编码。统计分析表明,编码一致性平均达到95%以上。针对编码不一致的情况,由组内协商解决。具体编码框架见表1,编码结果见表2。
表1 文献编码框架

Table 1 Document coding framework

编码信息 操作性定义
国内/国外 文章研究的评论平台来自国内/国外
评论平台类型 文章研究的评论平台类型
评论类型 文章数据的评论类型
样本量 文章抽取的数据样本元素的总数量
不真实评论量 文章抽取的数据样本元素中虚假评论、谣言、垃圾评论等的数量
不真实比例 不真实评论数量/样本量
表2 文献编码整合

Table 2 Literature coding integration

评论平台类型 评论类型 样本量/条 不真实数量/条 不真实比例
卖家平台 虚假评论 490 018 65 066 0.183
垃圾评论 7 593 1 017 0.142
谣言 0 0
第三方评论平台 虚假评论 68 461 16 954 0.154
垃圾评论 98 589 27 811 0.246
谣言 0 0
用户自建平台 虚假评论 19 751 3 404 0.159
垃圾评论 123 752 25 840 0.248
谣言 123 950 45 913 0.396
通过表2数据可以观察到,收集到的样本数据集呈现出卖家平台显著多于其他两类平台,说明学界有关网络用户评论相关的研究在消费决策场景下更为成熟,样本量更多。

4.3 结果元分析

效应值(effect size)是元分析中用来量化处理效应大小的指标,它反映了干预措施或研究条件对结果变量的影响程度。本实验不同于一般的效应值选取,由于研究领域关于评论真实性的研究文献所报告的统计值差异性过大,常见的相关性效应值(如相关系数、回归系数等)所得到的有效文献偏少。因此,本研究在遵循效应值选取的一般规则前提下,以带有特定特征的样本(如选取样本中人工标注的虚假评论)占总体样本的比例作为差异类效应值进行分析,其取值范围为0至1[19]。文献编码提取出的样本量和对应的不真实占比输入CMA3.0软件作为效应值,通过CMA转换得到Fisher’Z及其方差等重要指标,基于该结果对各类评论的不真实情况展开元分析。

4.3.1 发表偏倚检验

发表偏倚指统计结果显著的研究成果更容易被期刊所接受并发表,是影响研究结果可靠性的一个重要因素,因此对其进行检验是元分析不可或缺的一环[20]。本研究先基于漏斗图对各变量是否存在发表偏倚进行视觉判断,再通过Fail-Safe N 检验和Egger检验两种检验方法共同评价发表偏倚情况。Fail-Safe N(失效安全系数)是指当分析结果具有统计学意义时,为排除发表偏倚的可能或估计发表偏倚的程度,至少需要多少个未发表的研究才能使元分析的结果逆转[21]。通常情况下,失效安全数应该大于5k+10(k为纳入的研究个数)。Egger检验是通过识别回归截距与0之间是否有显著性判断是否存在发表偏倚,一般情况下,Egger检验的P值大于0.05表明存在发表偏倚的可能性较低[22]。
漏斗图是一种主观感受发表偏倚情况分析方法,本研究得到的漏斗图见图2。但考虑到Egger检验得到的T/P指数以及相关的失效安全系数更具说服力,因此在判断所选取的评论类型是否存在发表偏倚时主要依据表3中Egger检验的相关数据。
表3 发表偏倚分析结果

Table 3 Publication bias test results

评论类型 K Egger检验 失效安全系数
95%的置信区间 T值 P值
下限 上限
卖家—虚假 22 -21.004 38.121 0.604 0.552 8 383
卖家—垃圾 6 -21.502 19.151 0.161 0.880 4 083
三方—虚假 13 -38.536 -6.811 3.146 0.009 2 519
三方—垃圾 3 -133.477 -81.215 52.197 0.012 3 888
自建—虚假 4 -57.765 38.058 0.885 0.470 4 991
自建—垃圾 36 -11.108 9.876 0.120 0.906 3 131
自建—谣言 18 -12.227 24.372 0.703 0.492 6 774

注:k为研究数量;T值和P值分别表示Egger检验中的检验统计量和拒绝原假设所需要承担的风险

图 2 效应值发表偏倚漏斗图(例)

Figure 2 Funnel plot of effect value publication bias

由表3中Egger线性回归分析结果可以看出,第三方评论平台中的虚假评论占比以及第三方评论平台中的垃圾评论占比回归结果显著(P<0.05),表明第三方评论平台的虚假评论和垃圾评论占比情况的差异性研究存在发表偏倚,但其对应的失效安全系数均远大于5k+10,表明虽然存在发表偏倚情况,但对元分析结果的影响程度十分有限,分析结果受到发表偏倚的影响可能性较低。而其余评论类型Egger检验的P值均大于0.05且失效安全系数均大于5k+10。因此,可以判断本研究所分析的7种评论类型均是稳定的,受到发表偏倚影响的可能性较低。

4.3.2 异质性检验

元分析需要对纳入研究的数据进行异质性检验,以判断各个独立研究的一致性,继而根据检验结果选择合适的分析模型[23]。本研究采用Q检验方法对数据进行异质性检验,若Q检验结果不显著,则表明研究不存在异质性,采用固定效应模型进行分析;反之,则表明研究存在异质性,使用随机效应模型进行分析。随机效应模型不仅考虑研究内和研究间变异,还能够估计效应分布的平均值,同时可以防止低估小样本研究的权重或高估大样本的权重,产生更大的置信区间,从而形成更加保守可靠的结论[9]。
异质性检验结果见表4,所有变量异质性检验均达到显著性水平(P<0.05),表明各个效应量间呈现异质性。同时,所有变量的I2值均超过了75%。根据J. Higgins等提出的判别标准:I2<25%表明研究具有很强的同质性,I2在50%附近表明存在中度的异质性,而I2>75%表明研究存在很强的异质性[24],可知本研究所纳入的研究之间存在较大的异质性,应采用随机效应模型计算效应量。
表4 异质性检验结果

Table 4 Heterogeneity test results

评论类型 K N 异质性(Q检验) Tau-squared
Q值 P值 I2 Tau Tau2
卖家—虚假 22 490 018 42 299.828 <0.001 99.950 1.058 1.119
卖家—垃圾 6 7593 116.300 <0.001 95.701 0.402 0.162
三方—虚假 13 68 461 4 432.360 <0.001 99.729 0.670 0.449
三方—垃圾 3 98 589 2 455.336 <0.001 99.919 0.465 0.216
自建—虚假 4 19 751 504.304 <0.001 99.405 0.749 0.560
自建—垃圾 36 123 752 13 365.989 <0.001 99.738 0.918 0.843
自建—谣言 18 123 950 6 459.490 <0.001 99.737 0.526 0.277

注:K为研究数量;N为样本总数;Q值和P值表示Q检验中的检验统计量和拒绝原假设所要承担的风险;Tau2表示可用于计算权重的研究间变异的百分比

4.3.3 效应值分析

由于本研究将比例作为差异类效应值进行效应值分析,因此效应值的含义是对于各种不真实评论类型的比例进行进一步说明。本研究的效应值分析结果见表5。
表5 效应值分析结果

Table 5 Effect value analysis results

评论类型 K N r 95%置信区间 双尾检验
下限 上限 Z值 P值
卖家—虚假 22 490 018 0.183 0.125 0.258 -6.638 <0.001
卖家—垃圾 6 7 593 0.142 0.106 0.188 -10.545 <0.001
三方—虚假 13 68 461 0.154 0.112 0.208 -9.090 <0.001
三方—垃圾 3 98 589 0.246 0.162 0.356 -4.176 <0.001
自建—虚假 4 19 751 0.159 0.083 0.284 -4.403 <0.001
自建—垃圾 36 123 752 0.248 0.196 0.308 -7.190 <0.001
自建—谣言 18 123 950 0.396 0.339 0.456 -3.374 0.001

注:k为研究数量;N为样本总数;r为平均效应值;95%置信区间表示的是平均效应值r在置信水平95%下的置信区间;双尾检验中的Z值为平均效应值r进行显著性检验对应的Z值;P值为拒绝原假设所要承担的风险

根据表5中的平均效应值和95%置信区间下的效应值波动可以发现,本研究自主区分的7个评论类型均通过了显著性检验。卖家平台虚假评论占比在95%置信区间上处于0.125—0.258;卖家平台垃圾评论占比在95%置信区间上处于0.106—0.188;第三方评论平台虚假评论占比在95%置信区间上处于0.112—0.208;第三方评论平台垃圾评论占比在95%置信区间上处于0.162—0.356;用户自建平台虚假评论占比在95%置信区间上处于0.083—0.284;用户自建平台垃圾评论占比在95%置信区间上处于0.196—0.308;用户自建平台网络谣言占比在95%置信区间上处于0.339—0.456。

4.4 数据可视化分析

数据可视化是一种将复杂数据以直观形式展现出来的方法,能够更好地理解和分析数据,进而更好地发掘其内在价值。本研究运用Excel、SPSS软件对整理获得的数据进行可视化分析。
(1)国内外不真实评论情况差异。将编码整合的数据根据国内外差异进行统计,得到图3。
图3 不同类型平台/评论柱形图

Figure 3 Column charts of different types of platforms/comments

如图3显示,卖家平台和第三方评论平台上不真实评论的占比,国内相较国外少4%左右,而在用户自建平台上不真实评论的占比,国内相较国外明显多4%左右;国内评论平台中不真实评论在虚假评论占比方面和国外基本相同,而在谣言和垃圾评论占比方面要高于国外6%左右。
(2)不同时间段不真实评论情况差异。根据所得文献及数据的发布时间将其分为五年前和五年内进行统计(以2018年12月31日为五年前和五年内划分时间节点),得到图4。
图4 五年前和五年内不同类型平台柱形图

Figure 4 Column charts of different types of platforms five years ago and whthin the past five years

如图4显示,近五年各类平台的用户评论不真实比例较五年前都有所上升。其中,第三方评论平台增幅较少,为3%左右;卖家平台增幅为5%左右;用户自建平台增幅最高,为15%以上。
(3)主流评论平台不真实评论情况差异。选取编码整合过程中数据样本最多的6个评论平台进行统计,得到图5。
图5 主流平台不真实评论占比柱形图

Figure 5 Column chart of the proportion of untrue comments on mainstream platforms

由图5数据可以发现,主流的6种评论平台中以微博和Twitter上的不真实程度最高,分别为42.5%左右和36.7%左右;其次按占比从高到低依次是博客、京东、Yelp和大众点评。
(4)元分析效应值情况差异。根据元分析所得的平均效应值及其95%置信区间内的标准误,得到图6以评论平台和评论类型交叉定义的柱状图。
图6 元分析效应值柱状图

Figure 6 Bar chart of meta-analysis effect values

从图6可以发现,在卖家平台上相关研究对于虚假评论的总体认知约为18%,而对于垃圾评论的总体认知约为14%;在第三方评论平台上相关研究对于虚假评论的总体认知约为15.5%,而对于垃圾评论的总体认知约为24.5%;在用户自建平台上相关研究对于虚假评论的总体认知约为16%,对于垃圾评论的总体认知约为25%,而对于谣言评论的总体认识达到了40%左右。可以看出虚假评论在3种评论平台上的分布较为相似,其中以卖家平台占比最多;垃圾评论在3种评论平台上的分布呈现为第三方评论平台和用户自建平台较多,而卖家平台较少;谣言则由于其特性只存在于用户自建类型的平台。

5 结果讨论和结语/Results discussion and conclusion

在网络评论相关的研究日益受到关注、成果不断增长的发展趋势下,网络评论数据的真实性程度正在成为正确理解和解读网络评论相关研究成果的重要前提。本研究通过对大量样本数据进行定量化元分析,得出网络在线评论真实性的具体情况,如网络评论中不真实评论的类型、占比和分布情况等,为今后的在线评论研究提供数据参考。

5.1 研究结论

通过对收集筛选得到的数据进行元分析和可视化操作,本研究得出以下4条结论:
(1)虚假评论、垃圾评论和网络谣言在不同平台的占比差异较大。虚假评论占比较为稳定,占比在15%—19%左右,说明其受不同评论环境和评论平台的影响不大,后续研究进行虚假评论相关分析时可以尝试将不同类型平台、环境所得的评论进行联合分析;垃圾评论占比受平台类型影响较为显著,表现在卖家平台中仅占14.2%左右,而在第三方评论平台和用户自建平台中占比高达25%。由于垃圾评论包含了虚假评论与无关评论,而虚假评论在各个平台的占比较为稳定,则可以得出第三方评论平台和用户自建平台的无关评论明显更多,这与A. Mukherjee(2013)对于Yelp(第三方评论平台)和Amazon(卖家平台)的研究得到的“Yelp的无关评论占比更高(如商家广告、无关链接),而Amazon的虚假评论更为集中(如付费好评)”结果十分贴合[25];谣言评论仅在用户自建平台研究中被提及,且相关研究对该类型不真实评论的报道比例为40%,显著高于其他类型的不真实评论,具体原因亟待深入的研究分析。
(2)不同评论平台类型具有明显的不真实评论分布差异。卖家平台涉及的两种不真实评论类型呈现虚假评论占比大于垃圾评论占比的情况,其中虚假评论比例约为18.3%,垃圾评论比例约为14.2%。这一现象可能因为卖家平台相关研究大多更为关注虚假评论对消费者的影响,而很少使用垃圾评论这一定义,少数文章(如任亚峰的虚假评论识别研究[26])提到垃圾评论更多是将虚假评论与其拆分来研究,定义重复、无意义的评论为垃圾评论并在识别虚假评论之前就将该类评论进行预处理筛除,但具体的影响因素仍需进一步深入研究;第三方评论平台涉及的两种不真实评论类型呈现垃圾评论占比显著大于虚假评论的情况,其中垃圾评论的占比约为24.6%,虚假评论的占比约为15.4%。用户自建平台上涉及全部3种不真实评论类型,呈现谣言评论占比显著大于垃圾评论,垃圾评论占比显著大于虚假评论,其中谣言评论占比约为39.6%,垃圾评论占比约为24.8%,虚假评论占比约为15.9%。可以分析得出学者在对诸如微博、Twitter等自由度更高的用户交互评论平台进行分析时更多关注谣言评论,且谣言评论类型的占比也显示出该类平台最显著的不真实特征就是谣言评论过多。
三类平台(卖家平台、第三方平台、用户自建平台)的不真实评论占比差异反映了其监管机制与用户动机的差异[27-28]:卖家平台虚假评论占比最高(18.3%),与商家操纵评价的动机直接相关;用户自建平台谣言占比达39.6%,源于其开放性与传播匿名性。
(3)国内外各种平台的不真实评论类型分布差异较小。由图4可以看出,国内外不同评论平台类型和不同不真实评论类型分类下各组数据都只存在较小差异,且数据的变化规律也十分相似。可以得出国内外评论的真实性代表性特征具有一定的相似性。
(4)3种不真实评论类型的占比情况均呈现显著的上升趋势。由图5可以明显看出,3种不真实评论类型的占比情况均呈现显著的上升趋势,其中以用户自建平台的谣言评论最为显著。说明在日益丰富的互联网时代,不真实评论数量增长愈发快速。这也表明在线评论研究领域的知识更新速度和文献老化速度都是极快的,本研究的真实性、代表性分析也只能够代表当下阶段的具体情况,随着时间推移,网络评论的真实性、代表性表现情况如何需要持续的分析研究。

5.2 研究的不足和局限性

(1)纳入研究的文献数量有限。本研究最终的样本研究献中文122篇、英文101篇,研究样本量尚有扩充空间。有限样本容易导致误差率增加,结论的普适性、代表性也会将降低。在英文文献方面,由于国外的在线评论相关研究很少采用人工标注的样本集合,而是选择开源样本集合进行研究,如“gold-standard”等公开数据集,导致纳入的国外文献和数据量有限。但是,公开数据集的可靠性使其在分析使用时有较高权重,因此有限数据量对于本研究结论影响不大。未来研究应继续增加样本数量,提高结论精度。
(2)研究对象的局限性。本研究只提取了众多实证研究中样本数据集的相关内容,关注的是单一的不真实评论的比例,因此在研究结果上维度较为单一。后续可以更多关注相关研究报告的其他数据进行在线评论的综述性分析。

5.3 未来研究的建议

通过以上研究,笔者也发现相关领域的一些研究空缺以及未来研究可以关注的方向:
(1)影响相关实证研究所得不真实评论情况不一致的因素繁多复杂,包括但不限于研究选取的平台不同,样本集合选取不同,研究时间不同,人工标注不同,评论分类定义不同以及研究的评论类型关注点不同。这也可以成为后续在线评论研究的新方向,即探究是哪些因素导致评论真实性、代表性实证研究产生了差异性结果。
(2)通过研究发现,国内外不同评论平台类型和不同不真实评论类型分类下各组数据都只存在较小差异,且数据的变化规律也十分相似,可以认为,国内外评论的真实性、代表性特征具有一定的相似性,后续的研究工作可以将国内外数据进行联合分析以得出一些适用于不同评论环境的结论。

张鑫众:撰写论文,收集与分析数据,修改论文;

徐健:提出思路,修改论文;

张雯昕:收集与整理数据,撰写论文;

王玥瑄:收集与整理数据,撰写论文;

李文睿:收集与整理数据,撰写论文;

盛清泉:收集与整理数据,撰写论文。

[1]
LUCA M, ZERVAS G. Fake it until you make it:reputation, competition, and Yelp review fraud[J]. Management science, 2016, 62(12): 3412-3427.

[2]
CROCKETT Z. 5-star phonies: inside the fake Amazon review complex[EB/OL]. [2025-07-20]. https://thehustle.co/amazon-fake-reviews/.

[3]
JIN Z, CAO J, GUO H, et al. Detection and analysis of 2016 us presidential election related rumors on Twitter[C]//Social, cultural, and behavioral modeling: 10th international conference. Cham: Springer Inter-national Publishing, 2017: 14-24.

[4]
JINDAL N, LIU B. Review spam detection[C]//Proceedings of the 16th international conference on World Wide Web. Banff: ACM Press; 2007: 1189-1190.

[5]
武雅利, 徐勇, 焦梦蕾, 等. 基于在线交易的虚假评论与网络水军研究综述[J]. 现代计算机, 2019(21): 37-40.

WU, Y L, XU Y, JIAO M L, et al. A review of fake reviews and internet water army in online transactions[J]. Modern computer, 2019(21): 37-40.

[6]
王宁, 宋嘉莹, 杨学成. C2C电商平台中在线评论偏离真实性的诱因及应对策略[J]. 软科学, 2017, 31(4): 100-103.

WANG N, SONG J, YANG X. Incentives and countermeasures for deviation from authenticity of online reviews in C2C e-commerce platforms[J]. Soft science, 2017, 31(4): 100-103.

[7]
李璐旸, 秦兵, 刘挺. 虚假评论检测研究综述[J]. 计算机学报, 2018, 41(4): 946-968.

LI L, QIN B, LIU T. A survey on fake review detection research[J]. Chinese journal of computers, 2018, 41(4): 946-968.

[8]
魏瑾瑞, 徐晓晴. 虚假评论、消费决策与产品绩效——虚假评论能产生真实的绩效吗[J]. 南开管理评论, 2020, 23(1): 189-199.

WEI J, XU X. Fake reviews, consumer decision-making and product performance: can fake reviews generate real performance?[J] Nankai business review, 2020, 23(1): 189-199.

[9]
陈燕方, 娄策群. 在线商品虚假评论形成路径研究[J]. 现代情报, 2015, 35(1): 49-53.

CHEN Y, LOU C. Research on the formation paths of fake online product reviews[J]. Modern information, 2015, 35(1): 49-53.

[10]
KAPFERER J N. Rumors: uses, interpretations, and images[M]. Piscataway: transaction publishers, 1990.

[11]
刘建明. 舆论传播[M]. 北京: 清华大学出版社, 2000.

LIU J. Public opinion communication [M]. Beijing: Tsinghua University Press, 2000.

[12]
DUAN W, GU B, WHINSTON A B. Do online reviews matter?—an empirical investigation of panel data[J]. Decision support systems, 2008, 45(4): 1007-1016.

[13]
王永贵, 张言彩.元分析方法在国内外经济管理研究中的应用比较[J]. 经济管理, 2012, 34(4): 182-190.

WANG Y, ZHANG Y. Comparative analysis of meta-analysis applications in domestic and international economic management research[J]. Economic management journal, 2012, 34(4): 182-190.

[14]
彭国超, 程晓, 刘彩华. 基于元分析的网络用户个人信息披露意愿影响因素研究[J]. 现代情报, 2022, 42(11): 111-120.

PENG G, CHENG X, LIU C. Research on influencing factors of online users' personal information disclosure intention based on meta-analysis[J]. Journal of modern information, 2022, 42(11): 111-120.

[15]
杨笑. 基于元分析的电子商务平台评论有用性影响因素研究[D]. 北京: 北京外国语大学, 2022.

YANG X. Research on influencing factors of online review helpfulness in e-commerce platforms based on meta-analysis[D]. Beijing: Beijing Foreign Studies University, 2022.

[16]
LIPSEY M W, WILSON D B. Practical meta-analysis[M]. Thousand Oaks: Sage Publications, 2001.

[17]
万晨. 不同平台在线评论消费者感知差异研究——产品类型的调节作用[J]. 现代情报, 2014, 34(12): 154-158, 167.

WAN C. Research on consumer perception differences of online reviews across platforms: the moderating role of product type[J]. Journal of Modern Information, 2014, 34(12): 154-158, 167.

[18]
STROUD N J. Polarization and partisan selective exposure[J]. Journal of communication, 2010, 60(3), 556-576.

[19]
LIPSEY M W, WILSON D B. Guidance on the application of meta analysis method[M]. Thousand Oaks: SAGE Publication, 2001.

[20]
曾昭炳, 姚继军. 寻找“最佳证据”:如何运用元分析进行文献综述——以STEM教育对学生成绩的影响研究为例[J]. 华东师范大学学报(教育科学版), 2020, 38(6): 70-85.

ZENG Z, YAO J. Finding the "best evidence": how to conduct literature review using meta-analysis—taking the impact of STEM education on student achievement as an example[J]. Journal of East China Normal University (educational sciences), 2020, 38(6): 70-85.

[21]
严炜炜, 陈若瑜, 张敏. 基于元分析的在线知识付费意愿影响因素研究[J]. 情报学报, 2021, 40(2): 204-212.

YAN W W, CHEN R Y, ZHANG M. Research on influencing factors of online knowledge payment intention based on meta-analysis[J]. Journal of the China Society for Scientific and Technical Information, 2021, 40(2): 204-212.

[22]
韩继峰. 基于元分析的用户标注动机影响因素研究[J]. 情报探索, 2019(3): 6-10.

HAN J F. Research on influencing factors of user tagging motivation based on meta-analysis[J]. Information research, 2019(3): 6-10.

[23]
夏凌翔. 元分析及其在社会科学研究中的应用[J]. 西北师大学报(社会科学版), 2005, 42(5): 55-58.

XIA L X. Meta-analysis and its application in social science research[J]. Journal of Northwest Normal University (social sciences), 2005, 42(5): 55-58.

[24]
HIGGINS J P T, THOMPSON S G, DEEKS J J, et al. Measuring inconsistency in meta-analyses[J]. British medical journal, 2003, 327(7414): 557-560.

[25]
MUKHERJEE A. Spotting fake reviewer groups in consumer markets[C]//Proceedings of the 19th ACM SIGKDD international conference on knowledge discovery and data mining. New York: Association for Computing Machinery, 2013: 985-993.

[26]
任亚峰, 姬东鸿, 张红斌, 等. 基于PU学习算法的虚假评论识别研究[J]. 计算机研究与发展, 2015, 52(3): 639-648.

REN Y F, JI D H, ZHANG H B, et al. Deceptive reviews detection based on positive and unlabeled learning[J]. Journal of computer research and development, 2015, 52(3): 639-648.

[27]
DUAN W, GU B, WHINSTON A B. Do online reviews matter? an empirical investigation of panel data[J]. Decision support systems, 2008, 45(4): 1007-1016.

[28]
LUCA M, ZERVAS G. Fake it till you make it: reputation, competition, and Yelp review fraud[J]. Management science, 2016, 62(12): 3412-3427.

文章导航

/

〈 〉