26年5月来自美国东北大学、Tulane大学、华盛顿大学和CMU的论文"PhyGround: Benchmarking Physical Reasoning in Generative World Models"。
生成式世界模型正日益广泛地应用于视频生成领域,其中作为"学习型模拟器"的模型被期望能够捕捉支配现实世界动态的物理规律。然而,评估生成的视频是否真正遵循这些规律仍是一项挑战。现有的侧重于物理特性的视频基准测试虽已取得重要进展,但仍面临三大关键挑战:评估框架过于粗略,导致无法识别针对特定物理定律的失效情况;标注过程中的响应偏差与疲劳效应削弱标注结果的有效性;以及自动化评估器缺乏足够的物理感知能力或难以进行审计。为应对这些挑战,推出 PhyGround------一个基于明确标准的基准测试,旨在评估视频生成中的物理推理能力。该基准包含 250 个精心设计的提示词(prompt),每个提示词均附带预期的物理结果,并涵盖涉及刚体力学、流体动力学和光学领域的 13 种物理定律。每种定律都通过可观测的子问题进行具体化,从而实现针对特定定律的诊断分析。基于社会科学实验室实验设计,开展一项大规模且经过质量控制的人工评估,对八种主流视频生成模型进行评测。共有 459 名标注员提供 5,796 条完整标注和超过 37,400 个细粒度标签;经质量控制筛选后,保留的标注数据在模型排名上表现出极高的一致性(斯皮尔曼等级相关系数 Spearman's ρ > 0.90)。为支持可复现的自动化评估,发布 PhyJudge-9B,这是一个针对物理领域专门优化的开源视觉-语言模型(VLM)评估器。PhyJudge-9B 的总体相对偏差显著低于 Gemini-3.1-Pro(3.3% 对比 16.6%)。
生成式世界模型已越来越多地应用于视频生成领域 22, 41, 34。理想情况下,世界模型应具备理解和预测物理现象的能力 8, 22。然而,当前模型的输出往往违背基本的物理原理。例如,物体可能在没有支撑的情况下悬浮,流体可能消失或质量流失,阴影也可能与光源位置不符。这些缺陷削弱了生成视频的物理真实性,并限制了世界模型在需要可靠模拟、预测和视觉推理场景中的应用。为了更好地理解当前世界模型的物理推理能力并明确改进方向,评估生成视频对物理定律的遵循程度至关重要。此类评估需要一个可靠的基准,以便对世界模型输出结果的物理合理性进行衡量、比较和诊断。尽管近期针对物理特性的视频基准测试在评估生成式世界模型的物理遵循度方面取得了显著进展,但仍有三个关键挑战亟待解决。
首先,现有的评估框架往往在"领域"层面进行评估,得出的宏观评分掩盖了针对特定物理定律的失效情况。然而,物理领域并非单一的能力范畴,而是包含多种物理约束,这些约束可能被独立地满足或违反。例如,流体场景可能涉及流动动力学、边界交互、位移和连续性等多个方面。生成的视频可能呈现出合理的流动形态,却因液体凭空消失或出现而违反了连续性原则。若将这些不同的评估标准平均化为一个单一的"流体动力学"评分,可能会掩盖关键的失效模式,从而给人一种模型具备物理合理性的误导性印象。此外,现有框架通常依赖二元判断,无法区分问题的严重程度(例如,轨迹轻微偏差与物体违背重力向上飞行的区别)。
其次,针对物理特性视频基准的人工评估容易受到人类判断中固有反应偏差的影响。标注人员需要在有限的时间和注意力下观看视频、解读评分规则、识别相关视觉证据并进行评分。如果标注流程设计不当,基准评分可能会受到疲劳、反应捷径(response shortcuts)和顺序效应等因素的干扰。关于反应行为的社会科学研究已充分记录了这些问题 33, 5, 35, 21, 29。在物理特性视频评估中,这些问题尤为突出,因为标注人员必须区分"看起来合理"的视频与"真正满足相关物理约束"的视频。标注人员规模较小进一步加剧了这一问题,因为汇总评分可能更多地受个人偏好影响,而非反映模型稳定的性能。
第三,自动评估方法在物理规律感知和可审计性方面仍显不足。诸如 FVD40、SSIM、PSNR17 和基于 CLIP 的相似度32 等标准视频评估指标,虽有助于衡量分布相似性、像素级保真度或语义对齐度,却并非针对检测违反物理定律的情况而设计。近期出现的"VLM 作为裁判"(VLM-as-judge)方法提供了一种更具语义理解能力的替代方案,但其中许多方法依赖于闭源模型4, 18, 22。由于这些模型的架构、权重、训练数据、版本及 API 配置会随时间推移而变化,且不受基准测试用户完全掌控,因此评估结果往往难以复现或进行长期审计。此外,通用型 VLM 裁判未必擅长细粒度的物理特性诊断,尤其是在视觉上看似合理但包含细微物理违规的视频场景中。
为应对这些挑战,推出 PhyGround------一个基于明确标准的物理评估基准。如图 1 所示:PhyGround 将每个视频模型的整体物理推理得分分解为针对 13 条物理定律的各项得分。招募 459 名标注员,开展了一项大规模且经过质量控制的人工评估研究。基于这些人工标注数据,发布 PhyJudge-9B------这是一个经过微调的判别模型,支持可复现的自动化评估。

表1将PhyGround与六个侧重于物理特性的视频生成基准进行对比。首先,PhyGround结合明确的预期结果提示与基于物理定律的分解,从而支持更深入的诊断性评估。其次,PhyGround依托规模更大且经过质量控制的标注员团队,为人工评估提供更可靠的基础。第三,PhyGround提供一个开源评判模型,从而实现可复现的自动化评估。

1 提示词集构建
为了更客观、明确地评估物理正确性,从四个互补的来源中筛选 250 个提示词,并保留那些具有明确物理结果、视觉上可验证事件以及简洁日常场景的提示词。
预期结果增强。以往的基准测试大多基于隐式提示词:它们仅描述过程,而不指定物理结果(例如球是落下还是弹起)。最初的设计意图是考察视频模型能否推断出结果。然而,许多物理现象的发生并非必然,这导致视频可能出现多种结局,从而极大地影响了评估的可复现性。隐式提示词虽然能模糊地判断生成的视频看起来是否合理,却未必能揭示预期的物理结果是否真正发生。因此,我们修改了每个隐式提示词,增加了明确的预期物理结果。例如,"球在桌面上滚动"被改为"球在桌面上滚动并到达边缘后落下"。这迫使模型尝试呈现该物理现象,从而提高了对物理正确性的要求,并为评估者提供了明确的评分依据。所有提示词均采用"文本+图像生成视频"(ti2v)的格式,并以首帧图像作为图像条件。
筛选流程。首帧图像取自现有的视频语料库;具体而言,WorldModelBench 和 Physics-IQ 直接提供参考帧,而 OpenVid 和 VideoPhy-2 的首帧则提取自其原始视频。由于部分原始视频可能包含与评分标准相冲突的内容,在将每一组首帧图像和文本条件纳入提示词集之前,都会对其质量进行人工核查。
提示词多样性。图 2 展示了这 250 个提示词中核心动词和直接名词的分布情况。这250个提示涵盖了广泛且均衡的物理动作与实体:没有任何单一动词占据主导地位,每个动词都衍生出多种不同的对象,涉及刚体运动(投掷/撞击/滚动/弹跳)、重力与接触(跌落/着陆/放置/破碎)、流体(倾倒/流动/填充)、光学现象(投射/产生阴影/反射)以及工具使用(使用/握持/敲击)。

2 物理标准分类
定义一组跨三个领域的十三个物理定律。特别是,PhyGround 没有将"流体动力学"视为单一的整体类别,而是单独评估流动动力学、边界相互作用、位移和连续性,从而可以独立诊断同一域内的不同物理约束。形式上,令 L = {l_1 , . . . , l_13 } 表示定律集,D = {固体,流体,光学} 域集。每个视频都会根据其提示内容,使用 L 中的 2 至 4 条适用法律进行评估。
遵循关于有效性和测量质量的社会科学研究设计原则 33,用 1-5 等级来保留违规严重程度的差异,其中 1 表示完全不可信,5 表示完全可信。这种方法避免二元测量的限制,二元测量会将所有偏差归为同一类别,并模糊轻微缺陷和严重物理故障之间的区别。
3 自动 VLM 评判器
PhyGround 提供一个自动 VLM 评判器,用于支持可复现的大规模评估。该评判器接收视频帧、增强提示词(augmented prompt)以及针对特定标准的评分细则作为输入,并针对某项通用维度或适用的物理定律输出 1 到 5 分的评分。在进行物理定律评分时,评判器的提示词中会包含对应于该定律的子问题,作为观察核查清单。在实际操作中,针对每一项标准分别调用评判器;每个视频总共需要 5 到 7 次 VLM 调用:其中 3 次用于通用维度,2 到 4 次用于适用的物理定律。这种分项查询的方式确保每个提示词都专注于单一评分标准,减少不同性质标准间的相互干扰,从而生成更可靠且易于解析的诊断性评分。
子问题分解。针对 VLM 评判器,为每项物理定律设定 2 到 3 个子问题(SubQ),每个子问题针对特定的可观测属性。这些子问题将抽象的物理定律转化为视觉上可验证的观察项,并作为推理核查清单明确列入 VLM 评判器的提示词中,以此约束其观察视角并降低主观性。
4 评分
总体物理遵循度。从三个互补的维度评估每个视频。语义对齐(SA)衡量视频内容与文本提示的匹配程度。物理时间有效性(PTV)评估物理事件的时间序列是否符合合理的物理顺序。物体持久性(Persistence)评估物体在整个视频中是否保持一致的外观、形状和存在状态。
单项物理定律评分。对于每个视频,仅评估适用于其提示的物理定律子集,从而得出每个视频 2 到 4 个定律层面的评分。每项定律均独立评分,分数反映生成视频遵循该定律的程度。
人工标注。依据既定的有效且可靠的人工测量原则 5, 33, 35 设计标注流程。标注人员仅在台式设备上完成任务,以确保观看条件一致,并减少屏幕尺寸、分辨率和界面布局差异带来的影响。为避免疲劳和敷衍作答 21,每位标注人员平均评估约 12.6 个视频。参与者首先查阅知情同意书、研究概览、自愿参与声明及任务说明。任务描述中不透露研究假设,且模型身份被隐藏,以减少需求特征效应(demand effects)29。在表示同意后,参与者提供基本人口统计学信息,并完成一个简短的培训模块;该模块展示了不同程度的物理真实感,并解释了五点李克特量表(Likert scale)。在标注平台上进行评估时,每位参与者被随机分配来自总库的视频,且视频顺序独立随机化,以减少分配偏差、顺序效应和后续效应(carryover effects)。评分前,每个视频必须至少观看一次。标注人员针对三个总体维度和 2 到 4 项物理定律进行评分,均采用 1 到 5 分的李克特量表。最后,实施一套基于评分一致性、维度区分度、同伴一致性及行为参与度的两轮质量控制流程。
5 裁判模型训练
利用 LoRA 适配器进行监督微调,训练数据源自人工标注平台。每个样本为一个三元组 (v, q_k, y_k):包含视频帧 v;针对特定评估标准 k 实例化的增强提示词 q_k(其中包含预期结果);以及结构化的 JSON 评分标签 y_k = {k : s}。此处,s {1, . . ., 5} 表示汇总人工标注后得到的评分。设数据集为 D;仅 LoRA 参数 theta 可训练,且训练目标是最小化 token 级别的负对数似然。
训练过程采用留出验证(holdout validation)策略:在 Veo-3.1 的留出集上评估模型,并利用其余 7 个模型的人工标注数据进行训练。将最终微调得到的判别模型称为 PhyJudge-9B。
设置
视频生成模型。评估 8个涵盖不同架构和规模代表性范畴的视频生成模型,其中包括1个闭源模型(Veo-3.1 9)和7个开源模型(Wan2.2-27B-A14B 41、OmniWeaving 30、Cosmos-Predict2.5-14B 和 Cosmos-Predict2.5-2B 11、Wan2.2-TI2V-5B 41、LTX-2.3-22B 和 LTX-2-19B 13)。所有模型均在统一的 ti2v 格式下进行评估,共使用250个提示词(prompt),生成2,000个视频。除非另有说明,否则每个模型均在各自原生的默认生成设置(包括输出分辨率和帧率)下进行评估,且不进行事后标准化处理。
评估设计。总共招募 459 名标注员,他们通过评估平台针对全部 2,000 段视频,贡献 5,796 份完整标注和 37.4 万个独立标签。每段视频至少由两名标注员进行评估(其中 1,410 段视频由至少三名标注员评估)。针对物理导向视频生成基准测试所报告的人工标注员群体,算最大的。针对每一项物理定律,展示给标注员的评估参考标准(rubric anchor)包含该定律的核心问题及其附带说明(例如,针对重力:"不受支撑的物体向下坠落,抛射物沿曲线轨迹运动,倾倒的液体向下流动"),从而保持标注界面的简洁。经过两轮质量控制------即交叉验证四个相互独立的指标(评分一致性、基于"复制-粘贴"率衡量的单视频维度区分度、同行平均绝对误差 MAE 以及行为信号)------最终保留 352 名标注员,共获得 4,576 份完整标注和 29.5 万个独立标签;在 2,000 段视频中,仍有 1,831 段视频由至少两名标注员进行评估。
在 VLM(视觉语言模型)评估方面,将 Claude (Opus 4.7)、Gemini-3.1-Pro 38、Qwen3.5 9B-base 和 Qwen3.5 27B-base 1 纳入基准模型,并视情况采用"直接回答"和"思维链(Chain-of-Thought)"两种提示方式。
提示词选择
只有同时满足以下所有条件的提示词(prompt)才会被保留:
唯一的物理结果。预期结果必须明确无误,且仅有一种在物理上合理的结果。例如,"意大利面断成碎片"这一描述会被排除,因为碎片的数量没有唯一正确答案。
视觉可验证性。结果是否发生必须能从生成的视频中直观地看出来,无需专业领域知识或逐帧分析。
简洁的日常场景。提示词必须在50字以内描述一个发生在熟悉环境中的具体情境。需要专业实验室设备或罕见物体(如"旋转灌装机"、"折弯机")的提示词会被排除,因为视频模型缺乏这些物体的足够视觉参考信息。
域契合度。核心现象必须真正属于目标物理领域。仅通过关键词产生表面关联的提示词会被排除。例如,当底层机制是摩擦时,不应将"研磨"归类为"碰撞";同样,当场景主要描绘动物行为时,也不应将"企鹅入水"归类为"流体动力学"问题。
以物理现象为核心。场景必须由自然物理过程驱动。涉及机器和工具操作(如液压升降机、挖掘机、机械压力机)的场景会被排除,因为其物理结果只是机械动作的附带产物。涉及人类或动物主动运动(如跳跃、投掷、奔跑)的场景也会被排除,因为初始条件(如施加的力、发射角度)无法观测,导致正确结果的范围变得不确定。例如,"运动员投掷标枪"这一描述并未规定标枪应飞行30米还是60米。这与被动过程(如自由落体、流体流动、碰撞反弹)形成鲜明对比,在这些过程中,结果完全由可观测的初始状态决定。
物理定律选择
从 PhyGenBench 26、Physics-IQ 28、VideoPhy-2 4、VideoScience-Bench 18 和 WorldModelBench 22 的物理指标中筛选出 13 条定律。这些基准测试从不同的维度组织物理学:PhyGenBench 使用四个广泛的领域,Physics-IQ 和 VideoPhy 按场景类型分组,VideoScience-Bench 使用三级大学课程层次结构,而 WorldModelBench 则列出具体的物理定律。应用三个选择标准将它们整合为一个统一的词汇表。
选择标准包括:
视觉可观察性。物理现象必须能够从生成的短视频中立即验证。此标准排除了温度、能量和电磁场等无法直接观察的量。它也排除了那些原则上可观察,但在生成视频的典型短时间内无法可靠捕捉的现象。例如,热传导在视频帧中是不可见的,而熔化和沸腾虽然在视觉上明显,但很少会在如此短的时间内发生。
VLM 可区分性。每条定律都必须能够转化为 VLM 评判者可以可靠回答的具体视觉问题(例如,"无支撑物体是否会向下坠落?",而不是"视频是否符合万有引力定律?")。
范式兼容性。评估必须在没有真实参考视频的情况下也能进行(ti2v 范式)。这不包括 Physics-IQ 的像素级指标(空间 IoU、时空 IoU、加权空间 IoU、MSE),这些指标假设唯一的真实延续,并对物理上合理但视觉上不同的世代进行惩罚。
在 250 个提示中,每个领域的提示-定律标注数量分别为:固体 693 个,流体 136 个,光学 47 个。完整的定律细分见表 8,其中列出每条定律对应的(提示,定律)对的数量;报告每个定律和每个领域平均值所使用的样本量。

包含的定律有:
重力、惯性、动量守恒、不可穿透性、碰撞响应和材料属性。这些代表最基本的日常物理常识,并产生了最清晰的视觉评估标准。固体力学定律构成了基准测试的主体,因为几乎所有视频生成场景都涉及刚体。
流体(5 条定律)。浮力(重物下沉,轻物漂浮)、位移(液体浸入时液面上升,容器装满时溢出)、流动动力学(液体整体运动模式)、边界相互作用(对障碍物的响应------飞溅、偏转)以及流体连续性(质量守恒,无自发间隙或生成)。将浮力和位移合并到流体域中,因为它们都受液体行为控制,并且与流动动力学共享相同的物理基础;将它们作为单独的顶层域处理会导致每个视频的样本数量过少,无法进行稳定的域级聚合。
光学物理(2条定律)。反射(镜像内容与场景匹配)和阴影(方向与光源一致,与物体同步)。将阴影与反射分开,因为它们的评估标准截然不同:反射需要镜像内容匹配,而阴影需要方向一致性。这种划分源于 Physics-IQ 的光学类别,之前的基准测试并未采用。
完整的子问题清单。图 4 列出评估者针对三个领域共 13 条法律所使用的全部二元子问题。每个子问题都以违规探测的形式提出("是"的回答表示存在实际违规行为),为 VLM 法官提供了每条法律的具体检查清单。人工标注者看不到这些子问题。如果将检查清单提供给人工标注者,会增加标注负担,并可能导致评分过于机械化。相比之下,VLM 法官可以从明确的探测中受益,因为这些探测有助于构建其推理过程,并减少法律层面评估中的歧义。

排除的类别有:
热力学。相变(熔化、沸腾)和燃烧在生成的短视频中无法可靠地发生,产生的评估样本太少,且视觉边界模糊("部分熔化"与"未改变")。
电磁学。过滤后,没有提示针对电磁效应。更根本的是,大多数电磁现象产生的视觉效果与非电磁解释无法区分------磁斥力看起来与碰撞反弹完全相同,这使得VLM无法验证其潜在机制。
化学。氧化还原反应、酸碱反应及相关现象(VideoScience-Bench)过于复杂,现有视频模型无法生成,且评估人员无法仅从视频帧中判断其性质。
波动、能量和现代物理学。VideoScience-Bench仅以粗粒度覆盖这些领域。波动现象需要精确的空间模式;能量无法直接观察;现代物理学没有视觉评估标准。
参考依赖型和整体性指标。排除像素级参考指标(例如Physics-IQ的IoU系列指标,该指标需要与ti2v不兼容的真实视频)和整体物理评分(例如VideoPhy的PC、WorldModelBench的PA、PhyGenBench的二元自然度),因为这些指标无法提供关于模型违反哪些物理定律的诊断信息。采用1-5分制,将每个物理定律分解为子问题,从而解决这两个局限性。
评估设计
人工标注。根据既定的有效性和可靠性人工测量原则设计标注流程5, 33, 35。标注员仅在台式机设备上完成任务,以确保观看条件的一致性,并减少屏幕尺寸、分辨率和界面布局的差异。为了减少疲劳和低效作答21,每位标注员平均标注约12.6个视频。参与者首先阅读知情同意书、研究概述、自愿参与声明和任务说明。任务描述中不透露我们的假设,并且模型身份也被隐藏,以减少需求效应29。同意后,参与者需提供基本的人口统计信息,并完成一个简短的培训模块,该模块演示了不同程度的物理真实感,并解释了五点李克特量表。在标注平台上进行评估时,每个参与者都会从所有视频中随机分配到视频,并且视频顺序也是独立随机的,以减少分配偏差、顺序效应和残留效应。每个视频必须至少观看一次才能进行评分。标注员对三个通用维度和 2-4 条物理定律进行评分,每个维度和定律均采用 1-5 分的李克特量表。最后,应用两轮质量控制流程,该流程基于评分一致性、维度区分度、同行一致性和行为参与度。图 5 总结整个工作流程。

将标注过程设计为一项受控的人类测量研究,而非简单的标注任务。遵循既定的有效性和可靠性测量研究设计原则 33, 5, 35,目标是减少与生成视频的物理质量无关的标注噪声源。这些噪声源包括观看设备的差异、标注员疲劳、排序效应、响应捷径和需求效应。
观看环境和工作量控制。为确保观看条件的一致性,标注员必须仅在台式机上完成任务。此限制减少了屏幕尺寸、分辨率、界面布局和移动设备特有的观看行为方面的系统性差异。由于以物理为中心的视频评估需要仔细检查运动、物体行为和视觉一致性,因此移动设备观看可能会引入不必要的测量噪声。为了减少这项认知负荷较高的任务中的疲劳和敷衍作答21,还将每位标注者的工作量限制在平均约12.6个视频。此工作量限制旨在确保标注会话足够短,以便标注者能够认真应用评分标准,而不是依赖捷径。
下表9 所示评估标准分类:3项适用于所有视频的通用物理合规性标准,以及按领域划分的13条物理定律。第3列显示了针对每项标准向人工标注员提出的问题。

实验步骤如下:
- 随机分配与呈现顺序。当受试者进入自主开发的标注平台时,系统会从完整的视频库中随机分配一部分视频给他们。视频的呈现顺序针对每位标注者独立随机化。这些程序旨在减少分配偏差、顺序效应及后续效应(carryover effects)。随机分配避免特定标注者与特定提示词(prompt)、模型或难度等级之间出现系统性匹配的情况;随机呈现顺序则降低了先观看的视频影响后续视频评估结果的风险。
- 知情同意、任务说明与人口统计学信息。参与者首先查阅知情同意书、研究概览、自愿参与声明及其他必要信息。任务说明中不透露研究假设,且标注者无法获知视频对应的模型身份。这种设计降低标注者因揣测研究人员期望而调整评分的可能性------即行为研究中常讨论的"需求特征"(demand characteristics)问题 29。在表示同意后,参与者需提供与评估相关的人口统计学信息,包括年龄段、性别、教育背景及专业。这些变量仅用于对标注者群体进行总体特征描述,并与任何可识别身份的课程学分记录相隔离。
- 训练环节。在正式开始评估任务前,标注者需完成一个简短的训练环节。该环节展示体现不同物理真实性水平的示例视频,并讲解如何使用五点李克特量表(Likert scale)。此步骤有助于标注者理解"视觉合理性"与"物理正确性"之间的区别,并明确微小瑕疵、中度不一致以及严重物理违背现象应如何在评分量表中体现。
- 评分流程。在评分前,每段视频必须至少观看一次。标注者需评估三个主要维度------语义对齐(semantic alignment)、物理时间有效性(physical temporal validity)及物体持久性(object persistence)------以及该视频所涉及的适用物理定律。评分设计要求标注者基于可观察的视觉证据进行评估,而非求解物理方程或估算物理参数。
质量控制流程
原始标注数据经过两轮质量控制。筛选过程采用四个相互独立的指标;只有当多个指标同时出现异常时,才会剔除该标注者:
- 评分恒定性(Score Constancy):标注者评分的标准差(std)。std = 0 意味着标注者对每个视频的每个维度都给出了相同的分数,无法提供任何区分性信息;std < 0.3 被视为"近乎恒定"。
- 单视频"复制粘贴"率(Per-video Copy-paste Rate):指标注者是否对同一视频内的所有维度给出完全相同的评分。100% 的复制粘贴率意味着标注者未区分评估维度(例如"重力"与"碰撞"),因此即使该标注者跨视频的总体标准差大于零,其标签仍应被视为无效。该指标是对评分恒定性的补充:存在复制粘贴行为的标注者其总体标准差可能大于零,从而逃过恒定性检测。
- 同行平均绝对误差(Peer MAE):指某标注者在特定"视频-维度"组合上的评分与其他标注者评分之间的平均绝对误差(MAE),该值基于该标注者参与的所有两两比对计算得出。在 1--5 分的评分量表中,若 Peer MAE 超过 1.8,则被标记为异常值,这相当于平均与同行存在近两个分值的差异;该阈值约为群体典型两两差异的两倍,表明存在系统性偏差或评分本质上是随机的。由于诚实的标注者偶尔也会产生分歧(例如因评分标准更严格或更宽松),因此不会仅凭 Peer MAE 剔除标注者,必须同时伴随行为异常或高复制粘贴率。
- 行为指标:每次提交标注时都会记录两个平台端指标。页面停留时间(Page stay time)指从页面加载到提交评分之间经过的秒数;若标注者提交记录的中位数低于 30 秒,则视为"停留时间短"(视频本身通常长达数秒,而使用李克特量表对 3 个常规维度及 2--4 个物理定律进行评分,实际至少需要半分钟);若低于 10 秒,则视为时间过短,无法进行任何审慎判断。视频播放次数(Video play count)指标注者在提交前触发视频播放的次数;如果某位标注者所有提交记录中的最大播放次数均为零,则意味着其评分是在未播放视频的情况下给出的;这违反了"评分前必须至少观看一次视频"的规定。单独依据任一指标都可能存在误差:标注者既可能动作迅速又保持严谨,从而快速提交;而播放计数器有时也可能出现漏记情况。因此,只有当此类行为异常与"复制粘贴"或"同行 MAE(平均绝对误差)"证据结合时,才会将其作为判定依据。
总体而言,该流程剔除 23.3% 的标注者及其相关评分(标注者总数从 459 人减少至 352 人)。