导读:
文本情感分析已广泛用于在线评论和旅游体验研究,但小红书内容具有笔记--评论双层结构,评论往往需要结合原笔记才能准确理解。为避免在数据清洗阶段误删有价值评论,或在主题分析中因简单拼接造成噪声混入与主题情感错配,本文构建面向笔记--评论融合的评论上下文依赖识别任务。本文以小红书旅游评论为研究对象,整理有效评论数据30,802条,并依据语义将评论划分为完整语义评论、上下文依赖评论和无有效态度评论三类。该分类将评论处理由简单"保留/删除"转化为"独立分析/融合分析/过滤噪声"的分层策略,使缺少对象但包含情绪态度的评论得以保留,也避免无效互动进入后续主题建模。在双人人工标注与分歧复核基础上,本文比较BERT、ERNIE等八类模型,并通过五次数据划分检验结果稳定性。实验结果显示,预训练语言模型整体优于传统机器学习方法,其中ERNIE-3.0-base取得最高平均Macro F1;同时,上下文依赖评论的识别效果仍明显低于其他类别。进一步的BERTopic下游验证表明,分层处理策略能够提升主题一致性和主题区分度,说明该分类体系具有实际应用价值。本文可为层级评论数据清洗、评论保留策略和笔记--评论融合建模提供参考。
作者信息:
孙杰一:同济大学经济与管理学院,上海
doi:
层级评论上下文依赖识别数据集构建与研究------以小红书旅游评论数据为例
论文详情
数据来源与标注体系
本文数据来源于小红书平台中与旅游体验相关的笔记及其评论内容。数据来源与规模如表 1 所示。

本文的分类目标并不是判断评论情感正负,而是判断评论是否能够脱离原笔记独立理解、是否需要 结合笔记上下文,以及是否具有进入后续旅游主题分析的价值。基于这一目标,本文构建了三类标签: Label 0 为完整语义评论,Label 1 为上下文依赖评论,Label 2 为无有效态度评论。具体判定标准如表 2 所示。

数据集中三个类别的样本数量与比例如表 3 所示。

实验设计
数据集划分方式如表 4 所示。

具体模型设置如表 5 所示。

主要训练参数如表 6 所示。

本文采用 Accuracy、Precision、Recall 和 F1 值评价模型效果。
多模型测试结果与分析
如表 7 所示,8 类模型在 5 次数据划分下的测试集平均结果。

图 2 展示了主要预训练模型在 5 次划分中的 Macro F1 波动情况,而不是重复模型总体排名。

平均表现最优的 ERNIE-3.0-base 在 5 次测试集上的平均混淆矩阵如图 3 所示。

综合表 7、图 1 和图 2,本文实验得到三个主要结论。第一,预训练语言模型比传统词面特征模型更适合小红书旅游评论上下文依赖识别任务,说明上下文语义表示能力是该任务的关键。第二,ERNIE-3.0- base 在平均性能上最优,MacBERT-base 和 RoBERTa-wwm 表现接近,可作为后续研究的重要基线。第三,Label 1 是最难识别的类别,其难点来自评论文本自身的语义不完整,而不是简单的情感正负差异。 这一结果也从实验层面支持了本文对小红书评论进行分层处理的必要性。
为进一步验证本文提出的评论分层策略在实际文本分析任务中的应用价值,本文设计了下游主题建 模验证实验。具体实验过程及结果详见原文链接。
结论
研究结果表明,预训练语言模型整体优于传统机器学习方法,其中 ERNIE-3.0-base 在多次数据划分下最高平均 Macro F1,但上下文依赖评论仍是三类评论中最难识别的类别。进一步的下游实验表明,基于本文标签体系的分层处理策略能够改善 BERTopic 主题建模的数据输入质量,提升主题结果的语义一 致性和可解释性。