一、数据简介与研究价值
企业数智化转型本质上是一场系统性变革,如何对其进程进行客观、可比的量化刻画,一直是实证研究面临的难点。本数据集依托 Python 文本分析技术,基于 A 股上市公司年报构建了数智化关键词词频指标,能够同时刻画企业数字化与智能化融合的广度与深度。借助这一指标,研究者既可识别企业技术应用的真实水平,也可对数智化转型进程进行逐年动态追踪,从而为企业行为变革研究提供可观测的微观基础。
从学术意义上看,该指标为理解数智化如何重塑企业信息披露行为提供了切入点:其一,它将数字化转型经济后果的研究边界从传统的治理效率、市场表现等议题,拓展至信息披露策略的选择;其二,相关研究验证了数智化对正式渠道量化预测信息的替代效应,揭示出企业借助非正式渠道的定性披露来规避风险、优化投资者沟通的新型范式。这为解释数字经济时代企业在披露渠道偏好、披露形式创新及风险应对等方面的机制提供了理论突破口。本数据集的构建方法参照刘凌冰、王语彤、耿会欣(2024)发表于《会计研究》的研究设计。
二、指标构建方法
数据处理流程如下:以 A 股上市公司年报文本为原始语料,依据上市公司行业分类名单剔除金融业、保险业公司以及 ST 类和样本期内退市的公司;对筛选后的年报文本进行中文分词,并参照哈工大停用词表过滤无实质含义的停用词,提取有效词汇;随后基于预先定义的数智化专业词典,识别文本中的行业特征术语。
数智化识别词典涵盖的技术术语包括(部分示例):
智能金融合约、机器学习、流计算、深度学习、混合现实、差分隐私技术、智能医疗、电子商务......
在词频统计阶段,分别计算各公司年报中特征术语的绝对出现频次,以及其占总文本词汇量的相对比重。考虑到此类数据呈现典型的"右偏"分布特征,进一步做对数化处理(即词频加 1 后取自然对数),最终形成刻画企业数智化程度的综合指标。数据集同时输出股票代码、公司名称、总词数、特征词频次及其占比等结构化字段,可为监管部门完善信息披露规则、投资者提升信息甄别能力提供实践参考。
三、数据基本信息

四、数据字段说明

五、数据示例

数智化指标数据示例(字段展示)
参考文献
1 刘凌冰, 王语彤, 耿会欣. 企业数智化与量化预算目标信息披露行为J. 会计研究, 2024(11): 63-78.
顶部专栏分享更多内容
来源:Paper数据分析
