2411 企业数据要素应用能力数据(2010-2025)
| 数据来源 | 由数据皮皮侠团队进行人工标注、整理和核对,全部内容真实有效。 |
| 时间跨度 | 2010-2025年 |
| 区域跨度 | 可获取年度报告MD&A文本且能够与上市公司基础信息成功匹配的中国A股上市公司 |
| 数据格式 | Excel形式 |
本数据为中国上市公司企业数据要素应用能力数据,主要来源于上市公司年度报告“管理层讨论与分析”(MD&A)文本及上市公司基础信息。参考巫强、曹长帅与汪阳昕(2026)的研究思路,本数据从企业数据要素应用的广度与深度两个维度出发,识别企业是否在研发设计、生产运营、采购物流、营销服务、经营管理、风险控制与数据安全等业务场景中实际部署和使用数据相关技术,并形成公司—年份层面的企业数据要素应用能力指标。
具体而言,首先对上市公司MD&A文本进行编码统一、字符清理和语句切分,并依据数据基础设施、数据处理与分析、数据管理与存储、数据驱动应用以及数据安全与隐私保护等类别建立关键词体系。广度维度主要覆盖服务器、数据中心、算力、数据平台、数据中台、数据分析、数据库、数据湖与云存储等词语;深度维度主要覆盖数字孪生、机器人、自动化、物联网、机器学习、神经网络、计算机视觉、数据安全、隐私保护、数据合规与隐私计算等词语。互联网技术、信息技术、数据管理、信息管理、AI、人工智能、智能、数据驱动、技术赋能和数字化等宽泛词仅用于辅助识别语境,不单独计入核心词频。
为减少行业趋势、政策背景、产品介绍、客户应用、未来计划、荣誉认定及一般词义造成的误判,本数据在关键词筛选基础上,使用人工标注语句微调中文BERT二分类模型,判断相关语句是否体现企业自身已经开展的实际应用。模型将“企业自身实际部署、应用或使用数据技术”记为1,将行业背景、业务介绍、对外产品或服务、未来规划、口号及无关含义记为0。正式计算时,当模型预测企业实际应用的概率大于或等于0.60时,该语句被保留;低于0.60时予以排除。
在公司—年份层面,广度核心词频表示被保留语句中广度类核心词出现的总次数,深度核心词频表示被保留语句中深度类核心词出现的总次数,核心词总频次为二者之和。在此基础上构造企业数据要素应用广度(Breadth)、应用深度(Depth)和综合应用能力(Dea)三个指标。其中,Breadth=ln(1+广度核心词频),Depth=ln(1+深度核心词频),Dea=ln(1+广度核心词频+深度核心词频)。未识别到候选语句或未识别到有效核心词的公司—年份记录仍予以保留,相应指标记为0。
本数据可用于分析企业数据要素应用能力的时间变化、行业差异与地区分布,也可与上市公司供应链韧性、创新产出、全要素生产率、经营绩效、投资效率、融资约束、风险承担和绿色转型等数据结合,研究数据要素应用的经济后果及其作用机制。广度指标更侧重企业在数据基础设施、处理分析与管理存储方面的投入和覆盖范围,深度指标则更侧重数据技术在具体业务场景中的嵌入程度以及数据安全与隐私保护能力。
股票代码 | 年份 | 股票简称 | 行业代码 |
行业名称 | 省份代码 | 省份 | 城市代码 |
城市 | 上市状态 | 广度核心词频 | 深度核心词频 |
核心词总频次 | Breadth | Depth | Dea |

[1]巫强,曹长帅,汪阳昕.企业数据要素应用能力与供应链韧性:广度与深度的差异化机制[J].中国工业经济,2026,(3):170-193.