数据名称:上市公司数字技术风险数据
时间范围:2000-2024年
数据层级:上市公司-年度层面
核心指标:digi_risk数字技术风险暴露、data_risk数据风险暴露、cyber_risk网络风险暴露
识别变量:stkcd、year;辅助识别变量包括 stock_code股票代码、证券代码、证券中文简称、company。
文件格式:结果数据提供 .dta 与 .xlsx 格式;原始与过程数据包括 .csv、.xlsx、.dta、.docx、.pdf;代码文件包括 .py 与 .do;数据质量评估结果包括 .csv、.jpg、.log。
本数据以A股上市公司年报文本中的数字技术风险相关语句为基础,结合“数据风险、网络风险、具体技术风险”关键词体系和 FinBERT 情感识别结果,按公司-年度构建数字技术风险暴露、数据风险暴露、网络风险暴露三类指标,并合并上市公司基本信息、股票类型、行业A-D层级、注册资本、上市日期、成立日期、退市日期等公司层面字段;未剔除金融ST未缩尾版本覆盖2000-2024年、5,408家公司、45,780条公司-年度观测,其中 digi_risk数字技术风险暴露均值为0.997538、标准差为0.005751、中位数为0.998864,data_risk数据风险暴露均值为0.262713、标准差为0.438878、中位数为0.000000,cyber_risk网络风险暴露均值为0.927545、标准差为0.254723、中位数为0.998848;剔除金融ST未缩尾版本覆盖4,799家公司、38,381条公司-年度观测,digi_risk均值为0.997474、标准差为0.005973、中位数为0.998848,data_risk均值为0.268420、标准差为0.441889、中位数为0.000000,cyber_risk均值为0.926228、标准差为0.256877、中位数为0.998848;剔除金融ST缩尾版本覆盖4,799家公司、38,381条公司-年度观测,digi_risk均值为0.997637、标准差为0.004285、中位数为0.998848,data_risk均值为0.268420、标准差为0.441889、中位数为0.000000,cyber_risk均值为0.926228、标准差为0.256876、中位数为0.998848,可用于上市公司数字化风险、文本风险暴露、行业异质性、资本市场反应及稳健性检验等实证研究。
二、原始数据与基本信息合并
上市公司数字技术风险关键词分类数据.xlsx:该文件为数字技术风险关键词分类表,工作表为“数字技术风险”,共104条关键词记录,覆盖数据风险、网络风险、具体技术风险三类及9个子类,主要字段为 分类、子类、关键词。
上市公司数字技术风险句子情感识别明细数据.csv:该文件为上市公司年报中识别出的数字技术风险相关句子及其情感标签明细,共173,657条句子记录,覆盖2000-2024年和5,408家公司,主要字段为 id、stock_code、company、year、file_path、sentence、risk_label、process_time。
上市公司数字技术风险核心指标过程数据.csv:该文件为核心风险暴露指标过程表,当前数据包中该表保留表头但无观测记录,主要字段为 id、stock_code、company、year、file_path、digi_risk、data_risk、cyber_risk、process_time。
上市公司基本信息数据.dta:该文件为上市公司基本信息数据,共5,718家公司记录,用于按 stkcd 补充证券代码、证券中文简称、上市日期、股票类型、ABH股交叉码、公司名称、公司中文简称、公司英文名称、行业名称D、行业代码D、行业名称C、行业代码C、行业名称B、行业代码B、行业名称A、行业代码A、注册资本、成立日期、退市日期等公司层面信息。
行业代码对应.xlsx:该文件为行业描述与行业代码对应关系表,共16条记录,用于辅助理解行业代码口径,主要字段为 政策文件中的行业描述、2017年行业代码 (大类)、对应的2012年格式代码。
《上市公司行业分类指引》(2012年修订).docx:该文件为上市公司行业分类口径参考资料,用于解释行业A-D层级字段。
GBT+4754-2017.pdf:该文件为国民经济行业分类参考资料,用于解释2017年行业代码口径。
三、计算说明
【digi_risk数字技术风险暴露】该指标衡量上市公司年报中数字技术风险相关内容的总体风险暴露程度。代码先依据关键词表提取包含数字技术风险关键词的年报句子,再使用 FinBERT 输出句子负面、中性、正面概率;对同一公司-年度的相关句子,计算公式为 max(负面句子概率最大值 - 正面句子概率均值, 0)。取值越大表示公司年报中数字技术相关表述的负面风险暴露越强;取值为0表示未形成正向风险暴露差值或无可用相关句子。
【data_risk数据风险暴露】该指标衡量上市公司年报中“数据风险”类关键词对应语句的风险暴露程度,计算口径与 digi_risk 一致,但仅使用关键词分类为“数据风险”的语句。取值越大表示数据安全、数据泄露、信息风险等相关风险暴露越强;取值为0表示该类风险暴露未体现或负面概率不高于正面概率均值。
【cyber_risk网络风险暴露】该指标衡量上市公司年报中“网络风险”类关键词对应语句的风险暴露程度,计算口径与 digi_risk 一致,但仅使用关键词分类为“网络风险”的语句。取值越大表示网络安全、网络攻击、系统安全等相关风险暴露越强;取值为0表示该类风险暴露未体现或负面概率不高于正面概率均值。
【risk_label】该变量为句子情感识别标签,-1表示负面风险语句,0表示中性语句,1表示正面语句;结果数据中不保留该句子级变量,仅在句子情感识别明细数据中用于核心指标计算。
【_is_financial】该变量为计算代码中的临时金融行业识别变量,行业名称A等于“金融”或行业代码A等于“0001”时记为1;该变量仅用于生成剔除金融样本,最终结果数据中不保留。
【_is_stpt_delisted】该变量为计算代码中的临时 ST/PT/退市样本识别变量,证券中文简称、company、公司中文简称、公司名称中包含 ST、*ST、*ST、PT、退市,或退市日期非空时记为1;该变量仅用于生成剔除 ST/PT/退市样本,最终结果数据中不保留。
【缩尾处理】剔除金融ST缩尾版本在剔除金融行业与 ST/PT/退市样本之后,仅对 digi_risk数字技术风险暴露、data_risk数据风险暴露、cyber_risk网络风险暴露 三个核心连续指标进行1%和99%分位缩尾,其他变量不做缩尾处理。
四、结果数据文件
共有3套结果数据文件。样本筛选步骤如下:
(1) 以合并基本信息后的上市公司-年度风险暴露数据为基础,保留全部样本,生成未剔除金融ST未缩尾版本;
(2) 根据行业名称A、行业代码A识别金融行业样本,并根据证券简称、公司名称、退市日期识别 ST/PT/退市样本,剔除上述样本后生成剔除金融ST未缩尾版本;
(3) 在剔除金融ST未缩尾版本基础上,对三项核心风险暴露指标进行1%和99%分位缩尾,生成剔除金融ST缩尾版本。
编号 文件名称 说明
1 计算结果+未剔除金融ST未缩尾版本.dta Stata格式结果数据,保留金融行业、ST/PT/退市样本且不进行缩尾,样本量为45,780条公司-年度观测,适合原始全样本留档、口径复核与敏感性比较。
2 计算结果+未剔除金融ST未缩尾版本.xlsx Excel格式结果数据,内容与同名 .dta 文件一致,便于直接查看与跨软件使用。
3 计算结果+剔除金融ST未缩尾版本.dta Stata格式结果数据,剔除金融行业、ST/PT/退市样本但保留核心指标原始极端值,样本量为38,381条公司-年度观测,适合清洗样本下的描述统计与稳健性比较。
4 计算结果+剔除金融ST未缩尾版本.xlsx Excel格式结果数据,内容与同名 .dta 文件一致,便于直接查看与跨软件使用。
5 计算结果+剔除金融ST缩尾版本.dta Stata格式结果数据,剔除金融行业、ST/PT/退市样本并对核心风险暴露指标进行1%/99%缩尾,样本量为38,381条公司-年度观测,通常适合作为实证回归主结果版本。
6 计算结果+剔除金融ST缩尾版本.xlsx Excel格式结果数据,内容与同名 .dta 文件一致,便于直接查看与跨软件使用。
五、变量说明
序号 变量名称 变量类型 变量说明
1 stkcd float 上市公司证券代码数值型口径,是基本信息合并与面板识别的主要公司代码。
2 证券代码 str 上市公司证券代码字符型口径,来自上市公司基本信息数据。
3 证券中文简称 str 上市公司证券中文简称,来自上市公司基本信息数据。
4 上市日期 str 上市公司上市日期,来自上市公司基本信息数据。
5 股票类型 str 股票类型,来自上市公司基本信息数据。
6 行业名称A str 行业A层级名称,来自上市公司基本信息数据。
7 行业代码A str 行业A层级代码,来自上市公司基本信息数据;金融行业识别使用该字段及行业名称A。
8 行业名称B str 行业B层级名称,来自上市公司基本信息数据。
9 行业代码B str 行业B层级代码,来自上市公司基本信息数据。
10 行业名称C str 行业C层级名称,来自上市公司基本信息数据。
11 行业代码C str 行业C层级代码,来自上市公司基本信息数据。
12 行业名称D str 行业D层级名称,来自上市公司基本信息数据。
13 行业代码D str 行业D层级代码,来自上市公司基本信息数据。
14 注册资本 float 公司注册资本,来自上市公司基本信息数据。
15 成立日期 str 公司成立日期,来自上市公司基本信息数据。
16 退市日期 str 公司退市日期,来自上市公司基本信息数据;非空时用于识别退市样本。
17 stock_code股票代码 float 年报文本或过程数据中的股票代码字段,是风险暴露计算阶段的公司代码。
18 company str 年报文本或过程数据中的公司名称字段,用于识别公司并辅助识别 ST/PT/退市样本。
19 year float 年份变量,是面板时间识别变量,范围为2000-2024年。
20 digi_risk数字技术风险暴露 float 数字技术风险总体暴露指标,取值越大表示数字技术相关负面风险暴露越强。
21 data_risk数据风险暴露 float 数据风险暴露指标,取值越大表示数据安全、数据泄露、信息风险等相关风险暴露越强。
22 cyber_risk网络风险暴露 float 网络风险暴露指标,取值越大表示网络安全、网络攻击、系统安全等相关风险暴露越强。
23 ABH股交叉码 str A/B/H股交叉码,来自上市公司基本信息数据。
24 公司名称 str 公司全称,来自上市公司基本信息数据。
25 公司中文简称 str 公司中文简称,来自上市公司基本信息数据。
26 公司英文名称 str 公司英文名称,来自上市公司基本信息数据。
六、代码文件
文件名称 语言 说明
上市公司数字技术风险数据计算代码.py Python 用于读取关键词表、句子情感识别明细、核心指标过程数据与上市公司基本信息数据,计算或整理数字技术风险暴露指标,合并基本信息,并输出三套 .dta 与 .xlsx 结果文件。
上市公司数字技术风险数据计算代码.do Stata 用于按 Stata 口径复现结果整理流程,完成基本信息合并、金融行业与 ST/PT/退市样本识别、1%/99%缩尾处理,并输出三套 .dta 与 .xlsx 结果文件。
上市公司数字技术风险数据评估代码.py Python 用于对结果 .dta 文件进行数据质量评估,输出描述统计、频率分布、分布图、异常值检验、逻辑合理性验证、稳健性测试和总评估结论表。
上市公司数字技术风险数据评估代码.do Stata 用于按 Stata 口径独立运行数据质量评估,输出与 Python 版功能对等的数据质量评估报告、日志、图形和汇总表。
七、数据质量评估
评估结果存放于 数据质量评估报告_20260620 文件夹,运行日志为 评估日志_20260620.log。各子文件夹内容如下:
子文件夹名 内容说明
1 数据分布分析 存放各结果版本的描述性统计与变量频率分布 csv 文件,共81个 csv 文件。
2 分布图 存放核心数值变量及主要数值变量的直方图、箱线图、核密度图、散点图矩阵、时间趋势图 jpg 文件,共81个 jpg 文件。
3 异常值检验 存放各结果版本的缺失值统计与异常值统计 csv 文件,共6个 csv 文件。
4 逻辑合理性验证 存放各结果版本的时间连续性问题与取值范围检验 csv 文件,共6个 csv 文件。
5 稳健性测试 存放不同样本期核心指标对比与不同处理版本核心指标对比 csv 文件,共2个 csv 文件。
总评估结论表_20260620.csv 汇总每个结果版本、每个变量的缺失、异常值、取值范围、一致性检验状态,共78行、14列。
八、参考文献
[1] 本数据包未提供可核验的正式论文题录信息;如后续确认数据来源论文或方法论文,可在此补充作者、题名、期刊、年份、卷期与页码。
[2] 代码与论文方法的逐项对比说明.docx:本地随包提供的方法对照文件,用于说明关键词分类、文本预处理、FinBERT情感识别与风险指标计算的对应关系。
数据质量评估报告_20260620.zip
(11.56 MB)
上市公司数字技术风险2024-2000年含do-python代码和excel-dta格式数据.zip
(61.29 MB, 需要: RMB 35 元)


雷达卡



京公网安备 11010802022788号







