数据名称:上市公司绿色化转型词频结果数据。
时间范围:2000—2025年。
数据层级:上市公司—年度面板数据。
识别变量:stkcd(上市公司代码)与 year(年度)。
核心指标:绿色化转型词频、绿色化转型指数。
文件格式:Stata .dta、Excel .xlsx;计算代码、评估代码与本说明均为 UTF-8 编码。
本数据以上市公司年报绿色化转型词项频次为基础,将“绿色发展”至“绿色创新战略”之间连续排列的113个词项逐行汇总,并计算相应对数指数。结果数据进一步匹配公司年度行业与注册地区信息,并按 stkcd 补充上市公司静态基本信息,可用于企业绿色化转型、绿色战略、环境治理及资本市场后果等研究。
二、原始数据与基本信息合并
1. 上市公司绿色化转型词频计算基础数据.dta/.xlsx:共73,441条原始记录、115个字段,包含证券代码、年份和113个绿色化转型词项频次。
2. 上市公司行业及注册地区信息数据.dta:公司年度行业与注册地区信息,主要字段包括 stkcd、year、证券简称、行业代码、行业名称、所属省份和所属城市。
3. 行业代码/上市公司基本信息数据.dta:公司层面静态基本信息,主要字段包括 stkcd、证券中文简称、上市日期、股票类型、ABH股交叉码、公司名称、行业A—D、经营范围、公司沿革、注册资本、成立日期和退市日期。
计算时先按 stkcd-year 与年度行业及注册地区信息进行多对一匹配,再按 stkcd 与上市公司基本信息进行多对一合并。同名字段以基本信息数据中的非缺失值为主;基本信息缺失时保留结果数据原值。
三、核心指标计算说明
1. 绿色化转型词频:对同一公司同一年度从“绿色发展”到“绿色创新战略”的113个绿色化转型词项频次求和。缺失词项按 Stata egen rowtotal() 的原计算口径处理,即对可用词项求和;若全部词项均缺失,行合计为0。
2. 绿色化转型指数:绿色化转型指数 = ln(绿色化转型词频 + 1)。加1用于保留词频为0的观测并避免对0取对数。
3. 基础范围处理:剔除证券代码前3位为200或900的B股记录;从年份字段提取四位年度,仅保留2000—2025年;按 stkcd-year 匹配年度行业与地区信息。
4. 缩尾处理:在已经剔除金融行业、ST/PT及退市公司的清洗样本内,按 year 分组,分别对绿色化转型词频和绿色化转型指数实施1%与99%分位缩尾。Stata 使用 winsor2,Python 使用与 Stata _pctile 对应的分位点定义。
四、结果数据文件与样本量
1. 计算结果未剔除金融ST未缩尾版本.dta/.xlsx:保留金融行业、ST/PT及退市公司,不缩尾;72,584条公司—年度观测。绿色化转型词频均值为8.6163204011903449,绿色化转型指数均值为1.7633801421673436。
2. 计算结果剔除金融ST未缩尾版本.dta/.xlsx:剔除行业代码以J开头的金融业观测,剔除简称含ST或PT、退市日期非空及简称含“退”的公司,不缩尾;64,795条公司—年度观测。绿色化转型词频均值为8.8095532062659156,绿色化转型指数均值为1.8076905994202124。
3. 计算结果剔除金融ST缩尾版本.dta/.xlsx:沿用第2套清洗样本,并按年度对两项核心指标实施1%与99%缩尾;64,795条公司—年度观测。绿色化转型词频均值为8.4934948684312062,绿色化转型指数均值为1.8047667740800841。
三套结果均为32个字段,stkcd-year 无重复。每套结果的 DTA 与 XLSX 内容对应;Stata 与 Python 计算结果按 stkcd-year 排序逐行核验,两项核心指标最大绝对差异均为0。
五、结果变量说明
1. 证券代码(string):六位证券代码字符串。
2. 证券简称(string):公司年度证券简称。
3. stkcd(double):数值型上市公司代码,面板ID。
4. year(double):四位公司年度,时间变量。
5. 绿色化转型词频(double):113个绿色化转型词项频次之和。
6. 绿色化转型指数(double):ln(绿色化转型词频+1)。
7. 行业代码、行业名称(string):公司年度行业代码及名称。
8. 所属省份、所属省份代码、所属城市、所属城市代码(string):公司年度注册地区信息。
9. 证券中文简称(string):基本信息数据中的证券中文简称。
10. 上市日期(string):公司上市日期。
11. 股票类型(string):公司股票类型。
12. ABH股交叉码(string):A/B/H股交叉上市标识。
13. 公司名称、公司中文简称、公司英文名称(string):公司名称信息。
14. 行业名称D、行业代码D、行业名称C、行业代码C、行业名称B、行业代码B、行业名称A、行业代码A(string):不同层级行业分类信息。
15. 经营范围、公司沿革(string/strL):公司经营范围与历史沿革长文本。
16. 注册资本(double):公司注册资本。
17. 成立日期、退市日期(string):公司成立与退市日期。
六、计算与评估代码
1. 上市公司绿色化转型词频数据计算代码.do:Stata 15+计算代码,生成三套 DTA 与 XLSX 结果。
2. 上市公司绿色化转型词频数据计算代码.py:与 Stata 在指标计算、样本筛选、合并、缩尾和结果命名上对等的 Python 脚本。
3. 上市公司绿色化转型词频数据评估代码.do:可独立运行的 Stata 数据质量评估代码。
4. 上市公司绿色化转型词频数据评估代码.py:可独立运行的 Python 数据质量评估脚本。
七、数据质量评估
评估程序递归识别计算结果 DTA,自动探测 stkcd 与 year,区分数值变量和字符变量,并按运行日期创建“数据质量评估报告_YYYYMMDD”。报告含五个固定子文件夹:1 数据分布分析、2 分布图、3 异常值检验、4 逻辑合理性验证、5 稳健性测试。
主要评估内容包括描述性统计与频率分布、直方图/箱线图/核密度图/散点图矩阵/时间趋势图、Z-score与IQR异常值、变量缺失率、面板键重复与年度断档、取值范围、不同样本期和不同处理版本比较。总评估结论逐变量给出样本量、非缺失数、均值、标准差、缺失率、异常值比例、范围越界率及“通过/关注/不通过”状态。项目专属逻辑检验为“绿色化转型指数 = ln(绿色化转型词频+1)”。
八、参考文献
周阔,王瑞新,陶云清,郑逸婷. 企业绿色化转型与股价崩盘风险[J]. 管理科学,2022,35(6):56—69。
说明:原项目论文用于核对绿色化转型指标的研究背景与应用场景;本文件夹中的实际计算变量、样本筛选与输出结果以整理后的 Stata/Python 计算代码及最终 DTA 为准。
数据质量评估报告_20260716.zip
(6.29 MB)
上市公司绿色化转型词频2000-2025年含do-python代码和excel-dta格式数据.zip
(69.37 MB, 需要: RMB 32 元)


雷达卡




京公网安备 11010802022788号







