数据名称:上市公司是否重污染行业企业年度指标数据
时间范围:2000—2025年
数据层级:上市公司—年度面板
核心指标:是否重污染行业企业1、是否重污染行业企业2、是否重污染行业企业3
识别变量:stkcd、year;原始证券识别字段为证券代码
文件格式:Stata DTA、Excel XLSX、Stata DO、Python PY
二、原始数据与基本信息合并
上市公司行业分类与地区年度数据.dta:上市公司年度行业、地区和公司简称基础面板,共75,495条;主要字段为证券代码、证券简称、stkcd、year、行业代码、行业名称、所属省份、所属省份代码、所属城市、所属城市代码。
行业代码\上市公司基本信息数据.dta:按公司静态合并的基本信息,共5,718家公司;主要字段为证券代码、证券中文简称、上市日期、股票类型、ABH股交叉码、公司名称、行业A-D代码及名称、所属省份、所属城市、经营范围、公司沿革、注册资本、成立日期、退市日期、stkcd。
合并规则:先按stkcd-year去除重复公司年度记录,再按stkcd进行基本信息公司级合并;同名字段以基本信息数据为主,采用update replace口径。
三、计算说明
【是否重污染行业企业1】若行业代码匹配B06、B07、B08、B09、C17、C19、C22、C25、C26、C28、C29、C30、C31、C32或D44,则取1,否则取0。
【是否重污染行业企业2】若行业代码匹配B06、B07、B08、B09、C15、C17、C18、C19、C22、C25、C26、C27、C28、C29、C31、C32、D44或D45,则取1,否则取0。
【是否重污染行业企业3】若行业代码匹配B06、B07、B08、B09、B10、B11、B12、C13、C15、C17、C19、C22、C25、C26、C27、C28、C29、C30、C31、C32、D44或D45,则取1,否则取0。
【STPT】若证券简称包含ST或PT,则取1,否则取0;该变量主要用于样本筛选,完整样本版本保留,清洗结果中删除。
【金融业】若行业代码包含J,则取1,否则取0;该变量主要用于样本筛选,完整样本版本保留,清洗结果中删除。
【stkcd】上市公司数值型公司识别码,用于公司级基本信息合并。
【year】上市公司年度面板年份。
【缩尾处理】三项核心指标及STPT、金融业均为0/1虚拟变量,不进行连续变量缩尾,因此剔除金融ST后的缩尾版本与清洗未缩尾版本保持一致。
四、结果数据文件
共有3套结果数据版本,每套同时提供DTA和XLSX格式。样本筛选步骤如下:
(1) 对原始行业地区年度数据按stkcd和year去除重复记录,生成三套重污染行业识别指标、STPT和金融业指标,并合并公司级基本信息;
(2) 全样本版本保留金融、ST/PT和退市公司;清洗版本剔除证券简称缺失、ST/PT、金融业以及退市日期非空的观测;
(3) 因核心变量均为虚拟变量,不进行连续指标缩尾,缩尾版本保存为清洗样本的等同版本。
编号 文件名称 说明
1 计算结果未剔除金融ST未缩尾版本.dta / 计算结果未剔除金融ST未缩尾版本.xlsx 保留金融行业、ST/PT和退市公司,不缩尾;75,495条,用于全样本留档和复核,并保留STPT、金融业字段。
2 计算结果剔除金融ST未缩尾版本.dta / 计算结果剔除金融ST未缩尾版本.xlsx 剔除金融行业、ST/PT和退市公司,不缩尾;66,613条,用于清洗样本分析。
3 计算结果剔除金融ST缩尾版本.dta / 计算结果剔除金融ST缩尾版本.xlsx 因无连续型核心指标,与清洗未缩尾版本保持一致;66,613条。
五、变量说明
序号 变量名称 变量类型 变量说明
1 证券代码 str 上市公司证券代码。
2 证券简称 str 上市公司证券简称。
3 证券中文简称 str 基本信息中的证券中文简称。
4 stkcd double 上市公司数值型公司识别码。
5 year double 年度面板年份。
6 是否重污染行业企业1 double 第一套重污染行业代码集合识别结果,匹配时为1,否则为0。
7 是否重污染行业企业2 double 第二套重污染行业代码集合识别结果,匹配时为1,否则为0。
8 是否重污染行业企业3 double 第三套重污染行业代码集合识别结果,匹配时为1,否则为0。
9 STPT double 证券简称含ST或PT时为1,否则为0;仅完整样本结果保留。
10 金融业 double 行业代码含J时为1,否则为0;仅完整样本结果保留。
11 行业代码 str 公司行业代码。
12 行业名称 str 公司行业名称。
13 行业代码D str 行业分类D级代码。
14 行业名称D str 行业分类D级名称。
15 行业代码C str 行业分类C级代码。
16 行业名称C str 行业分类C级名称。
17 行业代码B str 行业分类B级代码。
18 行业名称B str 行业分类B级名称。
19 行业代码A str 行业分类A级代码。
20 行业名称A str 行业分类A级名称。
21 上市日期 str 公司首次上市日期。
22 股票类型 str 股票类型或上市板块类型。
23 ABH股交叉码 str A、B、H股交叉上市相关代码。
24 公司名称 str 公司名称。
25 公司中文简称 str 公司中文简称。
26 公司英文名称 str 公司英文名称。
27 所属省份 str 公司所属省份。
28 所属省份代码 str 公司所属省份代码。
29 所属城市 str 公司所属城市。
30 所属城市代码 str 公司所属城市代码。
31 经营范围 str 公司登记经营范围。
32 公司沿革 str 公司历史沿革信息。
33 注册资本 double 公司注册资本。
34 成立日期 str 公司成立日期。
35 退市日期 str 公司退市日期;空值通常表示未退市。
六、代码文件
文件名称 语言 说明
上市公司是否重污染行业企业数据计算代码.py Python 读取年度行业地区数据,生成三套重污染行业指标、STPT和金融业指标,合并基本信息并输出三套结果。
上市公司是否重污染行业企业数据计算代码.do Stata 执行与Python版等价的重复记录处理、行业代码匹配、样本筛选、基本信息合并和结果保存。
上市公司是否重污染行业数据评估代码.py Python 对三套结果执行描述统计、频数、异常值、逻辑一致性、稳健性和绘图评估。
上市公司是否重污染行业数据评估代码.do Stata 独立执行同等数据质量评估;结果DTA若因strL兼容性无法读取时回退读取同名XLSX。
七、数据质量评估
评估结果存放于数据质量评估报告_20260722文件夹,运行日志为评估日志_20260722.log。各子文件夹内容如下:
子文件夹名 内容说明
1 数据分布分析 数值变量描述性统计、字符变量和数值变量频率分布CSV。
2 分布图 未剔除金融ST未缩尾版本的直方图、箱线图、核密度图、散点图矩阵和时间趋势图;大样本绘图固定种子抽样,失败时按日志回退PNG。
3 异常值检验 缺失率、IQR温和/极端异常、Z-score异常及异常率CSV。
4 逻辑合理性验证 面板键重复、时间连续性、虚拟变量取值范围和行业识别逻辑相关检验CSV。
5 稳健性测试 三套结果版本的样本量、变量描述统计和时间范围对比CSV。
八、参考文献
[1] 潘爱玲,刘昕,邱金龙,申宇. 媒体压力下的绿色并购能否促使重污染企业实现实质性转型[J]. 中国工业经济, 2019(2):174-192. DOI:10.19581/j.cnki.ciejournal.20190131.005.
[2] 李井林,阳镇,陈劲,崔文清. ESG促进企业绩效的机制研究——基于企业创新的视角[J]. 科学学与科学技术管理, 2021,42(9):71-89.
[3] 郭晔,苏彩珍,张一. 社会责任信息披露提高企业的市场表现了么?[J]. 系统工程理论与实践, 2019,39(4). DOI:10.12011/1000-6788-2018-2074-12.
上市公司是否重污染行业企业2000-2025年含do-python代码和excel-dta格式数据.zip
(61.49 MB, 需要: RMB 29 元)
上市公司是否重污染行业企业2000-2025年含do-python代码和excel-dta格式数据.zip
(57.79 MB, 需要: RMB 999 元)


雷达卡



京公网安备 11010802022788号







