搜索
经管之家 › 附件下载

附件下载

所在主题:
文件名:  数据质量评估报告_20260519.zip
资料下载链接地址: https://bbs.pinggu.org/a-8867044.html
附件大小:
一、数据简介
数据名称:上市公司"和合"文化指标数据
时间跨度:2001-2024 年(年报年份)
数据层级:上市公司-年度面板
核心指标:和文化Har(和文化指标)、合文化Co(合文化指标)
识别变量:证券代码、stkcd(数值型证券代码)、year(年份)
文件格式:.dta(Stata 15+)、.xlsx(Excel 2007+)
本数据集基于沪深 A 股上市公司年报全文文本,借助"和合"文化关键词词典统计每份年报中"和"文化与"合"文化两类关键词的出现频次,并以词频与年报总词数的比值(百分制)构造反映企业"和合"文化水平的两类核心指标,可用于研究企业文化、企业社会责任、绿色发展、ESG 表现、利益相关者治理与组织韧性等议题中的中国传统文化因素。





二、计算说明
【和文化_关键词总词频】当年年报中"和"文化关键词出现的总次数。"和"文化关键词共 25 个:和谐、共生、包容、环境友好、兼顾、权衡、统筹、中庸、柔性、韧性、灵活、调和、权变、双元、平衡、均衡、协调、兼备、调整、和解、适应、同步、保护、融合、长短结合。
【合文化_关键词总词频】当年年报中"合"文化关键词出现的总次数。"合"文化关键词共 24 个:合作、团结、配合、协作、竞合、合力、互助、资源获娶资源交换、资源重组、资源协调、资源配置、整合、引进、兼并、并购、联合、双赢、共赢、合资、伙伴、联盟、共谋、产学研。
【和文化Har】上市公司年报和文化指标,公式:和文化Har =(和文化_关键词总词频 / 年报总词数)× 100,反映企业年报话语体系中"和"文化词汇的相对密度,数值越大表示企业越强调和谐、协调、包容、平衡等"和"文化理念。
【合文化Co】上市公司年报合文化指标,公式:合文化Co =(合文化_关键词总词频 / 年报总词数)× 100,反映企业年报中"合"文化(合作、整合、联合、共赢等)词汇的相对密度,数值越大表示企业越强调资源整合、协同合作与战略联盟等"合"文化导向。
【年报总词数】当年年报全文经分词后的总词数,作为构造比例型指标的分母。





三、结果数据文件
本数据集共提供 3 套结果数据,按"是否剔除金融业与 ST/PT 样本"以及"是否做缩尾处理"两个维度交叉生成,便于研究者按需选用。样本筛选步骤如下:
(1)以原始词频数据按"证券代码-年份"展开为公司-年度面板;剔除证券代码首位为 2 或 9 的 B 股样本,仅保留 A 股;
(2)合并"上市公司行业与地区信息数据.dta"补充证券简称、行业代码与名称、所属省份与城市等属性;
(3)合并"行业代码/上市公司基本信息数据.dta"补充上市日期、股票类型、A/B/C/D 类行业、注册资本、成立日期等基本信息,并以基本信息为主回写"证券简称""行业代码""行业名称";
(4)剔除金融行业样本(C 类行业代码以 J 开头);
(5)剔除证券简称中含"ST""PT"的特别处理样本;
(6)对核心连续变量(和文化Har、合文化Co、和文化_关键词总词频、合文化_关键词总词频、年报总词数)按年份分组做前后 1% 双侧缩尾。
编号文件名称 说明
------------------------------------------------------ ------------------------------------------------------------
1 计算结果未剔除金融STPT未缩尾版本.dta / .xlsx 完成步骤(1)-(3)后的全样本基础版本,未做行业与状态过滤
2 计算结果已剔除金融STPT未缩尾版本.dta / .xlsx 在版本 1 基础上完成步骤(4)-(5),剔除金融业与 ST/PT 样本
3 计算结果已剔除金融STPT已缩尾版本.dta / .xlsx 在版本 2 基础上完成步骤(6),按年份对核心连续变量做 1% 缩尾





四、变量说明
序号变量名称 变量类型 变量说明
------------------------ ---------- ------------------------------------------------------------
1 证券代码 object 上市公司证券代码(字符型,保留前导零,6 位)
2 证券简称 object 上市公司证券简称(已用基本信息表中的"证券中文简称"回写)
3 stkcd int32 上市公司证券代码(数值型)
4 year int32 年份(2001-2024)
5 和文化Har float64 上市公司年报和文化指标 =(和文化关键词总词频 / 年报总词数)× 100
6 合文化Co float64 上市公司年报合文化指标 =(合文化关键词总词频 / 年报总词数)× 100
7 和文化_关键词总词频 float64 上市公司年报中"和"文化 25 个关键词出现的总次数
8 合文化_关键词总词频 float64 上市公司年报中"合"文化 24 个关键词出现的总次数
9 年报总词数 float64 上市公司年报全文经分词后的总词数
10 行业代码 object 上市公司行业代码(C 类,证监会 2012,已用基本信息回写)
11 行业名称 object 上市公司行业名称(C 类,证监会 2012,已用基本信息回写)
12 行业代码A object 上市公司行业代码(A 类)
13 行业名称A object 上市公司行业名称(A 类)
14 行业代码B object 上市公司行业代码(B 类)
15 行业名称B object 上市公司行业名称(B 类)
16 行业代码C object 上市公司行业代码(C 类)
17 行业名称C object 上市公司行业名称(C 类)
18 行业代码D object 上市公司行业代码(D 类)
19 行业名称D object 上市公司行业名称(D 类)
20 所属省份 object 上市公司注册所在省份
21 所属省份代码 object 上市公司注册所在省份行政区划代码
22 所属城市 object 上市公司注册所在城市
23 所属城市代码 object 上市公司注册所在城市行政区划代码
24 上市日期 object 上市公司上市日期
25 股票类型 object 上市公司股票类型(A 股 / B 股 / H 股等)
26 ABH股交叉码 object 上市公司 A/B/H 股交叉证券代码
27 公司名称 object 上市公司公司全称
28 公司中文简称 object 上市公司公司中文简称
29 公司英文名称 object 上市公司公司英文名称
30 经营范围 object 上市公司经营范围(来自工商登记)
31 公司沿革 object 上市公司公司沿革(重大历史变更)
32 注册资本 float64 上市公司注册资本(元)
33 成立日期 object 上市公司成立日期
34 退市日期 object 上市公司退市日期(未退市则为缺失)
35 证券中文简称 object 上市公司基本信息表中的证券中文简称(用于回写"证券简称")





五、原始数据与基本信息合并
本数据集涉及 3 份原始/参照数据,合并方式与回写规则如下:
原始词频数据:上市公司年报和合文化关键词词频原始数据.dta / .xlsx,主要字段为"证券代码""年份""年报总词数"以及 49 个"和合"文化关键词的逐词词频列(和谐 - 长短结合 25 列、合作 - 产学研 24 列)。
行业地区数据:上市公司行业与地区信息数据.dta,主要字段为"证券代码、证券简称、stkcd、year、行业代码、行业名称、所属省份、所属省份代码、所属城市、所属城市代码"。合并方式:以(stkcd, year)为键,按 m:1 合并到核心面板,仅保留匹配(_merge==1 或 3)的样本,并剔除"证券简称"为空的观测。
基本信息数据:行业代码/上市公司基本信息数据.dta,主要字段为"证券代码、证券中文简称、上市日期、股票类型、ABH股交叉码、公司名称、公司中文简称、公司英文名称、行业名称D、行业代码D、行业名称C、行业代码C、行业名称B、行业代码B、行业名称A、行业代码A、经营范围、公司沿革、注册资本、成立日期、退市日期、stkcd"。合并方式:以 stkcd 为键 m:1 合并;
回写规则:以"上市公司基本信息数据.dta"为主回写同义列——用"证券中文简称"覆盖"证券简称",用"行业代码C/行业名称C"覆盖"行业代码/行业名称"。





六、代码文件
文件名称 语言 说明
---------------------------------------------- ------------ ----------------------------------------------------------
上市公司和合文化指标数据计算代码.do Stata 15+ 计算"和合"文化指标的 Stata 主代码(读入词频数据、计算指标、合并基本信息、生成 3 套结果)
上市公司和合文化指标数据计算代码.py Python 3.9+ 计算代码的 Python 等价实现(pandas/numpy 依赖,与 .do 输出一致)
上市公司和合文化指标数据评估代码.do Stata 15+ 数据质量评估 Stata 代码(描述统计、分布图、异常值、逻辑验证、稳健性)
上市公司和合文化指标数据评估代码.py Python 3.9+ 评估代码的 Python 等价实现(matplotlib/seaborn/scipy 依赖)


七、数据质量评估
评估输出根目录:数据质量评估报告_YYYYMMDD
日志文件:评估日志_YYYYMMDD.log
子文件夹 内容
-------------------- ------------------------------------------------------------
01_数据分布分析 三套结果数据的描述性统计、年度/行业/省份频数表(dta + xlsx)
02_分布图 直方图、按年箱线图、核密度图、散点矩阵、年度均值与观测数趋势图(jpg,300 dpi)
03_异常值检验 IQR 法与 Z-score 法异常值汇总、缺失值 Top 20 表与缺失值条形图(dta + xlsx + jpg)
04_逻辑合理性验证 年份范围、时间序列连续性、stkcd-year 唯一性、指标范围与负值检验、词频上限合理性(dta + xlsx)
05_稳健性测试 全样本/2001-2012/2013-2024/制造业 C 子样本对比、三版本核心指标均值与标准差对比图(dta + xlsx + jpg)





八、参考文献
汤临佳."和合"文化与民营企业本地社会责任履行 [J/OL]. 详见同目录参考文献 PDF:《"和合"文化与民营企业本地社会责任履行_汤临佳.pdf》。






    熟悉论坛请点击新手指南
下载说明
1、论坛支持迅雷和网际快车等p2p多线程软件下载,请在上面选择下载通道单击右健下载即可。
2、论坛会定期自动批量更新下载地址,所以请不要浪费时间盗链论坛资源,盗链地址会很快失效。
3、本站为非盈利性质的学术交流网站,鼓励和保护原创作品,拒绝未经版权人许可的上传行为。本站如接到版权人发出的合格侵权通知,将积极的采取必要措施;同时,本站也将在技术手段和能力范围内,履行版权保护的注意义务。
(如有侵权,欢迎举报)
二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

GMT+8, 2026-9-28 23:11