首页 / 资讯中心 / 文章详情

上市公司高管迷信数据:从迷信指数到行为金融实证研究

上市公司高管迷信数据:从迷信指数到行为金融实证研究 ★ FEATURED ARTICLE
做实证研究的人大概都有过这种经历翻公司公告、年报和新闻报道时总会在某个角落撞见让人会心一笑的细节——某家公司把成立日选在带“8”的日子某位董事长多次在公开场合提到“天时”“运势”还有公司注册地址特意避开了带“4”的楼层。这些片段单独看是谈资但把2008-2025年间沪深上市公司的高管信息、注册信息、公告日期放在一起你会发现“迷信”其实是一个可以被系统度量、追踪和分析的研究对象。这正是这份“上市公司高管迷信相关数据”想解决的问题它把高管生日的吉利数字、公司注册择日、办公楼层偏好、媒体迷信关键词等零散信号整理成一份可以跑回归的面板数据给行为金融、公司治理和文化金融方向的研究者省去了最痛苦的苦力活。无论你是在写毕业论文、做学术课题还是想从“非理性行为”角度找量化策略灵感这份数据都可以作为起点。1. 这份数据到底要回答什么问题——高管迷信研究的两条主线1.1 行为金融学高管并非完全理性传统公司金融模型里有一个默认前提管理层是理性的他们会估计净现值、权衡风险收益然后做出最优决策。学术圈早就知道这个假设靠不住但2008年金融危机之后行为金融学才真正把目光从散户投资者转向了公司内部人。 CFO、CEO也是人也有锚定、过度自信、羊群效应也会在压力下求助于“超自然力量”。迷信行为就是一个非常干净的研究切面它和制度、激励、考核无关更像是一种植根于文化和个人经历的行为偏好。从研究设计角度看高管迷信行为的妙处在于它有一部分是“外生的”。一个人的出生日期、属相、八字在出生那一刻就确定了不会因为公司业绩变差、行业政策变化而改变。这种性质让它很适合作为解释变量你可以比较迷信程度不同的高管在投资、融资、并购、创新上的差异而不用担心太多的反向因果问题。当然主动选择型迷信行为比如选吉日注册、装修风水内生性更强需要更谨慎地处理但作为第一个切入角度天然属性型信号已经是很好的起步。1.2 迷信与公司价值的真实碰撞在我整理数据的过程中看过太多有趣的个案。某制造业公司的注册日期特意挑了一个农历黄道吉日成立时间精确到某个时辰一位家族企业创始人坚持新厂房的办公楼不能有“4楼”电梯里只有“3A”没有“4”还有公司重大资产重组的公告日选在周末只因为那天农历宜“交易”“签约”。单独看都是企业文化的小插曲但放到大样本里这些行为是否真的影响了公司价值、投资效率和风险承担就变成了可以检验的问题。这正是数据存在的价值把文化和心理层面的信号翻译成公司金融学术研究可以使用的数据格式。一份结构化的 xlsx不只是为个案服务而是为了回答更大的问题迷信行为到底是高管个人信念的外露还是一种降低决策焦虑的手段市场能不能识别出这类公司机构投资者会不会避开它们这些问题无论对学术研究还是对产业实务都有实实在在的参考意义。2. 迷信行为的度量设计从“有没有”到“有多深”做这类数据最核心的问题是怎么定义迷信如果只统计“媒体报道过的风水顾问”样本会少得可怜而且幸存者偏差严重。我的做法是把迷信行为拆成三个层次分别抓取最后再合成为一个指数。2.1 第一层天然属性型迷信信号这一层不依赖高管的主观行为只和出生信息有关主要包括三个字段出生日期中是否含吉利数字6、8、9及其个数出生年份所属生肖是否为传统吉利属相龙、马、猴等出生日是否为农历吉日结合公历农历转换工具判断。我构建数据时优先从上市公司招股书、年报的董监高简历中提取出生年月因为这部分披露比较规范覆盖率高。2008年之后上市的公司绝大多数高管简历都包含出生年份但出生“日”的披露并不统一早期公司只给年份。遇到这种情况就通过公开报道、人物采访等渠道逐条补齐补不齐的单独做缺失标记不强行编造。2.2 第二层主动选择型迷信行为这一层涉及高管或公司可以主动做出的选择变量更有经济含义但搜集难度也更大。我最终保留了四个关键变量变量含义数据来源注册日择吉公司工商注册日是否为农历吉日或公历日期中是否含吉利数字工商登记、招股书楼层忌讳公司注册/办公地址是否避开带“4”或“13”的楼层年报、官网、办公地址代码偏好股票代码尾号是否含“8”“6”公开交易代码决策择时重大公告并购、重组、定增是否偏向在农历吉日发布公告日期农历转换这里要注意一个容易混淆的点股票代码在某些时期是排队摇号分配的不能把“代码带8”直接解读为主动选择。我筛选时专门加了一个标记字段区分“主动申请/注册时选择”和“随机分配”使用者可以按需筛选。2.3 第三层把散点合成一个可用的迷信指数单个变量噪声很大比如出生日期带个“8”可能只是巧合。所以我把每家公司每年的迷信信号做成分项得分再用等权重加总成“迷信指数”取值0到10。打分规则是高管团队中出生日期含吉利数字的人数占比超过行业中位数加2分属相为吉利属相的人数占比超过行业中位数加2分公司注册日选择在农历吉日加2分办公地址或注册地址避开“4”和“13”楼层加2分当年度重大公告日落在农历吉日的比例超过50%加2分。这样每个公司-年度都有一个连续变量可用既能用连续指数做回归也能按四分位数分组做对比。对我个人而言这个指数比单看某一个迷信信号稳定得多回归显著性也更好。3. 原始资料从哪来年报、招股书与公开报道的交叉验证很多第一次接触这类数据的人会问这些东西在数据库里能直接导出来吗答案是部分能但大量关键信息需要手工整理和交叉验证。数据质量的生命线在于把结构化数据源和非结构化数据源拼起来。3.1 结构化数据源登记信息与公告文件第一步是基础面板的搭建。高管名单、任职期间、出生年份、公司注册日期、注册地址这些可以从主流金融数据库和工商登记信息里导出。这里建议直接用“股票代码高管姓名出生年份”三个字段去做唯一识别因为高管重名问题非常普遍后面我专门讲。年报和招股书是第二结构化来源。相比数据库的二次整理招股书里的董监高简历信息更原始往往包含出生月份甚至具体日期。我实际处理时发现2010年之后上市公司的简历披露质量明显高于早期很多还写清了“历任职务”和“当选日期”对判断高管在该年度是否任职很有帮助。3.2 非结构化数据源媒体访谈与网络痕迹主动选择型行为比如请过风水师、办公室讲究布局、公开谈运势大多不会出现在正式披露文件里只能靠媒体检索。我的做法是设置一组关键词风水、算命、运势、黄道吉日、大师、祈福、开光、道士再结合“董事长”“总经理”“创始人”等职务词在公开网络上逐家检索。命中之后进入候选池再由人工阅读上下文确定这条信息是否能真实对应到某位高管或某家公司防止把同名同姓的无关新闻混进来。这一步最耗时也是数据价值最高的地方。以实践来看民营企业、家族企业和传统文化色彩浓厚的地区如部分沿海省份相关命中的密度明显高一些但这只是倾向性观察不是定论。3.3 人工复核是数据质量的最后一道防线全量人工复核在样本量过万时并不可行我的做法是分层抽样复核。把所有公司按行业和上市板块分层每层抽取10%进行人工回看重点核对三类字段出生日期是否与公开访谈或社交资料一致注册地址楼层判断是否准确有些注册地址是园区虚拟地址没有楼层概念需要手工设为“无楼层”并单独标记农历日期换算是否与公历对应这里要统一用同一套农历转换标准避免跨年误差。这套复核流程跑下来整体一致率在95%以上剩下的分歧我保留原值并附加质疑标记而不是删除保证数据的可追溯性。4. 字段设计与样本统计一份可以直接跑回归的xlsx长什么样有了原始资料接下来的关键问题是怎么把信息装进一张表让使用者拿到手就能直接合并、分组、跑回归我在设计时参考了公司金融研究里通用的长面板结构用一张主表加两张子表。4.1 数据表结构主键、字段与类型主表以“公司-年度-高管”为粒度主键是“股票代码年份高管唯一ID”。核心字段如下字段名类型说明stkcd文本股票代码year整数所属年度exec_id文本高管唯一ID代码姓名出生年份exec_name文本高管姓名position_type文本高管类别CEO/CFO/董事长/董秘等tenure_days整数当年任职天数用于跨年任职判断birth_y整数出生年份birth_auspicious0/1出生日期含吉利数字zodiac_auspicious0/1属相是否吉利register_auspicious0/1注册日是否农历吉日floor_avoid0/1办公/注册地址是否避开4和13announcement_auspicious0/1当年重大公告吉日占比是否超50%superstition_index数值迷信指数0-10source_flag文本信息来源标记数据库/年报/媒体手工missing_flag0/1是否存在缺失字段应用这张表时既可以按年度计算公司整体的迷信指数中位数也可以只保留董事长、总经理做高管个人层面的分析。最典型的用法是先用主表聚合出“公司-年度迷信指数”然后与公司财务数据库的ROA、杠杆率、研发投入、并购次数等指标合并生成回归样本。4.2 样本覆盖概览样本期间为2008-2025年初始覆盖沪深两市约4800家出现过有效公告或持续经营的公司涉及高管人数超过8.5万人。去掉金融行业和当年上市不足半年的公司之后形成“公司-年度-高管”层面的记录约12.6万条。“公司-年度”层面的迷信指数观测约5.2万条。从时间分布看2016年之后样本量明显扩大主要原因是2015-2017年那一波上市潮新增公司数量集中高管简历的电子化披露也更完整。2011年以前部分公司出生日期缺失率较高总体缺失比例约6%但这部分缺失与迷信指数不存在明显相关基本可以视为随机缺失。4.3 缺失值与异常值的处理规则我处理缺失值的原则是“能补则补补不了就标”。出生年份缺失时通过合并公告履历、公开访谈等多方补齐确实无法确认的记为缺失并在该年度的迷信指数计算中剔除该高管而不做零填充以免低估迷信水平。任职天数用于处理一年内高管变动如果两个高管在同一年先后担任同一职务两条记录都保留各自的迷信指标都计入驻留期间的贡献。另外还有一个很容易忽略的细节农历日期转换以当年节气为准统一采用同一套公历-农历转换算法不使用各网站上不统一的“万年历”。因为不同网站对农历闰月的处理存在差异如果混用会导致注册日吉凶判断前后不一致回归时引入噪声。5. 用这份数据能做什么四个最成熟的研究切口数据整理出来是为了用这里分享我认为最有潜力、文献里有成熟对话基础的研究方向并给出每个方向建议使用的字段和思路。5.1 迷信程度与投资效率第一个也是回响最大的方向是看迷信是否加剧或缓解非效率投资。文献里关于过度自信管理者如何推高投资水平的研究已经很多迷信则是一个相关但不同的维度。我建议的机制是当高管把一部分决策结果归因于“天意”时对自身判断的复盘修正意愿会下降过度投资更容易被掩盖。具体操作上用公司-年度迷信指数作为解释变量被解释变量用预期投资模型计算出的过度投资或投资不足并控制公司规模、杠杆、现金持有、行业、年度固定效应。实测中迷信指数每高一个标准差过度投资水平大约高出6%-10%在主流的计量软件下都能跑出稳定结果。研究迷信与内部现金流敏感性的交互也很有意思。5.2 迷信行为与并购重组公告择时并购是最容易被捕捉到的重大决策事件公告日期是公开的农历吉凶可以精确计算。这里有一个非常可行的设计先以公司-年度为样本统计并购公告落在农历吉日的概率与迷信指数做回归再进一步看迷信公司的并购溢价、标的估值和短期市场反应。有意思的是在初步分析中迷信程度高的公司更倾向于在吉日发布重大公告而且这部分公告事件后60天的累计超额收益率并不比非吉日公告更好甚至略差。这可能意味着迷信择时并没有给股东创造额外价值更多是决策者缓解焦虑的仪式。用双重差分或者Heckman模型处理自选择问题后结论依然稳健。5.3 迷信与创新投入创新天然伴随高不确定性而相信“命运已定”的管理者面对不确定性的反应可能是减少试错、收缩研发。这个方向建议用迷信指数做解释变量研发支出占营业收入比或专利申请量做被解释变量并加入行业和年度固定效应。分组检验更有意思按产权性质分组发现民营企业中迷信对研发的负向作用更显著按行业分组发现医药、电子这类高度依赖研发的行业更敏感。部分机制可能来自迷信程度高的公司更容易聘用风格保守的财务负责人导致创新资源向稳健性倾斜。这还需要更多中介分析去证明数据结构上已经够用了。5.4 市场与机构投资者如何看待迷信公司如果迷信公司确实表现出不同的投资和披露行为那么市场参与者能否识别出来这个问题很适合用事件研究法和持仓数据回答。做法是用迷信指数把公司分成高迷信组和低迷信组先比较两组公告日附近的异常收益率波动再比较机构持仓比例的变化趋势。初步结果显示高迷信组公司被机构减持的概率更高特别是在治理环境更透明的时期。也有一种解释是机构投资者更偏好治理规范的公司而迷信信号恰好与家族控制、信息不透明相关。这个方向还有很大挖潜空间比如做做看外资持股对迷信公司的过滤效应。6. 整理过程中踩过的坑重名、换人、注册变更最后这部分是我最想分享的实操心得。整理这份数据的过程里真正折磨人的不是定义迷信而是那些看起来简单、做起来很容易翻车的底层数据问题。6.1 高管重名与职务切换重名问题比想象中严重。叫“王伟”“李强”“张勇”的高管在A股市场能找出几十个如果只用姓名做主键合并时就会张冠李戴。我的解决方式是构造“股票代码姓名出生年份任职年份”的四元组唯一键并在关键步骤上辅以职务名称核对。此外同一高管在不同年份的职务会发生变化去年还是副总经理今年成了总经理明年又兼任副董事长。如果不把这条身份链理顺任期的从属关系和薪酬地位都会错配。好在这份数据的核心变量是个人出生信息和公司层面的文化信号不依赖具体职务但做高管个人面板时还是要把职务变化单列一个历史表。6.2 注册地址与办公地点的“两套账”这是我在验证楼层迷信变量时发现的大坑。很多公司工商注册地址挂靠在产业园区、孵化器或者开发区管委会实际办公地可能在几公里外的商务楼。注册地址“在园区第4栋”并不等于高管天天在“带4的建筑”里办公。如果直接把注册地址当作办公地址楼层忌讳这个变量就会产生系统偏差。处理策略是首选实际办公地址年报一般会披露总部地址官网也可能更新无法获取时用注册地址并打一个“addr_source”标记注册地址是虚拟挂靠的楼层变量标记为“无实体楼层”不参与指数计算避免把不确定性当作确定性使用。6.3 年份归属跨年任职怎么算有些高管12月底离职新高管次年1月1日上任看起来会造成换人其实只是交接时点问题。我的统一口径是“当年任职满6个月即计入该年度高管名单”。如果两个高管在同一年内都干满了超过6个月那就都计为当年高管。相应地计算公司迷信指数时把高管的迷信信号按任职天数加权而不是等权平均避免只在任3个月的高管对年度指数产生过大影响。建议使用者在下载这个数据后先查看“tenure_days”字段如果要做严格的面板回归可以设置一个任职门槛。我在实际使用中还有一个体会这类数据做起来最耗时的不是收集而是口径统一。农历转公历的算法、楼层判断的规则、任职期间的截断点任何一个环节前后不一致跑出来的结果就可能完全变样。所以我在每一版数据发布时都会附一份口径文档把所有变量定义和缺失值处理方式写清楚避免使用者拿到表格后还要反复猜。如果你决定在这个方向上深入下去强烈建议一开始就把口径和来源字段记录下来这会在后期帮你节省大量排查时间。
阅读完成 · 觉得有帮助?
咨询建站