ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

董事网络位置数据全解析:中心度与结构洞指标计算及实证应用

董事网络位置数据全解析:中心度与结构洞指标计算及实证应用 做公司治理或社会网络实证研究的朋友几乎都绕不开“董事网络位置关系”这个数据。最近整理完一套2006-2024年A股上市公司董事网络面板数据包括董事的度数中心度、中介中心度、接近中心度、特征向量中心度以及Burt结构洞理论下的有效规模、效率、约束指数和等级度等核心指标。这组数据的时间跨度接近二十年基本覆盖股权分置改革后中国资本市场的完整周期也包含了独立董事制度改革、注册制全面落地等重要制度节点无论做横截面回归还是面板固定效应都很有参考价值。这篇内容不是简单的资源盘点而是想从数据使用者角度讲清楚这些变量是怎么算出来的、实际匹配时有哪些坑、以及能支撑哪些研究选题。1. 董事网络位置关系数据到底是什么先搞清楚三件事1.1 一张“董事连接图”的构建逻辑董事网络听起来抽象其实逻辑很简单把每家上市公司看成网络中的节点把“同在一家公司担任董事”看成形成连接的纽带。两个董事如果同时在至少一家公司任职他们之间就存在一条边一个董事同时兼任两家公司的董事这两家公司也因此被这个“连锁董事”连接起来。把全市场的董事和公司都放进去就形成了一张覆盖所有A股上市公司的社会网络。这套数据的关键在于“位置关系”。一个人在董事网络里认识多少人、处在网络的中心还是边缘、连接的群体是否冗余这些都会影响他获取信息、资源和控制机会的能力。所以“董事网络位置关系数据”往往既包含最原始的董事-公司-年度对应关系也包含基于这种关系计算出的网络位置特征变量后者才是实证研究中真正进入回归模型的东西。1.2 2006-2024这个区间为什么值得关注从年份选择上看2006年是一个很合理的起点。2005年底股权分置改革启动2006年市场交易制度逐步完善上市公司治理信息披露的规范性明显提升董事任职数据和财务数据都更可靠。2006年之后独立董事制度也进入实质强化阶段董事席位变动频繁网络结构呈现出比较丰富的动态变化这就给研究者提供了足够多的变异来源。2024年作为终点意味着这套数据覆盖了将近19个完整会计年度样本量非常可观。即便剔除金融行业、ST公司和主要变量缺失的样本每年仍然能保留3000到5000家上市公司董事个体的观测值可以轻松超过10万条。这种体量足以支撑分组回归、分位数回归、PSM匹配、安慰剂检验等对样本量要求较高的操作。1.3 数据形态与核心变量组成这套数据的基础结构是“年度-公司-董事个体”的平衡面板。每一行代表某位董事在某一年内的网络位置特征同时可以通过公司代码和年份匹配到该公司的财务数据。常见的核心变量可以分成三块位置关系变量董事所在网络中的节点编号、公司编号、董事任职起止月份、是否独立董事、是否兼任其他公司董事等信息用于描述“谁和谁在哪里连接”的原始结构。中心度指标度数中心度、中介中心度、接近中心度、特征向量中心度衡量董事在网络中的整体地位。结构洞指标有效规模、效率、约束指数、等级度衡量董事连接的“冗余程度”以及她在不同群体之间扮演的“搭桥者”角色。另外部分数据版本还会附带公司层面的网络变量比如公司董事网络规模、公司平均中心度、公司结构洞约束的均值或最大值方便研究者做公司层面分析。2. 核心指标拆解中心度计算的逻辑与经济含义2.1 度数中心度最直白的“人脉广度”度数中心度Degree Centrality就是直接连接数。某个董事在一家上市公司任职同一家公司里其他董事就是她的直接连接如果她还兼任其他公司的董事那边董事会成员也算她的连接。为了消除网络规模的影响通常用实际度数除以理论上最大可能度数n-1进行标准化。这个指标度量的是“人脉广不广”。度数越高说明这位董事直接接触的董事数量越多获取非正式信息的渠道自然更宽。实证中常发现董事度数中心度越高公司信息环境越好、融资成本越低因为董事网络相当于一个低成本的信息传递通道。不过要注意度数中心度对“连接质量”不敏感——认识十个边缘董事可能比不上认识三个处于枢纽位置的董事所以还需要结合其他指标一起看。2.2 中介中心度信息桥与权力控制中介中心度Betweenness Centrality计算所有两两节点之间的最短路径中有多少条经过了目标节点。它衡量的是“控制信息流动”的能力也就是一个董事能否充当不同子群体之间的“桥”。解释起来像现实中的“关键中间人”圈子里所有人都要认识张三才能互相传话那张三的位置就举足轻重。董事网络里的中介中心度越高意味着该董事处于多个相对独立董事圈的交汇处她可以优先获取跨群体信息甚至决定是否将这个信息传递给某一方。在并购交易、供应链合作这类需要资源对接的场景中中介中心度高的董事往往能显著提升公司达成交易的概率。2.3 接近中心度与特征向量中心度间接连接与“强关系放大”接近中心度Closeness Centrality定义为一个节点到网络中所有其他节点的平均最短距离的倒数。度数高只代表朋友多接近中心度高则代表“我朋友的朋友也很多能帮助我快速联系到你”。这个指标更关注信息在全网范围内的传递效率适合研究公司创新这种需要引入外部异质性知识的场景。特征向量中心度Eigenvector Centrality则是一个“质量加权”指标你和谁连接比连接数量本身更重要。一个董事连接的全是中心度极高的董事她的特征向量中心度也会被放大。这个指标在度量“是否接近权力核心”时特别有效比如研究政治关联或者金融资源分配时特征向量中心度比单纯的度数中心度解释力更强。下面给出一个核心变量的速查表方便建模时对照含义变量类别变量名称含义经济直觉中心度Degree直接连接数量标准化人脉广度中心度Betweenness最短路径经过度信息桥梁与资源控制中心度Closeness到全网距离倒数信息传输效率中心度Eigenvector邻居重要性的加权靠近权力核心程度结构洞Effective Size非冗余连接数量网络多样性结构洞Efficiency有效规模/实际规模单位连接的价值结构洞Constraint投资集中度约束受单一关系束缚程度结构洞Hierarchy约束集中程度依赖是否集中于少数群体2.4 结构洞四件套从Burt理论到实际操作结构洞理论由Ronald Burt提出核心思想是网络中的两个节点之间如果没有直接连接就存在一个“洞”如果第三方节点能同时连接这两个节点她就占据了结构洞从而获得信息优势和控制优势。实际软件里最常用的四个度量有效规模Effective Size等于个体网络规模减去冗余度。比如你认识12个人但他们之间互相认识很多有效规模可能只有5如果12个人互不相识有效规模就是12。计算公式为 n - (2倍重复连接数 / n)不过一般直接用软件计算。效率Efficiency有效规模除以实际连接数衡量单位连接能带来的非冗余价值。约束指数Constraint这个指标最重要计算思路大致是你在多大程度上把精力集中在同一群人身上。约束指数 ∑_j (p_ij ∑_q p_iq*p_qj)^2其中p_ij是i在j身上花费的关系投入比例q是i和j共同的联系人。约束指数越高说明你的关系高度集中在少数人之间几乎没有结构洞空间。等级度Hierarchy度量约束指数在多大程度上集中于某一个特定的联系人上。等级度越高说明网络权力越集中你越依赖于某一个关系脆弱性越强。在实证中结构洞指标与中心度经常一起出现。结构洞强调的是“非冗余连接”中心度强调的是“总体连接强度或位置中心性”两者相关但不完全替代。做回归的时候要格外警惕它们之间的多重共线性这一点后面细讲。3. 数据实操从原始数据到可用面板我踩过的坑3.1 数据来源与格式预处理市面上能用到的董事网络数据主要来自两类渠道一类是国泰安CSMAR的“中国上市公司人物特征研究”和“高管任职动态”数据库另一类是CNRDS的中国董事网络数据库。有些团队也会根据年报中的董事任职披露手工整理但成本极高而且容易出现披露口径不一致的问题。拿到原始数据之后最让人头疼的是格式。CSMAR导出的董事兼任关系往往是一行一个任职记录包含“证券代码-会计年度-董事姓名-任职起始日期-任职截止日期-是否独立董事-具体职务”等字段。我们需要先把这种“长表”转换成“网络邻接表”也就是把“同在一个董事会任职”的董事两两配对。这一步听起来简单但如果不考虑董事在一年内发生变更就会把前后两任董事也算成同时任职导致虚假连接。我的习惯是先根据任职起始和截止日期判断出每个公司每个年度的“实际任职董事会成员名单”。一个董事只要任职这段时间与会计年度有重叠就纳入当年名单。然后以年度和市场为单位生成无向网络再用社会网络分析软件计算指标。3.2 滚动窗口选择与滞后处理董事网络是动态变化的我们观测的是每一年末或者每一年度的网络截面但某位董事的网络位置往往受过去影响。多数研究会选取一个滚动窗口比如以当年为终点向前推三年或五年把窗口期内出现的所有任职关系都纳入网络再计算中心度。这样的好处是避免单一年度董事任职短暂变动带来的噪声。窗口长度没有绝对标准。三年窗口更贴近“当前任职关系”五年窗口更平滑但会把很久以前已经不存在的连接算进去。我建议回归主结果用当年或前三年的网络稳健性检验再用五年窗口。此外为了避免反向因果通常将中心度滞后一期也就是用t-1年的董事网络去解释t年的公司行为并用当期网络做补充检验。3.3 与财务数据匹配的三个陷阱第一是股票代码口径问题。A股历史上存在大量借壳、更名和代码变更直接用原始“证券代码年份”去匹配财务数据很容易错配。最好用公司唯一识别代码或者先通过证券代码对照表进行年度校验。第二是董事ID的稳定性。很多数据库给董事分配的ID在早期版本中不稳定同名同姓但不同人的情况也不少见。所以不能只靠姓名去匹配跨年数据而应该结合出生年份、学历、任职经历等综合去重。如果数据集没有稳定的董事ID建议先按“姓名出生年份”构建内部ID再结合任职交叉验证。第三是ST、退市和金融行业的处理。常规金融研究会把金融行业样本剔除因为金融公司财务结构特殊。退市公司和长期停牌公司往往有极端或缺失的财务数据这些样本保留与否会影响结果稳健性。一般原则是主回归剔除金融行业和主要变量缺失的样本稳健性检验再纳入全样本看结论是否一致。3.4 数据结构示例与统计描述整理完成后你应该得到类似下面的数据结构年份证券代码董事ID是否独董DegreeBetweennessClosenessEigenvectorEffSizeEfficiencyConstraintHierarchy2018600000D0001126.352.80.430.05217.40.660.120.15如果从2006年开始每年都有几千家公司那么董事个体年度观测通常会有15万条以上。使用时需要注意中心度和结构洞的量纲差异极大。特征向量中心度往往趋近于0而中介中心度可能达到几十甚至上百。建议在回归前对连续型网络变量做标准化处理或者至少报告“均值±标准差”并说明系数含义。4. 实证场景这套数据能回答哪些研究问题4.1 公司治理与决策行为网络位置如何影响“人”的决策董事网络的经典应用场景是公司治理。比如董事网络中心度越高董事获取信息的渠道越丰富公司内部控制质量、盈余信息透明度往往越好。又比如独立董事的网络位置直接影响其监督意愿连接关系越多独董越有可能因为维护声誉而积极发声表现出更少的违规倾向、更低的盈余管理程度。这类研究的基本设计是用董事网络中心度或结构洞指标度量“董事的社会资本”然后把它作为解释变量控制公司规模、杠杆、成长性、大股东持股比例和行业年度固定效应解释经营决策变量。需要注意的是公司层面的网络变量通常取董事会成员的中位数或均值如果研究独立董事就只针对独立董事子样本计算网络变量避免被内部董事关系稀释。4.2 信息传递与创新结构洞带来的“异质性知识”创新研究是另一个高热度方向。董事网络本质上是一个信息通道如果公司董事处在网络枢纽位置能吸收更多外部知识公司研发投入和创新产出就可能更高。而结构洞的作用更微妙低约束的网络意味着董事能够接触到多个彼此不重叠的群体异质性信息更多但也可能造成信息过载和决策迟缓。实际操作中可以用“专利申请数/授权数”或“研发投入占营业收入比例”作为被解释变量解释变量用中介中心度和结构洞效率。由于创新存在长期性最好把网络变量滞后两到三期并采用公司固定效应控制不随时间变化的企业特质避免网络变量捕捉到的是公司本身的资源禀赋。4.3 高管薪酬与监督“圈子”是否影响定价董事网络对高管薪酬的影响同样被反复验证。一方面网络位置越核心高管的市场声誉和外部机会越多议价能力越强薪酬水平可能越高另一方面董事网络也会加强监督防止过度薪酬。独董的监督效果与网络位置密切相关拥有多个独立董事席位的“职业独董”往往更珍惜自己的声誉约束力更强。利用这套数据你可以识别董事在多家公司任职的“连锁董事”身份建立“董事同时任职的公司数量”变量研究多重任职对薪酬业绩敏感性、薪酬粘性的影响。这个方向的数据基础就是董事网络位置关系数据变量构建非常直接。4.4 前沿交叉ESG与社会网络的连接近几年ESG研究大量借用社会网络工具董事网络结构会影响企业的ESG表现和信息披露质量。比如网络中心度高的公司董事会更容易接触机构投资者和评级机构的信息需求因而更愿意主动改善ESG表现结构洞丰富的公司因为信息更分散可能更早发现ESG风险并采取行动。这类研究的扩展空间很大可以结合外部制度环境、行业属性、数字化转型程度等异质性因素做分组检验。董事网络数据已经被不少顶刊作为核心解释变量或调节变量说明它的认可度足够高拿来发期刊或写学位论文都很适合。5. 高频踩坑清单与稳健性补救方案5.1 网络溢出与边界问题计算中心度之前要先定义清楚“网络边界”。是使用全A股公司构建网络还是仅使用同行业公司构建网络两者经济含义不同全市场网络捕捉的是跨行业资源协作同行业网络捕捉的是行业内部竞争与模仿。多数研究默认使用全市场网络但稳健性检验中可以换行业网络看结果是否一致。另一个容易忽略的问题是孤立节点。某些公司的董事全年没有任何兼任关系那么该董事的度数中心度为0、结构洞约束为1因为约束指数的分子分母关系孤立节点通常趋向于最高约束。这些孤立节点不能直接删除否则会引入样本选择偏差。面板回归中保留这些观测但建议额外加入“是否孤立节点”虚拟变量或者在稳健性检验中单独剔除。5.2 中心度与结构洞的多重共线性问题中心度和结构洞指标本质上都是由同一个网络矩阵计算出来的相关系数经常超过0.6甚至达到0.8以上。如果一股脑放进回归方差膨胀因子会爆表系数符号也不稳定。常见对策是主检验只放其中一个维度的指标比如核心变量用约束指数控制变量里不再放中心度做机制检验的时候再换用中介中心度或度数中心度替换。根据个人经验中介中心度和结构洞约束指数的组合最稳定因为中介中心度看重的是路径经过次数约束指数看重的是关系集中度两者理论上互补但相关性比度数中心度和有效规模低。如果确实需要在同一模型里同时放多个网络变量建议先做调用变量相关性分析把相关系数过高的变量分组进入模型。5.3 内生性与因果识别策略董事网络位置并不是随机分配的公司聘请什么样的董事本身受到公司需求、行业环境、管理层偏好的影响所以直接回归很可能存在反向因果和遗漏变量偏差。常见的补救路径有下面几条滞后解释变量用t-1期或t-2期的网络变量解释t期的结果至少能缓解同期反向因果。公司固定效应加入公司固定效应控制公司层面不随时间变化的遗漏变量。但注意如果网络变量时间序列波动不大固定效应会让估计精度大幅下降需要用行业×年份固定效应做互补。工具变量法寻找工具变量比较难一种常用做法是使用“同行业其他公司董事网络的平均值”作为工具变量理由是行业共享的董事人才池会影响本公司董事网络但不会直接影响本公司特定决策。Heckman两步法需要处理“为什么这家公司会聘请网络中心度高的董事”这个自选择问题时使用第一步用公司地理距离、同城董事供给等变量估计聘请概率第二步再代入结果方程。这里面没有万能方案但至少要做到报告多种识别策略下的一致性结果如果是学位论文最好把内生性部分单独立节展示工具变量的有效性检验和弱工具诊断。5.4 稳健性检验的常用做法针对董事网络数据稳健性检验可以从几个维度展开替换指标把核心变量从度数中心度换成特征向量中心度或从约束指数换成有效规模。替换网络口径全市场网络换同行业网络或换滚动窗口三年/五年/当年。替换样本区间剔除2008年金融危机前后、2020年疫情期间等异常年份看结果是否不变。剔除金融行业、剔除ST公司也是必做项目。替换被解释变量例如盈余管理从操纵性应计绝对值换成真实盈余管理指标或者创新产出从专利申请数换成发明专利申请数。排除极值影响对连续变量在1%水平上做缩尾winsorize或截尾trim并在表格下方注明处理方式。一套完整的数据分析中主回归加三五个稳健性检验基本上是论文标配。这套数据的时间跨度长、变量维度多完全支撑得起上面这些检验但也要注意不要过度“组合拳”审稿人更看重逻辑连贯性。最后分享一个我个人常用的工作流拿到董事网络原始数据后先花半天时间做“年度-公司-董事”关系表的完整性检查统计每个年度有多少家公司、多少董事、多少条连接再和公开披露的董事任职总数对比偏差超过3%就重新核对数据源。同时建议把所有网络指标用不只一种软件计算一遍——先用Python的NetworkX再用Stata的nwcommands算一遍两边对比相关系数如果低于0.95说明网络构建可能存在错误。这个步骤虽然费时间但能避免后面跑回归时出现无法解释的奇怪结果。数据研究就是这样前期清洗越扎实后面的结论越站得住。
返回列表