
做农村消费研究的朋友这两年大概率绕不开一个选题数字普惠金融到底有没有真正拉动农村居民的消费我最初的想法很简单——拉一份省级面板数据跑个固定效应就收工。但把数据真正摊开之后发现事情没那么简单各省的农村消费水平在空间上明显扎堆相邻省份的消费走势高度同步传统面板回归的独立性假设压根撑不住。这篇文章就是把这条完整的研究链路复现一遍——从北大数字金融研究中心的数字普惠金融指数出发用Stata构建空间权重矩阵、跑SAR空间面板模型检验空间效应再叠加中介效应模型和分位数回归最后验证东中西部的区域异质性。整套方法组合适合研究区域经济、农村金融、数字金融实证的同学参考对需要从零搭建空间计量分析流程的同行来说也可以直接照着操作。1. 选题逻辑数字普惠金融、农村消费与空间计量为什么必须在一起1.1 数字普惠金融影响农村消费的三条路径先说清楚数字普惠金融为什么值得研究。它影响的不是某一个环节而是整个农村消费链条的基础设施。我梳理下来机制大致有三条。第一条是支付便利化。移动支付把农村居民的支付摩擦压到极低从现金交易转向扫码交易小额高频消费被激活。以前赶集买菜要取现金、找零钱现在一个二维码就完成交易频次上升自然带动消费总量上升。第二条是流动性约束的缓解。传统金融体系里农户没有抵押物、没有征信记录想借一笔正规信贷几乎不可能。数字信贷通过大数据风控让一部分原本被排斥在正规金融体系之外的农户第一次获得了信贷资格。手里有钱了跨期平滑消费的能力提高当期消费自然释放。第三条是财富效应与预期效应。数字理财、数字保险等产品改变了农村家庭的储蓄和风险管理方式。以前不敢花钱是因为怕生病、怕灾年现在有保险兜底预防性储蓄动机下降当期消费比例会明显提升。这三条机制在理论上都指向同一个结论数字普惠金融对农村消费应该存在正向促进。但实证上的难点不在于验证有没有促进作用而在于验证在不同的空间范围、不同的消费水平、不同的区域里这个作用的形态和大小是否一致。这就要用到空间面板、分位数回归和区域异质性分析这些工具。1.2 消费的空间依赖性为什么固定效应模型不够用农村消费从来不是孤立的。省际之间人口流动、商品流通、价格信息传导甚至看到隔壁县都在搞直播带货的示范效应都会让消费产生空间联动。更关键的是数字普惠金融本身也有空间溢出——一家互联网银行在东部省份跑通的业务模式很快会复制到中西部省份数字金融基础设施的共享性决定了这种空间关联不可忽略。如果忽视这种空间关联直接跑固定效应模型残差里会残留空间自相关。虽然系数估计仍然可能保持一致但标准误被低估显著性检验很容易失真。SAR模型解决的就是这个问题在方程里加入被解释变量的空间滞后项让邻近省份的消费水平直接参与解释本省消费。这就等于承认了消费决策不是孤立的个体行为而是一个存在空间交互的系统。1.3 这篇文章的定位与结构这篇文章不是教科书是我在做这个课题时完整跑过的模型链路的复盘。数据用的是省级面板2011—2020年核心变量是北大数字金融研究中心发布的数字普惠金融指数和农村居民人均消费支出。整条链路一共五个环节数据与变量准备、空间权重矩阵与莫兰检验、SAR空间面板估计、中介效应检验、分位数回归与区域异质性分析。最后附上可以直接跑的Stata代码和我在实际排查中遇到的报错记录。如果你只需要其中某一环也可以直接跳到对应章节代码都是独立可用的。2. 数据准备与变量构建省级面板整理中的关键细节2.1 核心变量的来源与预处理被解释变量是农村居民人均消费支出。数据可以从各省统计年鉴和《中国统计年鉴》里拿到。这里要特别提醒必须先做价格平减。用农村居民消费价格指数农村CPI把名义值调整到基期否则十年间通胀因素会混在里面估计出的系数会系统性高估数字金融的真实作用。我用的基期是2011年所有年份的消费支出统一折算到2011年价格水平。核心解释变量是数字普惠金融指数。这是北京大学数字金融研究中心发布的公开指数覆盖中国31个省市自治区包含总指数和三个子维度——覆盖广度、使用深度、数字化程度。这里有一个细节总指数的量纲是0到300直接放进回归模型时系数会很小不便于阅读。我习惯的做法是取自然对数或者统一除以100相当于把解释变量换算成百分制这样系数的量级更友好经济含义也更直观。中介变量是农村居民人均可支配收入。这个链条的设想是数字金融先通过促进非农就业、提升经营收入来增加农民收入再由收入增长拉动消费。选择收入做中介变量在经济学直觉和统计检验两个方向上都比较稳妥。2.2 控制变量的选取逻辑控制变量不能随手抓每个都要有经济逻辑。我最终保留了四个人均GDP刻画区域整体经济发展水平消费归根到底受收入约束而GDP是收入的基础。城镇化率城镇化进程改变了农村居民的消费环境和消费习惯进城务工、农村人口减少都会影响农村消费统计口径下的支出水平。财政支出占GDP比重地方政府的转移支付和公共消费会影响农村消费环境也能部分捕捉政策干预的效果。第一产业增加值占比产业结构决定了农村居民的收入来源结构传统农业为主的省份和二三产业发达的省份消费行为差异明显。这些变量在省级面板回归里几乎都是必选项而且相性比较好不容易出现严重的遗漏变量偏差。2.3 描述性统计与共线性诊断进入建模前我习惯先看一眼描述性统计确认数据的分布形态。数字普惠金融指数取对数后基本接近正态分布农村消费支出取对数后也没有明显的厚尾问题。核心解释变量和几个控制变量之间的相关系数需要特别留意——数字普惠金融指数跟人均GDP、城镇化率的相关性往往很高因为发达地区金融基础设施好、互联网普及率高指数自然偏高。正式回归之前务必做一次VIF诊断如果某个变量的VIF超过10就要考虑是保留还是替换。变量取对数之后还有个额外的好处系数可以直接读作弹性。数字普惠金融指数每提升1%农村人均消费支出变动百分之多少一目了然。政策解读时这种表述也更直观。3. 空间权重矩阵与莫兰指数跑SAR之前必须做对的功课3.1 三种常用的空间权重矩阵空间面板模型里空间权重矩阵是灵魂。选错了矩阵后面的莫兰指数和SAR系数全部没有意义。我实际用过的有三种各有利弊。第一种是邻接矩阵。两个省份有共同边界就赋值为1否则为0。这是最直观、也最常用的设定反映了邻居之间的相互影响。但缺陷在于它把影响范围限定在相邻省份现实中消费示范效应和数字金融溢出往往能跨越中间省份传播。第二种是地理距离矩阵。用省会城市之间的球面距离取倒数距离越近权重越大。这个设定承认了空间影响的连续衰减比邻接矩阵更符合实际。我在研究里主要用了反距离矩阵因为它对远距离但经济联系紧密的情况刻画得更好。第三种是经济距离矩阵。用各省人均GDP均值之差的绝对值取倒数经济水平越接近、权重越大。这个矩阵适合捕捉同类省份之间的相互学习效应比如两个经济水平相当但地理上不接壤的省份消费行为可能高度相似。3.2 Stata中的构建命令Stata 15及以上版本提供了官方空间计量命令构建权重矩阵的语法非常简洁。我建议把权重矩阵的生成放在数据准备阶段因为莫兰指数和SAR模型都要用到同一套矩阵。* 面板设定 xtset province year * 邻接矩阵 spmatrix create contiguity Wc * 反距离矩阵 spmatrix create idistance Wd * 经济距离矩阵需要先定义经济距离变量 spmatrix create custom We(edistance)3.3 全局莫兰指数检验空间相关性的第一道关口权重矩阵准备好之后第一件事不是急着跑SAR而是先算莫兰指数确认数据里确实存在空间自相关。如果莫兰指数不显著后面跑SAR就属于多此一举普通面板回归就已经够了。* 在SAR模型设定下计算全局莫兰指数 spmatrix create contiguity Wc xtset province year estat moran, lag(Wc)莫兰指数的取值在-1到1之间。显著为正说明高消费省份周围也是高消费省份存在正向空间聚集显著为负说明高消费省份被低消费省份包围呈现空间排斥接近0说明空间分布接近随机。我当时算出来的全局莫兰指数大约是0.35P值远小于0.01这个结果给跑SAR模型提供了充分的理由。3.4 权重矩阵构建中的三个坑第一个坑是行标准化。空间权重矩阵必须做行标准化让每行之和等于1。否则矩阵的特征值范围不稳定模型的收敛性和系数解释都会出问题。Stata的spmatrix create命令默认不自动标准化需要手动处理。第二个坑是海南的邻接问题。海南省在地理上没有与任何大陆省份接壤在邻接矩阵里会成为孤岛——整行权重全为0。解决办法是改用距离矩阵或者把海南视为与广东存在经济联系手动指定邻接关系。我在实际研究中直接采用了反距离矩阵天然规避了这个问题。第三个坑是西藏的缺失值。西藏部分年份的统计指标缺失如果直接删掉会造成面板数据非平衡。spxtregress对非平衡面板的支持并不完善建议先做数据插补或者统一采用平衡面板。我用的是线性插值补齐了缺失年份再进入后续检验。4. SAR空间面板模型的设定、估计与空间效应分解4.1 为什么选SAR而不是SEM或SDM空间计量模型家族里有SAR空间自回归模型、SEM空间误差模型、SDM空间杜宾模型三大常用选项。选哪个不是靠偏好而是看你对空间效应的理论判断。SAR假设空间效应来自被解释变量本身——即本省消费受邻近省份消费水平的影响。这个设定与消费示范效应的直觉吻合。SEM假设空间效应藏在误差项里——即遗漏变量存在空间相关。SDM则两者兼有还把解释变量的空间滞后也放进来。我的选择逻辑很简单数字普惠金融的溢出效应可能同时体现在被解释变量和解释变量上理论上SDM最全面。但SDM的参数繁多在省级样本31个省份、10年里效率损失较大。综合考虑理论适配和样本效率我用SAR做主模型另跑SDM做稳健性检验。如果两个模型的核心结论一致说明结果不是模型设定驱动出来的。4.2 模型方程与stata实现SAR空间面板模型的基本方程为消费支出 ρ × 空间滞后消费支出 β1 × 数字普惠金融指数 β2 × 控制变量 区域固定效应 时间固定效应 误差项这里的核心参数是ρ空间自回归系数。如果ρ显著为正说明邻近省份的农村消费水平确实会正向影响本省消费空间示范效应存在。β1则反映了数字普惠金融指数对消费的直接作用。Stata的官方命令是spxtregress语法比传统xtreg多了一个sar(Wc)选项指定空间权重矩阵。随机效应和固定效应的选择跟普通面板一样可以通过Hausman检验确定。* SAR空间面板模型固定效应 spxtregress ln_consumption ln_index ln_pgdp ln_urban ln_fiscal ln_ind, fe sar(Wc) * SAR空间面板模型随机效应 spxtregress ln_consumption ln_index ln_pgdp ln_urban ln_fiscal ln_ind, re sar(Wc) * Hausman检验基于随机效应估计结果 estimates store sar_re spxtregress ln_consumption ln_index ln_pgdp ln_urban ln_fiscal ln_ind, fe sar(Wc) estimates store sar_fe hausman sar_fe sar_re4.3 直接效应与间接效应分解SAR系数不能直接解释这里是最容易误解的地方。SAR模型里的β1并不等于数字普惠金融指数对消费的完整边际效应。由于空间滞后项的存在某个省的数字金融水平提升不仅直接影响本省消费还会通过影响邻近省份的消费再反向传导回来。也就是说一个政策冲击的效应会被空间网络放大。要区分两种效应直接效应数字普惠金融指数提升导致本省农村消费的平均变化。间接效应空间溢出效应本省数字金融提升通过影响邻近省份消费再反过来作用于本省消费的反馈效应。Stata通过estat impact命令输出这两类效应的点估计和标准误。* 效应分解 estat impact, fe estat impact, re我跑完的实际数据显示直接效应约为0.35间接效应约为0.12总效应接近0.47。这说明数字普惠金融对农村消费的总拉动中有大约四分之一是通过空间溢出来实现的。这个比例相当可观如果用普通面板回归这0.12的部分会被完全遗漏政策评估会明显偏低。4.4 空间模型的稳健性检验主模型跑完之后我建议至少做三组稳健性检验。第一换权重矩阵——从邻接矩阵换成反距离矩阵、经济距离矩阵看核心系数的方向和显著性是否变化。第二换SDM模型——如果SAR和SDM的结果方向一致说明结论不依赖模型设定。第三缩尾处理——对关键连续变量做1%的缩尾排除极端值干扰。这三组下来如果结论都稳定在显著为正的区间这个结果才敢写进论文。我当时做完SAR主模型之后换经济距离矩阵重跑了一遍核心系数的变化幅度在10%以内心里就有底了。5. 中介效应模型数字普惠金融如何间接拉动消费5.1 中介链条的设定与变量选择SAR模型回答的是数字金融有没有用的问题中介效应要回答的是它是通过什么路径起作用的。我设定的中介链条是数字普惠金融指数 → 农村居民人均可支配收入 → 农村居民人均消费支出。逻辑链条是数字金融通过给农户提供信贷、保险、理财等金融服务提升其收入水平收入增加后再转化为消费支出。为什么选收入做中介而不是直接选信贷规模或者支付笔数原因在于省级层面的信贷分省数据和支付笔数数据口径不一致缺失值又多而人均可支配收入是每个省份每年都公布的权威统计指标数据质量有保障。从经济学角度看收入也是消费最直接的驱动力。5.2 三步法的Stata实现中介效应的经典检验是三步法回归对应Baron和Kenny的逐步法。第一步总效应数字普惠金融指数对消费支出回归。第二步中介变量方程数字普惠金融指数对收入回归。第三步同时放入解释变量和中介变量观察数字普惠金融指数的系数变化。* 第一步总效应 xtreg ln_consumption ln_index ln_pgdp ln_urban ln_fiscal ln_ind, fe vce(cluster province) * 第二步中介变量方程 xtreg ln_income ln_index ln_pgdp ln_urban ln_fiscal ln_ind, fe vce(cluster province) * 第三步同时放入解释变量与中介变量 xtreg ln_consumption ln_index ln_income ln_pgdp ln_urban ln_fiscal ln_ind, fe vce(cluster province)第三步的结果里如果ln_income显著且ln_index的系数比第一步明显下降但仍然显著说明存在部分中介效应如果ln_index变得不显著说明是完全中介如果ln_index系数不降反升就要警惕可能存在遮掩效应了。5.3 Bootstrap检验逐步法的缺陷与替代方案三步法有一个广为人知的缺陷它对间接效应的直接检验功效偏低。即使a路径和b路径各自都不太显著乘积a×b也可能显著反过来a和b显著时乘积也可能不显著。现代实证研究的主流做法是用bootstrap直接检验间接效应的置信区间。在Stata里我推荐用sgmediation命令配合bootstrap或者手工写一个循环程序。sgmediation命令是一个第三方命令需要先安装。* 安装第三方命令 ssc install sgmediation * 中介效应检验普通面板OLS版本 bootstrap r(ind_eff) r(dir_eff), reps(1000) seed(2024): sgmediation ln_consumption, mv(ln_income) iv(ln_index) cv(ln_pgdp ln_urban ln_fiscal ln_ind)Bootstrap输出的间接效应如果95%置信区间不含0说明中介效应在统计上成立。我实际跑出来的间接效应约为0.05置信区间在[0.02, 0.08]之间等于确认了收入这条中介路径确实存在。5.4 空间框架下中介效应的处理方式在空间面板框架下同时做中介效应Stata目前没有一条命令能一步到位。我的做法是分两步第一步用SAR模型验证总效应中空间溢出部分是否显著第二步用普通面板的三步法和bootstrap验证中介路径的方向和显著性。最后把两套结果放在一张汇总表里说明数字金融→收入→消费的中介链条在空间溢出的背景下依然稳健。这种处理虽然简单但在实证论文里是常见且可接受的做法。6. 分位数回归看消费分布不同位置上的数字红利6.1 均值回归的盲区平均效应掩盖了结构性差异普通线性回归拟合的是条件均值它回答的问题是数字普惠金融指数平均提高1%农村消费平均提高多少。但如果数字金融的红利并不是均匀分布在所有农户身上的呢消费水平处在低分位最穷的农村居民和高分位较富裕的农村居民的群体对数字金融的响应可能完全不同。现实中这个担心是有道理的。低收入农户可能因为教育水平低、智能手机使用不熟练即使数字金融普及了也用不上而高收入农户本来就有金融资源数字金融只是锦上添花。这两种情况都会导致均值回归的系数无法反映真实的结构性差异。分位数回归解决的就是这个问题。它把因变量按条件分布切成若干分位点比如0.1、0.5、0.9在每个分位上分别估计解释变量的系数从而刻画出数字金融对不同消费水平人群的差异化影响。6.2 面板分位数回归的Stata实现Stata自带的分位数回归命令qreg只支持截面数据面板分位数回归需要安装第三方命令xtqreg。* 安装第三方命令 ssc install xtqreg * 面板分位数回归 xtqreg ln_consumption ln_index ln_pgdp ln_urban ln_fiscal ln_ind, quantile(0.10 0.25 0.50 0.75 0.90)命令输出的关键系数是ln_index在各分位点上的估计值。我建议把0.1、0.25、0.5、0.75、0.9五个分位点的系数放在同一张图表里看趋势能比较直观地发现效应是否存在单调递增或倒U型结构。6.3 分位数结果的解读好消息与坏消息我当时跑出来的结果很有意思数字普惠金融指数对低分位消费群体0.1分位的边际效应是正向显著的且系数显著大于均值回归的系数对高消费群体0.9分位的效应相对较弱。这个结果的直觉解释是低收入农村家庭在获得数字信贷和移动支付手段后能够释放原本受到流动性约束抑制的基本消费需求边际效应自然更大。而高收入家庭的消费本来就相对充分数字金融带来的额外刺激有限。这个发现的政策含义非常直接数字普惠金融不仅是做大蛋糕的工具更是改善分配的手段。它对消费最不足、最需要拉动的那部分群体恰恰产生了更大的边际影响。如果只看均值回归这部分信息会被完全掩盖。6.4 分位数回归中需要注意的样本限制分位数回归对样本量有一定要求。31个省级单位、10年数据总共310个观测值在分位点上切分之后每个分位组大约60—80个观测值做10个变量的回归勉勉强强。如果发现某个分位点的系数不稳定可以优先看0.25和0.75这两个更稳的分位点0.1和0.9作为辅助参考。另外xtqreg在处理固定效应时的算法对缺失值非常敏感务必保证面板平衡。7. 区域异质性检验东中西部划分与组间差异的显著性论证7.1 分组策略为什么按照三大地带划分中国区域经济发展的梯度差异决定了数字普惠金融的作用效果不太可能是均质的。东部沿海地区金融基础设施完善、互联网普及率高、农村居民收入水平也高中西部地区数字金融基础设施还在建设期农户的金融可得性起点低。同样的指数增长对两类地区消费的边际影响很可能存在系统差异。我采用的是传统的东中西部三大地带划分。东部包括北京、天津、河北、辽宁、上海、江苏、浙江、福建、山东、广东、海南11个省市中部包括山西、吉林、黑龙江、安徽、江西、河南、湖北、湖南8个省西部包括内蒙古、广西、重庆、四川、贵州、云南、西藏、陕西、甘肃、青海、宁夏、新疆12个省市自治区。划分依据是《中国统计年鉴》的标准口径外部可验证性好。7.2 分组回归与组间系数差异检验分组回归的做法是把全样本按区域拆分重新跑SAR模型。但这里有个非常关键的细节只比较两个组回归出的系数大小不能直接得出差异显著的结论。因为两个系数的标准误是独立估计的在统计上必须做正式的组间差异检验。常用的方法是基于Bootstrap的费舍尔组合检验Fishers Permutation Test或者用Suest检验。Stata里实现费舍尔组合检验需要写一点程序。* 分组回归以SAR为例 spxtregress ln_consumption ln_index ln_pgdp ln_urban ln_fiscal ln_ind if group1, fe sar(Wc) spxtregress ln_consumption ln_index ln_pgdp ln_urban ln_fiscal ln_ind if group2, fe sar(Wc)把两组的系数和标准误记录下来然后通过bootstrap抽样重估两组系数差值看经验分布的置信区间是否包含0。如果95%区间不包含0说明两组系数差异显著区域异质性真实存在。7.3 结果的经济学解释与实际含义我跑下来的结果显示中西部组的数字普惠金融系数明显大于东部组且组间差值的经验p值小于0.05。含义是数字普惠金融对农村消费的边际拉动作用在中西部地区更强。这个结果看似与直觉相反——东部地区数字化程度明明更高为什么效应反而弱其实经济学逻辑很清晰东部农村的消费已经比较充分数字金融只是优化了支付方式属于边际改进而中西部农村原本面临严重的流动性约束和支付不便数字金融相当于直接从0到1的突破对消费的边际释放作用自然更强。这说明数字普惠金融的普惠属性在最需要它的地方体现得最明显也从侧面支持了国家大力发展农村数字金融的政策取向。7.4 空间溢出与区域异质性的交叉解读有一个容易被忽视的细节区域异质性检验里的空间矩阵用的是全样本构建还是分组样本构建我的处理是保持全样本矩阵不变因为空间联系并不是按行政区域废掉的——东部省份的消费仍然会通过人口流动、商品贸易影响中部省份。如果分组后重新构建权重矩阵等于人为切断了区域间的空间联系反而会引入新的偏误。这一点在论文方法部分一定要说清楚否则审稿人很容易提出质疑。8. 完整Stata代码流程与高频报错处理8.1 可复现的完整流程代码把前面所有环节串起来下面是完整可复现的Stata代码流程从数据导入到区域异质性检验的基准模型。*--------------- 第1步面板设定与变量处理 ---------------- use digital_finance_rural_consumption.dta, clear xtset province year gen ln_consumption ln(rural_consumption) gen ln_income ln(rural_income) gen ln_index ln(dif_index) gen ln_pgdp ln(pgdp) gen ln_urban ln(urbanization) gen ln_fiscal ln(fiscal_expenditure_gdp) gen ln_ind ln(primary_industry_share) *--------------- 第2步空间权重矩阵 ---------------- spmatrix create contiguity Wc spmatrix create idistance Wd spmatrix create custom We(edistance) *--------------- 第3步莫兰指数检验 ---------------- estat moran, lag(Wd) *--------------- 第4步SAR空间面板模型 ---------------- spxtregress ln_consumption ln_index ln_pgdp ln_urban ln_fiscal ln_ind, fe sar(Wd) estat impact, fe * 稳健性检验换权重矩阵 spxtregress ln_consumption ln_index ln_pgdp ln_urban ln_fiscal ln_ind, fe sar(Wc) estat impact, fe *--------------- 第5步中介效应检验 ---------------- xtreg ln_consumption ln_index ln_pgdp ln_urban ln_fiscal ln_ind, fe vce(cluster province) xtreg ln_income ln_index ln_pgdp ln_urban ln_fiscal ln_ind, fe vce(cluster province) xtreg ln_consumption ln_index ln_income ln_pgdp ln_urban ln_fiscal ln_ind, fe vce(cluster province) bootstrap r(ind_eff) r(dir_eff), reps(1000) seed(2024): sgmediation ln_consumption, mv(ln_income) iv(ln_index) cv(ln_pgdp ln_urban ln_fiscal ln_ind) *--------------- 第6步分位数回归 ---------------- xtqreg ln_consumption ln_index ln_pgdp ln_urban ln_fiscal ln_ind, quantile(0.10 0.25 0.50 0.75 0.90) *--------------- 第7步区域异质性分组回归 ---------------- spxtregress ln_consumption ln_index ln_pgdp ln_urban ln_fiscal ln_ind if region1, fe sar(Wd) estat impact, fe spxtregress ln_consumption ln_index ln_pgdp ln_urban ln_fiscal ln_ind if region2, fe sar(Wd) estat impact, fe8.2 高频报错与排查思路我实际跑这些命令的时候遇到过四个高频报错。第一个是spxtregress报错requires balanced panel或者面板不一致。原因是某个省份某一年数据缺失导致面板非平衡。解决办法就是前文说的插补或者删除异常省份。第二个报错是spmatrix create contiguity执行时报variable not found或者weights contain missing values。这类问题通常是因为省份名称或编码在数据里存在缺失值权重矩阵无法生成。先跑一下tabulate province确保没有空值再执行权重矩阵命令。第三个是estat impact报错option fe not allowed。这个命令的语法对不同版本的Stata有差别有的版本要求去掉fe选项直接用estat impact。遇到这种问题建议先查help estat impact确认当前版本支持的语法而不是死记命令格式。第四个是xtqreg报错fixed effects cannot be used with unbalanced panel。这个命令对平衡面板的要求更严格如果有缺失值最省事的方式是先用fillin或者插补把面板补齐。8.3 跑完这一整套流程之后我对数据计算的一点点体会整套模型跑下来我最大的感受是空间计量最怕的不是模型选错而是数据预处理不到位。权重矩阵的标准化、面板的平衡性、变量量纲的统一任何一个环节出问题后面的显著性全部要打问号。所谓的稳健性检验本质就是在这些最容易出错的环节上反复折腾折腾之后结果还在才算真正站得住脚。另外我强烈建议做一次伪结果对比。具体做法是先把权重矩阵随机打乱再重新跑SAR。如果打乱后的结果依然显著说明你的显著性不是来自空间结构而是来自变量本身的趋势性。如果打乱后显著性消失那才是权重矩阵捕捉到了真实的空间效应。这个测试虽然没有被写进正式论文但自己对结果会更有把握。数据文件我整理了一份可以直接运行的测试样本包含2011—2020年31个省份的数字普惠金融指数、农村消费、农村收入、人均GDP、城镇化率、财政支出和产业结构指标字段命名跟上面代码完全对齐。有需要的同行可以自己核对运行重点看莫兰指数的显著性、SAR中间接效应的量级以及分位数回归中低分位和高分位系数的差异方向——这三处是最容易出故事的地方也是最值得在论文里展开讨论的部分。