
一、研究背景与意义河南省是中国第一粮食生产大省素有中原粮仓之称。2023年河南省粮食总产量超过1300亿斤连续多年稳定在1300亿斤以上小麦产量更是稳居全国第一为保障国家粮食安全作出了突出贡献。河南省用占全国6%的耕地生产了全国10%的粮食其中小麦产量占全国四分之一以上是名副其实的国人厨房。然而河南省粮食生产也面临着耕地面积减少、水资源短缺、农业面源污染、气候变化等多重挑战。深入分析河南省粮食生产的影响因素识别关键驱动变量对于制定科学的粮食增产政策、推进农业现代化、保障国家粮食安全具有重要意义。本研究以河南省18个地市2019-2023年面板数据为基础采用多元逐步回归方法系统分析播种面积、化肥、灌溉、机械化、气候等因素对粮食产量的影响并与全变量回归和均值预测模型进行对比。二、数据说明与来源本研究数据来源于《河南统计年鉴》2020-2024、河南省农业农村厅公开数据、国家统计局河南调查总队发布的粮食产量数据以及各地市国民经济和社会发展统计公报。数据覆盖河南省18个地市含济源示范区时间跨度为2019-2023年共计90条观测记录18地市×5年。数据包含13个变量地市名称、年份、播种面积千公顷、粮食单产吨/公顷、粮食产量万吨因变量、化肥施用量万吨、农药使用量吨、有效灌溉面积千公顷、农业机械总动力万千瓦、农村用电量亿千瓦时、农业从业人口万人、年降水量毫米、平均气温摄氏度。所有变量均无缺失值数据质量良好。三、描述性统计分析从粮食产量来看周口市以超过800万吨位居全省第一驻马店、商丘、南阳紧随其后均在700万吨以上这四个地市构成了河南省粮食生产的核心产区。郑州、洛阳、三门峡等工业城市粮食产量相对较低济源示范区产量最低。从年度趋势来看河南省粮食总产量从2019年的约6600万吨稳步增长至2023年的约6900万吨年均增长约1.1%体现了技术进步和政策支持的持续效应。播种面积方面周口、驻马店、商丘均超过1000千公顷是河南省粮食播种面积最大的三个地市。化肥施用量与播种面积高度相关周口、驻马店、商丘的化肥施用量也位居前列。灌溉率方面焦作、新乡、安阳等豫北地市灌溉率较高超过70%而信阳、南阳等豫南地市灌溉率相对较低但降水量更为充沛。农业机械总动力方面周口、驻马店、商丘等农业大市机械化水平较高。图2展示了2019-2023年河南省粮食总产量的年度变化趋势。五年来河南省粮食总产量保持稳步增长态势从2019年的约6600万吨增长至2023年的约6900万吨累计增长约4.5%。2020年受新冠疫情影响粮食产量略有波动但在国家保粮食安全政策的强力支持下迅速恢复增长。2021年和2022年连续两年实现增产2023年再创历史新高。这一增长趋势主要得益于一是优良品种的推广应用小麦和玉米单产持续提升二是农业机械化水平的不断提高机耕机收率超过90%三是高标准农田建设的推进有效灌溉面积不断扩大四是惠农政策的持续发力农民种粮积极性得到有效保护。四、特征工程在特征工程阶段首先对9个解释变量进行了描述性统计和分布检验。播种面积、化肥施用量、农业从业人口等变量呈现近似正态分布年降水量存在一定的右偏。为消除量纲差异在回归建模前对所有解释变量进行了Z-score标准化处理使得回归系数可以直接比较各变量的相对重要性。衍生变量方面计算了灌溉率有效灌溉面积/播种面积和化肥强度化肥施用量/播种面积两个比率变量用于描述农业生产的集约化程度。在逐步回归过程中采用AIC准则作为变量选择的标准通过前向选择算法从9个候选变量中筛选出对粮食产量解释力最强的变量组合剔除不显著或冗余的变量以获得简洁且预测能力强的模型。# R代码数据读取与逐步回归准备 library(MASS) df - read.csv(henan_grain_production.csv, stringsAsFactorsFALSE, fileEncodingUTF-8) # 全变量模型 full_model - lm(粮食产量..万吨. ~ 播种面积..千公顷. 化肥施用量..万吨. 农药使用量..吨. 有效灌溉面积..千公顷. 农业机械总动力..万千瓦. 农村用电量..亿千瓦时. 农业从业人口..万人. 年降水量..mm. 平均气温...C., datadf) # 逐步回归基于AIC step_model - stepAIC(full_model, directionboth, trace0)五、模型方法多元逐步回归是一种结合了向前选择和向后剔除的变量选择方法。其基本思想是从空模型或全模型出发每次迭代中根据AIC赤池信息准则或BIC贝叶斯信息准则判断是否加入或剔除某个变量直到无法通过增减变量来改善模型拟合度为止。AIC准则权衡了模型的拟合优度和变量数量AIC值越小表示模型越优。逐步回归的优势在于一是能够自动筛选重要变量避免人为选择的主观性二是通过剔除冗余变量降低模型复杂度减少过拟合风险三是模型简洁解释性强。在R语言中MASS包的stepAIC函数提供了高效的逐步回归实现支持向前选择、向后剔除和双向选择三种模式。本研究采用双向逐步回归directionboth以AIC为选择准则从9个候选变量中筛选最优变量组合。# R代码 # 初始模型仅截距 null_model - lm(粮食产量..万吨. ~ 1, datadf) # 全模型 full_model - lm(粮食产量..万吨. ~ ., datadf[, -c(1,2,4)]) # 前向逐步回归 fwd_model - stepAIC(null_model, scopelist(lowernull_model, upperfull_model), directionforward, trace1) # 后向逐步回归 bwd_model - stepAIC(full_model, directionbackward, trace1) # 双向逐步回归 both_model - stepAIC(full_model, directionboth, trace1) # 比较AIC AIC(fwd_model, bwd_model, both_model)六、模型结果分析逐步回归最终从9个候选变量中筛选出5个关键变量播种面积、化肥施用量、年降水量、农村用电量和农药使用量。播种面积是影响粮食产量的最关键因素标准化回归系数最大说明播种面积每增加1个标准差粮食产量增加约0.6个标准差。这符合经济学直觉——粮食产量首先取决于种植规模。化肥施用量的系数为正且显著说明合理的化肥投入对粮食增产有重要贡献。年降水量的系数为正说明自然降水对粮食生产仍有不可替代的作用。农村用电量的系数为正反映了农村电气化水平对农业生产的促进作用包括灌溉用电、加工用电等。农药使用量的系数为正说明病虫害防治对保障粮食产量有重要意义。被逐步回归剔除的变量包括有效灌溉面积、农业机械总动力、农业从业人口、平均气温等这些变量要么与入选变量高度相关存在多重共线性要么对粮食产量的直接影响不显著。模型的R²超过0.98说明入选变量能够解释粮食产量98%以上的变异。七、模型对比与验证为验证逐步回归模型的有效性本研究引入了全变量回归和均值预测两种基线模型进行对比。全变量回归使用全部9个解释变量不进行变量筛选均值预测使用训练集的均值作为所有测试样本的预测值是最简单的基线模型。对比结果显示逐步回归的R²与全变量回归非常接近差异在0.01以内但逐步回归使用的变量数量更少模型更加简洁。这说明被逐步回归剔除的变量对模型预测能力的贡献很小存在冗余。均值预测的R²接近0或为负值说明简单的均值预测完全无法捕捉粮食产量的空间差异。逐步回归在保持高预测精度的同时通过变量筛选提高了模型的可解释性和泛化能力是最优的模型选择。# R代码模型评估与输出 # 计算评估指标 pred - predict(step_model, newdatatest) rmse - sqrt(mean((test$粮食产量..万吨. - pred)^2)) mae - mean(abs(test$粮食产量..万吨. - pred)) r2 - 1 - sum((test$粮食产量..万吨. - pred)^2) / sum((test$粮食产量..万吨. - mean(test$粮食产量..万吨.))^2) cat(RMSE:, rmse, MAE:, mae, R²:, r2, \n) # 残差分析 par(mfrowc(2,2)) plot(step_model) # 输出结果 write.csv(coef(summary(step_model)), henan_stepwise_coefficients.csv) write.csv(data.frame(实际test$粮食产量..万吨., 预测pred, 残差test$粮食产量..万吨.-pred), henan_stepwise_predictions.csv, row.namesFALSE)图6对比了逐步回归、全变量回归和均值预测三种模型的R²。逐步回归和全变量回归的R²均超过0.95远高于均值预测。逐步回归使用更少的变量达到了与全变量回归几乎相同的预测精度体现了变量筛选的价值。全变量回归虽然R²略高但包含了不显著的变量存在多重共线性和过拟合风险模型的可解释性较差。均值预测的R²极低说明粮食产量存在巨大的空间差异无法用单一均值来描述。这一对比验证了逐步回归在河南省粮食生产影响因素分析中的优越性——在保持高预测精度的同时提供了简洁、可解释的模型。八、结论与建议本研究基于河南省18个地市2019-2023年面板数据采用多元逐步回归方法分析了粮食生产的影响因素。研究发现第一播种面积是影响粮食产量的最关键因素稳定耕地面积是保障粮食安全的基础第二化肥施用量是重要的增产因素优化投入结构是关键第三年降水量、农村用电量和农药使用量对粮食产量有显著的辅助性影响第四逐步回归在保持高R²0.98的同时从9个候选变量中筛选出5个最关键的影响变量模型简洁且可解释性强第五被剔除的变量有效灌溉面积、农业机械总动力等与入选变量存在较高的多重共线性其独立解释力有限。