报告概述
本报告介绍了一种开创性方法,用于生成加纳高分辨率(0.005度)网格化劳动力市场数据。研究利用随机森林算法和64个辅助变量(包括土地覆盖、夜间灯光、基础设施、兴趣点等),将区级普查数据降尺度至17个就业类别,涵盖年龄、性别、技能、就业状态、部门、失业和NEET。报告旨在弥补数据匮乏环境中精细尺度劳动力市场数据的不足,为政策制定提供本地化信息。
报告的核心结论
模型实现高精度预测,多数类别R²超过90%
随机森林模型在17个就业类别中表现优异,均方残差低至0.07-0.2,解释方差百分比超过90%。仅农业(68%)和矿业(67%)等少数类别精度较低,可能与辅助数据捕捉不足有关。
加纳就业率像素间差异极大,从10%到98%
全国就业率48%,但像素级标准差达15个百分点。就业率呈现明显南北差异:南部普遍较高,北部除几个城市中心外普遍偏低。青年就业率在城市较低,老年就业率在西部较高。
建成区、夜间灯光和道路密度是就业预测的关键变量
变量重要性分析显示,反映人口密度的建成区、代表经济活动的夜间灯光以及作为基础设施指标的道路密度,对多数就业类别预测贡献最大。农业就业则更多受植被指数影响,矿业就业依赖矿产和交通距离。
高技能就业高度集中于主要城市,制造业存在局部专业化中心
尽管制造业就业全国占比小,但在阿克拉、库马西等城市中心集中明显。高技能就业在城市核心区比例高,而低技能就业广泛分布于城乡。城市集聚区集中了68%的高技能就业和58%的制造业就业。
方法可扩展至其他数据匮乏国家,但参与决策因素难以捕捉
该框架结合遥感和机器学习,适用于数据稀缺地区。然而,家庭结构、教育等影响劳动力市场参与的因素在地理空间数据中反映不足,未来需优化辅助数据或采用更细行政单元。
报告回答的关键问题
加纳就业率的空间分布有何特点?
加纳就业率呈现显著的南北差异和城乡差异。南部地区无论城乡就业率普遍较高,而北部除塔马莱等少数城市外就业率极低。像素级就业率从10%到98%不等,城市中心就业率高于周边,但青年就业率在城市反而较低,反映城市青年就业机会有限。
哪些地理因素最能预测加纳的就业分布?
建成区比例、夜间灯光强度和道路密度是预测总就业的最重要因素,它们分别代表人口密度、经济活动和基础设施可达性。对于农业就业,植被指数和水分指标更关键;矿业就业则取决于矿区距离;制造业就业受道路和城市设施影响大。
加纳的制造业和服务业就业集中在哪些地区?
制造业就业虽然在国家层面占比很小,但在阿克拉、库马西等城市中心集中明显,形成局部专业化中心。服务业就业同样高度集中在主要城市及沿海地区,尤其是公共行政和商业服务密集的区域。高技能就业则在城市核心区比例更高。
如何利用机器学习和遥感技术生成高分辨率劳动力市场数据?
研究采用随机森林算法,以区级普查数据为因变量,64个网格化辅助变量(土地覆盖、夜间灯光、道路、POI等)为自变量训练模型。然后应用模型预测0.005度像素级的就业值,并通过区级校准因子匹配官方统计。该方法在大多数类别实现高精度,为数据稀缺地区提供可复制的框架。
报告中的代表性数据
全国就业率
2021年,基于加纳2021年人口普查,15岁及以上人口就业率。区级标准差11.2个百分点,最低16.5%,最高64.7%。
像素级就业率范围
2021年,0.005度网格下估算的就业率,标准差15个百分点,显示巨大空间异质性。
模型解释方差百分比
2021年,17个就业类别中,多数类别R²超过90%,仅农业(68%)和矿业(67%)较低。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 完整图集:报告中包含全部17个就业类别在0.005度分辨率下的空间分布地图(如青年就业、自雇就业、高技能就业等),直观展示不同类别在全国的精细格局。
- 模型评估与参数调优:详述随机森林模型的训练过程,包括10折交叉验证、mtry和ntree参数选择结果,以及不同分辨率(0.05度)下的精度对比表格。
- 变量重要性分析:通过均方误差增加和节点纯度两种指标,列出对每个就业类别预测最重要的辅助变量排序,解释各变量的实际意义。
- 应用案例:利用网格化数据对阿克拉、库马西、塔马莱等城市进行详细的劳动力市场分析,展示城市内部就业分布异质性。
- 城乡对比:结合Africapolis集聚层数据,量化城市集聚区(人口>1万)在总就业、高技能就业、制造业就业等方面的集中程度,揭示城市偏向性。
- 方法讨论与局限性:深入分析模型在预测农业和矿业等类别时的挑战,讨论辅助数据覆盖不均匀、参与因素难以捕捉等问题,并提出未来改进方向(如XGBoost、更细行政单元)。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





