跳到主要内容
返回文章
文章文章
2026年8月5日/18 分钟阅读

生态再分类模型 LightGBM/XGBoost

说明基于 LightGBM/XGBoost 构建可更新生态分类模型的理论基础、训练框架、特征体系与分区建模方法。

生态评价生态分类专业模型

本文说明基于 LightGBM/XGBoost 构建可更新生态分类模型的理论基础、训练框架、特征体系与分区建模方法。

摘要

本次工作的目标是构建一套可用于生态分类更新的 LightGBM/XGBoost 模型,而不是直接制作某一期生态分类数据。模型建设包含两个能力目标:第一,能够利用已有生态分类数据作为监督样本来源,学习生态类型与 Sentinel-2 遥感影像、地形、土壤等特征之间的关系;第二,模型在应用时能够接收最新年份的 30m 特征数据,从而具备输出新一期、更高分辨率生态分类结果的能力。

本文整理生态分类模型 LightGBM/XGBoost 路线的理论基础、数据组织、样本构建、特征工程、模型训练、模型推理和后处理方法。该路线的核心思想是:把已有 90m 生态分类图作为训练监督来源,而不是作为需要机械细化的最终产品;先在 90m 标签尺度上提取高置信度样本点,再为这些点读取 30m Sentinel-2 三季光谱指数、地形、土壤、ESA 等预测期可用特征,训练 LightGBM/XGBoost 表格模型。模型训练完成后,可在目标年份最新特征上按 R1-R9 分区推理,输出新的生态分类图作为模型应用成果。

关键词

生态分类模型;LightGBM;XGBoost;Sentinel-2;高置信度样本;30m 推理;JRC Global Surface Water;EMC-BUILT;分区模型;全国统一模型

1. 研究目标:构建可更新的生态分类模型

本路线的总体目标是基于已有生态分类数据训练一个可复用、可迁移、可按年份更新的 三级生态类型分类模型。模型原生预测采用 GEP 平台三级生态编码,后续可从模型后处理结果导出 GB/T42340 三级分类和 HJ 1166 二级分类产品。

可以把整条路线概括为:

已有 90m 原始生态类型标签
    -> 标签侧高置信度样本提取
    -> 目标年份 Sentinel-2 春/夏/秋三季样本级特征
    -> DEM/HWSD/ESA 等环境特征合并
    -> LightGBM/XGBoost 训练
    -> R1-R9 分区或全国统一模型对比
    -> 分区模型推理
    -> JRC/EMC-BUILT 后处理
    -> 模型应用输出:三级生态分类图、置信度图、QA 标记

这条流程强调三个原则:

  1. 生态类型训练监督来自于既有的三级分级生态模型数据,90米分辨率。
  2. Sentinel-2、DEM、HWSD、ESA、JRC、EMC-BUILT 都是目标年份特征、先验或 QA 证据,不能替代生态类型训练标签,但它们决定新一期分类结果对最新地表状态的响应。
  3. filtered 初始预测不是最终成果,正式产品必须经过 JRC/EMC-BUILT 空间语义后处理。

2. 理论基础:为什么树模型适合这个问题

2.1 生态分类本质上是多源异构特征分类

生态类型不是单纯的土地覆盖。比如草地、草甸、草原、草丛之间,既有光谱差异,也受海拔、坡度、水分、土壤和区域生态背景影响;城市草本绿地不仅要“像草”,还要位于人工建成环境内部或周边;湖泊与水库/坑塘在单个像元光谱上可能很像,但在斑块形态和水文背景上有差异。

这意味着模型输入天然是表格化的:

光谱:Sentinel-2 多季波段和指数
地形:DEM、slope、aspect、aspect_sin、aspect_cos
土壤:HWSD2 SMU 和土壤理化属性
区域:region_id 或分区模型上下文
外部证据:ESA 类别、JRC 水体先验、EMC-BUILT 建成环境证据

LightGBM 和 XGBoost 都是梯度提升决策树模型,擅长处理非线性、多特征、缺失值和特征尺度不一致的问题。相比单棵树,它们通过多轮弱学习器叠加,逐步修正上一轮错误;相比普通线性模型,它们能自然表达“高海拔 + 某个季节 NDVI + 某类土壤 + 某个生态区”这样的交互条件。

2.2 GBDT:从弱树到强分类器

LightGBM 和 XGBoost 都属于梯度提升决策树(Gradient Boosting Decision Tree, GBDT)体系。GBDT 的基本思想是按迭代方式训练一组弱决策树:前一轮模型给出已有拟合结果,后一轮模型重点拟合前一轮尚未解释好的残差、梯度或损失函数下降方向,最后将多棵树的结果累加形成强分类器。Friedman(2001)系统给出了梯度提升机的理论框架,它的优势在于可以把复杂的非线性分类问题拆成一系列较简单的树模型拟合问题。

对生态分类而言,这一点很关键。三级生态类型并不总是由单个阈值决定,例如“某季 NDWI 较高”只能说明水分状态较强,但不能单独区分湖泊、坑塘、湿地或季节性积水;“NDVI 较高”也不能单独区分林地、草地、农田或城市绿地。GBDT 可以在多轮树分裂中自动组合多季光谱、地形、土壤和区域背景,形成类似以下的判别逻辑:

夏季 NDVI 高
+ 春秋季 NDMI 稳定
+ 海拔和坡度处于某个范围
+ 土壤排水条件匹配
+ 位于某个生态区
=> 更可能属于某一类草地/农田/林地生态类型

这种逻辑与生态分类中的专家判读经验比较接近,也比单纯的线性模型更适合表达特征之间的条件组合关系。

2.3 XGBoost:稳健、成熟、泛化能力强

XGBoost 是工程化程度很高的梯度提升树实现。Chen and Guestrin(2016)提出的 XGBoost 在目标函数中显式加入正则化项,并利用二阶梯度信息、列采样、树结构约束和高效并行计算来提升泛化能力和训练效率。对本项目来说,XGBoost 的价值不只是“准确率可能高”,更重要的是它在中等规模表格遥感特征上比较稳健。

本项目中 XGBoost 的输入不是影像块,而是像元级表格:

三季 Sentinel-2 光谱与指数
+ 3x3 局部均值
+ DEM/slope/aspect/aspect_sin/aspect_cos
+ ESA WorldCover
+ HWSD SMU 和 soil_* 属性

XGBoost 适合这类输入的原因包括:

  1. 它不要求所有特征服从线性关系,也不要求特征量纲一致。
  2. 它能处理光谱、地形、土壤等变量之间的高阶交互。
  3. 正则化目标有助于控制复杂类别边界带来的过拟合。
  4. predict_proba 可以输出类别概率,为后续低置信度标记、候选类别分析和 JRC/EMC 后处理提供依据。

从现有试验看,filtered 后的 R8 10km 代表 tile 上,regional XGBoost 初始预测整体表现较好,尤其在剔除不合理和数据错误的分类标签后,预测类别体系更干净。因此 XGBoost 可以作为分区模型的主力候选之一,但不能直接推断全国所有 R 区都一定优于 LightGBM。

2.4 LightGBM:面向大样本训练的高效梯度提升

LightGBM 的核心优势是高效。它使用 histogram 算法把连续特征分桶,在大样本、多特征情况下训练速度快、内存占用低。对于全国 R1-R9 共数十万样本、数百个字段的训练表,这一点非常重要。

LightGBM 还引入了 GOSS(Gradient-based One-Side Sampling)和 EFB(Exclusive Feature Bundling)等策略,以减少样本和特征维度带来的训练开销(Ke et al., 2017)。在全国生态分类场景中,R1-R9 样本合并后数据量较大,且特征字段包含三季波段、指数、邻域统计、地形、土壤和外部辅助层,LightGBM 的训练效率优势非常明显。

LightGBM 还支持缺失值处理、类别不均衡参数、特征重要性输出,便于后续做模型解释和类别诊断。在本项目中,LightGBM 是分区模型和全国统一模型的主力候选之一。

需要注意的是,LightGBM 默认 leaf-wise 生长策略往往比 level-wise 树更激进。如果某些三级生态类型样本量较少,或者某一区域训练样本空间聚集明显,LightGBM 可能获得较高训练分数但空间泛化不稳。因此不能只看 overall accuracy,应同时检查 macro F1、per-class F1 和代表 tile 空间图斑质量。

2.5 遥感实操依据:树集成模型适合土地覆盖和生态分类

从遥感应用经验看,树集成模型长期用于土地覆盖、植被类型、农作物、湿地和城市地表分类。Maxwell et al.(2018)对遥感机器学习分类进行了应用综述,指出随机森林、支持向量机、梯度提升等机器学习方法在多源遥感分类中具有良好的实用性。Belgiu and Drăguţ(2016)以及 Rodriguez-Galiano et al.(2012)也表明,树集成模型能够较好处理遥感数据中的非线性关系、变量冗余和类别异质性。

Sentinel-2 的实操文献也支持多季光谱特征与机器学习分类结合。Immitzer et al.(2016)展示了 Sentinel-2 在作物和树种分类中的潜力;Whyte et al.(2018)将 Sentinel 系列数据与面向对象机器学习方法用于湿地监测,说明水体、湿地和植被类问题通常需要光谱、时相和空间证据共同判断。这与本项目“三季 Sentinel-2 + 地形/土壤 + JRC/EMC 后处理”的设计一致。

因此,本项目选择 LightGBM/XGBoost 不是为了追求某个单一算法名称,而是因为它们满足四个工程条件:

  1. 能处理多源异构表格特征。
  2. 能表达生态类型和环境变量之间的非线性关系。
  3. 能输出特征重要性、类别概率和混淆矩阵,便于 QA。
  4. 训练和部署成本低,适合 R1-R9 分区模型快速迭代。

2.6 本章参考文献

  1. Friedman, J. H. (2001). Greedy function approximation: A gradient boosting machine. The Annals of Statistics, 29(5), 1189-1232. https://doi.org/10.1214/aos/1013203451
  2. Chen, T., & Guestrin, C. (2016). XGBoost: A scalable tree boosting system. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, 785-794. https://doi.org/10.1145/2939672.2939785
  3. Ke, G., Meng, Q., Finley, T., Wang, T., Chen, W., Ma, W., Ye, Q., & Liu, T. Y. (2017). LightGBM: A highly efficient gradient boosting decision tree. Advances in Neural Information Processing Systems, 30, 3146-3154.
  4. Maxwell, A. E., Warner, T. A., & Fang, F. (2018). Implementation of machine-learning classification in remote sensing: An applied review. International Journal of Remote Sensing, 39(9), 2784-2817. https://doi.org/10.1080/01431161.2018.1433343
  5. Belgiu, M., & Drăguţ, L. (2016). Random forest in remote sensing: A review of applications and future directions. ISPRS Journal of Photogrammetry and Remote Sensing, 114, 24-31. https://doi.org/10.1016/j.isprsjprs.2016.01.011
  6. Rodriguez-Galiano, V. F., Ghimire, B., Rogan, J., Chica-Olmo, M., & Rigol-Sanchez, J. P. (2012). An assessment of the effectiveness of a random forest classifier for land-cover classification. ISPRS Journal of Photogrammetry and Remote Sensing, 67, 93-104. https://doi.org/10.1016/j.isprsjprs.2011.11.002
  7. Immitzer, M., Vuolo, F., & Atzberger, C. (2016). First experience with Sentinel-2 data for crop and tree species classifications in Central Europe. Remote Sensing, 8(3), 166. https://doi.org/10.3390/rs8030166
  8. Whyte, A., Ferentinos, K. P., & Petropoulos, G. P. (2018). A new synergistic approach for monitoring wetlands using Sentinels-1 and 2 data with object-based machine learning algorithms. Environmental Modelling & Software, 104, 40-54. https://doi.org/10.1016/j.envsoft.2018.01.023

3. 分类模型训练框架与技术路线

3.1 总体框架

生态再分类模型的训练框架不是“把已有生态分类图直接重采样为 30m”,而是把已有 90m 生态分类成果转化为监督学习样本,再利用目标年份可获取的 30m 遥感与环境特征训练分类模型。其核心逻辑是:旧一期生态分类图提供类别监督,新一期 Sentinel-2、地形、土壤和外部辅助数据提供预测变量,LightGBM/XGBoost 学习二者之间的统计关系,最终在新年份特征空间中推理得到更新后的生态分类结果。

可概括为以下框架:

已有生态分类标签
    -> 标签质量控制与高置信度样本筛选
    -> 样本点多源特征提取
    -> 训练表构建与字段一致性检查
    -> LightGBM/XGBoost 分区模型训练
    -> 全国统一模型对照训练
    -> 类别级精度评价与空间质量评价
    -> 候选生产模型确定
    -> 目标年份 30m 特征推理
    -> 空间语义后处理与标准分类产品输出

这个框架强调两个分离:第一,训练标签与预测特征分离,Sentinel-2、DEM、HWSD、ESA、JRC、EMC-BUILT 等数据不能替代生态标签;第二,初始像元分类与最终产品分离,LightGBM/XGBoost 输出的是初始分类结果,最终产品还需要经过水体、建成环境、拓扑和类别一致性后处理。

3.2 训练监督来源

训练监督来源为已有 90m 生态分类图。该图提供三级生态类型编码,是模型学习的类别目标。由于 90m 标签与 30m 预测目标存在尺度差异,训练阶段不应把 90m 标签直接复制到 30m 网格,而应先在标签侧识别相对可靠的样本区域。

高置信度样本筛选主要解决三个问题:

  1. 排除无效值、背景值和分类体系中不应作为终端类训练的编码。
  2. 避免边界像元、混合像元和小破碎图斑对模型造成噪声污染。
  3. 降低空间自相关导致的训练集和测试集泄漏。

因此,训练样本不是普通随机点,而是经过层级一致性、图斑内部性、邻域同质性和空间去聚集控制后的样本点。这样做的目标不是让样本数量最大,而是让监督信号更可信。

3.3 特征体系

模型特征应全部来自预测期可以稳定获得的数据。训练阶段能够使用的字段,必须在未来目标年份推理时同样可以构建,否则会造成特征泄漏或生产不可复现。

特征体系包括四类:

光谱时相特征:Sentinel-2 春、夏、秋三季波段和指数
空间邻域特征:光谱和指数的局部均值或局部统计量
自然环境特征:DEM、坡度、坡向、土壤类型和土壤理化属性
外部辅助特征:ESA WorldCover 等稳定辅助层或一致性证据

三季 Sentinel-2 特征用于表达物候差异。单期影像只能描述某一时刻的地表状态,而生态类型往往由季节变化共同决定。例如农田、草地、草甸、林地和湿地在某一季节可能光谱相近,但春、夏、秋的 NDVI、NDWI、NDMI、NBR 等指数变化模式不同。多季特征能够提高模型对生态过程差异的识别能力。

地形和土壤特征用于提供生态位背景。同样的光谱特征在不同海拔、坡度、水分条件和土壤背景下可能对应不同生态类型。将 DEM、坡度、坡向、土壤质地、排水、有效水容量等变量纳入模型,可以帮助树模型形成更符合生态地理规律的条件分裂。

3.4 标签目标与分类体系约束

模型训练目标为三级生态类型编码。训练表中必须保证目标字段代表合法终端类别,而不是中间层级编码或历史异常编码。若错误的、不合理的分类标签进入训练目标,模型会学习到分类体系本身的错误,并在预测阶段输出不应出现的类别。

3.5 分区模型与全国统一模型

全国生态环境差异显著,同一光谱响应在不同生态区可能代表不同生态类型。例如同样的植被指数和水分指数,在青藏高原、东北湿地、南方丘陵和西北干旱区具有不同生态含义。因此,模型训练应同时考虑分区模型和全国统一模型两条路线。

分区模型路线是按 R1-R9 生态分区分别训练 LightGBM/XGBoost。其优势是每个模型只学习本区内部的生态-光谱-环境关系,类别边界更符合区域背景,空间解释性更强。其风险是某些区域样本量较少,小类可能训练不足。

全国统一模型路线是合并全部生态区样本训练一个模型,并在特征中保留区域信息。其优势是样本量更大,能够学习跨区共享规律;其风险是区域差异被平均化,可能在局部生态区产生系统偏差。

因此,本项目不预设某一路线绝对优越,而是采用“分区模型为主、全国统一模型为对照”的训练框架:

分区模型:强调区域适应性和空间解释性
全国统一模型:强调样本规模、跨区一致性和对照诊断
最终选择:由每区精度、类别级 F1、代表区域空间 QA 和边界连续性共同决定

3.6 LightGBM/XGBoost 双模型对照

在每一种空间组织方式下,LightGBM 和 XGBoost 都应作为候选模型进行对照。二者同属 GBDT 系列,但训练机制和模型偏好不同。XGBoost 通常更稳健,正则化控制较强;LightGBM 训练效率更高,在大样本和高维特征条件下具有明显速度优势。

双模型对照的目的不是简单选择总精度最高者,而是识别不同类别和不同生态区的模型适用性。某一区域可能 XGBoost 对水体、湿地和农田更稳,而 LightGBM 对林地或草地小类更好;也可能全国统一 LightGBM 在样本较少区域表现更平滑,而分区 XGBoost 在空间细节上更合理。

因此,模型比较应采用矩阵式框架:

R1-R9 分区 LightGBM
R1-R9 分区 XGBoost
全国统一 LightGBM
全国统一 XGBoost

每个模型都应保留类别概率、特征重要性、混淆矩阵和类别级评价结果,为后续模型选择和误差诊断提供依据。

3.7 训练、验证与空间评价

生态分类模型评价不能只依赖总体准确率。总体准确率容易被大面积优势类别主导,掩盖湿地、河流、水渠、城市绿地、裸地等小样本类别的问题。因此评价体系应包括样本统计指标和空间质量指标两部分。

样本统计指标包括:

overall accuracy
macro F1
weighted F1
per-class precision
per-class recall
per-class F1
confusion matrix

空间质量指标关注模型输出是否符合生态制图常识,包括图斑连续性、边界合理性、碎斑程度、水体连通性、城市绿地空间语义、R 区边界一致性以及后处理前后类别变化是否合理。对于生态分类产品而言,一个模型即使样本测试集分数较高,如果空间图斑明显破碎或水体拓扑错误,也不能直接作为生产模型。

3.8 从训练模型到再分类产品

LightGBM/XGBoost 模型输出的是像元级初始分类结果。该结果表达的是模型基于光谱、地形、土壤等特征给出的统计判别,不等同于最终制图产品。最终生态再分类产品还需要经过空间语义后处理和标准分类映射。

后处理的作用主要有三类:

  1. 利用 JRC Global Surface Water 等长期水体证据约束水体、湿地、岸线和消落带相关类别。
  2. 利用 EMC-BUILT 等建成环境证据约束城市绿地等依赖空间语义的类别。
  3. 对明显不符合分类体系或空间连续性的局部结果进行标记、修正或保留不确定性记录。

最终产品应从后处理后的三级生态分类结果导出。若需要形成 GB/T42340 或 HJ 1166 等标准分类成果,应以最终后处理结果为源进行分类体系映射,而不是直接从初始预测结果映射。

3.9 技术路线小结

本章提出的训练框架可以概括为“高置信度标签监督、多源特征学习、分区与全国模型对照、统计精度与空间质量联合评价、后处理形成最终产品”。其中,LightGBM/XGBoost 只是模型核心,真正决定再分类结果可靠性的,是从标签筛选、特征构建、模型选择、空间 QA 到产品映射的完整闭环。

主题定位

文章

围绕 GIS 数据、制图与应用场景的长期内容

继续浏览

回到文章频道

查看全部文章、切换主题筛选,或从首页入口继续向下浏览。

浏览全部文章