中国生态地理区划与生态建模分区
介绍中国生态地理区划、生态类型建模分区的划分依据,以及 R1-R9 分区对 LightGBM/XGBoost 模型的意义。
本文介绍中国生态地理区划、生态类型建模分区的划分依据,以及 R1-R9 分区对 LightGBM/XGBoost 模型的意义。
生态分区是生态再分类模型中的基础空间框架。它的作用不是给像元赋予生态类型标签,而是把全国复杂的气候、地形、植被、土壤、水文和物候差异组织成若干相对一致的建模区域,使模型能够在相似生态背景下学习更稳定的光谱—环境—生态类型关系。
1. 生态分区数据
数据介绍
生态分区数据描述全国不同生态区的空间范围,例如 R1-R9 分区。它不是训练标签,而是表达区域生态背景差异的空间框架。同样的 Sentinel-2 光谱响应,在不同气候、地形和生态区内可能对应不同生态类型,因此生态分区对模型训练和模型选择非常重要。

2. 为什么需要进行生态分区
2.1 全国生态类型不是同一套光谱规则
生态类型分类不是单纯土地覆盖分类。土地覆盖更多回答“地表看起来是什么”,例如水体、林地、草地、农田、建筑;生态分类还需要回答“这个地表在什么生态背景中形成”,例如同样是草本植被,在东北平原、内蒙古草原、青藏高原、南方丘陵和城市建成区中,生态含义并不相同。
如果不进行生态分区,而是把全国样本直接放入一个模型中,模型会遇到明显的“同谱异类”和“异谱同类”问题:
同谱异类:光谱相似,但生态类型不同。
异谱同类:生态类型相同或相近,但因气候、物候、地形不同,光谱表现差异很大。
例如,高 NDVI 在东北可能对应森林或湿地植被,在华北可能对应农田,在南方可能对应常绿阔叶林或水田,在城市周边可能对应人工绿地。仅靠一个全国统一阈值或统一模型,很容易把区域生态背景差异误当成类别差异,或者把真实类别差异平均掉。
2.2 物候差异会改变 Sentinel-2 特征含义
本模型大量使用 Sentinel-2 春、夏、秋三季光谱和指数特征。三季特征本质上是在描述物候过程,但中国不同区域的物候节律差异很大:东北春季返青晚,南方常绿植被全年较稳定,西北荒漠区植被响应主要受降水和绿洲灌溉影响,青藏高原生长季短且受海拔控制明显。
因此,同样的“春季 NDVI 低、夏季 NDVI 高、秋季 NDVI 下降”在不同区域可能有不同生态解释。生态分区可以让模型在相对一致的物候背景下学习规则,减少跨区域物候差异带来的混淆。
2.3 地形、土壤和水热条件存在强烈区域分异
生态系统的形成受水热条件、地形格局和土壤背景共同控制。全国尺度上,这些因子具有明显区域分异:
东北:寒温带/中温带气候、沼泽湿地和森林明显。
西北:干旱半干旱背景,荒漠、草原、绿洲和裸地交错。
华北:暖温带农田和落叶阔叶林、人类活动强。
南方:亚热带常绿林、水田、丘陵山地和季风水热条件明显。
西南:山地垂直分异强,森林、灌丛、草地和高山生态交错。
青藏高原:高寒、低温、短生长季,高寒草地和高寒荒漠占主导。
这些差异决定了模型不能只学习像元光谱,还需要在区域生态背景中解释光谱。生态分区相当于为模型提供“这个像元处于什么生态地理背景”的先验约束。
2.4 分区模型更利于小样本类别和空间 QA
三级生态类型中存在许多小样本类别,例如湿地细分类、河流沟渠、城市绿地、灌丛、荒漠稀疏植被等。如果全国统一训练,大面积优势类别容易主导模型,导致小类被压制。分区后,每个区域的主导类别、易混类别和小样本类别更清楚,便于单独检查类别级 F1、混淆矩阵和代表区域空间图斑。
生态分区还便于后处理规则按区校准。例如水体、湿地、城市绿地和荒漠过渡带在不同区域的空间语义不同,分区 QA 比全国平均指标更有意义。
2.5 分区不是为了割裂全国,而是为了更稳定地拼接全国
生态分区并不意味着每个区完全孤立。全国统一模型仍然可以作为对照模型,甚至在某些小样本类别上可能有优势。但在生产路线中,分区模型可以减少区域间生态差异对模型学习的干扰;全国统一模型则用于检查分区模型是否过拟合、边界是否不连续、某些类别是否需要跨区共享信息。
因此,合理策略是:
分区模型:学习区域内更稳定的生态—光谱关系。
全国统一模型:作为对照、诊断和补充。
边界 QA:检查 R 区交界处分类是否突变。
最终产品:在分区模型基础上进行全国拼接和一致性检查。
3. 生态分区
3.1生态地理分区
本文采用的生态分区来自文献《王芳,李炳元,田思雨,郑度,葛全胜.中国生态地理区划更新和优化[J]. 地理学报, 2024, 79(1): 3-16》
论文认为:全球气候变化对生态地理区域分布产生一定影响。1961—1990年全国平均气温的变暖趋势约为0.2 ℃/10a,而1991—2020年全国平均气温的变暖趋势约为0.3 ℃/10a,这样的变化导致了中国东部温度带的多条界线出现不同程度北移[。此外,全国平均降水量在区域上也呈现出不同幅度的增减,多个干湿区的干湿程度出现了变化。在气候变化影响下,一些区域的植被分布范围以及相应的生态地理特征出现一定程度变化。因此在2007年提出的生态地理区化基础上,大幅提升相关生态地理要素的容量和精度,将气候、植被等自然地理要素资料全面更新,并进一步将制图比例尺提升至1∶400万,编制中国生态地理区域图(2023版),探讨了生态地理区域分异。
论文按照温度带、干湿区域和自然区来进行划分。
论文采用的数据源:
(1)气温和降水数据。1991—2020年全国641个气象观测站的日气温、日降水数据集,来源于国家气象信息中心;均一化数据集来自中国科学院大气物理研究所。
(2)生态地貌类型和海拔高度数据。中国1∶100万数字地貌数据集、中国1∶400万地貌图和DEM数据均来源于中国科学院地理科学与资源研究所。
(3)植被数据。2000—2020年土地覆盖数据,分辨率30 m,来源于中国科学院地理科学与资源研究所和中国科学院空天信息创新研究院。
(4)沙漠、冰川、冻土数据。1∶400万的中国冰川冻土沙漠数据集来源于中国科学院西北生态环境资源研究院。
(5)底图数据。1∶400万中国地图数据库,包含国界、省界、河流、山脉、地级市等数据,来源于国家基础地理信息中心。
论文将全国划分出11个温度带(一级区)、22个干湿区(二级区)、50个自然区(三级区)。其中,一级区表达热量背景和高原温度带差异,二级区表达湿润、半湿润、半干旱和干旱等水分条件,三级区则进一步结合地貌、植被、土壤和生态系统组合划分具体自然区。
2023 版中国生态地理区域划分方案如下:
| 一级区(温度带) | 二级区(干湿区) | 三级区(自然区) |
|---|---|---|
| I 寒温带 | A 湿润地区 | ⅠA1 大兴安岭北部山地落叶针叶林区 |
| Ⅱ 中温带 | A 湿润地区 | ⅡA1 三江平原沼泽区;ⅡA2 东北东部山地针阔叶混交林区;ⅡA3 东北东部山前台地针阔叶混交林区 |
| Ⅱ 中温带 | B 半湿润地区 | ⅡB1 松辽中部平原森林草原区;ⅡB2 大兴安岭中部山地森林区;ⅡB3 大兴安岭西麓北丘陵森林草原区 |
| Ⅱ 中温带 | C 半干旱地区 | ⅡC1 西辽河平原草原区;ⅡC2 大兴安岭南部草原区;ⅡC3 内蒙古东部中平原草原区;ⅡC4 呼伦贝尔平原草原区 |
| Ⅱ 中温带 | D 干旱地区 | ⅡD1 河套与内蒙古西部中平原荒漠草原区;ⅡD2 阿拉善与河西走廊灌木、半灌木荒漠区;ⅡD3 准噶尔盆地小乔木、半灌木荒漠区;ⅡD4 阿尔泰与额尔齐斯平原山地草原、针叶林区;ⅡD5 天山伊犁高山盆地半灌木荒漠、针阔叶混交林区 |
| Ⅲ 暖温带 | A 湿润地区 | ⅢA1 辽东胶东低山丘陵落叶阔叶林、栽培植被区 |
| Ⅲ 暖温带 | B 半湿润地区 | ⅢB1 鲁中低山丘陵落叶阔叶林、栽培植被区;ⅢB2 华北平原栽培植被区;ⅢB3 华北山地落叶阔叶林区;ⅢB4 汾渭盆地与黄土高原南部落叶阔叶林、栽培植被区 |
| Ⅲ 暖温带 | C 半干旱地区 | ⅢC1 黄土梁峁与山地草原区 |
| Ⅲ 暖温带 | D 干旱地区 | ⅢD1 塔里木与东疆盆地灌木、半灌木荒漠区 |
| Ⅳ 北亚热带 | A 湿润地区 | ⅣA1 淮河中下游平原与大别山地栽培植被、常绿、落叶阔叶混交林区;ⅣA2 秦巴山地常绿、落叶阔叶混交林区 |
| Ⅴ 中亚热带 | A 湿润地区 | ⅤA1 长江中下游平原与江南丘陵盆地常绿阔叶林、栽培植被区;ⅤA2 南岭与浙闽山地常绿阔叶林区;ⅤA3 湘贵高原山地常绿阔叶林区;ⅤA4 四川盆地栽培植被区;ⅤA5 云南高原常绿阔叶林、松林区;ⅤA6 东喜马拉雅南翼山地季雨林、常绿阔叶林区 |
| Ⅵ 南亚热带 | A 湿润地区 | ⅥA1 台中台北山地平原栽培植被、常绿阔叶林区;ⅥA2 闽粤桂(华南)低山平原常绿阔叶林、栽培植被区;ⅥA3 滇中南亚高山谷地常绿阔叶林、松林区 |
| Ⅶ 边缘热带 | A 湿润地区 | ⅦA1 台南山地平原季雨林、雨林区;ⅦA2 琼雷山地丘陵半常绿季雨林区;ⅦA3 滇南中山谷地季雨林、雨林区 |
| Ⅷ 中热带 | A 湿润地区 | ⅧA1 琼南低地与东、中、西沙诸岛季雨林、雨林区 |
| Ⅸ 赤道热带 | A 湿润地区 | ⅨA1 南沙群岛珊瑚岛植被区 |
| HI 高原亚寒带 | B 半湿润地区 | HIB1 川青藏高山谷地高寒灌丛草甸区 |
| HI 高原亚寒带 | C 半干旱地区 | HIC1 青南高原宽谷高寒草甸草原区;HIC2 羌塘高原湖盆高寒草原区 |
| HI 高原亚寒带 | D 干旱地区 | HID1 中昆仑北羌塘高山高原荒漠、荒漠草原区;HID2 喀喇昆仑西昆仑高山荒漠半荒漠区 |
| HII 高原温带 | A 湿润地区 | HIIA1 东喜马拉雅地区高山深谷森林区 |
| HII 高原温带 | B 半湿润地区 | HIIB1 横断山区高山深谷针叶林 |
| HII 高原温带 | C 半干旱地区 | HIIC1 祁连青东高山盆地针叶林、草原区;HIIC2 藏南高山谷地灌丛草原区 |
| HII 高原温带 | D 干旱地区 | HIID1 柴达木盆地半灌木、灌木、盐荒漠区;HIID2 阿里山地半灌木、灌木荒漠区 |
新划分的2023版中国生态地理区域见下图:

3.2 生态—物候建模区
由于生态分区高达50个,而我们认为不需要这么个多,综合考虑生态地理区、气候带、植被地带性、物候节律、地形格局和主要生态类型组合后划分建模区域。
并遵循以下原则:
- 区内生态背景尽量相似,便于模型学习稳定关系。
- 区间生态差异足够明显,避免把差异很大的区域强行放入同一模型。
- 每个区保留足够样本量,避免分区过细导致训练样本不足。
- 分区边界尽量参考已有生态地理区,而不是行政边界。
- 分区数量控制在可训练、可评估、可部署的范围内。
如果分区太少,全国生态差异仍然过大;如果分区太多,样本量、模型管理、边界拼接和 QA 成本都会明显增加。9 个区是在生态差异表达能力和模型工程可管理性之间的折中。
| 建模区编号 | 建模区名称 | 对应生态地理区 |
|---|---|---|
| R1 | 东北寒温带—中温带森林与沼泽区 | ⅠA1、ⅡA1、ⅡA2、ⅡA3、ⅡB2 |
| R2 | 东北—内蒙古温带草原森林草原区 | ⅡB1、ⅡB3、ⅡC1、ⅡC2、ⅡC3、ⅡC4 |
| R3 | 西北干旱荒漠—绿洲区 | ⅡD1–ⅡD5、ⅢD1 |
| R4 | 华北暖温带农田—落叶阔叶林区 | ⅢA1、ⅢB1–ⅢB4、ⅢC1 |
| R5 | 北亚热带混交林—栽培植被区 | ⅣA1、ⅣA2 |
| R6 | 中亚热带常绿阔叶林—水田丘陵区 | ⅤA1–ⅤA5 |
| R7 | 西南山地—横断山森林灌丛区 | ⅤA6、HIIA1、HIIB1 |
| R8 | 南亚热带—边缘热带常绿林季雨林区 | ⅥA1、ⅥA2、ⅥA3、ⅦA1、ⅦA2、ⅦA3 ⅧA1、ⅨA1 |
| R9 | 青藏高原高寒草地—高寒荒漠区 | HIB1、HIC1、HIC2、HID1、HID2、HIIC1、HIIC2、HIID1、HIID2 |
3.3 各分区的建模意义
R1 东北寒温带—中温带森林与沼泽区
R1 主要归并 ⅠA1 大兴安岭北部山地落叶针叶林区、ⅡA1 三江平原沼泽区、ⅡA2 东北东部山地针阔叶混交林区、ⅡA3 东北东部山前台地针阔叶混交林区和 ⅡB2 大兴安岭中部山地森林区。该区受寒温带—中温带冷凉气候控制,积温低,冬季长,植被生长季相对较短,春季返青晚、秋季衰退明显。森林、沼泽湿地、河湖水体和农林交错区是模型需要重点区分的对象。将其单独设为建模区,可以避免南方常绿植被或华北农田物候规则干扰东北森林—湿地系统的识别。
R2 东北—内蒙古温带草原森林草原区
R2 主要归并 ⅡB1 松辽中部平原森林草原区、ⅡB3 大兴安岭西麓北丘陵森林草原区、ⅡC1 西辽河平原草原区、ⅡC2 大兴安岭南部草原区、ⅡC3 内蒙古东部中平原草原区和 ⅡC4 呼伦贝尔平原草原区。该区处于森林向草原、湿润向半干旱过渡带,降水梯度明显,人类农牧利用强。草原、草甸、农田、灌丛、裸地和退化草地在光谱上容易混淆。独立建模可以更好表达温带草原—森林草原—农牧交错带的区域规则。
R3 西北干旱荒漠—绿洲区
R3 主要归并 ⅡD1 河套与内蒙古西部中平原荒漠草原区、ⅡD2 阿拉善与河西走廊灌木半灌木荒漠区、ⅡD3 准噶尔盆地小乔木半灌木荒漠区、ⅡD4 阿尔泰与额尔齐斯平原山地草原针叶林区、ⅡD5 天山伊犁高山盆地半灌木荒漠针阔叶混交林区和 ⅢD1 塔里木与东疆盆地灌木半灌木荒漠区。该区水分是最主要限制因子,荒漠、戈壁、裸地、盐碱地、绿洲农田、河谷湿地和稀疏草灌交错出现。短波红外、土壤背景和绿洲灌溉物候对分类影响很大。单独建模可以避免湿润区的高植被覆盖规则误导西北干旱区生态类型判断。
R4 华北暖温带农田—落叶阔叶林区
R4 主要归并 ⅢA1 辽东胶东低山丘陵落叶阔叶林栽培植被区、ⅢB1 鲁中低山丘陵落叶阔叶林栽培植被区、ⅢB2 华北平原栽培植被区、ⅢB3 华北山地落叶阔叶林区、ⅢB4 汾渭盆地与黄土高原南部落叶阔叶林栽培植被区和 ⅢC1 黄土梁峁与山地草原区。该区暖温带季风气候明显,农田、落叶阔叶林、人工林、草地、城市和河湖湿地交错,人类活动强度高。农田物候、城市绿地、灌溉水体和落叶林季节变化是模型混淆重点。单独建模有利于处理暖温带农田—城市—落叶林复合景观。
R5 北亚热带混交林—栽培植被区
R5 主要归并 ⅣA1 淮河中下游平原与大别山地栽培植被、常绿落叶阔叶混交林区和 ⅣA2 秦巴山地常绿落叶阔叶混交林区。该区位于暖温带与中亚热带之间,水热条件由北向南快速变化,落叶阔叶林、常绿落叶混交林、栽培植被、丘陵农田和水系交错。其物候特征兼具北方落叶季节性和亚热带较高绿度背景。作为独立分区,可以减少华北暖温带农田规则与南方常绿林规则之间的相互干扰。
R6 中亚热带常绿阔叶林—水田丘陵区
R6 主要归并 ⅤA1 长江中下游平原与江南丘陵盆地常绿阔叶林栽培植被区、ⅤA2 南岭与浙闽山地常绿阔叶林区、ⅤA3 湘贵高原山地常绿阔叶林区、ⅤA4 四川盆地栽培植被区和 ⅤA5 云南高原常绿阔叶林松林区。该区水热条件好,植被覆盖度高,常绿林、灌丛、茶园/果园、水田、旱地、村镇和城市绿地在光谱上容易接近。独立建模可以利用三季光谱、红边、短波红外和地形差异,更好区分常绿林、栽培植被和丘陵水田生态类型。
R7 西南山地—横断山森林灌丛区
R7 主要归并 ⅤA6 东喜马拉雅南翼山地季雨林常绿阔叶林区、HIIA1 东喜马拉雅地区高山深谷森林区和 HIIB1 横断山区高山深谷针叶林。该区海拔落差大,山地垂直分异强,局地气候复杂。森林、灌丛、草地、裸岩、高山植被、河谷农田和湿地镶嵌分布。该区建模必须强调 DEM、坡度、坡向与多季光谱共同作用,单独建模可以更好表达山地生态梯度和垂直带谱。
R8 南亚热带—边缘热带常绿林季雨林区
R8 主要归并 ⅥA1 台中台北山地平原栽培植被常绿阔叶林区、ⅥA2 闽粤桂低山平原常绿阔叶林栽培植被区、ⅥA3 滇中南亚高山谷地常绿阔叶林松林区、ⅦA1 台南山地平原季雨林雨林区、ⅦA2 琼雷山地丘陵半常绿季雨林区、ⅦA3 滇南中山谷地季雨林雨林区、ⅧA1 琼南低地与东中西沙诸岛季雨林雨林区和 ⅨA1 南沙群岛珊瑚岛植被区。该区热量充足,植被全年高绿度,季节性相对北方弱,常绿林、季雨林、水田、果园、城市绿地、海岸湿地和河湖水体混淆明显。单独建模有利于处理低纬高水热条件下的常绿植被、水体湿地和人工绿地识别。
R9 青藏高原高寒草地—高寒荒漠区
R9 主要归并 HIB1 川青藏高山谷地高寒灌丛草甸区、HIC1 青南高原宽谷高寒草甸草原区、HIC2 羌塘高原湖盆高寒草原区、HID1 中昆仑北羌塘高山高原荒漠荒漠草原区、HID2 喀喇昆仑西昆仑高山荒漠半荒漠区、HIIC1 祁连青东高山盆地针叶林草原区、HIIC2 藏南高山谷地灌丛草原区、HIID1 柴达木盆地半灌木灌木盐荒漠区和 HIID2 阿里山地半灌木灌木荒漠区。该区海拔高、气温低、生长季短,冻土、强辐射、积雪冰川和高寒水文过程影响显著。高寒草甸、高寒草原、高寒荒漠、裸地、冰雪、湖泊湿地和河谷植被的光谱关系与低海拔区域差异很大。单独建模可以避免高原高寒生态系统被普通温带草地、南方草地或西北裸地规则误导。
3.4 九区划分对 LightGBM/XGBoost 模型的意义
对 LightGBM/XGBoost 这类表格模型而言,生态分区可以通过两种方式发挥作用:
方式一:训练 R1-R9 分区模型,每个区独立学习。
方式二:训练全国统一模型,把 region_id 作为输入特征或对照变量。
当前生产路线更倾向于分区模型优先。原因是树模型很擅长学习条件分裂,但如果全国差异过大,同一个特征阈值可能在不同区域代表不同生态含义。分区后,模型不需要在一棵树里同时解释青藏高原、华北农田、南方常绿林和西北荒漠,从而减少规则冲突。
同时,R1-R9 分区也便于模型诊断:每个区都可以独立输出 accuracy、macro F1、weighted F1、per-class F1、混淆矩阵和代表 tile 空间 QA。这样可以清楚知道模型在哪个生态区、哪些类别上表现好,哪些类别需要补样本或后处理。
4. 生态分区如何使用
生态分区主要用于三类任务:第一,按生态区提取样本和统计类别分布;第二,训练 R1-R9 分区 LightGBM/XGBoost 模型;第三,在全国推理时根据像元或 tile 所属分区选择对应模型。
全国统一模型也可以使用生态分区信息,但其作用通常是作为 region_id 或区域类别特征,而不是裁剪边界。分区模型和全国统一模型的比较,应基于每区指标、类别级指标和空间连续性共同判断。
生态分区在模型全流程中的作用如下:
| 阶段 | 作用 |
|---|---|
| 样本提取 | 按 R 区统计类别分布,避免样本被全国优势区域主导 |
| 特征提取 | 保留 region_id,便于分区训练和全国模型对照 |
| 模型训练 | R1-R9 分区训练 LightGBM/XGBoost |
| 模型评估 | 按区计算精度指标和类别级混淆 |
| 模型推理 | 根据 tile 或像元所属 R 区选择模型 |
| 后处理 | 按区检查水体、湿地、城市绿地、荒漠等易混类别 |
| 全国拼接 | 检查 R 区边界处分类连续性和类别突变 |
5. 数据位置
9个分区的数据在昕图模版,用户可以直接使用。
