01 数据介绍
▪ 数据名称:全国尺度的中国农业与乡村场景超高分辨率多标签图像分类数据集
▪ 数据编号:0462
▪ 数据区间:2023–2024年,覆盖全国范围的农业与乡村区域
▪ 数据量:55 520 张 512×512 像素的 RGB 真彩色 PNG 图像
▪ 数据简介:全国尺度的中国农业与乡村场景超高分辨率多标签图像分类数据集,数据集基于全国 50km×50km 网格采样,影像取自 Google Earth,空间分辨率约 1.2 米,拍摄时间为 2023–2024 年;经云量、清晰度、场景丰富度筛选后,最终保留55 520 张 512×512 像素的 RGB 真彩色 PNG 图像。
▪ 数据来源:由中国农业大学牵头,联合首都师范大学、瓦赫宁根大学、中科院地理所等单位建设,数据论文发表于《Scientific Data》,数据集托管在 Figshare 平台,CNDD根据原始数据清洗并整理。
▪ 数据价值:这套数据是面向乡村遥感的多标签分类基准,核心用于以下方向:
1.多标签图像分类:训练模型同时识别一张遥感图中的多种地物 / 场景,是最核心的基础用途。
2.长尾学习研究:利用 78 倍的类别差距,验证重采样、代价敏感学习、Focal Loss/ASL 损失等长尾优化算法的效果。
3.弱监督语义分割:以图像级标签为弱监督信号,生成像素级伪标签,探索弱监督分割方法。
4.乡村遥感应用研究:比如分析地物共现规律、乡村场景复杂度、农业设施分布识别等。
5.拓展方向:也可用于遥感图文检索、领域大模型微调、遥感视觉问答等多模态研究。
CNDeepData 根据数据应用质量评级如下:
▪ 常用度:★★★★★
▪ 稀缺度:★★★★☆
▪ 新颖度:★★★★☆
▪ 总体级别:13颗星
✔ 常用度:是数据市场中需求指标,是指该数据在经济管理类学术论文中使用频率。
✔ 稀缺度:是数据市场中供给指标,是指该数据在其他数据库的出现频率。
✔ 新颖度:是数据市场中生成指标,是指该数据在生成时方法新颖程度和工作量。
02 数据集说明
数据为一个.7z 格式压缩包,解压后包含「图像文件夹 + 一张 CSV 标签表」,整体结构简洁直接。
1. 图像数据
- 数量与格式:共 55520 张 PNG 格式真彩色图像,文件名从
image_00001.png连续编号至image_55520.png,统一存放在China-MAS-50k_image目录下。 - 规格参数:单张图像尺寸固定为 512×512 像素,三通道 RGB 格式,空间分辨率约 1.2 米(对应 Google Earth zoom 18 级别);影像拍摄于 2023–2024 年,覆盖全国范围的农业与乡村区域。
- 采样逻辑:按全国 50km×50km 网格均匀筛选采样,剔除了云量过高、积雪覆盖、画面模糊、场景过于单一的无效影像,最终保留有效样本。
2. 标签数据
- 载体形式:单独的
China-MAS-50k_label.csv文件,共 55520 行、19 列,每行对应一张图像。 - 关联方式:第一列字段名为
nim,值为对应的图像文件名(如image_00001.png),是关联图像与标签的唯一主键。注意 CSV 行序和文件编号顺序不一致,必须通过nim字段匹配,不能按行号直接对齐。 - 标签规则:剩余 18 列为 0/1 二值的多热编码标签,
1代表该类别在图像中出现,0代表未标注为该类别;单张图像可同时标注多个正标签,属于典型的多标签数据集。 - 类别覆盖:18 个类别涵盖农业用地、乡村建筑、水体、交通、文体设施等类型,具体包括:林地、耕地、乡村聚落、道路、裸地、湖泊 / 池塘、工厂建筑、河流、铁路、温室大棚、足球场、草地、篮球场、公园、固体废弃物、地膜覆盖、光伏设施、防尘网。
- 分布特点:标签呈显著长尾分布,头部的林地、耕地样本量最高,尾部的防尘网、光伏设施样本极少,最大类别样本量是最小类别的 78.2 倍。
- 特殊项:数据中存在 511 行全 0 标签的图像(所有类别均为 0),暂无法确认是漏标还是纯背景样本,使用时需单独处理。
03 数据使用方法
1.基础使用流程
(1)数据预处理
- 解压压缩包,得到图像文件夹和 CSV 标签表;
- 通过`nim`字段将图像路径与对应标签一一匹配,构建数据集索引;
- 处理全 0 行:根据研究目的选择剔除、保留为背景类,或单独复核。
(2)数据集划分
官方未提供固定的训练 / 验证 / 测试拆分清单,需要自行划分。推荐采用“多标签分层抽样”方式,按 8:1:1 比例拆分,同时固定随机种子,保证实验可复现。
(3)模型训练
- 输入为 512×512 的 RGB 三通道图像,输出为 18 维的二值标签向量;
- 可参考原始论文的基线结果:论文对比了随机森林、XGBoost、VGG19、ResNet152、ResNeXt101、Swin-B 等 9 组模型,其中 ResNeXt101 效果最优,mAP 达 74.0%,可作为复现基准。
(4)效果评估
不建议只用总体准确率评价(头部类别会拉高整体分数,掩盖尾部类别失效的问题),推荐核心报告以下指标:
- 整体指标:mAP(平均精度均值)、宏平均 F1、样本级 F1;
- 细粒度指标:每个类别的 AP、召回率、精确率,重点关注尾部类别的识别效果。
2.关键使用注意事项
- 标签编码以 CSV 和作者代码为准,`1=类别出现,0=未标注出现`;论文原文曾写反编码方向,不要被误导。
- 针对长尾分布,训练时建议搭配类别重加权、长尾损失函数、分类别阈值调整等策略,避免模型只学好头部类别。
- 合规层面:数据集标注协议为 CC BY 4.0,但底层影像来自 Google Earth,二次传播、商业用途需额外遵守 Google Earth 的服务条款。
04 获取方式
本数据为会员专属数据,添加客服微信,购买年度基础会员149元,年度高级会员299元,永久高级会员899元,可享CNDeepData所有会员数据免费获取。
▪ 添加客服微信方式:
扫描下方二维码,或搜索微信号:DeepData001
版权声明
1. 除中国深度数据库(CNDD)特殊声明外,CNDD对基于合法来源的数据的选择、整理和编排具有独创性。任何自然人、法人、其他组织未经CNDD授权,不得以任何目的截取、上传、下载、复制、修改、使用、编译等或者以任何方式任何媒介传播上述作品的任何部分,否则视为侵权。
2. 对于存在侵害CNDD上述权利违法行为的主体,CNDD保留依法追究其法律责任的权利。
数据授权使用说明
任何使用CNDD数据等产品的单位和个人,承诺只将CNDD的数据等用于学术研究,并在所得研究成果(包括但不限于学术论文、咨询报告等)中注明数据来源于CNDD。数据来源的注明方式请参考:“本研究数据来源于中国深度数据库CNDD”;英文参考:“We get the data from CNDeepData (CNDD)”。
中国深度数据库:让精品数据 得以流动
CNDeepData:Let high-quality data flow without barriersOffice Action
本文由 CNDD 发布
如需获取完整数据,请访问我们的官方网站