农业农村部数据存储38PB,建成高质量数据集仅3TB。农业不缺数据,缺的是"机器能吃"的数据。采集标准不一、标注缺失、非结构化占比过高,农业AI的瓶颈不在算法,在数据治理。

做农产品数据分析的时候,遇到过一件有意思的事:某天蒜头价格数据突然出现一个异常尖峰,初看以为是行情异动,细查才发现是档口录入的"结账价"而非真实成交价。结账价里可能含运费、装卸、赊账利息,与成交价不是一回事。一个档口的账本,被当成了行情数据喂进系统。
这件事让我意识到:数据不是天然的。你以为拿到的是"价格",实际上可能只是"某个人某个环节记下来的一笔账"。
后来看到农业农村部发布会公布的数据——38PB总存储空间、18PB实际存储、4673个开放数据集,但官方原话是"真正能够稳定用于模型训练的高质量数据仍显不足",建成的高质量数据集只有3TB。这个蒜头结账价的例子,与整个农业AI数据困境,本质上是同一个问题:量够,质散。
一、量:38PB够不够?

38PB这个数,乍一听会觉得农业数据很充裕。国家数据局发布会上,农业农村部宋丹阳副司长公布:总存储空间38PB,实际存储18PB,建成的高质量数据集3TB。
3TB是什么概念?是实际存储量18PB的0.0167%。
再看结构。国家农业数据中心历史数据显示,结构化数据仅占17%,剩下83%是非结构化的——遥感影像、田间照片、监控视频、日志文件【来源:中国农业信息期刊】。这些不是没用,但直接喂给模型训练,需要先清洗、标注、结构化,成本可能比重采一遍还高。
Token消耗方面,农业农村部公布的年度Token消耗量超过2.4亿个。对比通用大模型训练动辄数十万亿token的量级,农业领域的模型训练消耗几乎可以忽略。不是不想多喂,是能喂进去的太少。
核心观察:38PB不是不够,是大部分"喂不进去"
从38PB到18PB再到3TB,每往下走一层,数据就缩水一个数量级。38PB是总量,18PB是存量,3TB是可用量。中间差的是数据采集能力吗?不是,差的是数据治理能力。
二、质:能不能用?

38PB吃不了,问题出在"能不能用"上。农业数据的质量问题,核心在于标准缺失。
编码不统一。同一棵白菜在不同系统里能叫四个名——有的按品种分,有的按产地分,有的按等级分,有的干脆是档口老板自己起的别名。"本地白菜""外地白菜""精品白菜""普通白菜",在不同数据库里指向的可能根本不是同一个东西。
规格各搞各的。山东金乡的蒜头和河南中牟的蒜头,在产地数据里是两条记录,规格、分级标准各自为政。要做全国蒜头行情模型,第一件事不是调算法,是把"什么叫一箱蒜头""什么叫一级品""什么叫成交价"这些字段全部对齐。
成交价定义混乱。不同批发市场对"成交"的定义都不一样——有的记开秤价,有的记收秤价,有的记大宗批发价,有的混进了零售零单。这种数据喂给模型,它学到的可能是"记账习惯的分布",而非"市场行情的规律"。
三家央媒给出了同一个诊断。光明日报:"农业数据来源广、类型多、产出主体分散,采集标准不一、标注质量不齐、流通渠道不畅等问题仍然存在。经济日报:"涉农数据分散在农业、气象、自然资源、市场监管等多个部门,采集困难,标注标准也不统一"。科技日报:"不同厂商的传感器协议兼容性不足,导致数据采集碎片化"。
标注更是一笔算不过来的账。病虫害识别需要准确图片和专家标注,土壤肥力判断需要长期监测和区域经验。这些活儿又贵又慢,没人愿意长期投。结果是"数据不完整、不准确、不及时——模型输出可能失真,甚至误导农业生产"。
核心观察:农业AI卡的不是算法,是数据治理
国内已发布农业大模型约40个。神农出到4.0了,训练数据3PB,36个智能体,病虫害识别覆盖1016种,甚至具备因果推演能力。算法层面参数量动辄几十亿上百亿,架构该用的都用了。
但官方还在说"高质量数据仍显不足"。算法是厨子,数据是食材;厨艺再高,烂菜叶也炒不出米其林。
农业AI接下来两年的瓶颈,不会在算力、不会在算法,会在数据治理上。谁先把数据洗干净、标注好、标准统一了,谁的大模型才能真正落地。
三、通:流不流动?

农业数据不光乱,还散。经济日报明确指出:"涉农数据分散在农业、气象、自然资源、市场监管等多个部门,采集困难,标注标准也不统一,导致数据孤岛问题突出"。科技日报点名了制度层面的缺失:"数据要素产权制度缺位,导致数据垄断与数据滥用并存,同时部门间存在数据壁垒,形成数据孤岛'"。
数据攥在不同的人手里,互相之间不打通,各自为政。你做你的气象数据库,我做我的耕地数据库,他做他的市场行情数据库。合在一起——格式不兼容、口径不一致、时间戳对齐不了。
更深层的是产权问题。光明日报一针见血:"数据被拿走、收益留不下"。农民贡献了土壤数据、种植数据、收成数据,但这些数据一旦被采集走,谁在用、用在哪儿、创造了什么价值,贡献者一概不知。没有确权机制,没有收益分配机制,谁愿意把自己的数据交出来?
核心观察:智慧农业的瓶颈不在田里,在"表"里
智慧农业喊了这么多年,田里的活儿进步其实挺快——北斗导航精度到3cm以内,无人驾驶收割机都下地了。卡住的是那些看不见的"表":
- 采集端:传感器协议各厂商各搞各的,A厂的探头数据B厂的系统读不了;细碎地块、特色种养的数据采集成本居高不下
- 标准端:同一棵白菜在不同系统的编码都不一样;多源数据标准化率不足
这四层全在"表"里——采集规范表、质量标准表、流通机制表、标注规程表。
四、用:喂给谁?

数据收回来、洗干净、打通了——喂给谁?
答案是约40个农业大模型。覆盖面从种业、种植到畜牧、农机:
综合通用类:神农4.0(病虫害识别1016种)+农业世界模型1.0(因果推演);司农——国内首个开源农业通用大模型底座,8B/32B,40亿+token农业知识;天工开悟,服务超100万亩耕地,降成本10%、增产5%。
种业专用类:丰登,首个种业大模型,200亿+参数,整合140万+文献;丰菽,大豆AI育种。
畜牧养殖类:孺子牛,国际首个奶业大模型,覆盖210万头奶牛(全国30%存栏);司牧,融合超1亿条养殖数据。
土肥耕地类:土肥大模型,28亿条土壤养分数据,70年尺度,1km网格精度。
农机设施类:机芯大模型,133万+条数据集,故障诊断准确率95%+。
落地效果也有实据:河南农大智慧农场漯河基地480亩,节水31%、节肥20%、水肥管理人工减少80%、增产19.1%、每亩节本增效916元。甘肃临洮智慧灌溉,每亩用水从500方降至250方(节水50%),化肥减15-20%,亩均增收300-500元。新都军屯3700亩示范区,水稻亩产630公斤,核心区每亩收益超2000元。

但这些案例用的数据,是3TB里的优质数据,不是38PB里还没洗干净的泥矿。现在的落地案例都是在"数据治理已经做完"的那一小块绿洲上做出来的。要让这些效果从"盆景"变成"风景",得先把38PB里的数据一块一块洗出来。
收尾

要成为行业核心数据源,第一步不是做大模型,不是搞AI,是把数据洗干净。这句话放到农业身上,同样适用。
农业农村部这38PB是一笔巨大的资产,但现在更像是"沉睡的资产"。怎么醒来?不是靠喊口号——是靠一锹一锹地把数据治理这个坑填上:采集标准统一、标注规范建立、数据确权到位、流通机制打通。
数据治理是最不性感的投资,但它是所有AI故事的地基。我见过太多团队,一上来就谈大模型、谈参数量、谈智能体,问到数据怎么来的、怎么清洗的、标注谁做的,集体沉默。这是本末倒置。
算法可以买,算力可以租,干净的数据资产只能自己一锹一锹挖。谁先把手伸进泥矿里洗数据,谁就先拿到农业AI的入场券。
如果你在关注农业数据,可以用「数查查」查自己关心的农产品数据。平台覆盖了农产品价格、产量、流通等多维度数据源,配合车辆物流数据可以做产销地追踪。蒜头也好、白菜也好、生猪也好——数据对齐和清洗的活儿,底层已经做了。

【大数据猎人】
数据治理不是最性感的活儿,但它是一切AI故事的地基。