中国农业大学谯仕彦院士团队在顶级期刊(IF=16.1)发表研究论文,构建芽孢杆菌生物制造领域大模型可指导饲用抗菌肽生物制造
近日,中国农业大学动物科学技术学院谯仕彦院士团队于海涛副教授构建了AI驱动的芽孢杆菌农业生物制造领域大模型BaciCausalLM。与侧重知识问答或一次性方案生成的通用模型不同,该研究把专业知识、显式因果推理、本地部署和湿实验反馈纳入同一技术路线,并在微生物代谢干预判断、培养基迭代优化和跨任务工艺优化中得到普适性验证,实现饲用免疫调节肽的克级表达。相关研究论文“BaciCausalLM: A lightweight causal-reasoning large language model for Bacillus-based agricultural biomanufacturing”在线发表于农业与人工智能交叉领域国际期刊《农业人工智能(英文)》(Artificial Intelligence in Agriculture)。
芽孢杆菌是农业微生物产品的重要生产底盘,但从“能够合成”到“稳定、低成本生产”之间仍存在较长的优化链条。代谢通路中的前体竞争、反馈调控和能量分配会改变干预效果,培养基与发酵参数又相互影响。面对分散在论文、专利和企业记录中的知识,研究者不仅需要更快找到信息,更需要判断哪些方案值得优先试验、为什么值得试验,以及哪些风险需要提前排除。
团队整合3200篇论文、46卷专业书籍资料、61件专利、820个高质量网页和1500条脱敏发酵工艺记录,形成约2100万字符语料和约10万组问答数据;另建1100题领域通用能力基准和308条代谢干预—结果记录。研究通过来源隔离和近重复过滤控制训练—评测交叉,并由领域专家复核评测内容。经6个开放权重基座模型比较,团队选用Qwen3-32B,结合QLoRA与4位量化完成领域适配,使其可在单张桌面级GPU上本地推理。
BaciCausalLM的数据构建与评测框架
BaciCausalLM把研究问题转化为“目标产物—菌株背景—实验约束”的结构化输入,并输出因果链、候选策略和风险标注。其领域通用能力准确率由基础模型的82.0%提高到94.4%,代谢干预结果三分类准确率为85.7%,Cohen’s κ为0.770。显式因果链使无改善方案的增产误判率从25.9%降至14.8%,严重跨等级错误未增加;外部基准测试也显示,模型在扰动和多因素交互条件下的推理表现较基础模型更稳定。
BaciCausalLM本地因果推理平台及评测结果
在实际应用任务中,团队首先以贝莱斯芽孢杆菌(Bacillus velezensis)生产脂肽Iturin A为对象,连续开展三阶段培养基试验。随着领域适配和实验反馈加入,15个候选配方的阶段平均滴度由146.2±92.1 mg/L提高到690.6±357.1 mg/L,第三阶段所有配方均检出产物,最高滴度达到1442.0±2.6 mg/L,单位产物培养基成本中位数仍较基础模型阶段低20.9%,实现抗真菌肽克级表达。这说明模型反馈并非只追求更高滴度,而是在高产、失败风险和原料成本之间重新组织候选空间。
BaciCausalLM驱动的Iturin A三阶段培养基优化
随后,研究团队将模型用于没有专属训练数据的脂肽brevicidine生产任务。模型生成的10个候选培养基中,7个获得可检测产物,最佳初始滴度为120.80±7.21 mg/L。结合多因素实验筛选、本地知识库证据和前序结果反馈,模型辅助确定Tween 80添加与变温培养等后续策略;经专家监督和湿实验验证,最高滴度达到337.93±7.78 mg/L,为初始最佳配方的2.80倍,显示出在数据稀缺条件下辅助跨任务假设生成和策略排序的潜力。
BaciCausalLM在Brevicidine任务中的跨任务迁移与反馈迭代
该研究将领域知识、显式因果推理、本地部署和湿实验反馈整合为实验设计前端的决策支持层,在实验前压缩候选空间、标注风险,在实验后吸收结果并更新判断,同时将敏感工艺数据留在本地。BaciCausalLM并非替代专家的“自动优化器”,其输出仍需专业审查和湿实验验证。现有实验主要覆盖芽孢杆菌及相近菌属的非核糖体肽产品,且处于摇瓶尺度;向更远菌属或工艺放大拓展,还需补充可检索证据、持续反馈和更多场景验证。
中国农业大学为论文第一完成单位,动物科学技术学院2023级博士研究生彭思毅为第一作者,于海涛副教授、谯仕彦院士为通讯作者。邓爱华教授、曾祥芳教授参与研究构思和方法设计。该研究获得国家自然科学基金(32402807)、拼多多—中国农业大学研究基金(PC2023A01001)和国家生猪技术创新中心战略先导项目(NCTIP XD/B05)资助。
