MENU

新闻中心

当前位置: 首页» 新闻中心» 科研进展

Molecular Plant | 基因组所商连光团队开发自进化AI科学家“绿洲”助力作物耐盐碱研究

2026-09-21 03:26:00

【字体:

  

2026年9月18日,中国农科院基因组所(大鹏湾实验室)商连光团队联合崖州湾国家实验室、盐碱地综合利用国家技术创新中心,在《分子植物(Molecular Plant)》上在线发表题为“OASIS, a self-evolving AI scientist that integrates omics data and literature knowledge for plant stress research”的研究论文。



该研究开发了面向植物逆境研究的自进化AI科学家“绿洲”(OASIS)。系统将大语言模型、多智能体协作、植物逆境文献知识库以及组学和遗传数据纳入同一科研流程,可围绕一个科学问题自主完成任务规划、文献检索、数据查询、文献与组学数据融合推理和结果审查,并能够从历史任务中的失败与纠错中学习可复用经验。研究团队进一步以水稻耐盐为案例,对“绿洲”提出的候选基因开展实验验证,形成了从科学问题到候选假说再到实验验证的完整研究路径。


植物抗逆研究往往不是“缺少信息”,而是证据分散在不同载体中:机制研究主要沉淀在论文里,基因表达、遗传定位、群体变异和种质资源则分布在多个数据库中。研究人员通常需要在大量文献和多类数据之间反复检索、比对和判断,才能把一个科学问题逐步收敛为可供实验验证的假说。通用大语言模型擅长理解和生成文本,但仅依靠模型自身知识,仍难以稳定完成跨数据库、跨数据类型的连续科研分析。


从“读文献”到“查数据”,让AI进入真实科研工作流

针对这一问题,“绿洲”将复杂科研任务拆解为多个子任务,由6个AI智能体分工协作完成。系统先识别研究意图并制定任务计划,再根据需要调用文献检索、数据分析和科研数据库等工具,最终由审查与综合模块检查证据覆盖范围和任务完成情况后生成结论。任务规划、文献片段、数据库查询结果和分析记录都会保存在共享工作空间中,便于研究人员回溯和核对。整个过程类似于一个小型科研团队围绕同一科学问题持续协作。


图1 | “绿洲”多智能体协作科研框架。系统围绕科学问题进行任务拆解,并协调文献检索、数据分析、结果审查和综合生成,使不同来源的科研证据能够在同一工作流中被连续调用和融合推理。


支撑这一流程的是专门整理的植物逆境知识和数据资源。“绿洲”目前覆盖拟南芥、水稻、玉米、小麦、大豆和陆地棉6个物种,以及盐、干旱、高温和低温4类主要非生物胁迫。文献知识库收录超过15万篇相关论文摘要和1.5万篇开放获取全文,并持续同步新发表研究;同时接入植物逆境表达数据、GWAS/QTL、群体变异、eQTL和种质资源等结构化信息,使系统不仅能够回答“文献中有哪些报道”,还能够进一步判断“数据是否支持这一推断”。


OASIS的优势,体现在数据驱动的研究任务中

为评估系统在真实科研任务中的表现,研究团队构建了面向植物逆境研究的基准测试集PlantStressQA,包含200个贴近真实科研过程的问题,覆盖机制证据、基因ID映射、表达分析、遗传位点分析、品种筛选和群体变异六类任务。

在与多种通用大语言模型的比较中,“绿洲”总体得分为84.0分,参评通用模型得分为33.8至50.1分。在需要实际调用并整合结构化数据的任务中,“绿洲”优势明显,其中群体变异和遗传位点分析两类任务分别比表现最好的通用模型高55.6分和52.3分,在基因ID映射和表达证据分析中也表现出明显优势。


图2 | “绿洲”在PlantStressQA上的系统评价。系统在基因ID转换、表达数据查询、遗传位点分析和群体变异分析等数据密集型任务中表现出更明显的优势。


这些结果说明,“绿洲”的核心并不是单纯依赖语言模型“记住更多知识”,而是通过组织科研工具和数据资源,在研究过程中主动查找数据、完成格式转换、比较不同来源的证据,并将这些步骤串联为可追溯的分析过程。


做错一次之后,下一次还会不会犯同样的错误?

真实科研分析中,数据库字段不匹配、基因ID格式错误、工具调用顺序不合理等问题并不少见。如果系统每次遇到相似任务都从头试错,不仅效率低,也会造成额外的计算资源消耗。为此,“绿洲”设计了自进化经验学习模块(SEEL),从历史任务中识别“先失败、随后被成功纠正”的执行轨迹,对比错误路径和正确路径,提炼可复用的操作经验,并通过重新执行真实任务检验其有效性。只有验证通过的经验才会进入技能库,供后续相似任务调用。


图3 | SEEL自进化经验学习流程及效果。系统从历史任务的失败与纠错过程中提炼可复用经验,经验证后纳入技能库。


研究团队从PlantStressQA的历史轨迹中筛选出86个包含可复用经验的任务。应用这些经验后,工具调用失败、数据库错误、重复操作和模型处理文本量均有所减少。在一个表达分析任务中,大模型调用次数从75次降至42次,模型处理文本量从112万降至31万,运行时间从476秒缩短到236秒,数据库错误和失败工具调用则从多次降为0次。随着有效经验持续积累,“绿洲”能够在后续相似任务中减少重复试错并优化执行过程。


最关键的一步:AI提出的候选基因,实验能不能验证?

基准测试可以衡量AI系统是否“会做题”,但科研价值最终还要回到能否帮助提出值得验证的科学假说。研究团队以水稻耐盐为案例,在未预设具体候选基因的情况下,通过多轮提问引导“绿洲”开展分析。系统先从已有研究中归纳离子稳态与Na⁺/K⁺运输、ABA信号与渗透调节、ROS稳态、MAPK级联和盐感知/Ca²⁺信号等主要耐盐调控模块,并整理出284个有文献证据支持的拟南芥调控基因;随后开展跨物种同源映射和功能筛选,再整合水稻耐盐GWAS/QTL等遗传证据,最终逐步确定5个优先候选基因。


图4 | “绿洲”辅助筛选水稻耐盐候选基因的多轮对话示例。系统整合耐盐机制文献、水稻同源基因信息和群体遗传证据,逐步筛选出5个优先候选基因。


研究团队根据“绿洲”给出的证据链,选择此前未被直接报道参与水稻耐盐调控的OsPP2a(LOC_Os12g04290)开展实验验证。该基因的拟南芥同源基因TAP46与ABA信号相关,OsPP2a本身位于水稻耐盐meta-QTL区间内,并与一个eQTL信号共定位。两个独立的Ospp2a突变材料在150 mM NaCl处理后均表现出更明显的盐敏感表型,恢复存活率降低,同时Na⁺积累增加、Na⁺/K⁺平衡发生改变。RT-qPCR结果还显示,离子稳态相关基因OsSOS1和OsHKT1;5的表达发生变化,为OsPP2a参与水稻盐胁迫响应提供了遗传和分子层面的证据。


图5 | “绿洲”优先推荐基因OsPP2a的耐盐功能验证。两个独立突变材料在盐胁迫下表现出更低的恢复存活率和更高的Na⁺/K⁺比值,支持OsPP2a参与水稻耐盐响应。


在这一案例中,研究人员通过多轮提问引导“绿洲”完成机制梳理、跨物种证据迁移、遗传数据查询和候选基因优先级排序,再由实验进一步检验候选假说,形成了“科学问题→证据融合→候选假说→实验验证”相衔接的研究路径。


从“AI回答科学”到“AI参与科学”

“绿洲”的目标并不是用AI替代科研人员作出判断,而是把过去需要在多篇文献、多个数据库和不同分析工具之间往返完成的工作,组织成一条可追溯、可复核的科研流程。通过多智能体协作、文献与组学数据融合推理以及自进化经验学习,系统能够帮助研究人员更高效地汇集证据、缩小候选范围并提出更有依据的科学假说。


这项工作为人工智能参与植物抗逆研究提供了一个从“回答问题”走向“参与分析”的实践框架。未来,随着文献、组学数据和科研工具持续扩展,“绿洲”有望进一步服务于作物抗逆机制解析、关键基因挖掘和后续实验研究,为耐盐碱等作物抗逆改良提供智能化研究工具。


基因组所(大鹏湾实验室)商连光研究员和崖州湾国家实验室钱前院士为论文共同通讯作者,基因组所(大鹏湾实验室)博士后韩漾和副研究员魏华为论文共同第一作者。该研究得到国家重点研发计划和国家自然科学基金的资助。


平台入口:https://www.oasis.ac.cn


原文链接:https://www.cell.com/molecular-plant/abstract/S1674-2052(26)00305-9

TOP TOP