Omni-Mol:用多模态大语言模型构建通用多任务分子模型

参考:https://github.com/ChengxinHU/Omni-Mol

文献:https://arxiv.org/abs/2502.01074

基本上现在要做生物大分子 通用、多任务(通用的狭义定义)的模型,都是用的大语言模型(多模态可以适配多任务),

因为广义上理解只有语言能够统一多种任务描述,

也只有语言模型能够通往AGI,所以语言模型也被用来做各个领域的多任务、通用模型。

比如说,一个模型搞定分子生成、性质预测、分子描述、结构翻译等所有分子任务。

所谓通用,狭义上理解,什么都能做,那就是目前有什么任务,就都拿来做一做、比一比

但是,语言模型要想通用、统一,就需要在多任务上联合学习,这个学习过程有很多需要解决的问题:

在分子领域,已有大量研究探索利用多模态大语言模型(LLM)构建通用、多任务的分子模型。然而,现有工作距离实现真正的通用分子模型仍有较大差距。我们梳理出该方向存在三大核心挑战:
(1)现有的分子任务数据集通常规模较小,领域覆盖不够全面。
(2)不同分子子领域的任务存在显著分布偏移与任务竞争问题,难以通过大语言模型实现有效的联合学习,造成学习过程不稳定。
(3)任务间与任务内的分子表征在语言空间需要不同的本征维度,导致语言模型表征难以在冗余性与信息不足之间取得平衡。

比如说有的任务,无序预测,只需要低维feature,描述这个任务只需要简单信息、几个低维表征就够了,比如说随便举几个物理化学性质、参数即可,你不需要搞什么ESM-2 256、1280等高的不得了的维度特征来处理这个任务;

但是有的任务,比如说反应途径预测,那就需要非常复杂的维度信息、非常高维来表征描述
"为解决上述挑战,我们创新性地将现有小分子任务划分为四类:Mol2Mol、Mol2Text、Mol2Num、Text2Mol。随后构建了包含16项以上任务、超过140万样本的数据集,是目前规模最大的分子指令微调数据集。依托大语言模型在海量化学文献上完成的预训练基础,本文提出全新多模态大语言模型框架Omni-Mol,统一处理全部小分子任务,同时支持分子生成与分子理解。Omni-Mol的核心是本文提出的MoGE模块,它能够动态适配不同任务的本征秩。该混合专家架构有效提升模型处理各类任务与模态的能力。我们的模型在16项任务上完成统一指令微调,并在其中13项任务上取得当前最优性能。大量实验进一步验证了Omni-Mol具备良好的可扩展性与通用性。"

Omni-Mol 简要解析

Omni-Mol(NeurIPS 2025)是基于共享LLM主干(Llama-3.2-1B-Instruct)的小分子多任务统一模型,主打任意模态间分子任务,用一套模型同时处理16种分子/化学任务。

核心创新

  1. 多任务指令微调 :构建小分子指令微调数据集;多任务联合训练优于每个任务单独LoRA,看似无关任务(分子描述Molcap、量子性质预测)互相增益。
  2. MoGE:提出MoGE,结合改进LoRA适配器+MoE扩展层,提升多任务性能,同时让不同任务效果更均衡。
  3. 统一底座:单共享LLM backbone,覆盖四大类16项化学任务。

16项任务分类

  • 分子↔分子:正向反应、试剂预测、逆合成、溶剂/催化剂预测、分子编辑MolEdit
  • 分子→数值:量子力学性质、分子量、TPSA、LogP、反应产率预测
  • 分子→文本:实验流程、分子问答、分子字幕Molcap
  • 文本→分子:IUPAC转SELFIES、文本引导分子设计

工程与版本

  • 依赖:Llama3.2-1B-Instruct作为LLM主干,MoleculeSTM提供GNN编码器;使用uv管理环境,DeepSpeed、PyG等。
  • 模型权重:V1为论文主结果;V2除产率回归外全部任务效果更强。
  • 代码状态:推理代码、数据集已发布;训练代码是预览版,未完整复现验证,可读性差,后续会重构。
  • 推理:配置test.sh,支持多GPU批量推理;输出预测json与任务指标json。

论文指出的局限与未来方向

  1. 评测基准问题
    • 分子字幕、分子问答:现有指标靠文本匹配,模型给出正确但和参考文本不一样的答案会被低估;建议改成单选/多选客观评测集。
    • 逆合成等反应任务:存在多条可行合成路线,但评测只校验单一条路线;建议用正向预测模型做结果验证器。
  2. 训练数据:现有数据集只有输入+最终答案,缺少中间推理步骤;计划用大模型拒绝采样蒸馏推理链,后续可做RLVR强化学习。
  3. 多轮分子对话:基于同一分子构建多轮对话数据,进一步提升模型对分子的深度理解。

现在回过头来前面的3个问题怎么解决

  • 第1个问题是数据的问题

    这里我粗浅的理解是数据集本来就小,是不是把零散小任务归类,然后数据集分到4大类的话,可以避免单个任务样本太少?

当然,基本方向上应该是理解没问题的,但是这还没有理解到本质点子上,重点其实不在于将数据集合并拆分为4类,拆分成更少的3类、2类也不是我们应该学习的点;

更本质的其实是统一任务的输入输出格式,最小统一只能统一到4类输入输出格式,那么就再拆分不了了。

不是数据集路由到 4 类;是任务的输入输出范式被统一成 4 类,所有样本都套入这 4 种模板,降低每个子任务的学习难度

  • 第2个问题是任务竞争、分布偏移的问题

    这种多任务的,基本上都是走MOE混合专家架构,就是全部参数不是参与所有任务,什么任务激活网络中的什么专家子网,然后更新什么参数。

分布偏移是因,任务竞争是果;

就是因为不同需要学习的数据统计规律不一致,所以不能一刀切参数,那么用同一套神经网络参数同时学习这两种规律的时候,就是同时学习这两个分布的时候,网络只能拟合到一个折中分布,就会产生竞争

  • 第3个任务,不同任务表征本征维度不匹配,任然需要动态匹配

    一个粗糙的想法就是,不同的任务使用固定的独立向量长度,比如说任务a就用128维的embedding,任务b用12维等等。


    也可以有另外一种想法,就是语言model embedding输入的维度统一,在内部再采样挑选哪些维度。

粗浅的平替实现,我们可以再单独训练1个小模型,用来预测每个任务单独路由需要激活哪些维度,

MoGE = Mixture-of-GAL-Experts

GAL,Gradient Adaptive LoRA

总结:

Omni-Mol 是化学领域多任务通用大模型,用MoGE+多任务指令微调,依托LLM+GNN,把反应、性质、分子生成、文本描述等16个化学任务放到同一个模型里完成,是分子大模型往通用化学智能方向的尝试。

相关推荐
智能RPA4 分钟前
智能体自动化平台与主数据管理平台(MDM)对比评测
人工智能·自动化·agent·rpa
跨境小彭37 分钟前
Temu拉美站点铺货实操复盘:手动复制痛点与批量自动化解决方案
服务器·人工智能·搜索引擎·自动化·temu电商运营
封印师请假去地球钓鱼42 分钟前
边解边变的问题:从“决策依赖“一词出发
人工智能·算法
AI搅拌机1 小时前
ComfyUI管理大师:安全稳定升级+切换指定版本!
人工智能
浅安的邂逅1 小时前
20929-OpenAI 一天踩三脚急刹:暂停前沿训练、叫停 Astra、披露越权访问澳政府网站
人工智能·大模型·ai编程·行业动态·ai日报
Qyr991 小时前
2026-2032直接芯片液冷板市场爆发式增长:AI算力浪潮下的热管理核心赛道
大数据·人工智能
微学AI1 小时前
不让每一步都调用最贵模型:用蓝耘智能路由改造自主式研究 Agent
数据库·人工智能·蓝耘
a努力。1 小时前
百毫秒搜索架构:高可用电商系统实战
人工智能
蓝色的风-20261 小时前
国产算力双雄对决:曙光8000十万卡集群 vs 华为昇腾950超节点深度解析
大数据·人工智能·自然语言处理
xcLeigh2 小时前
AI 编程的未来趋势:2025-2026 年你必须关注的六大技术方向
人工智能·ai·ai编程