【MLLM】科学领域Innovator-VL多模态模型

note

  • Innovator-VL架构上,视觉编码器RICE-ViT【区域感知表示学习的ViT变体,融合全局和局部视觉线索,优化目标与OCR区域表示,适配科学图像的符号、标注、空间局部模式等细粒度结构,相比CLIP/SigLIP,在分割、密集检测等视觉任务表现更优】+投影层PatchMerger压缩视觉token+语言模型Qwen3-8B-Base【在STEM、逻辑推理、长上下文理解上表现优异】

文章目录

一、Innovator-VL模型

【科学领域多模态大模型进展】之前讲过interns1多模态模型,这个系列继续看一个新的模型Innovator-VL: A Multimodal Large Language Model for Scientific Discovery,https://arxiv.org/pdf/2601.19325,Homepage: https://InnovatorLM.github.io/Innovator-VL,Github: https://InnovatorLM/Innovator-VL,Instruct Model: https://nnovatorLab/Innovator-VL-8B-Instruct,Thinking Model: https://InnovatorLab/Innovator-VL-8B-Thinking,instruct Data: https://InnovatorLab/Innovator-VL-Instruct-46M,RL Data: https://InnovatorLab/Innovator-VL-RL-172K,核心看几点:

1)架构上,视觉编码器RICE-ViT【区域感知表示学习的ViT变体,融合全局和局部视觉线索,优化目标与OCR区域表示,适配科学图像的符号、标注、空间局部模式等细粒度结构,相比CLIP/SigLIP,在分割、密集检测等视觉任务表现更优】+投影层PatchMerger压缩视觉token+语言模型Qwen3-8B-Base【在STEM、逻辑推理、长上下文理解上表现优异】。

2)训练流程上采用预训练→有监督微调(SFT)→强化学习(RL)的分阶段训练策略:

  • step1.预训练语言-图像对齐(LLaVA-1.5,558k样本)+高质量中期训练(85M样本),全参数训练
  • step2.有监督微调(SFT)46M样本,含通用多模态/思维链推理/科学理解数据,人工参与数据构建,做冷启动
  • step3.强化学习(RL)172K数据集,采用偏差驱动选择,筛选Pass@N与Pass@1差距大的样本,保留中等难度实例。使用GSPO优化算法,分层奖励系统(格式+准确率);

3)训练数据上,少样本(<500万科学样本)、高质量、人工参与、领域覆盖广,STEM&Code占比最高(RL阶段56.4%),含化学/物理/生物/数学等科学领域,方式为合成生成+真实来源,领域专家审核,迭代优化与质量控制。

Reference

1 https://arxiv.org/pdf/2601.19325

相关推荐
熊猫钓鱼>_>3 小时前
MetaAI深度研究研究报告
ai·meta·大模型·llm·agent·web·metaai
老A的AI实验室4 小时前
赛博月刊 #2026年9月
大数据·人工智能·深度学习·ai·llm
用户3134672143544 小时前
Agent相关-文档加载器 Document Loader
langchain·llm
EW Frontier6 小时前
【多模态 ISAC】USRP + 28 GHz 相控阵 + RealSense:这套毫米波通感一体原型把 UE 定位做到了 0.30 米【文末附代码链接】
多模态·usrp·realsense·相控阵·isac(通感一体化)
海天一色y7 小时前
AI 大模型算法岗面试题库
llm·rmsnorm·flash-attention·decoder-only
吃饱了得干活1 天前
Agent 的核心组件:大脑、记忆、手脚与心跳
llm·agent
孟健1 天前
Gemini 4 Argon 对比 GPT-6 Astra:百万 Token 输出很诱人,但我劝你先别迁编程工作流
人工智能·llm·ai编程
柒和远方1 天前
LangSmith RAG 量化评估:从"感觉还行"到"数据说话"
langchain·llm·测试
银河技术1 天前
TB级文本去重实战:从单机 OOM 到 Spark / Ray 分布式架构的工程演进
分布式·微服务·重构·架构·spark·llm·rag
流浪0011 天前
大模型技术全景(十三):记忆管理 Memory
llm·memory·记忆