混合专家架构

在水一缸10 天前
人工智能·深度学习·大模型·工程实践·推理模型·混合专家架构·grok 4.5
深度解析 Grok 4.5:当推理模型遇上大规模工程实践在当前的大模型技术演进路线图中,我们正处在一个微妙的转折点。如果说过去两年是“预训练军备竞赛”的时代,那么当下无疑正在进入“推理与架构优化”的深水区。近期,xAI 发布的 Grok 4.5 在 Hacker News 上引发了技术社区的广泛讨论,这不仅仅是因为其性能指标的跃升,更因为它展示了在十万卡级集群上,模型架构与训练效率的极限平衡。
audyxiao00116 天前
人工智能·cvpr·智慧医疗·混合专家架构·医学影像分割
人工智能顶会CVPR 2026论文分享|SegMoTE:一种可显著提高模型泛化能力的Token级混合专家架构本推文介绍了一篇发表于CVPR 2026的论文《SegMoTE:Token-Level Mixture of Experts for Medical Image Segmentation》。SAM通用分割能力惊艳业界,但落地CT、MRI、皮肤镜、X光等多模态医学影像时存在跨模态泛化差、海量专业标注成本高昂等问题。四川大学、新疆大学、阿里达摩院等团队联合提出SegMoTE,建立Token级混合专家架构,仅新增17M可训练参数,依托仅0.15M高质量掩码数据集,在完整保留SAM(Segment Anythin
阿杰学AI3 个月前
人工智能·ai·语言模型·智能路由器·aigc·moe·混合专家架构
AI核心知识125—大语言模型之 混合专家架构(简洁且通俗易懂版)MoE (Mixture of Experts, 混合专家架构) 是大模型突破“物理极限”、实现千亿甚至万亿参数的终极扩容魔法。
张彦峰ZYF7 个月前
人工智能·计算机视觉·多模态大模型·混合专家架构·大小模型协同架构
多模态大模型、混合专家模型与云端协同架构目录一、多模态大模型(一)什么是多模态大模型(二)多模态大模型的核心技术1. 多模态表征与统一语义空间
我是有底线的