moe

thesky1234562 小时前
大模型·负载均衡·moe·deepseek·混合专家·专家并行·稀疏激活
27届大模型面试准备(二十一):MoE 架构全攻略——稀疏激活、路由、负载均衡与专家并行上一篇《评测体系全攻略》收尾时说过,A 系列前二十篇走完了"架构—训练—对齐—推理—量化—评测"的完整链路,接下来转向更前沿的主题。这一篇是第二十一篇,讲混合专家(Mixture of Experts,MoE)。为什么先讲它?因为 2024 年之后所有你叫得出名字的开源旗舰模型——Mixtral、DeepSeek-V2/V3、Qwen2-MoE、Llama 4、Kimi K2——全部是 MoE 架构。面试里问"你了解 MoE 吗",大部分人能答出"稀疏激活、只激活部分专家",然后就没了。而真正的区分度在后
人间凡尔赛6 天前
ai·大模型·注意力机制·moe·kimi
Kimi K3 技术拆解:2.8 万亿参数开源模型背后的 KDA 线性注意力与 Stable LatentMoE全球首个 3 万亿级开源模型,896 个专家只激活 16 个,KV Cache 砍掉 75%——月之暗面如何用架构创新把「算力」变成「智能」?
带娃的IT创业者8 天前
人工智能·开源·大语言模型·多模态·moe·开源模型·inkling
Inkling:当开源模型开始思考“如何思考”👋 大家好,我是 带娃的IT创业者,CSDN 人工智能领域新星创作者,一边带娃一边创业的全栈工程师。专注 AI 大模型应用落地、Python 实战进阶与 AI 开发工具链(Python / FastAPI / 大模型 / AI 编程)。
Briwisdom11 天前
gemm·vllm·moe·decode·prefill
MoE 推理优化实战——从“瓶颈罗列“到“性能调优“副标题: #20 篇拆解了 MoE 部署的五大瓶颈,这篇给出对应的解法——Expert Parallelism 怎么配、Grouped GEMM 为什么比 for-loop 快 10 倍、路由怎么调丝滑、推测解码如何掩盖 MoE decode 的劣势。从理论到实践的完整拼图。
猫先生Mr.Mao23 天前
大语言模型·论文解读·moe·模型推理·开源权重
从“更大”到“更会做事”:Kimi K3 的开放前沿智能路线【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
Token炼金师1 个月前
人工智能·encoder-decoder·moe·decoder-only
架构的岔路:Decoder 一统江湖,MoE 另辟蹊径 —— 主流架构变体的工程权衡大模型架构从 Encoder-Decoder、Decoder-Only 到 MoE 的演进,是训练推理一致性、参数效率、稀疏激活三条线的工程权衡。本文从 Dec-Only 胜出原因、MoE 路由与负载均衡、Enc-Dec 的适用边界、混合架构四个切口,给出源码级实现与企业级选型决策框架。
bryant_meng2 个月前
yolo·moe·yolo-master
【YOLO-Master】When YOLO-Master Sees GhostsYOLO 中引入 MoE(Mixture of Experts)后(eg:yolo-master),漏检下降但误检(FP)升高是非常常见的问题。因为 MoE 本质上增加了模型容量和表达能力,如果路由器(Gate)没有学好,很容易产生「过拟合局部模式」和「专家幻觉」。
一条大祥脚2 个月前
pytorch·moe
Tilelang-Metax|MoE|torch baseline这个比赛的github仓库,race_tests目录下有三个算子,拉取源码操作如下,记得切换分支这里来看看moe算子的实现思路
Robot_Nav2 个月前
moe·cts·本体感知·四足机器人高鲁棒控制
仅依赖本体感知的高鲁棒性运动控制——go2_rl_gym项目分析项目地址:https://github.com/Robot-Nav/vbot_rl_gym 论文参考:https://arxiv.org/html/2602.00678v4;https://arxiv.org/html/2405.10830v2
是Yu欸2 个月前
大模型·llm·prompt·webui·moe·sensenova u1·商汤科技
从 Prompt 到 WebUI:基于 SenseNova U1 封装一个图文技术博客生成工具版权声明:本文为原创,遵循 CC 4.0 BY-SA 协议。转载请注明出处。这次实践的核心产品对象是商汤日日新 SenseNova U1。我的工作不是训练模型,也不是开发 SenseNova U1 本身,而是基于它的图文生成能力,封装一个面向技术博客创作场景的本地 WebUI/API 工具。这个工具的目标很明确:用户输入文章主题、技术材料和信息图风格后,系统自动生成博客大纲、信息图 Prompt 和 Markdown 技术博客,并可选择继续调用图像生成接口。
计算机魔术师3 个月前
人工智能·后端·面试·架构·moe·vol.3.3·vol.3.4
【AI面试八股文 Vol.3.4:训练微调部署选型】从预训练到量化部署:LLM 工程落地如何做模型选择摘要:用一条工程主线讲清 LLM 从预训练、SFT、RLHF/DPO/KTO 对齐,到 LoRA/Adapter/P-tuning/IA3 微调、INT8/INT4/GPTQ/AWQ 量化部署和 Llama/Qwen/DeepSeek 等模型选型的取舍逻辑,重点回答面试里最容易被追问的成本、显存、效果和项目落点。
这是谁的博客?3 个月前
ai·架构·大模型·moe·开源模型·deepseek·国产ai
[模型解析] DeepSeek: 技术创新与架构解析DeepSeek 作为国产大模型的代表,在开源领域取得了显著突破。本文将深入分析 DeepSeek 的技术创新与架构设计。
Luca_kill3 个月前
大模型·moe·deepseek·ai架构·v4·混合注意力·流形约束
深度拆解 DeepSeek V4:混合注意力 + 流形约束超连接如何重塑万亿 MoE 架构2026 年 4 月 24 日,DeepSeek V4 预览版正式发布,同步开源了 V4-Pro(总参数 1.6 万亿,激活 490 亿)和 V4-Flash(总参数 2840 亿,激活 130 亿)两个版本。这组数据本身已经足够震撼,但更让技术圈沸腾的是它交出的成绩单:
薛定谔的猫3693 个月前
深度学习·ai·llm·machine learning·moe·deepseek
DeepSeek-V3 模型架构与训练技术深度解析随着大规模语言模型(LLM)技术的飞速发展,DeepSeek-V3 作为国产大模型领域的领军者,凭借其卓越的性能和极高的训练效率引起了广泛关注。本文旨在深入剖析 DeepSeek-V3 的底层架构设计,重点解析其如何通过优化混合专家模型(MoE)和创新性的训练策略,实现性能与成本的平衡。
litble4 个月前
人工智能·大模型·llm·moe·kv-cache·pre-ln
如何速成LLM以伪装成一个AI研究者(2)——Pre-LN,KV-Cache优化,MoE如何速成LLM以伪装成一个AI研究者(1)——循环,卷积,编解码器,注意力,Transformer免责声明:作者也是伪装的,有错漏属于正常现象,欢迎评论指正。
阿杰学AI4 个月前
人工智能·ai·语言模型·智能路由器·aigc·moe·混合专家架构
AI核心知识125—大语言模型之 混合专家架构(简洁且通俗易懂版)MoE (Mixture of Experts, 混合专家架构) 是大模型突破“物理极限”、实现千亿甚至万亿参数的终极扩容魔法。
Flying pigs~~4 个月前
gpt·chatgpt·llm·llama·moe·deepseek·混合专家模式
主流大模型介绍(GPT、Llama、ChatGLM、Qwen、deepseek)发布者:OpenAI(2022年11月30日)类型:聊天机器人模型,基于自然语言处理技术核心能力:理解语言、生成对话、撰写邮件/文案/代码、翻译等
三点水-here6 个月前
分布式·rdma·nccl·moe·流水线并行·张量并行·专家并行
04 - 分布式大模型推理实战:TP/PP/EP并行策略深度解析本文是《大模型推理框架深度解析》系列的第四篇,详解张量并行、流水线并行与专家并行的原理与配置。当你的模型从7B扩展到70B、405B,单卡显存已经无法满足需求时,分布式推理成为必然选择。但面对TP、PP、EP等各种并行策略,很多开发者感到困惑:
AI资源库6 个月前
langchain·cot·ai agent·moe·lmdeploy·intern-s1-pro·open source llm
Intern-S1-Pro模型深入解析我们将文件分为三大类,并解释它们如何像齿轮一样咬合。为了让你更直观地理解,我们将 Intern-S1-Pro 比作一个拥有超级大脑的科研团队。
马武寨山的猴子6 个月前
架构·transformer·moe·ktransformers·sglang
【KTransformers+SGLang】:异构推理架构融合与性能实测全解析期望使用KTransformers的将部分模型加载到内存和cpu上,达到在GPU资源比较匮乏的情况下运行一些超过显存的模型,并且达到一定的token数,可以多人同时使用