技术栈
moe
一条大祥脚
2 天前
moe
·
deepseek
·
cs336
·
专家路由
【CS336】lecture4 MoE|专家路由|专家数量
啥是MoE?就是原本模型有一个大线性层(FFN),不管来什么token都走一遍,这也是推理时主要的计算开销。现在改成多个小FFN层,对于每个token,选一些最相关的FFN做前向传播,因为不是所有token都需要整个FFN的知识。
智码看视界
3 天前
agent
·
vllm
·
moe
·
全模态
·
小米大模型
·
mimo-v2.6
开源大模型每日追踪:小米 MiMo-V2.6-Pro,登顶开放权重第一(超过 GLM-5.3 、Kimi K3)
项目信息发布方小米大模型团队(Xiaomi MiMo Team)发布时间2026-09-21 HuggingFace 上权重;09-22 正式公告
I Am a robert girl
4 天前
注意力机制
·
模型优化
·
moe
·
大模型架构
·
混合专家
·
循环transformer
·
foil
如何循环 MoE:压平专家,解开注意力
从今天觉醒,技术赋予每一个人数字生命过去两年,大模型架构的演进基本沿着两条独立路线展开。一条是循环 Transformer(Looped Transformer):把同一组层反复用几遍,用额外算力把固定尺寸的模型"榨"得更充分,让参数被复用得更彻底。另一条是稀疏混合专家(MoE):每个 token 只激活众多专家中的少数几个,从而在总参数量膨胀的同时控制单 token 计算量。
deepseek23
4 天前
开源
·
大模型
·
moe
·
aiagent
·
ai架构
Kolibri 拆解:计算像 3.5B、显存要 78GB 的德国主权模型,把合规做进六个架构决策
2026 年 10 月 3 日,德国公司 Aleph Alpha 发布了开放权重模型 Kolibri。
智码看视界
7 天前
昇腾
·
moe
·
开源大模型
·
智能体agent
·
本地推理
·
xing4.0-29b-a4b
·
单卡部署
开源大模型追踪:中电信人工智能Xing4.0-29B-A4B:SWE-bench 75.0逼近Qwen3.6-35B
一句话定位:面向 Agent 的轻量 MoE,单张消费级显卡就能私有化跑长上下文智能体。这里要先说清一个容易混淆的点:总参 29B 听着比 7B 大,但本地跑得快不快,看的是"每 token 激活"而不是"总参"。Xing4.0 每 token 只点亮 4B 专家,推理算力开销接近一个 4B 稠密模型,显存却要装下全部 29B 权重——所以量化后单卡能跑,但原始 BF16 必须多卡。换句话说,它的"聪明"来自大权重库,"便宜"来自稀疏激活,两者分开看才不会误判部署门槛。
liferecords
7 天前
人工智能
·
开源
·
大模型
·
moe
专家池 8→128 只慢 5%:Ai2 开源万亿参数 MoE 训练框架 Olmo-core 3
💡 一句话总结:非营利机构 Ai2 于 10 月 1 日开源 Olmo-core 3——一套重写过的 MoE(混合专家)训练系统:8 张 B300 上吞吐约 2.7 倍于旧实现、512 卡验证 1.2 万亿参数模型、MXFP8 低精度再提速 21%。它不是新模型,而是下一代 Olmo 的训练基座,也是目前 Megatron-Core 之外少有的开放替代。
小马926
8 天前
大模型
·
moe
·
kv cache
·
deepseek
·
推理优化
·
ai基础设施
KV Cache 瘦身 437 倍:DeepSeek V4.1-Flash 的推理效率革命
2026 年 9 月,大模型行业迎来史上最密集的发布季:OpenAI、Anthropic、Google、xAI 接连甩出旗舰模型。但比"谁又刷了榜"更值得关注的是评价标准的换轨——从裸跑分转向"单位成本下的交付能力"。在这一轮竞赛中,DeepSeek 用一款 V4.1-Flash 给出了自己的答案:不堆参数、不打嘴仗,而是在推理效率和显存占用上做了一次教科书级的手术。
super大力张
11 天前
cadd
·
moe
·
药物设计
·
肽设计
# MOE 肽类药物设计(十二):柔性肽怎么 Dock?从 Conformational Search 到 General Dock
上一篇介绍了肽对接的两条路线:Protein–Protein Docking 和 Protein–Ligand Docking。
super大力张
20 天前
cadd
·
moe
# MOE 肽类药物设计(八):让自定义非天然氨基酸真正可用——Rotamer Library 怎么建立?
上一章完成以后,我们已经有了一个:nnaa_library.mdb其中保存了 CYC4、AZE2 等自定义非天然氨基酸。
super大力张
22 天前
cadd
·
moe
·
药物设计
MOE 肽类药物设计(七):天然氨基酸不够用?在 MOE 中创建自己的非天然氨基酸
上一篇中,我们已经使用 Molecule Builder 对肽上的单个原子进行修改。如果进一步思考,就会发现一个很自然的问题:
super大力张
1 个月前
cadd
·
moe
·
药物设计
MOE 肽类药物设计(四):结合位点还有没有优化空间?用 Surface 和 Protein Patches 看懂蛋白口袋
上一节中,我们已经发现 p53 的 Phe19、Leu22、Trp23 和 Leu26 与 Mdmx 存在较多接触。
SLD_Allen
1 个月前
架构
·
moe
MoE架构原理与算力基础设施重估
"更多参数、更低算力开销"这对看似矛盾的需求,被 Mixture-of-Experts(MoE)做到了。但稀疏激活这份"免费午餐"并不白给——它把压力从计算侧转移到了显存驻留与通信侧。本文讲清 MoE 的路由与负载均衡原理,再用 Mixtral、Grok、DeepSeek-V3 三个真实案例,说明为什么一个 MoE 集群真正烧钱的地方,往往不是 FLOPs,而是 HBM 容量和跨节点 all-to-all 带宽。
super大力张
1 个月前
数据库
·
算法
·
cadd
·
moe
·
svl
·
基于结构的药物设计
MOE基于结构的药物设计(七):Ligand R-Vectors——如何判断配体可以从哪里继续生长?
前两篇中,我们已经从两个角度分析了 EGFR–Tarceva(1M17)的结合口袋:Interaction Surface:哪里还有空间?
deepseek23
1 个月前
大模型
·
ai agent
·
moe
Kimi K3 开放日拆解:2.8T MoE 的 896 专家稀疏路由、KDA 混合注意力与 Infra 三件套
开放日当天,月之暗面把 Kimi K3 的模型权重、技术报告和三个基础设施仓库同时放了出来。我第一时间把权重拉下来,顺手把报告和仓库也一起克隆了,现场拆解会人坐得挺满,周围几位开发者没太关注台上讲了什么,都在低头翻刚公开的模型卡和配置文件。官方公布时间是 2026 年 7 月 27 日,选择这个日子相当于把整个训练家底一次性摊开。
晨欣
1 个月前
qwen
·
moe
·
gqa
·
kv cache
·
deepseek
·
mla
·
llm架构
LLM Architecture Gallery 是什么:新开源模型出来后,先对照架构再决定要不要部署
新开源模型一出来,开发者最容易先去看跑分、看参数量、看别人说好不好用。但真正决定你能不能部署、长上下文贵不贵、MoE 是否划算的,往往是结构本身。Sebastian Raschka 做的 LLM Architecture Gallery 把 100 多个现代 LLM 的结构图、注意力机制、decoder 类型、每 token KV cache 和 config.json 链接放到同一页,适合当作日常对照表,而不是又一个榜单。
山顶夕景
1 个月前
大模型
·
llm
·
agent
·
多模态
·
moe
【LLM】GLM-5.3-Flash模型
MVBench 和 MMVU:我们使用的参数设置为温度=1.0,top_p=0.95,最大上下文长度为 256K 个令牌。对于那些原生支持视频输入的模型,比如 Gemini 3.7 Flash,我们可以直接将原始视频作为输入进行评估。而对于那些不支持视频输入的模型,我们会采用默认的 1 帧每秒的提取策略。如果提取出的帧数超过 API 的最大限制,我们会在整个视频范围内进行均匀采样,直到达到这个最大帧数限制为止。
EDPJ
1 个月前
llm
·
负载均衡
·
大语言模型
·
moe
(2024|DeepSeek & 北大,Loss-Free Balancing,每专家偏置,QB)MoE 的无辅助损失负载均衡策略
论文地址:https://arxiv.org/abs/2408.15664ICLR 2025:https://openreview.net/forum?id=y1iU5czYpE
XLYcmy
2 个月前
google
·
meta
·
llm
·
负载均衡
·
token
·
moe
·
glam
小红书 算法一面 十一
# 基于MoE的模型架构全景解析MoE(混合专家模型)核心思想是**将模型总参数量与单次推理计算量解耦**,通过稀疏激活专家子网络实现高效扩展。以下按时间线与创新维度,系统介绍主流MoE架构的设计特点、核心突破与适用场景。
thesky123456
2 个月前
大模型
·
负载均衡
·
moe
·
deepseek
·
混合专家
·
专家并行
·
稀疏激活
27届大模型面试准备(二十一):MoE 架构全攻略——稀疏激活、路由、负载均衡与专家并行
上一篇《评测体系全攻略》收尾时说过,A 系列前二十篇走完了"架构—训练—对齐—推理—量化—评测"的完整链路,接下来转向更前沿的主题。这一篇是第二十一篇,讲混合专家(Mixture of Experts,MoE)。为什么先讲它?因为 2024 年之后所有你叫得出名字的开源旗舰模型——Mixtral、DeepSeek-V2/V3、Qwen2-MoE、Llama 4、Kimi K2——全部是 MoE 架构。面试里问"你了解 MoE 吗",大部分人能答出"稀疏激活、只激活部分专家",然后就没了。而真正的区分度在后
人间凡尔赛
2 个月前
ai
·
大模型
·
注意力机制
·
moe
·
kimi
Kimi K3 技术拆解:2.8 万亿参数开源模型背后的 KDA 线性注意力与 Stable LatentMoE
全球首个 3 万亿级开源模型,896 个专家只激活 16 个,KV Cache 砍掉 75%——月之暗面如何用架构创新把「算力」变成「智能」?