技术栈

moe架构

deepseek23
9 天前
agent·kv缓存·deepseek·稀疏注意力·moe架构·v4.1-flash
DeepSeek-V4.1-Flash 拆解:8B/16B 非对称激活,KV 缓存压到 890 字节/Token 才是 1M Agent 经济账DeepSeek-V4.1-Flash 预填激活 8B,解码激活 16B。预填的 8B 比上一代 V4-Flash 的 13B 更低。
金融先生-Frank
4 个月前
大语言模型·ai部署·moe架构
Gemma-4-26B-A4B-it-GGUF镜像免配置:预置备份恢复脚本与模型版本灰度发布机制Gemma-4-26B-A4B-it-GGUF 是 Google Gemma 4 系列中高性能、高效能的 MoE(混合专家)聊天模型,具备256K tokens的超长上下文处理能力,原生支持文本+图像多模态理解。该模型在开源模型全球排名第6(Arena Elo 1441),采用Apache 2.0协议可免费商用。
我是有底线的