技术栈
moe架构
deepseek23
9 天前
agent
·
kv缓存
·
deepseek
·
稀疏注意力
·
moe架构
·
v4.1-flash
DeepSeek-V4.1-Flash 拆解:8B/16B 非对称激活,KV 缓存压到 890 字节/Token 才是 1M Agent 经济账
DeepSeek-V4.1-Flash 预填激活 8B,解码激活 16B。预填的 8B 比上一代 V4-Flash 的 13B 更低。
金融先生-Frank
4 个月前
大语言模型
·
ai部署
·
moe架构
Gemma-4-26B-A4B-it-GGUF镜像免配置:预置备份恢复脚本与模型版本灰度发布机制
Gemma-4-26B-A4B-it-GGUF 是 Google Gemma 4 系列中高性能、高效能的 MoE(混合专家)聊天模型,具备256K tokens的超长上下文处理能力,原生支持文本+图像多模态理解。该模型在开源模型全球排名第6(Arena Elo 1441),采用Apache 2.0协议可免费商用。
我是有底线的