技术栈
token 压缩
deepseek23
19 天前
多模态大模型
·
推理优化
·
token 压缩
紫东太初 GMC 核心集剪枝拆解:少 80% Token 还满血,多模态视觉 Token 冗余有了新解法
多模态大模型这几年越跑越快,但有一笔账始终绕不开:图像进入模型的那一刻,就被拆成了成百上千个视觉 Token。一张高分辨率图片经过视觉编码器,往往要吐出上千个离散表示,这些表示要和文字一起进入解码器参与每一层注意力计算。Token 越多,前向计算越重,显存占用越高,推理时延越长。视觉 Token 的冗余,已经成为多模态模型规模化落地最扎眼的瓶颈之一。
一直会游泳的小猫
3 个月前
ai上下文压缩引擎
·
可逆压缩协议
·
token 压缩
·
零损失准确度
Headroom-AI-Agent-上下文压缩引擎深度解析
一个让 Claude、Cursor、Copilot 等 AI 编程助手 token 消耗骤降 60-95% 的开源神器,同时保持答案准确度零损失
我是有底线的