技术栈

token 压缩

deepseek23
19 天前
多模态大模型·推理优化·token 压缩
紫东太初 GMC 核心集剪枝拆解:少 80% Token 还满血,多模态视觉 Token 冗余有了新解法多模态大模型这几年越跑越快,但有一笔账始终绕不开:图像进入模型的那一刻,就被拆成了成百上千个视觉 Token。一张高分辨率图片经过视觉编码器,往往要吐出上千个离散表示,这些表示要和文字一起进入解码器参与每一层注意力计算。Token 越多,前向计算越重,显存占用越高,推理时延越长。视觉 Token 的冗余,已经成为多模态模型规模化落地最扎眼的瓶颈之一。
一直会游泳的小猫
3 个月前
ai上下文压缩引擎·可逆压缩协议·token 压缩·零损失准确度
Headroom-AI-Agent-上下文压缩引擎深度解析一个让 Claude、Cursor、Copilot 等 AI 编程助手 token 消耗骤降 60-95% 的开源神器,同时保持答案准确度零损失
我是有底线的