【Patch Policy】稠密视觉表示驱动的轻量级机器人策略深度解析机器人策略常把一帧图像压缩成 CLS token 或全局平均池化向量,虽然计算方便,却容易丢失插孔、边缘、接触点等精细空间信息;直接使用 patch token 的视觉语言动作模型又往往背负数十亿参数。论文《Patch Policy: Efficient Embodied Control via Dense Visual Representations》提出一个更轻量的中间方案:冻结预训练 Vision Transformer,保留每帧的 dense patch features,并用 block-cau