Qwen1/2/2.5/3 VL的图像处理与位置编码方式讲解

Qwen2 VL visual encoder

Qwen2 VL中在patch size的基础上还会通过MLP 做一个2*2的merge,进一步减小viusal token输,并加上start 和 end token。

注意:在Qwen2VL以及Qwen2.5/3VL中,单张图像都是视为2张同样的帧作为输入的,因此在通过image_processor时,一个patch的pixel shape是14*14*3(RGB)* 2(视为相同2帧)= 1176

M-RoPE: MultimodalRotaryPositionEmbedding

Qwen2 VL做2D grounding还是采取的类似Qwen1 VL的特殊token的表示形式:

Qwen1 VL visual encoder

Qwen1 VL的visual encoder 其实是一个Q -former的架构,通过256个可学习的token来表示图像,并且这个版本中还不支持视频输入。只支持输出2D normaliezd 的bbox。范围是归一化到0,1000的图像grid空间。表示方式是文本,并通过<ref> ,和<box>的方式指代物体和对应的box。

相关推荐
星核0penstarry15 小时前
三款Flash模型横向对比:GLM-5.3、DeepSeek-V4、Qwen3.8怎么选?
人工智能·qwen·flash·glm-5.3·deepseek-·横向测评
晨欣19 小时前
LLM Architecture Gallery 是什么:新开源模型出来后,先对照架构再决定要不要部署
qwen·moe·gqa·kv cache·deepseek·mla·llm架构
zhangfeng11336 天前
AMD Instinct MI50(gfx906)上为 Qwen 系列模型优化并可用的 vLLM 相关仓库、Docker 镜像与实践指南。
人工智能·docker·ai编程·qwen·算子开发·vllm·mi50
云卷云舒___________7 天前
Qwen新模型paloma现身Arena、阿里Wan3.0视频模型上线、字节豆包工作开放下载 | 8月25日 AI日报
qwen·阿里·字节跳动·ai日报·豆包工作·paloma·wan30
老大白菜14 天前
Qwen3.8-27B 本地推理 + DeepSeek Harness 配置
python·qwen·deepseek·harness
虎鲸不是鱼16 天前
【RTX Pro 4500】Qwen3.8 27B NVFP4在LM Studio挂载多模态模型
大模型·多模态·qwen·lm studio·千问
小白跃升坊17 天前
阿里云通义千问正式开源 Qwen3.8-27B:性能与成本的黄金平衡点
开源·大模型·通义千问·qwen·qwen3.8-27b
咕噜咕噜啦啦21 天前
vLLM框架
人工智能·qwen·vllm
liferecords1 个月前
Qwen3.8-Max 开源了:该不该从 Claude 切过去?
开源·llm·qwen
神奇霸王龙1 个月前
跨厂商大模型接入实战:5大基座性能对比
人工智能·ai·aigc·dubbo·claude·qwen·ai金融