大模型【进阶】(六)QWen2.5-VL视觉语言模型详细解读

模型的优势

  • 能力提升方面
    • 文档智能 和 视频理解
    • Object grounding 通用性
    • 长视频理解 与 定位
  • 技术细节
    • 原生动态分辨率
    • 动态 FPS 采样训练
    • M-ROPE 对齐绝对位置时间
      • position id (time width height )
    • 更快更高效的视觉编码器

模型结构与训练策略

模型架构:视觉编码器(ViT) + 语言模型

1. 朴素动态分辨率(Naive Dynamic Resolution)

2.多模态旋转位置编码嵌入(M-RoPE)

position id :(temporal,height,width)

texts input id:相同的 position IDs,eg. [(4,4,4)]...

images position id:(temporal,height,width),eg. [(0,0,0)、(0,0,1)]...

videos position id:(temporal,height,width),eg. [(0,0,0)、(0,0,1)]、[(1,0,0)、(1,0,1)]...

3. 统一图像和视频理解(Unified Image and Video Understanding)

训练方案:图像和视频混合数据

视频采样:两帧/second,

卷积:深度为2的3D卷积

一致性:每个图像 视为 两个相同的帧

平衡长视频处理效率:每个视频的token总数限制为16384

训练数据拓展与模型性能验证

QWen2-VL-7B

  • info VQA,比如高密度文字的图片
    • 需要更高的分辨率,以获得更全面的信息,从而达到更准确的表现
  • HallBench,处理自然图片
    • 分辨率合适就可以达到好的效果
  • OCRBench,小截图
    • 更小的分辨率上表现更好
  • MMMU,学科类问题
    • 有最佳分辨率
  • token 达到 80k依然保持优秀的增长

QWen2.5-VL能力应用案例

使用的提示

  • 由于支持动态的分辨率,所以到底应该输入怎么样的分辨率合适
    • min_pixels 和 max_poxels 用于限制最大像素和最大像素
    • 模型 最少能支持 4 token,最大 16384 token (训练有达到32k)
    • 实际使用中可以调到合适的范围,默认是(256~1280)
    • 视频的输入:长视频输入采用短FPS,短视频输入可用更高的FPS
  • 对于定位任务,可能会存在缩放分辨率大小,这里会造成模型输出的坐标定位是reset的关系,和实际会有差别。

附 件

视频:https://www.bilibili.com/video/BV1TMRHYJEaw/?spm_id_from=333.337.search-card.all.click&vd_source=e3c31d7b173e33322428b9ff4dfd84f7

论文:https://arxiv.org/html/2409.12191

相关推荐
铁蛋AI编程实战3 分钟前
通义千问 3.5 Turbo GGUF 量化版本地部署教程:4G 显存即可运行,数据永不泄露
java·人工智能·python
HyperAI超神经7 分钟前
在线教程|DeepSeek-OCR 2公式/表格解析同步改善,以低视觉token成本实现近4%的性能跃迁
开发语言·人工智能·深度学习·神经网络·机器学习·ocr·创业创新
JoySSLLian20 分钟前
手把手教你安装免费SSL证书(附宝塔/Nginx/Apache配置教程)
网络·人工智能·网络协议·tcp/ip·nginx·apache·ssl
BestSongC22 分钟前
行人摔倒检测系统 - 前端文档(1)
前端·人工智能·目标检测
空白诗22 分钟前
CANN ops-nn 算子解读:Stable Diffusion 图像生成中的 Conv2D 卷积实现
深度学习·计算机视觉·stable diffusion
模型时代28 分钟前
Anthropic明确拒绝在Claude中加入广告功能
人工智能·microsoft
夕小瑶32 分钟前
OpenClaw、Moltbook爆火,算力如何48小时内扩到1900张卡
人工智能
一枕眠秋雨>o<34 分钟前
透视算力:cann-tools如何让AI性能调优从玄学走向科学
人工智能
那个村的李富贵1 小时前
昇腾CANN跨行业实战:五大新领域AI落地案例深度解析
人工智能·aigc·cann
集简云-软件连接神器1 小时前
技术实战:集简云语聚AI实现小红书私信接入AI大模型全流程解析
人工智能·小红书·ai客服