vlm

JoannaJuanCV3 天前
大模型·vlm·视觉编码器
VLM学习-DINOv2三大损失DINO / iBOT / KoLeo 解析源码 code github 三个损失是 DINOv2 自监督训练的核心,分工是:DINO 损失管全局语义、iBOT 损失管局部细节、KoLeo 损失管特征空间不坍塌。逐个结合源码解析。
还不秃顶的计科生12 天前
人工智能·深度学习·算法·机器学习·语言模型·vla·vlm
具身智能论文学习10:π0: A Vision-Language-Action Flow Model for General Robot Control如何在保留预训练 VLM 强大视觉语言知识的同时,直接生成高频、连续、精细的机器人 Action Chunk,从而实现通用且灵巧的机器人控制?
还不秃顶的计科生12 天前
人工智能·深度学习·学习·机器学习·语言模型·vla·vlm
具身智能论文学习8:Octo: An Open-Source Generalist Robot PolicyOpen X-Embodiment→多机器人、大规模数据Diffusion Policy→连续动作序列与扩散动作生成
怦怦蓝16 天前
人工智能·语言模型·自然语言处理·vlm
给AI装上“眼睛”:一文讲透视觉语言模型(VLM)这些能力的背后,是一种正在改变AI交互方式的技术——视觉语言模型(Vision-Language Model,简称VLM)。
山顶夕景20 天前
音视频·video·vlm·多模态理解
【全模态】音视频理解模型Audio-Visual FlamingoAudio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos arXiv:https://arxiv.org/abs/2607.16107 机构:NVIDIA + 马里兰大学 | 参数规模:7B,开源
liferecords1 个月前
人工智能·算法·ocr·idp·vlm
HPD-Parsing: Hierarchical Parallel Document Parsing这篇论文提出一种新解码范式——分层并行解码(Hierarchical Parallel Decoding, HPD),解决 unified VLM 文档解析器"整页单条自回归生成"造成的序列瓶颈。做法是:主版面分支(layout branch)串行协调全局结构与阅读序,遇到路由 token <FORK> 时 fork 出并发的内容分支(content branch)解码各区域,分支内再叠加 P-MTP 推测解码。核心结论是 1B 模型达到 4,752 TPS,是最快现有文档解析模型的 2.62×、vani
-cywen-1 个月前
vlm
QWen-VLLLM展现出很强的文本理解和生成能力,通过Instruction Tuning能够很好地与用户交互,逐渐成为智能助手的重要基础。
山顶夕景2 个月前
rl·vqa·vlm·grpo·视频质量评估
【AAAI 2026】VQAThinker:通过RL进行可解释VQA训练论文:VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning 2026.2 https://github.com/clh124/VQAThinker 开源模型:https://huggingface.co/kkkkkklinhan/InternVL3-VQAThinker-8B
山顶夕景2 个月前
vlm·rope·视频理解·多模态理解·长视频·token压缩
【VLM】视频理解LLaVA-OneVision-2(Codec-stream)链接:https://github.com/EvolvingLMMs-Lab/LLaVA-OneVision-2
_张一凡2 个月前
llm·aigc·vlm·aigc前沿资讯·前沿资讯
【AIGC行业前沿】2026年6月AIGC行业前沿模型发布动态(6月8日-6月14日)目录:1、剪映首发 Seedance 2.0 系列新模型剪映通过官方小红书账号官宣,将于15日首发上线Seedance 2.0新模型。官方表示该模型相较前代生成速度更快、使用成本更低,首发期间将同步推出折扣优惠,目前官方正通过社交平台发起互动,邀请用户猜测具体折扣力度。 参考链接:https://www.xiaohongshu.com/user/profile/5cc0829f000000001100e8e0
mex_wayne3 个月前
vlm
VLM (1): VLM 一般知识点总结 + VLM重点梳理我们可以看到有如下关系 LLM: text tokens → text tokens VLM: image tokens + text tokens → text tokens VLA: image tokens + text tokens + robot state/history → action tokens / continuous actions 笔者 在 看 很多vla 的 论文时, 看到 VLM 是 很多 机器人和自驾的核心. 所以 接下来会深入vlm 进行学习
超人也会哭️呀3 个月前
人工智能·ai·llm·ocr·vlm·视觉模型·dots.ocr
视觉模型中的坐标漂移之前提过,我们搞了个企业级知识库系统,结果文档解析时总出幺蛾子——时不时就报错"解析失败"。我这人对 Bug 的容忍度基本为零,决定死磕到底。
_张一凡3 个月前
llm·aigc·vlm·前沿资讯
【AIGC行业前沿】2026年5月AIGC行业前沿模型发布动态(5月25-5月31)1、SpaceXAI 完成 Grok V9-Medium 模型训练并公布开源规划 2、OpenBMB 推出开源小模型 MiniCPM5-1B,登顶2B以下模型榜单 3、快手Kwai-Keye开源Keye-VL-2.0-30B-A3B超长视频理解多模态模型 4、PrismML 发布轻量化图像生成模型Bonsai Image 4B,适配本地终端设备 5、微软推出MAI-Image-2.5文生图模型,登顶行业榜单前三 6、OpenMOSS 发布语音与音效双模型,升级多语种合成与高保真音效生成能力 7、NVIDI
feasibility.3 个月前
人工智能·机器人·ros·仿真·具身智能·vla·vlm
ROS2+Gazebo+VLM服务:纯仿真环境下的具身智能闭环系统| 大脑-小脑分离控制上一篇创建环境和代码框架基础可以见《ROS2+Gazebo+VLA占位服务:纯仿真环境下的具身智能闭环实现》(https://blog.csdn.net/weixin_55221858/article/details/156659624),本次把占位服务替换为VLM服务,读者有能力的话也可以自己训练能直接输出动作的VLA模型,实现真正的VLA端到端服务。
feasibility.3 个月前
人工智能·深度学习·计算机视觉·llm·图像分割·多模态·vlm
Qwen3-VL-Seg 深度解读:当多模态大模型学会“像素级精准手术“论文: Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
feasibility.4 个月前
人工智能·llm·多模态·量化·llama.cpp·vlm·llama-factory
多模态模型Qwen-3.5在Llama-Factory使用+llama.cpp量化导出+部署流程(含报错处理)可以去huggingface或hf-mirror镜像站等下载Qwen3.5的模型,比如https://huggingface.co/Qwen/Qwen3.5-0.8B/tree/main 或https://hf-mirror.com/Qwen/Qwen3.5-0.8B/tree/main下载模型相关文件,保存到合适路径,比如/Users/Zhuanz/Desktop/work/Qwen3.5/model
山顶夕景4 个月前
python·大模型·llm·agent·多模态·vlm
【VLM】结合Python沙箱的以图思辨S1-VL模型【多模态推理大模型进展】基于Qwen3-VL-32B-Thinking做的面向数学、物理、化学、天文、地理、生物六大学科的科学多模态推理模型,主要特点是Python 沙箱执行图像裁剪、缩放、标注等代码,多轮迭代推理。S1-VL: Scientific Multimodal Reasoning Model with Thinking-with-Images,https://arxiv.org/pdf/2604.21409,https://huggingface.co/ScienceOne-AI,https:
一颗小树x5 个月前
机器人·开源数据集·人形机器人·vlm
《VLA 系列》Humanoid Everyday | 人形机器人 | 开源数据集Humanoid Everyday 是首个面向开放世界的人形机器人,大规模多模态数据集,涵盖260个真实场景任务、超1万条演示轨迹与300万帧30Hz高频数据,覆盖基础操作、移动操作、人机交互等七大技能类别,
bryant_meng5 个月前
人工智能·深度学习·rl·vla·世界模型·vlm
【VLA】Vision Language Action世界模型 是智能体(Agent)内部对环境动态(dynamics)的可学习、可推理的内部表征或模拟器。它能预测“如果我执行某个动作,环境会如何变化”。
一颗小树x5 个月前
格式转换·vlm·lora微调·空间理解·siti 数据集
空间理解 SITI 数据集 | 格式转换 | Lora微调 | VLM 大模型本文分析使用空间理解 SITI 数据集,进行VLM的Lora微调微调,包括 数据格式转换、多图像VQA微调、视频VQA微调。