vlm

程序猿编码2 小时前
大模型·llm·rk3588·qwen·推理·vlm
不用 GPU!RK3588 跑视觉大模型,Qwen3.5-2B VLM 端侧落地这是一套面向瑞芯微RK3588 NPU硬件加速的Qwen3.5-2B视觉语言模型推理实现,完全基于原生C++构建,配套专用大模型运行时与神经网络加速引擎,完整支持单图像理解与视频序列分析两种模式。
Robot_Nav2 天前
具身智能·vla·vlm
前沿 | VLA 演进:从动作 Token 到分层具身智能体论文:Zitkovich et al., RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control, CoRL 2023。 论文:Black et al., π₀: A Vision-Language-Action Flow Model for General Robot Control, RSS 2025。 论文:Pertsch et al., FAST: Efficient Action Tokeniza
一直在努力的小宁3 天前
agent·vla·vlm·vln·harness
[特殊字符] 具身智能Agent开发调研|零基础超详细笔记(万字长文)老师发了一份智能体开发调研文件,零基础看完全懵。花了一整天查资料、拆概念、整理成这份笔记。既是科普,也是自己的完整学习记录。全文包含所有细节、数据、例子、设计动机,建议收藏慢慢看。 具身智能Agent开发调研|零基础超详细笔记 - 小红书
山顶夕景12 天前
agent·多模态·vlm·omni·全模态
【Omni】OmniGAIA: Towards Native Omni-Modal AI Agents项目链接:https://github.com/RUC-NLPIR/OmniGAIA当前多模态大模型(MLLM)存在三个明显的断层:
一颗小树x12 天前
具身智能·vlm·端侧·nvfp4
NVFP4 量化 × 具身智能:ModelScope 模型生态调研目的:了解当前行业模型情况,“机器人/具身智能方向有哪些模型可用?其中有没有 NVFP4 量化版?” 适合读者:正在做机器人端侧部署、或关注具身智能模型选型的工程师与研究者。
JoannaJuanCV18 天前
深度学习·学习·机器学习·大模型·视觉大模型·vlm·视觉编码器
VLM学习-SFT(监督微调)SFT = Supervised Fine-Tuning(监督微调)SFT 是在预训练模型基础上,用带标注的数据做进一步训练,让模型学会按人类意图回答问题。
JoannaJuanCV23 天前
大模型·vlm·视觉编码器
VLM学习-DINOv2三大损失DINO / iBOT / KoLeo 解析源码 code github 三个损失是 DINOv2 自监督训练的核心,分工是:DINO 损失管全局语义、iBOT 损失管局部细节、KoLeo 损失管特征空间不坍塌。逐个结合源码解析。
还不秃顶的计科生1 个月前
人工智能·深度学习·算法·机器学习·语言模型·vla·vlm
具身智能论文学习10:π0: A Vision-Language-Action Flow Model for General Robot Control如何在保留预训练 VLM 强大视觉语言知识的同时,直接生成高频、连续、精细的机器人 Action Chunk,从而实现通用且灵巧的机器人控制?
还不秃顶的计科生1 个月前
人工智能·深度学习·学习·机器学习·语言模型·vla·vlm
具身智能论文学习8:Octo: An Open-Source Generalist Robot PolicyOpen X-Embodiment→多机器人、大规模数据Diffusion Policy→连续动作序列与扩散动作生成
怦怦蓝1 个月前
人工智能·语言模型·自然语言处理·vlm
给AI装上“眼睛”:一文讲透视觉语言模型(VLM)这些能力的背后,是一种正在改变AI交互方式的技术——视觉语言模型(Vision-Language Model,简称VLM)。
山顶夕景1 个月前
音视频·video·vlm·多模态理解
【全模态】音视频理解模型Audio-Visual FlamingoAudio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos arXiv:https://arxiv.org/abs/2607.16107 机构:NVIDIA + 马里兰大学 | 参数规模:7B,开源
liferecords2 个月前
人工智能·算法·ocr·idp·vlm
HPD-Parsing: Hierarchical Parallel Document Parsing这篇论文提出一种新解码范式——分层并行解码(Hierarchical Parallel Decoding, HPD),解决 unified VLM 文档解析器"整页单条自回归生成"造成的序列瓶颈。做法是:主版面分支(layout branch)串行协调全局结构与阅读序,遇到路由 token <FORK> 时 fork 出并发的内容分支(content branch)解码各区域,分支内再叠加 P-MTP 推测解码。核心结论是 1B 模型达到 4,752 TPS,是最快现有文档解析模型的 2.62×、vani
-cywen-2 个月前
vlm
QWen-VLLLM展现出很强的文本理解和生成能力,通过Instruction Tuning能够很好地与用户交互,逐渐成为智能助手的重要基础。
山顶夕景2 个月前
rl·vqa·vlm·grpo·视频质量评估
【AAAI 2026】VQAThinker:通过RL进行可解释VQA训练论文:VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning 2026.2 https://github.com/clh124/VQAThinker 开源模型:https://huggingface.co/kkkkkklinhan/InternVL3-VQAThinker-8B
山顶夕景2 个月前
vlm·rope·视频理解·多模态理解·长视频·token压缩
【VLM】视频理解LLaVA-OneVision-2(Codec-stream)链接:https://github.com/EvolvingLMMs-Lab/LLaVA-OneVision-2
_张一凡3 个月前
llm·aigc·vlm·aigc前沿资讯·前沿资讯
【AIGC行业前沿】2026年6月AIGC行业前沿模型发布动态(6月8日-6月14日)目录:1、剪映首发 Seedance 2.0 系列新模型剪映通过官方小红书账号官宣,将于15日首发上线Seedance 2.0新模型。官方表示该模型相较前代生成速度更快、使用成本更低,首发期间将同步推出折扣优惠,目前官方正通过社交平台发起互动,邀请用户猜测具体折扣力度。 参考链接:https://www.xiaohongshu.com/user/profile/5cc0829f000000001100e8e0
mex_wayne3 个月前
vlm
VLM (1): VLM 一般知识点总结 + VLM重点梳理我们可以看到有如下关系 LLM: text tokens → text tokens VLM: image tokens + text tokens → text tokens VLA: image tokens + text tokens + robot state/history → action tokens / continuous actions 笔者 在 看 很多vla 的 论文时, 看到 VLM 是 很多 机器人和自驾的核心. 所以 接下来会深入vlm 进行学习
超人也会哭️呀3 个月前
人工智能·ai·llm·ocr·vlm·视觉模型·dots.ocr
视觉模型中的坐标漂移之前提过,我们搞了个企业级知识库系统,结果文档解析时总出幺蛾子——时不时就报错"解析失败"。我这人对 Bug 的容忍度基本为零,决定死磕到底。
_张一凡3 个月前
llm·aigc·vlm·前沿资讯
【AIGC行业前沿】2026年5月AIGC行业前沿模型发布动态(5月25-5月31)1、SpaceXAI 完成 Grok V9-Medium 模型训练并公布开源规划 2、OpenBMB 推出开源小模型 MiniCPM5-1B,登顶2B以下模型榜单 3、快手Kwai-Keye开源Keye-VL-2.0-30B-A3B超长视频理解多模态模型 4、PrismML 发布轻量化图像生成模型Bonsai Image 4B,适配本地终端设备 5、微软推出MAI-Image-2.5文生图模型,登顶行业榜单前三 6、OpenMOSS 发布语音与音效双模型,升级多语种合成与高保真音效生成能力 7、NVIDI
feasibility.4 个月前
人工智能·机器人·ros·仿真·具身智能·vla·vlm
ROS2+Gazebo+VLM服务:纯仿真环境下的具身智能闭环系统| 大脑-小脑分离控制上一篇创建环境和代码框架基础可以见《ROS2+Gazebo+VLA占位服务:纯仿真环境下的具身智能闭环实现》(https://blog.csdn.net/weixin_55221858/article/details/156659624),本次把占位服务替换为VLM服务,读者有能力的话也可以自己训练能直接输出动作的VLA模型,实现真正的VLA端到端服务。