vlm

山顶夕景10 小时前
多模态·kv·vlm·infra
【VLM】DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache CompressionDeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression 技术报告:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf Hugging Face
山顶夕景2 天前
机器人·多模态·扩散模型·具身智能·vla·dit·vlm
【VLA】Qwen-VLA:VLM+DiT统一多模态理解与连续机器人动作生成Qwen-VLA 的做法,不是声称"把所有机器人统一成一种动作",而是用 Qwen3.5-4B 视觉—语言骨干 + 约 1.15B 参数的 DiT 流匹配动作专家 + 一套 H×K 张量/前缀掩码/具身提示的接口,把操作、导航、人本动作、轨迹预测接进同一个条件生成框架。
一直在努力的小宁8 天前
人工智能·深度学习·机器学习·agent·具身智能·vlm·vln
【阅读笔记】具身智能的真机数采,到了分水岭本篇位置:本批第 9 篇,也是今天三篇里信息密度最高的一篇,是主样本。它把第 8 篇提出的问题(缺什么数据、谁会成为主流)用一次行业深度访谈做了解答,而且给了具体的时间线、成本账和人物名单。第 10 篇(知乎技术综述)则是理解本篇所有设备名词的底图。
Robot_Nav8 天前
四足机器人·vlm·locovlm
ICRA 2025|LocoVLM:视觉与语言驱动的通用足式运动策略自适应【文献解读】文献:LocoVLM: Grounding Vision and Language for Adapting Versatile Legged Locomotion Policies 作者:I Made Aswin Nahrendra, Seunghyun Lee, Dongkyu Lee, Hyun Myung 单位:KAIST(Korea Advanced Institute of Science and Technology) 会议版本:ICRA 2025 Workshop on Safe Visi
一直在努力的小宁8 天前
后端·json·restful·具身智能·vla·vlm
【阅读笔记】具身操作的数采方案概览本篇位置:本批第 10 篇。它是今天三篇里唯一的非新闻稿——一篇写于 2024 年 12 月、2025 年 1 月更新的技术综述,作者本人就在这个行业里做数采。前两篇(36 氪的行业评论、钛媒体的深度访谈)讨论的所有设备名词——ALOHA、UMI、Ego、外骨骼、动捕手套——这一篇是它们的技术底图。
一颗小树x18 天前
jetson·vllm·vlm·gpu内存清理
vLLM大模型推理:Jetson AGX Thor 的 GPU 共享内存清理实战适用设备:NVIDIA Jetson AGX Thor(T5000)实测通过,思路同样适用于 AGX Orin 等采用统一内存架构的 Jetson 设备。
山顶夕景20 天前
音视频·vlm·视频理解·agentic·全模态
【VLM】Qwen3.8-Omni-Flash长音视频理解Agentic模型1、向 Qwen3.8-Omni-Flash 提出了一项任务:在 12 小时内提升 Qwen2.5-Omni-3B 的四川话识别能力,并交付可用模型。它自主选定 WenetSpeech-Chuan 评测集、固定评测标准并完成基线测试,随后直接听取语音样本,结合识别结果诊断问题,构建针对性的训练数据。在连续 4 轮实验中,Agent 累计构建了 3,413 条训练数据,并根据评测反馈调整方案、保留有效改进、回退无效尝试。最终,Qwen2.5-Omni-3B 在同一评测集上的字符错误率从 25.79% 降至
程序猿编码20 天前
大模型·llm·rk3588·qwen·推理·vlm
不用 GPU!RK3588 跑视觉大模型,Qwen3.5-2B VLM 端侧落地这是一套面向瑞芯微RK3588 NPU硬件加速的Qwen3.5-2B视觉语言模型推理实现,完全基于原生C++构建,配套专用大模型运行时与神经网络加速引擎,完整支持单图像理解与视频序列分析两种模式。
Robot_Nav23 天前
具身智能·vla·vlm
前沿 | VLA 演进:从动作 Token 到分层具身智能体论文:Zitkovich et al., RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control, CoRL 2023。 论文:Black et al., π₀: A Vision-Language-Action Flow Model for General Robot Control, RSS 2025。 论文:Pertsch et al., FAST: Efficient Action Tokeniza
一直在努力的小宁23 天前
agent·vla·vlm·vln·harness
[特殊字符] 具身智能Agent开发调研|零基础超详细笔记(万字长文)老师发了一份智能体开发调研文件,零基础看完全懵。花了一整天查资料、拆概念、整理成这份笔记。既是科普,也是自己的完整学习记录。全文包含所有细节、数据、例子、设计动机,建议收藏慢慢看。 具身智能Agent开发调研|零基础超详细笔记 - 小红书
山顶夕景1 个月前
agent·多模态·vlm·omni·全模态
【Omni】OmniGAIA: Towards Native Omni-Modal AI Agents项目链接:https://github.com/RUC-NLPIR/OmniGAIA当前多模态大模型(MLLM)存在三个明显的断层:
一颗小树x1 个月前
具身智能·vlm·端侧·nvfp4
NVFP4 量化 × 具身智能:ModelScope 模型生态调研目的:了解当前行业模型情况,“机器人/具身智能方向有哪些模型可用?其中有没有 NVFP4 量化版?” 适合读者:正在做机器人端侧部署、或关注具身智能模型选型的工程师与研究者。
JoannaJuanCV1 个月前
深度学习·学习·机器学习·大模型·视觉大模型·vlm·视觉编码器
VLM学习-SFT(监督微调)SFT = Supervised Fine-Tuning(监督微调)SFT 是在预训练模型基础上,用带标注的数据做进一步训练,让模型学会按人类意图回答问题。
JoannaJuanCV1 个月前
大模型·vlm·视觉编码器
VLM学习-DINOv2三大损失DINO / iBOT / KoLeo 解析源码 code github 三个损失是 DINOv2 自监督训练的核心,分工是:DINO 损失管全局语义、iBOT 损失管局部细节、KoLeo 损失管特征空间不坍塌。逐个结合源码解析。
还不秃顶的计科生2 个月前
人工智能·深度学习·算法·机器学习·语言模型·vla·vlm
具身智能论文学习10:π0: A Vision-Language-Action Flow Model for General Robot Control如何在保留预训练 VLM 强大视觉语言知识的同时,直接生成高频、连续、精细的机器人 Action Chunk,从而实现通用且灵巧的机器人控制?
还不秃顶的计科生2 个月前
人工智能·深度学习·学习·机器学习·语言模型·vla·vlm
具身智能论文学习8:Octo: An Open-Source Generalist Robot PolicyOpen X-Embodiment→多机器人、大规模数据Diffusion Policy→连续动作序列与扩散动作生成
怦怦蓝2 个月前
人工智能·语言模型·自然语言处理·vlm
给AI装上“眼睛”:一文讲透视觉语言模型(VLM)这些能力的背后,是一种正在改变AI交互方式的技术——视觉语言模型(Vision-Language Model,简称VLM)。
山顶夕景2 个月前
音视频·video·vlm·多模态理解
【全模态】音视频理解模型Audio-Visual FlamingoAudio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos arXiv:https://arxiv.org/abs/2607.16107 机构:NVIDIA + 马里兰大学 | 参数规模:7B,开源
liferecords2 个月前
人工智能·算法·ocr·idp·vlm
HPD-Parsing: Hierarchical Parallel Document Parsing这篇论文提出一种新解码范式——分层并行解码(Hierarchical Parallel Decoding, HPD),解决 unified VLM 文档解析器"整页单条自回归生成"造成的序列瓶颈。做法是:主版面分支(layout branch)串行协调全局结构与阅读序,遇到路由 token <FORK> 时 fork 出并发的内容分支(content branch)解码各区域,分支内再叠加 P-MTP 推测解码。核心结论是 1B 模型达到 4,752 TPS,是最快现有文档解析模型的 2.62×、vani
-cywen-2 个月前
vlm
QWen-VLLLM展现出很强的文本理解和生成能力,通过Instruction Tuning能够很好地与用户交互,逐渐成为智能助手的重要基础。