技术栈
视觉理解
thesky123456
10 天前
视频
·
语音
·
智能体
·
视觉理解
·
多模态agent
·
跨模态对齐
·
具身
智能体面试准备(二十五):多模态 Agent——图文、语音、视频输入的感知融合与决策
上一篇《GUI 智能体与 Computer Use》讲的是让 Agent 学会看屏幕、点鼠标,本质上已经踩进了"视觉输入"的门槛。顺着这条线再往下走一层,就是一个更底层的命题:Agent 能不能"看懂"世界——不只是看懂界面控件,而是看懂图片、听懂语音、理解视频。这是 B 系列第二十五篇。纯文本 Agent 的能力上限受限于"用户能打多少字"——而真实业务里,大量信息在图片、语音、视频、表格、PDF 里。2024 年之后,多模态大模型(VLM,见 A14)成熟,让 Agent 从"读文字的秘书"变成"看得
攻城狮7号
7 个月前
人工智能
·
ai编程
·
视觉理解
·
kimi code
·
kimi k2.5
·
agent 集群
Kimi 发布并开源 K2.5 模型:开始在逻辑和干活上卷你了
目录前言一、从“能读”到“能做”:Kimi 的这次进化有点猛1.1 代码有了“审美”1.2 Agent 集群:给我变出 100 个分身!
HyperAI超神经
8 个月前
人工智能
·
ai
·
开源
·
编程语言
·
向量数据库
·
视频生成
·
视觉理解
活动回顾丨 北大/清华/Zilliz/MoonBit共话开源,覆盖视频生成/视觉理解/向量数据库/AI原生编程语言
当下,AI 产业正迎来一个前所未有的发展周期。大模型的规模化应用、AI 原生软件体系的重构、多模态基础模型的加速演进,让学界与产业界的边界变得愈发模糊。无论是视频生成对音画同步的精细化要求、终端侧视觉模型的高效推理优化,还是新一代 AI 原生编程语言的出现,都在推动一个清晰的趋势——产研协同与开源生态,正在成为 AI 时代最关键的创新范式。
m0_65010824
10 个月前
计算机视觉
·
论文精读
·
视觉理解
·
视觉生成
·
多模态通用模型
·
视觉分割
·
视觉编辑
【论文精读】VITRON:统一的像素级视觉大语言模型
标题:VITRON: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
Struart_R
1 年前
计算机视觉
·
语言模型
·
transformer
·
大语言模型
·
vlm
·
视觉理解
·
空间推理
SpatialVLM和SpatialRGPT论文解读
目录一、SpatialVLM1、概述2、方法3、实验二、SpatialRGPT1、概述2、方法3、训练方法
Nicolas893
1 年前
语言模型
·
大模型
·
多模态
·
视觉理解
·
cogvlm
·
visionllm
·
视觉语言预训练模型
【大模型理论篇】CogVLM:多模态预训练语言模型
前两天我们在《Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought》中介绍了将ViT与推理模型结合构造多模态推理模型的案例,其中提到了VLM的应用。追溯起来就是两篇前期工作:Vision LLM以及CogVLM。
youcans_
2 年前
人工智能
·
计算机视觉
·
大语言模型
·
多模态
·
视觉理解
【微软报告:多模态基础模型】(2)视觉理解
欢迎关注【youcans的AGI学习笔记】原创作品 【微软报告:多模态基础模型】(1)从专家到通用助手 【微软报告:多模态基础模型】(2)视觉理解 【微软报告:多模态基础模型】(3)视觉生成
叶庭云
2 年前
人工智能
·
多模态大模型
·
gpt-4o
·
视觉理解
·
图片问答
视觉理解与图片问答,学习如何使用 GPT-4o (GPT-4 Omni) 来理解图像
🍉 CSDN 叶庭云:https://yetingyun.blog.csdn.net/OpenAI 最新发布的 GPT-4 Omni 模型,也被称为 GPT-4o,是一个多模态 AI 模型,旨在提供更加自然和全面的人机交互体验。
我是有底线的