具身

thesky1234563 天前
视频·语音·智能体·视觉理解·多模态agent·跨模态对齐·具身
智能体面试准备(二十五):多模态 Agent——图文、语音、视频输入的感知融合与决策上一篇《GUI 智能体与 Computer Use》讲的是让 Agent 学会看屏幕、点鼠标,本质上已经踩进了"视觉输入"的门槛。顺着这条线再往下走一层,就是一个更底层的命题:Agent 能不能"看懂"世界——不只是看懂界面控件,而是看懂图片、听懂语音、理解视频。这是 B 系列第二十五篇。纯文本 Agent 的能力上限受限于"用户能打多少字"——而真实业务里,大量信息在图片、语音、视频、表格、PDF 里。2024 年之后,多模态大模型(VLM,见 A14)成熟,让 Agent 从"读文字的秘书"变成"看得
Zlssszls4 个月前
人工智能·机器人·具身
数字孪生技术架构深度解析:从数据采集到智能决策的全栈技术体系随着“人工智能+”行动在2026年持续推进,数字孪生技术已从概念验证阶段迈入规模化产业应用阶段。据Gartner预测,到2026年,超过60%的大中型企业将在创新实践中应用数字孪生与AI等前沿技术。本文从技术研发视角出发,系统解析数字孪生的核心架构——从物理层数据采集、模型层高精度建模、引擎层实时渲染,到智能层AI驱动的分析与预测,并结合工业制造、智慧城市、水利水务等典型应用场景,探讨技术落地中的关键突破与挑战。当前,数字孪生正从“可视、可算”向“可调、可控”的智能决策阶段演进,核心技术自主可控已成为产业
tianyuanwo9 个月前
人工智能·管理·具身
从机器人到软件管理:“具身”思维如何重塑我们的世界朋友们,不知道你有没有观察过孩子学走路?他们不是通过看书或听讲座学会的,而是通过无数次摔倒、爬起,用整个身体去感知重力、平衡和空间,最终才稳稳地站立。这个过程,本质上就是一种“具身”学习。
我是有底线的