多模态感知

音视频牛哥7 分钟前
人工智能·llm·机器人视觉·slam·vla·多模态感知·机器人音视频
从 LLM、VLA、LLA、SLIM 到实时音视频感知底座:具身智能真正需要的不只是大模型过去十几年,音视频行业解决的问题,大多可以归结为一个核心目标:怎样把声音和画面更稳定、更清晰、更低延迟地送到另一个人面前。摄像头采集、H.264/H.265 编码、RTSP/RTMP 推流、播放器解码、GB28181 接入、录像与转发,这些技术最终服务的主要对象仍然是“人”。
音视频牛哥17 天前
人工智能·具身智能·世界模型·world model·vla模型·多模态感知·机器人决策
世界模型如何重塑具身智能:从VLA到预测式机器人控制围绕“世界模型是不是机器人下一个奇点时刻”的讨论正在升温。过去几年,具身智能的发展重点集中在大模型、VLA(Vision-Language-Action)、模仿学习和遥操作数据上:让机器人看懂场景、理解语言,并根据输入直接生成动作。如今,行业开始把更多注意力转向世界模型,因为仅仅知道“应该做什么”,并不等于能够判断“做完以后世界会发生什么”。
武汉唯众智创2 个月前
人工智能·具身智能·人形机器人·多模态感知·机器人运动控制·机器人产教融合·机器人感知决策
具身智能:人工智能的下一个范式革命2024年以来,具身智能(Embodied Intelligence)迅速成为人工智能领域最炙手可热的研究方向之一。从Figure机器人与OpenAI的合作演示,到特斯拉Optimus的持续迭代,再到国内各大科研院所和科技企业的纷纷入局,具身智能正在从实验室走向现实世界。
LeeeX!6 个月前
笔记·多模态感知
玩转 3D 检测和分割(一):MMDetection3D 整体框架介绍完整文章转载自OpenMMLab,此仅作个人学习笔记:带你玩转 3D 检测和分割 (一):MMDetection3D 整体框架介绍 - OpenMMLab的文章 - 知乎https://zhuanlan.zhihu.com/p/478307528
我是有底线的