技术栈
多模态感知
音视频牛哥
7 分钟前
人工智能
·
llm
·
机器人视觉
·
slam
·
vla
·
多模态感知
·
机器人音视频
从 LLM、VLA、LLA、SLIM 到实时音视频感知底座:具身智能真正需要的不只是大模型
过去十几年,音视频行业解决的问题,大多可以归结为一个核心目标:怎样把声音和画面更稳定、更清晰、更低延迟地送到另一个人面前。摄像头采集、H.264/H.265 编码、RTSP/RTMP 推流、播放器解码、GB28181 接入、录像与转发,这些技术最终服务的主要对象仍然是“人”。
音视频牛哥
17 天前
人工智能
·
具身智能
·
世界模型
·
world model
·
vla模型
·
多模态感知
·
机器人决策
世界模型如何重塑具身智能:从VLA到预测式机器人控制
围绕“世界模型是不是机器人下一个奇点时刻”的讨论正在升温。过去几年,具身智能的发展重点集中在大模型、VLA(Vision-Language-Action)、模仿学习和遥操作数据上:让机器人看懂场景、理解语言,并根据输入直接生成动作。如今,行业开始把更多注意力转向世界模型,因为仅仅知道“应该做什么”,并不等于能够判断“做完以后世界会发生什么”。
武汉唯众智创
2 个月前
人工智能
·
具身智能
·
人形机器人
·
多模态感知
·
机器人运动控制
·
机器人产教融合
·
机器人感知决策
具身智能:人工智能的下一个范式革命
2024年以来,具身智能(Embodied Intelligence)迅速成为人工智能领域最炙手可热的研究方向之一。从Figure机器人与OpenAI的合作演示,到特斯拉Optimus的持续迭代,再到国内各大科研院所和科技企业的纷纷入局,具身智能正在从实验室走向现实世界。
LeeeX!
6 个月前
笔记
·
多模态感知
玩转 3D 检测和分割(一):MMDetection3D 整体框架介绍
完整文章转载自OpenMMLab,此仅作个人学习笔记:带你玩转 3D 检测和分割 (一):MMDetection3D 整体框架介绍 - OpenMMLab的文章 - 知乎https://zhuanlan.zhihu.com/p/478307528
我是有底线的