具身智能论文伴读-第一期

具身智能论文伴读-第一期

2026年07月17日09:29:52 实际上,在AI时代,我错误评价了这种伴读的作用,这个专栏远没有达到。但是加上自己本身也想好好再读读论文,所以当做自己阅读的随摘了,贡献不大,各位道友批评取之。

一、这个专栏我们打算怎么读

先说清楚我们要练的四件事,因为它们会贯穿每一篇精读:

读论文的方法------不是逐字翻译,而是学会"分层读"。第一遍读摘要和图,搞清楚"这篇解决什么问题、结论是什么";第二遍读方法,搞清楚"它怎么做的";第三遍才抠细节和数学。我们在专栏里会刻意示范这个过程。

英文科研写作------论文的每一句话都是"被设计过的"。作者用什么词表达自信、用什么结构组织逻辑、如何在一句话里既谦虚又强势,这些是你将来自己写paper要偷师的东西。我会带你看"人家为什么这么写"。

科研思维------一篇好论文本质是一条完整的论证链:现状有什么问题 → 我提出什么 → 凭什么相信我 → 它还能推广到哪。你要学会在读的时候不断问"作者下一句该说什么",慢慢你就有了研究者的直觉。

表达能力------能把一个复杂的东西讲得让外行听懂,是研究者最被低估的能力。我们每篇都会试着用一句大白话概括核心。

二、专栏路线图(初版,我们一边走一边调)

我按"打地基 → 建高楼 → 进你的方向"来排。你现在不需要都看懂,先知道地图长什么样:

第一阶段:深度学习的骨架(理解"网络是怎么学的")

  • Attention Is All You Need(Transformer)------ 我们的第一篇,一切现代模型的起点
  • ResNet(残差网络)------ "为什么深网络能训得动"
  • BERT / GPT ------ 预训练范式的两条路线

第二阶段:从文字到感知(理解"模型怎么看世界")

  • ViT(Vision Transformer)------ Transformer 如何吃下图像
  • CLIP ------ 图文对齐,具身智能里视觉-语言的地基
  • Diffusion Models(DDPM)------ 后面机器人动作生成会大量用到

第三阶段:决策与控制(理解"智能体怎么行动")

  • DQN / PPO ------ 强化学习的两块基石
  • 模仿学习基础

第四阶段:进入具身智能(你的主场)

  • RT-1 / RT-2 ------ 机器人大模型的开创性工作
  • Diffusion Policy ------ 用扩散模型生成动作,当下的热门范式
  • ACT(ALOHA 那篇)------ 低成本高精度操作
  • OpenVLA 等 VLA 模型 ------ 视觉-语言-动作一体化

这条线的设计逻辑是:Transformer 是发动机,视觉和扩散是感官和手脚,强化/模仿是大脑,最后在具身智能里把它们拼成一个完整的机器人。

让我们拭目以待吧

相关推荐
智慧物业老杨2 小时前
物业数字化落地思考:真正的转型,是底层数据秩序的重构
java·大数据·人工智能·微服务·系统架构
7177775 小时前
中小团队 DevOps 平台选哪家:2026 年主流平台对比与 Gitee 本土化方案解析
人工智能·gitee
武子康5 小时前
小智断网后还能做什么?沿一次唤醒看清设备与服务端的分工
人工智能·llm·agent
西安栈上月明软件科技5 小时前
从 Linux 0.01 到 AI 开源:星图邻的开源实践
人工智能·自然语言处理·架构·开源·fastapi
麻雀飞吧5 小时前
先判断工具用来学习、开发还是执行
人工智能·python
甲维斯5 小时前
ZCode:快来领“免费”3亿tokens和“Git打包服务”
人工智能
揽秀亭长5 小时前
视频转文字有哪些方法?在线AI、剪辑软件、本地对比
人工智能·音视频
RoboWizard6 小时前
三星和金士顿内存条哪个更适合游戏超频
大数据·人工智能
深圳市恒星物联科技有限公司6 小时前
轻量MCU设备通过OpenHarmony兼容性测评的全流程关键要点与实战踩坑经验
大数据·人工智能·物联网·鸿蒙
AI闲人7 小时前
企业 AI 最大的问题,不是数据不足,而是数据没有业务语义
人工智能·数字化·企业ai落地