从离线评测到云端强化学习,从端侧实时控制到工厂级 MaaS 服务,每个场景对延迟、吞吐和多卡通信的要求各不相同。过去,开发者往往需要针对不同场景维护多套代码------迁移成本高、工程重复、效率参差不齐。
今天,由北京邮电大学 牵头,联合北京大学、清华大学、南京大学、明体科技 和面壁智能 共同完成的 PhyAI 正式开源并在AtomGit 首发同步上线,给这个问题提供一套解决方案。
-
🔗 项目开源地址:
-
📄 论文标题:
《PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud》
-
👉 论文地址:

01|四类场景,一套代码
Physical AI 的推理部署,典型地分布在四类场景中:
-
Benchmark 评测:关注复现的准确性,需要稳定的单次推理;
-
云端 RL Rollout:用于提升模型长程任务能力,关注多 batch 吞吐与多 GPU 利用率;
-
端侧部署:直接跑在机器人上,核心指标是推理时延;
-
工厂 MaaS:厂区共享 GPU 服务多台机器人,网络排队、批处理都会影响时延。
这四类场景的 batch 大小、模型精度和执行设备各不相同,但图像预处理、模型推理逻辑、缓存和动作输出可以复用,且必须保持一致。
然而,现有工作通常针对这四类场景分别维护代码,迁移成本高、重复劳动多、效率参差不齐。PhyAI 的核心目标,就是用一套模型运行代码,在这四个场景中无缝迁移。
02|架构设计:把繁杂的活交给运行时
PhyAI 的设计哲学是 "延迟优先"(Latency-First)。
具体来说,模型语义被放在 Model Adapter 中,而调度、缓存、算子选择、图执行和并行策略全部交给运行时处理。开发者只需要编写一套模型代码,运行时自动适配不同场景。
PhyAI 主要包含两个关键组件:
-
Model Runner:保存视觉语言条件、action expert 或视频动作生成、solver、状态复用与动作转换逻辑;
-
Scheduler:选择 DP、TP、CFG 等并行策略及设备组;同时管理 KV cache、buffer、CUDA Graph 和请求状态;按 shape、dtype 与硬件选择融合或分布式算子。
同一模型路径,可以运行在单卡、边缘设备和云端多卡环境中,无需修改代码。

PhyAI 框架结构
03|性能实测:最高加速 4.65 倍
用数据说话。在 11 组同模型、同设备的单请求对比中,PhyAI 相比官方实现加速 1.40x 至 4.65x。
两个直观的例子:
-
MiniCPM-Robot (H100 单卡):单次推理从 105.38 ms 压缩至 22.64 ms,提升约 4.66 倍;
-
Cosmos3-Nano-Policy-DROID (8 张 H20,CFG=2,TP=4):从 2.46 s 降至 1.18 s,提升约 2.08 倍。

在真机部署测试中,PhyAI 与官方框架对比运行 MiniCPM-Robot,三台机器人并行推理场景下,PhyAI 时延最多降低 2.3 倍,全程无卡顿完成任务------而官方框架在三机并行时因卡顿无法完成任务。
推理速度的提升还能惠及云端 RL Rollout。以 RLinf 的 PI0.5 GRPO 训练为例(4 张 A800,32 个环境),推理耗时 955.8 秒,占 RL 总时间的 15.9%。PhyAI 将推理速度提升 2.55 倍后,估算推理时间降至 863.2 秒,减少 9.7%。

PI0.5 和 Cosmos3 在不同硬件上各模块的 Roofline
04|关键洞察:Control-Time Roofline
PhyAI 提出了一个对落地团队极具参考价值的分析工具:Control-Time Roofline。
直觉上,推理越快,控制频率越高,系统表现越好。但实测发现了一个反直觉的现象------
当算力充足时,继续压低延迟,控制频率并不会等比例提升。 瓶颈已经从"模型推理"转移到了"物理环境"(网络时延、传感器响应、机械执行)。
研究团队对 PI0.5 在不同设备上进行了测试:
-
AGX Orin:主要瓶颈是推理,优化模型仍有收益;
-
RTX Pro 6000:主要瓶颈是物理环境,继续优化推理已无显著效果。
这意味着,框架优化节省下来的时间,与其死磕延迟,不如用于部署更大的模型、适配更慢的设备,或者接入更多并发。对于卡在"再快也没用"的团队,这个分析视角非常实用。

Control-Time Roofline Model
05|模型支持与技术能力
PhyAI 已接入主流具身模型,覆盖 VLA、世界动作模型和基础模型三大类:

在硬件适配上,PhyAI 往小能跑在 NVIDIA Jetson 边缘端,往大能用 DP、TP、CFG 并行扩展到 GPU 集群。内核采用 FlashInfer 和 Humming 高性能算子库,量化支持 W4A8(NVFP4、MXFP4、INT4)、W8A8、W8A16,将端侧有限算力用到极致。
06|在 AtomGit 快速上手
PhyAI 这类推理引擎项目有一个显著特点:代码是一块,模型权重是另一块,往后还可能挂数据集。想要开发者拉下来就能跑,就需要代码仓库、模型权重与数据集的一体化托管,使项目可以整体放在一个仓库中维护。国内访问顺畅,克隆到本地直接运行,无需等待镜像、无需绕路。
对做具身智能和机器人推理的团队来说,将项目托管在 AtomGit 中,意味着少花时间折腾环境,多花时间在业务上。
目前,PhyAI 已正式开源并在 AtomGit 首发同步上线,诚挚邀请广大开发者、科研团队及具身智能从业者前往 AtomGit 体验使用,共同推动 Physical AI 推理基础设施的演进:
🔗 AtomGit 地址: