技术栈
具身rsi
v_JULY_v
3 小时前
enpire
·
具身递归自我改进
·
具身rsi
·
具身agent
ENPIRE——Agent驱动的机器人策略自我改进(具身RSI的代表之一):自动奖励验证、自动复位、无人值守的策略迭代
通过本博客中的此文《π∗0.6——通过RL框架RECAP微调流式VLA π0.6:先基于示教数据做离线RL预训练,再SFT(即IL微调),最后在线RL后训练(与环境自主交互,从经验数据中学习,且必要时人工干预)》,可知在通过π*0.6做真机RL迭代的时候,数采时还需通过人工打标(标注成/败)的方式,给予模型反馈,那对于一些不那么复杂的任务,是否可以做到自动给奖励反馈呢
我是有底线的