ppo 找出口模型 训练笔记

1.

cnn模型大小我给他控制在训练耗时30s左右(4060ti)

2.

动作空间6个:4个移动2个转头,因为一开始都要跑一遍,动作太多需要跑更多步才能吃到正反馈

第3个episode就已经跑出来正反馈了/距离门很近

因为是随便乱跑,空间越大碰到门的概率才越大

我现在设置是60步一episode,5 episode训练一次

转头70度左右,前后移动控制在4s 8s,时间模型可以调,给了模型位移程度的控制,时间设置这么长也是为了能像无头苍蝇一样先把环境用脚完全跑一遍

3.

这个模型我没想到的是,它训练出来,是用屁股走路的,后退当前进走到门旁边

奖励是门的面积/10000,门越大奖励越高,面积大于30w就给大奖励

改成只识别爬墙按钮不识别门,到位了才给奖励500/步数

早上用小碎步是能收敛的这种奖励,越训练得分越多,早上哪个架构大一点训练2分钟




遇到的情况

yolo我还得重新训练一下近距离的情况,遇到了贴着门太大yolo没识别出来的情况

可能就是因为这样模型收敛不了

ai学会远处刷分了,准备把30000以下的面积奖励取消掉

相关推荐
9000AI6 小时前
AI真正重构的,是企业市场能力的生产关系:9000AI创始人李家旺谈组织智能、关键结果节点与流量产能
人工智能
心易行者6 小时前
从零搭建完整Web应用:7步走完全流程,配合web应用托管零门槛上线
人工智能·python·ai编程
一个处女座的程序猿7 小时前
Agent之Human-Agent Teaming:Cumora(面向人类与 AI Agent 协作的聊天应用)的简介、安装和使用方法、案例应用之详细攻略
人工智能·agent·cumora
凯尔萨厮7 小时前
Java学习笔记十(注解)
java·笔记·学习
β添砖java7 小时前
深度学习26转置卷积
人工智能·深度学习
小柯南敲键盘7 小时前
跨境电商图片翻译工具,批量处理视频字幕与抠图
人工智能·python·音视频
Mr数据杨7 小时前
结构化数据价格预测实战入门 从 Kaggle 回归赛题理解建模与落地
人工智能·数据分析·kaggle竞赛
chunmiao30327 小时前
116 家科技公司联名预警:AI 网络攻击进入高发期
人工智能·科技·安全
科技林总7 小时前
提示词测评概述
人工智能
武子康7 小时前
开放权重之后,为什么 Agent 仍然无法复现:真正缺的是可重放行为证据
人工智能·llm·agent