闭环最优控制问题(强化学习)

文章目录

学习闭环最优控制要解决的问题

问题本质:根据实时监测到的状态(熔池、温度等),动态调整激光功率、扫描速度、送粉率等参数,以补偿扰动、防止缺陷产生。

简单理解例子

首先,一个生动的类比:老司机开车 vs. 驾校学员开车

  1. 想象一下在一条蜿蜒的山路上行驶:

    开环控制 (驾校学员): 策略:教练说:"记住!这段路方向盘先右打90度,保持3秒,然后回正,油门踩20%..."

    执行:学员严格按这个固定的指令序列执行。 结果:如果路面有风、轮胎打滑、或者记错了时间,车很容易跑偏甚至出事故。它无法应对任何变化。
    闭环控制 (普通定速巡航):

    策略:你设定了目标:车速保持60km/h。

    执行:系统通过车速传感器实时测量当前速度。如果测到只有55km/h(有了反馈),它就自动多踩一点油门;如果测到65km/h,就收一点油门。

    结果:车能基本保持在60km/h左右,能应对小幅度的上下坡。它能根据"结果"的反馈来调整"动作"。
    闭环最优控制 (老司机):

    策略:老司机的目标不仅是"到达目的地",而且是"用最短时间、最省油、最平稳舒适的方式"到达。这是一个多目标的优化问题。 执行:

    感知:他眼睛(传感器)实时观察弯道曲率、路面颠簸、前后车距。

    决策:大脑(控制器)根据这些信息,瞬间做出最优决策:这个弯应该以什么速度、什么角度切入,出弯时如何加速。

    行动:手脚(执行器)精准地执行转向、油门、刹车的配合。

    评估:整个过程中,他不断感受车辆的姿态和乘客的舒适度(多维度奖励反馈),并微调操作。

    结果:不仅安全到达,而且又快又稳又省油。它在每一个瞬间,都在根据环境状态,求解一个"什么动作对我最终的多重目标最有利"的优化问题,并形成闭环。

定义与核心要素

闭环最优控制 是一种控制策略,它通过实时测量系统的输出状态(反馈),与期望目标进行比较,然后动态计算并执行一个能在某种指标下达到最佳性能的控制动作,以此构成一个持续的"感知-决策-执行"循环。

  • 闭环:关键在 "反馈" 。系统不断看"我现在做得怎么样",然后调整,而不是蒙着眼睛一杆子捅到底。
  • 最优:关键在 "代价函数" 。目标不是"差不多就行",而是要明确"好"的标准是什么(如:质量最高、用时最短、耗能最少),并数学化地追求这个标准下的最好结果。
  • 控制:关键在 "动态决策" 。根据当前状态,实时计算应该做什么。
相关推荐
Better Bench1 天前
从摸石头过河到看录像学习:强化学习与离线RL的进化故事
学习·强化学习·贝尔曼方程·离线强化学习·在线强化学习·q值
论文复现现场1 天前
Qwen3.8-27B 做 GRPO 需要几张 4090?Coding Agent 显存预算与多卡验收
强化学习·qwen·大模型微调·rtx4090·算家云·grpo
微小冷3 天前
gymnasium初步教程
强化学习·gym·仿真环境·gymnasium·动力学仿真
Web3&Basketball3 天前
用 SGLang 决策端点做毫秒级 Agent 路由
python·大模型·agent·强化学习·多模态·推理
AI你一生一世4 天前
一年前,我用 RL 造了一批非自回归决策模型
强化学习·决策系统·低延迟推理·非自回归模型·实时竞价
盘古开天16664 天前
PPO算法原理详解(上):从策略梯度到近端策略优化的演进之路
人工智能·算法·机器学习·强化学习·ppo
盼小辉丶5 天前
PyTorch强化学习实战(27)——进化策略在强化学习中的应用
人工智能·pytorch·深度学习·强化学习
火星机器人life6 天前
PPO 会探索、CBF 会保命:RADAR-BPO 把复杂环境碰撞率压到 10.7%
强化学习·机器人导航·控制屏障函数·安全滤波
维度攻城狮7 天前
从Q-learning到DQN:小车倒立摆的智能控制进阶
强化学习·dqn·drl
zh路西法8 天前
【上手一只MicroDuck】:(一)从机器人结构到强化学习训练框架
python·强化学习·huggingface·ppo·mujoco·microduck