hands-on-modern-rl:动手学强化学习 贝尔曼方程给定一个固定策略 π,贝尔曼期望方程为 V π ( s ) = Σ a π ( a ∣ s ) ∗ [ R ( s , a ) + γ ∗ Σ s ′ P ( s ′ ∣ s , a ) ∗ V π ( s ′ ) ] V^π(s) = Σ_a π(a|s) * [R(s,a) + γ * Σ_{s'} P(s'|s,a) * V^π(s')] Vπ(s)=Σaπ(a∣s)∗[R(s,a)+γ∗Σs′P(s′∣s,a)∗Vπ(s′)]