资讯中心

RL-02-赵-基于模型:贝尔曼/Bellman公式02【状态价值(State Values):v_π(s)】【①依赖于状态 s;②依赖于策略 π;③不依赖于时间步 t】

📅 2026/10/2 7:53:10
RL-02-赵-基于模型:贝尔曼/Bellman公式02【状态价值(State Values):v_π(s)】【①依赖于状态 s;②依赖于策略 π;③不依赖于时间步 t】
2.3 状态价值(State Values)前面提到,回报(Returns)可以用于评价策略(Policies)。但是,在随机系统(Stochastic Systems)中,直接使用单条轨迹的回报并不合适,因为从同一状态出发可能得到不同的回报。为了解决这一问题,本节引入状态价值(State Value)的概念。首先,需要介绍一些必要的符号。考虑时间步序列t=0,1,2,…t=0,1,2,\ldotst

看完文章,想为自己的企业也做一次专业网站诊断?

尧图顾问免费为您评估现有网站,并给出建站/改版建议与报价方案。

免费获取方案