主页
/
7.【Deepseek】视频文档学习教程
/
2025AI人工智能课程精选
/
AI算法工程师就业班
/
31、【加课】强化学习【新增】
/
章节3:PolicyGradient策略梯度
/
29:策略梯度PG_对比基于值和基于策略网络的区别.mp4
30:策略梯度PG_明确目标函数和导函数.mp4
31:策略梯度PG_简化导函数的公式推导.mp4
32:策略梯度PG_总结整体流程_对比交叉熵损失函数求导.mp4
33:策略梯度PG_讲解CartPole环境.mp4
34:代码实战_策略梯度PG和CartPole交互.mp4
35:代码实战_策略梯度PG网络构建.mp4
36:代码实战_策略梯度PG选择行为和参数训练.mp4
37:策略梯度PG_对TotalReward进行均值归一化.mp4
38:策略梯度PG_同一个回合中不同的action回溯不同的TotalReward_代码实战.mp4
© 2026
⚠
信息加载中,请等待...