主页
/
7.【Deepseek】视频文档学习教程
/
2025AI人工智能课程精选
/
AI算法工程师就业班
/
31、【加课】强化学习【新增】
/
章节4:ActorCritic(A3C)
/
39:ActorCritic原理_把PG和QLearning结合起来.mp4
40:AdvantageActorCritic_共享参数和修改reward技巧.mp4
41:代码实战_ActorCritic与环境交互.mp4
42:代码实战_Actor网络构建及训练.mp4
43:代码实战_详解Critic网络构建及训练.mp4
44:A3C架构和训练流程.mp4
45:Pendulum环境_根据网络预测的μ和σ得到连续型的action值.mp4
46:代码实战_A3C_讲解Coordinator调度多线程运算.mp4
47:代码实战_A3C_定义Worker计算loss的逻辑_针对连续型的action提高actor探索性.mp4
48:代码实战_A3C_增加actor探索性用到熵_定义worker正太分布抽样和求梯度的逻辑.mp4
49:代码实战_A3C_定义AC网络结构_定义worker拉取参数和更新全局网络参数的逻辑.mp4
50:代码实战_A3C_结合流程图分三点总结前面讲的代码.mp4
51:代码实战_A3C_讲解线程中worker和环境交互.mp4
52:代码实战_A3C_讲解线程中worker和GlobalNet交互_代码运行效果展示.mp4
© 2026
⚠
信息加载中,请等待...