成为第一个分享这门课真实体验的人。
来自官方课程资料的结构化信息
课程代码
DSAI4101
课程名称
Reinforcement Learning
开课学系
dsai
所属学院
Faculty of Engineering
学分
3 学分
级别
4
课程简介
强化学习基础 (4L+2T): 强化学习简介:智能体、环境、状态、动作、奖励;马尔可夫决策过程 (MDPs):转移概率、策略、价值函数;贝尔曼方程:期望方程和最优方程。 基于模型的强化学习 (4L+2T): 已知模型的规划;策略迭代;值迭代;基于模型的强化学习简介:学习环境模型。 无模型预测与控制 (6L+3T): 蒙特卡洛 (MC) 方法用于预测与控制;时差学习 (TD):TD(0)、SARSA、Q学习;探索与利用权衡:ε-贪婪、UCB。 函数逼近与深度强化学习 (6L+3T): 使用线性模型和神经网络的价值函数逼近;深度Q网络 (DQN) 及其变体 (如双重DQN);经验回放。 策略梯度方法 (4L+2T): 策略梯度定理;REINFORCE算法;策略梯度方法简介。 案例研究 (2L+1T): 强化学习库:Gymnasium、Stable-Baselines3、PyTorch/TensorFlow;经典控制与游戏玩法中的应用 (如Atari);强化学习代理的训练与部署案例研究。
学习目标
1) 介绍强化学习 (RL) 的基本原理,包括智能体与环境的交互以及问题的马尔可夫决策过程 (MDPs) 表述。 2) 展示主要的强化学习算法家族,包括基于价值和基于策略的方法。 3) 介绍高级概念,如深度神经网络 (Deep RL) 的函数逼近、探索与利用权衡以及策略梯度方法。 4) 提供使用现代强化学习库 (如Gymnasium、PyTorch) 实现、训练和评估解决序列决策问题的代理的经验。
先修要求
先修课程 1. 概率与统计 统计推断 (AMA3640) AND 2. 线性代数 (以下任选一门) 线性代数 (AMA1751);微积分与线性代数 (AMA1007);微积分与线性代数 (AMA10071);高等数学 II - 微积分与线性代数 (AMA1120) AND 3. Python 编程 (以下任选一门) 程序设计原理 (AMA2222);计算思维与问题解决 (COMP1010)
教学模式
本课程将通过讲座和辅导相结合的方式进行讲授。讲座将涵盖从MDPs到高级深度强化学习算法的理论基础。辅导将侧重于问题解决、数学推导,并引导学生使用基于Python的库如Gymnasium和PyTorch来实现、训练和分析在各种模拟环境中的强化学习代理。