该参考描述所示目录。请向院校确认当前的招生项目及适用于您入学年的条件。
描述
强化学习(亦作为 COSC 4P83 提供) 介绍强化学习的基本概念,包括多臂老虎机问题、马尔可夫决策过程、基于模型与无模型方法(如动态规划、蒙特卡洛方法与时序差分方法)用于学习价值函数与策略函数。近似解法包括深度强化学习。
原文参考文本
Reinforcement Learning (also offered as COSC 4P83) Introduction to fundamental reinforcement learning concepts including multi-armed bandits, Markov decision processes, model-based and model-free methods (such as dynamic programming, Monte Carlo methods, and temporal-difference methods) for learning value and policy functions. Approximation solutions including deep reinforcement learning.
来源与参考
为帮助您核实信息,保留了日期和来源。为便于阅读提供了翻译;以官方来源为准,查看条件和要求。
来源参考 : https://brocku.ca/webcal/2024/graduate/cosc.html