2026年秋江苏开放大学强化学习060733综合大作业答案

试题列表单选题题型:单选题客观题分值5分难度:简单得分:51马尔可夫决策过程是指()。A针对随机过程序贯的做出决策。B针对具有马尔可夫性的随机过程序贯的做出决策。C针对一般过程序贯的做出决策。D具有马尔可夫性的过程。学生答案:B老师点评:题型:单选题客观题分值5分难度:简单得分:52在强化学习的过程中,()能够在稍微偏离目前最好策略的基础上,尝试更多策略,()能够运用目前最好的策略,获取更高的奖励
温馨提示! 升级 VIP 1 免费下载,你当前 未登录
温馨提示! 你需要支付 ¥8.00 元后才可以下载

文档介绍

注意:因为学习平台题目是随机,选择题选项也是随机,一定注意答案对应的选项,同学们在本页按“Ctrl+F”快捷搜索题目中“关键字”就可以快速定位题目!!!

同专业其他作业点击右侧标签查看

试题列表
单选题
题型:单选题客观题分值5分难度:简单得分:5
1
马尔可夫决策过程是指()。
A
针对随机过程序贯的做出决策。
B
针对具有马尔可夫性的随机过程序贯的做出决策。
C
针对一般过程序贯的做出决策。
D
具有马尔可夫性的过程。
学生答案:B
老师点评:
题型:单选题客观题分值5分难度:简单得分:5
2
在强化学习的过程中,()能够在稍微偏离目前最好策略的基础上,尝试更多策略,()能够运用目前最好的策略,获取更高的奖励。
A
利用,探索
B
探索,利用
C
利用,输出
D
探索,输出
学生答案:B
老师点评:
题型:单选题客观题分值5分难度:简单得分:5
3
Q(s,a)是指在给定状态s的情况下,采取行动a之后,后续的各个状态所能得到的回报()
A
总和
B
最大值
C
最小值
D
期望值
学生答案:D
老师点评:
题型:单选题客观题分值5分难度:简单得分:5
4
在强化学习过程中,学习率越大,表示采用新的尝试得到的结果比例越(),保持旧的结果的比例越()
A
大,小
B
大,大
C
小,大
D
小,小
学生答案:A
老师点评:
题型:单选题客观题分值5分难度:简单得分:5
5
在epsilon-greedy算法中,epsilon的值越大,采取随机动作的概率越(),采用当前Q函数最大动作的概率越()。
A
小,小
B
大,小
C
大,大
D
小,大
学生答案:B
老师点评:
多选题
题型:多选题客观题分值5分难度:简单得分:5
1
强化学习包含的元素有()。
A
Reward
B
Agent
C
State
D
Action
学生答案:A;B;C;D
老师点评:
简答题
题型:简答题主观题分值30分难度:简单得分:25
1
基于 Q-Learning 算法,完整实现 Gymnasium 中 Taxi 出租车载客环境的智能体训练与测试。
1. 环境与算法实现(10分)
2. 训练奖励记录与可视化(10分)
3. 智能体测试与结果可视化(5 分)
使用训练好的 Q 表进行不少于 100 轮测试,测试过程中不再进行随机探索。
4. 实验结果分析(5分)
学生答案:(购买后获取答案)
题型:简答题主观题分值30分难度:简单得分:25
2
请利用DDPG算法实现钟摆游戏Pendulum-v1,需要在答案区附上训练和测试曲线,包括训练时的奖励曲线图(10分)和测试时的奖励曲线区图(10分),并进行结果分析(10分)。


学生答案:(购买后获取答案)
题型:简答题主观题分值10分难度:简单得分:10
3
请问DQN(Deep Q-Network)是什么?经验回放(Experience Replay)在 DQN 中的核心价值是什么?(每个问题5分)
学生答案:(购买后获取答案)

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论
立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部