2026年春江苏开放大学强化学习060733★★综合大作业答案
试题列表单选题题型:单选题客观题分值5分难度:简单得分:51在epsilon-greedy算法中,epsilon的值越大,采取随机动作的概率越(),采用当前Q函数最大动作的概率越()。A小,小B大,小C大,大D小,大正确答案:B题型:单选题客观题分值5分难度:简单得分:52在强化学习的过程中,()能够在稍微偏离目前最好策略的基础上,尝试更多策略,()能够运用目前最好的策略,获取更高的奖励。A利用,
文档介绍
注意:因为学习平台题目是随机,选择题选项也是随机,一定注意答案对应的选项,同学们在本页按“Ctrl+F”快捷搜索题目中“关键字”就可以快速定位题目!!!
同专业其他作业点击右侧标签查看
试题列表
单选题
题型:单选题客观题分值5分难度:简单得分:5
1
在epsilon-greedy算法中,epsilon的值越大,采取随机动作的概率越(),采用当前Q函数最大动作的概率越()。
A
小,小
B
大,小
C
大,大
D
小,大
正确答案:B
题型:单选题客观题分值5分难度:简单得分:5
2
在强化学习的过程中,()能够在稍微偏离目前最好策略的基础上,尝试更多策略,()能够运用目前最好的策略,获取更高的奖励。
A
利用,探索
B
探索,利用
C
利用,输出
D
探索,输出
正确答案:B
题型:单选题客观题分值5分难度:简单得分:5
3
在强化学习过程中,学习率越大,表示采用新的尝试得到的结果比例越(),保持旧的结果的比例越()
A
大,小
B
大,大
C
小,大
D
小,小
正确答案:A
题型:单选题客观题分值5分难度:简单得分:5
4
Q-learning算法中,Q函数是()。
A
状态-动作值函数
B
状态函数
C
估值函数
D
奖励函数
正确答案:A
题型:单选题客观题分值5分难度:简单得分:5
5
Q(s,a)是指在给定状态s的情况下,采取行动a之后,后续的各个状态所能得到的回报()
A
总和
B
最大值
C
最小值
D
期望值
正确答案:D
多选题
题型:多选题客观题分值5分难度:简单得分:5
1
强化学习包含的元素有()。
A
Reward
B
Agent
C
State
D
Action
正确答案:A;B;C;D
简答题
题型:简答题主观题分值50分难度:简单得分:48
1
题目:基于 Q-Learning 算法实现冰湖(FrozenLake-v1)游戏
基于 Q-Learning 算法,完整实现 OpenAI Gym 中 FrozenLake-v1(4x4 非滑溜版)环境的智能体训练与测试代码(15 分);
训练过程中实时记录每一轮的奖励值,训练完成后绘制训练奖励曲线图(横轴为训练轮数,纵轴为每轮奖励值,需包含滑动平均曲线)(15 分);
训练完成后,使用训练好的 Q 表进行至少 100 轮测试,记录每轮测试奖励值并绘制测试奖励曲线图(10 分);
对训练曲线、测试曲线的趋势和结果进行详细分析,包括但不限于:奖励值变化规律、算法收敛性、智能体性能表现等(10 分)。
正确答案:(购买后获取答案)
题型:简答题主观题分值10分难度:简单得分:10
2
Actor-Critic框架中的Critic起了什么作用?
正确答案:(购买后获取答案)
题型:简答题主观题分值10分难度:简单得分:10
3
请问DQN(Deep Q-Network)是什么?经验回放(Experience Replay)在 DQN 中的核心价值是什么?(每个问题5分)
正确答案:(购买后获取答案)
©软件著作权归作者所有。本站所有软件均来源于网络,仅供学习使用,请支持正版!
转载请注明出处: 形易网 » 2026年春江苏开放大学强化学习060733★★综合大作业答案

发表评论 取消回复