2026年春江苏开放大学强化学习060733★★形考作业2答案 试题列表单选题题型:单选题客观题分值5分难度:简单得分:51Bellman方程在计算Q(s, a)时,折扣因子γ的作用是什么?A它决定了未来奖励的重要性B它用来衡量当前奖励的重要性C它是奖励的直接来源D它只影响状态的转换正确答案:A题型:单选题客观题分值5分难度:简单得分:52Q 表格的概念中,()A表格中每一个坐标点对应某时刻智能体的状态B以每执行若干步,就对Q 表格进行更新C与时间差分法毫无关 江苏开放大学 2026年07月15日 0 点赞 0 评论 57 浏览
2026年秋江苏开放大学强化学习060733综合大作业答案 试题列表单选题题型:单选题客观题分值5分难度:简单得分:51马尔可夫决策过程是指()。A针对随机过程序贯的做出决策。B针对具有马尔可夫性的随机过程序贯的做出决策。C针对一般过程序贯的做出决策。D具有马尔可夫性的过程。学生答案:B老师点评:题型:单选题客观题分值5分难度:简单得分:52在强化学习的过程中,()能够在稍微偏离目前最好策略的基础上,尝试更多策略,()能够运用目前最好的策略,获取更高的奖励 江苏开放大学 2026年09月03日 0 点赞 0 评论 2 浏览
2026年春江苏开放大学强化学习060733★★综合大作业答案 试题列表单选题题型:单选题客观题分值5分难度:简单得分:51在epsilon-greedy算法中,epsilon的值越大,采取随机动作的概率越(),采用当前Q函数最大动作的概率越()。A小,小B大,小C大,大D小,大正确答案:B题型:单选题客观题分值5分难度:简单得分:52在强化学习的过程中,()能够在稍微偏离目前最好策略的基础上,尝试更多策略,()能够运用目前最好的策略,获取更高的奖励。A利用, 江苏开放大学 2026年07月15日 0 点赞 0 评论 60 浏览
2026年春江苏开放大学强化学习060733★★形考作业1答案 试题列表单选题题型:单选题客观题分值5分难度:简单得分:51强化学习由两部分组成()A状态和马尔可夫过程B智能体和环境C价值和动作D动作和状态正确答案:B题型:单选题客观题分值5分难度:简单得分:52对于强化学习中模型的理解是()。A马尔可夫决策过程中可以有模型,也可以没有模型。B模型决定了下一步要采取的动作。C模型中的奖励函数是指我们在当前状态采取了某个动作,可以得到多大的奖励。D它由状态、动作 江苏开放大学 2026年07月15日 0 点赞 0 评论 80 浏览
2026年秋江苏开放大学强化学习060733形考作业3答案 试题列表单选题题型:单选题客观题分值5分难度:简单得分:51确定性策略梯度算法(DPG)的核心思想是什么?A通过最大化当前状态的Q值来选择最优动作B通过最小化策略的损失函数来更新策略C直接通过策略梯度优化确定性策略的参数D通过生成随机动作来更新策略学生答案:C老师点评:题型:单选题客观题分值5分难度:简单得分:52以下说法是否正确:为了保证强化学习的训练效果,需要打破训练样本数据之间的相关性。A正 江苏开放大学 2026年09月03日 0 点赞 0 评论 3 浏览
2026年春江苏开放大学强化学习060733★★形考作业3答案 试题列表单选题题型:单选题客观题分值5分难度:简单得分:51以下说法是否正确:强化学习的数据存在马尔可夫性,满足训练神经网络需样本独立同分布的假设前提。A正确B错误正确答案:B题型:单选题客观题分值5分难度:简单得分:52在REINFORCE算法中,策略更新是如何进行的?A通过贪心选择来更新策略B通过最大化当前状态的价值函数来更新策略C使用策略的梯度与回报的乘积来更新策略D使用Q值来直接更新策略参 江苏开放大学 2026年07月15日 0 点赞 0 评论 54 浏览
2026年秋江苏开放大学强化学习060733形考作业1答案 试题列表单选题题型:单选题客观题分值5分难度:简单得分:51强化学习智能体的组成成分()。A只有策略和模型B只有策略和价值函数C可能有策略、价值函数、模型中的一个或多个成分D都包含策略、价值函数和模型学生答案:C老师点评:题型:单选题客观题分值5分难度:简单得分:52在最优控制理论中,贝尔曼方程的作用是什么?A预测环境的变化趋势B确定初始状态的策略C描述动态规划中递归地求解最优值函数的方法D计算每 江苏开放大学 2026年09月03日 0 点赞 0 评论 5 浏览