单元六 · AI项目工坊

第30课 训练模型玩游戏

任务场景
任务场景:训练模型玩游戏

一、学习目标

  • 了解训练人工智能玩游戏的基本流程,掌握奖惩机制设计方法。
  • 能够调用训练好的模型,实现利用人工智能自动玩游戏。

二、情境导入

如何有效评估人工智能在游戏中的表现?

当人工智能玩游戏时,它是如何从游戏画面中提取信息并做出决策的?

三、核心讲解

本课学习路径:

1分析任务
2选择人工神经网络
3训练模型
4调用模型玩游戏
5分析任务1

1.分析任务

自动玩游戏的模型,对应的核心技术是强化学习。强化学习是一

反馈:根据结果再调整下一步。闭环能对照目标修正,开环则按预设一路执行。
  • 种让智能系统(如模型)通过与环境交互,不断学习决策方法的机器
  • 学习方式。其基本思想是:智能系统在尝试不同动作的过程中,根据
  • 环境提供的反馈调整自身行为,以实现奖励的最大化。
  • 为实现这一目标,需要构建完整的训练体系,包括对当前状态的描述、动作的确定以及奖励机制的设计等。

2.分析任务1

奖励机制鼓励尽可能延长生存

分析任务1:先抓住「分析任务1」在做什么,再用例子对照验证。
  • 时间并穿越更多障碍物,同时
  • 避免危险操作。
  • ·未发生碰撞,每帧得0.01分;
  • ·成功穿过一根管道,得1分;
  • ·若发生碰撞,得-1分。

想一想:·游戏画面分辨率是多少?

3.训练模型

训练过程可视为计算机通过不断尝试玩游戏、积累经验并优

  • 化决策的过程。在这个过程中,智能系统并非初始即知晓什么动
  • 作是最好的选择,而是通过反复试错,逐步学会在不同状态下做
  • 出合理决策。
  • 为了实现这一学习过程,强化学习引入了“探索-利用”策略。在训练
  • 初期,智能系统主要进行“探索”,即以较高概率随机选择动作,从而广

想一想:探索率一直为0或一直为100%,会发生什么?

弄清以上要点后,再进入下方动手体验,用实际操作验证。

四、动手体验 · MixAI 组件

请在下列组件中完成操作,至少体验一个并记录现象。

组件 model_neural_network_playground — 在框内完成操作

组件 model_connection_parameters — 在框内完成操作

五、课堂总结

  • 1.强化学习的原理是让智能系统通过与环境交互不断学习决策方法,以实现奖励的最大化。
  • 2.为实现强化学习,需要构建完整的训练体系,包括对当前状态的描述、动作的确定以及奖励机制的设计等。
  • 3.训练模型的初期探索率高,智能系统更多随机选择动作进行探索。
  • 随着训练的推进,探索率逐步降低,随机动作逐渐减少。

六、拓展提升

拓展:需要对《赛车》游戏中的状态、动作和奖励机制等进行思考和设计。尝试用同样的思路,训练模型玩《赛车》游戏。

测评

完成练习后作答;选出后点「检查」。答错会显示简短说明。

  1. 下列哪一项更接近本课学习目标?

  2. 本课课堂总结强调的是?

  3. 本课主题最贴近下列哪一项?

  4. 完成本课后,优先应该做什么来证明学会了?

  5. 判断:教学指南中的学习活动可以全部跳过。

  6. 拓展提升部分的作用是?

本节小结

回顾本课要点,完成动手体验与测评。记住:训练模型玩游戏。