单元六 · AI项目工坊
第30课 训练模型玩游戏

一、学习目标
- 了解训练人工智能玩游戏的基本流程,掌握奖惩机制设计方法。
- 能够调用训练好的模型,实现利用人工智能自动玩游戏。
二、情境导入
如何有效评估人工智能在游戏中的表现?
当人工智能玩游戏时,它是如何从游戏画面中提取信息并做出决策的?
三、核心讲解
本课学习路径:
1分析任务
2选择人工神经网络
3训练模型
4调用模型玩游戏
5分析任务1
1.分析任务
自动玩游戏的模型,对应的核心技术是强化学习。强化学习是一
反馈:根据结果再调整下一步。闭环能对照目标修正,开环则按预设一路执行。
- 种让智能系统(如模型)通过与环境交互,不断学习决策方法的机器
- 学习方式。其基本思想是:智能系统在尝试不同动作的过程中,根据
- 环境提供的反馈调整自身行为,以实现奖励的最大化。
- 为实现这一目标,需要构建完整的训练体系,包括对当前状态的描述、动作的确定以及奖励机制的设计等。
2.分析任务1
奖励机制鼓励尽可能延长生存
分析任务1:先抓住「分析任务1」在做什么,再用例子对照验证。
- 时间并穿越更多障碍物,同时
- 避免危险操作。
- ·未发生碰撞,每帧得0.01分;
- ·成功穿过一根管道,得1分;
- ·若发生碰撞,得-1分。
想一想:·游戏画面分辨率是多少?
3.训练模型
训练过程可视为计算机通过不断尝试玩游戏、积累经验并优
- 化决策的过程。在这个过程中,智能系统并非初始即知晓什么动
- 作是最好的选择,而是通过反复试错,逐步学会在不同状态下做
- 出合理决策。
- 为了实现这一学习过程,强化学习引入了“探索-利用”策略。在训练
- 初期,智能系统主要进行“探索”,即以较高概率随机选择动作,从而广
想一想:探索率一直为0或一直为100%,会发生什么?
弄清以上要点后,再进入下方动手体验,用实际操作验证。
四、动手体验 · MixAI 组件
请在下列组件中完成操作,至少体验一个并记录现象。
组件 model_neural_network_playground — 在框内完成操作
组件 model_connection_parameters — 在框内完成操作
五、课堂总结
- 1.强化学习的原理是让智能系统通过与环境交互不断学习决策方法,以实现奖励的最大化。
- 2.为实现强化学习,需要构建完整的训练体系,包括对当前状态的描述、动作的确定以及奖励机制的设计等。
- 3.训练模型的初期探索率高,智能系统更多随机选择动作进行探索。
- 随着训练的推进,探索率逐步降低,随机动作逐渐减少。
六、拓展提升
拓展:需要对《赛车》游戏中的状态、动作和奖励机制等进行思考和设计。尝试用同样的思路,训练模型玩《赛车》游戏。
测评
完成练习后作答;选出后点「检查」。答错会显示简短说明。
下列哪一项更接近本课学习目标?
本课课堂总结强调的是?
本课主题最贴近下列哪一项?
完成本课后,优先应该做什么来证明学会了?
判断:教学指南中的学习活动可以全部跳过。
拓展提升部分的作用是?
本节小结
回顾本课要点,完成动手体验与测评。记住:训练模型玩游戏。