单元六

第30课 训练模型玩游戏

一、任务目标

任务场景:第30课
任务场景:第30课 训练模型玩游戏

训练(或调试)一个小游戏策略模型并试玩,能对照胜率/行为说明「训练目标」与「实际表现」是否一致。

二、我们要学什么

  • 游戏状态可表示成向量
  • 小网络可根据状态选择动作

三、操作步骤

1先手动玩游戏
2观察状态数值
3看网络如何决策
4训练后让 AI 自动玩

四、网页体验

网页体验:躲避障碍游戏

用键盘或按钮控制角色避开障碍。

网页体验:游戏状态分析

观察当前状态向量如何描述局面。

网页体验:小神经网络

查看简易网络如何把状态映射到动作。

网页体验:训练后自动玩

点训练,看策略在模拟环境中变好。

五、知识点讲解

模型是从数据里学到的可复用规则;训练就是用带标签(或可反馈)的数据不断调整,使预测越来越准。要分清:训练看的是「学习过程」,测试看的是「没见过的新例子行不行」。

先弄清本课输入与输出,再进编程练习对照现象。

六、课堂练习

先完成两道正误判断,再做其余题目;选出后点「检查」。

  1. 判断:只点体验按钮,说不清「AI 做了什么、人做了什么」。

  2. 判断:每完成一次体验,用一句话说清本课要点「躲避障碍游戏与小网络训练」,并区分生成结果与你的判断。

  3. 游戏状态向量可包含?

  4. 用网络选择动作属于?

  5. 训练后自动玩是为了?

七、本节小结

第30课「训练模型玩游戏」:先场景、再体验、后反思。