单元六
第30课 训练模型玩游戏
一、任务目标

训练(或调试)一个小游戏策略模型并试玩,能对照胜率/行为说明「训练目标」与「实际表现」是否一致。
二、我们要学什么
- 游戏状态可表示成向量
- 小网络可根据状态选择动作
三、操作步骤
1先手动玩游戏
2观察状态数值
3看网络如何决策
4训练后让 AI 自动玩
四、网页体验
网页体验:躲避障碍游戏
用键盘或按钮控制角色避开障碍。
网页体验:游戏状态分析
观察当前状态向量如何描述局面。
网页体验:小神经网络
查看简易网络如何把状态映射到动作。
网页体验:训练后自动玩
点训练,看策略在模拟环境中变好。
五、知识点讲解
模型是从数据里学到的可复用规则;训练就是用带标签(或可反馈)的数据不断调整,使预测越来越准。要分清:训练看的是「学习过程」,测试看的是「没见过的新例子行不行」。
先弄清本课输入与输出,再进编程练习对照现象。
六、课堂练习
先完成两道正误判断,再做其余题目;选出后点「检查」。
判断:只点体验按钮,说不清「AI 做了什么、人做了什么」。
判断:每完成一次体验,用一句话说清本课要点「躲避障碍游戏与小网络训练」,并区分生成结果与你的判断。
游戏状态向量可包含?
用网络选择动作属于?
训练后自动玩是为了?
七、本节小结
第30课「训练模型玩游戏」:先场景、再体验、后反思。