单元六

第20课 敏感信息能不能采——隐私诚信与安全

任务场景:敏感信息要保护,不能随便采集
任务场景:敏感信息要保护,不能随便采集

一、任务目标

判断哪些字段能采集,守住诚信与安全底线。

二、知识点短列表

  • 不采电话、住址、身份证号、精确成绩单等敏感字段。
  • 不伪造数据刷正确率。
  • 数据不公可能导致结果不公。
  • 最终是否采用结果,人主决定。
  • 「can_collect」:采集前的合规开关。
  • 敏感名单可随规范加长;加长后旧项目要重新审核字段。
  • 返回 False 表示规范不允许,不是“技术做不到”。

三、机器学习在说什么

指南与课堂规范把隐私、诚信放在技术前面。没有合规数据,再漂亮的准确率也不该展示。函数把规范变成可执行检查,避免只停留在口号。

偏见与隐私常结伴:乱采敏感信息,既侵权,也可能引入不相关特征伤害公平。能用“喜欢的运动”就够时,就不要碰电话号码。

全书收束四原则再念一遍:数据说话、例子教学、检验为准、人主决定。外加一句承诺:采集合规、标注诚实、检验认真、选型合理。

把 can_collect 当成校门口的门禁:字段想进来,先刷合规卡。False 不是“技术做不到”,而是“规范不允许”。把电话改成“喜欢的运动”这类低风险字段,项目仍然能做特征,只是更干净。

全册终点不是“会背四大类型”,而是遇到新校园任务时能:五问诊选型→准备合规数据→写或改小函数→用测试说话→人主决定。学完隐私门禁后,下一课再打开一次真实工具箱 sklearn,把 「训练模型」/「模型预测」/正确率与本册手工函数对照——规范在前,库在后。

四、相关积木怎么用

  • 「sensitive = ["家庭住址", "电话", "身份证号", "精确成绩单"]」。
  • 「return field not in sensitive」。
  • 迷你例子:喜欢的运动→True;电话→False。

走查:输入 「can_collect」 → 「True」,因为不在 sensitive 名单。输入 「can_collect」 → 「False」,因为 「field not in sensitive」 为假。

家庭住址、精确成绩单同样 False。可采示例再补:兴趣社团名称。结业抽查:字段表、can_collect 勾选记录、承诺签字,三件缺一不结业。

想一想:字段“身份证号”应返回 True 还是 False?依据是哪份名单?

应返回 False,依据 sensitive 名单。合规流五步再默写:列字段、can_collect、删 False、只采 True、再标注。全书承诺五句齐声:采集合规、标注诚实、检验认真、选型合理、人主决定——与 can_collect 函数一起作为结业门禁。

操作流:列字段→can_collect→删 False→只采 True→再标注训练。电话住址身份证精确成绩单禁止;喜欢的运动等低风险才可进方案。禁止伪造刷分,也禁止先偷采再承诺删除。

要点串讲:敏感字段不采;不造假刷分;偏见可能导致不公;can_collect 是合规门禁;全书落点是选型+合规数据+小函数+测试+人主决定。本课过关标准:字段清单全部过 can_collect,并签署承诺。加练:审核一份含“电话+喜欢的运动”的字段表,用 can_collect 逐项打勾叉,只保留合规字段进入项目。

五、操作步骤

步骤1
列字段写出项目想采集的所有字段。
步骤2
对照敏感名单逐项调用 can_collect。
步骤3
删掉违规项False 的字段从方案中移除。
步骤4
签署承诺诚信标注、认真检验、人主决定。

六、解题思路

任务:判断哪些字段能采集,守住诚信与安全底线。 生活情景:条件不安全时系统拒绝动作并报警——像电梯超载保护,先保安全再干活。 先想清楚:输入是什么、处理后得到什么、屏幕上应出现什么。

本课主要用到:屏幕输出。

  1. 1明确任务「判断哪些字段能采集,守住诚信与安全底线。」:运行后你希望看到什么结果(文字、图形或计算结果)。
  2. 2用「打印」积木把结果说出来,确认屏幕上出现预期内容。
  3. 3把可复用的一段动作做成函数,主程序里调用它。
  4. 4对照参考积木(或代码)跑通后,只改一个参数,观察结果如何变化。

流程示意(可对照左侧文字)

任务:判断哪些字段能…用「打印」积木把结果说出来,…把可复用的一段动作做成函数…对照参考积木(或代码)跑通后,只改一…

七、图形块功能讲解

本课用到的 Mixly 图形块均已在前面的课讲过。请直接对照编程练习搭积木;若有遗忘,回到该积木首次出现的课页复习。

即时验算:喜欢的运动→True;电话→False;身份证号→False。字段表含电话时必须删掉再采集。签署承诺后抽查:有伪造标签或偷采敏感项,项目星章取消。False 是门禁不是建议。承诺五句齐声。可采字段示例包含兴趣社团名称。

sensitive 四项点名:家庭住址、电话、身份证号、精确成绩单。可讨论采集的示例:喜欢的运动、兴趣社团。False=门禁;人主决定=模型结果采不采纳仍由人说了算。两道闸门一起守。

八、课堂练习

先完成两道正误判断,再做其余题目;选出后点「检查」。

  1. 判断:偷偷采集同学家庭电话;或伪造标签刷正确率。

  2. 判断:敏感字段不采;数据真实;结果由人决定是否采用。

  3. 判断:可以偷偷采集同学家庭电话训练模型。

  4. 判断:数据不公可能导致结果不公。

  5. 判断:不能伪造数据来刷高正确率。

  6. 判断:最终是否采用模型结果,应由人决定。

  7. 判断:喜欢的运动这类非敏感字段通常可讨论采集。

九、知识点讲解

数据与诚信:能采什么、不能采什么要先立规矩;不安全时系统应拒绝并提示。
  • 能用自己的话复述:输入是什么、按什么规则变、输出应怎样。
  • 练习时改一处、看一处,确认现象和概念对得上。

先弄清本课输入与输出,再进编程练习对照现象。

十、编程练习

用下拉列表切换题目;下方 Mixly 默认显示图形化积木。请在 Mixly 工具栏点「运行」;「检查」读取 Mixly 代码自动判题。

参考代码(对照抄写到下方 Mixly)
def can_collect(field):
    sensitive = ["家庭住址", "电话", "身份证号", "精确成绩单"]
    return field not in sensitive

print(can_collect("喜欢的运动"))
print(can_collect("电话"))

我承诺:采集合规、标注诚实、检验认真、选型合理、人主决定。

十一、本节小结

你现在能实现 can_collect:敏感字段返回 False,合规字段返回 True,并坚持不造假、人主决定;sensitive 四项能点名;门禁与人主两道闸。测。