单元六
第20课 敏感信息能不能采——隐私诚信与安全

一、任务目标
判断哪些字段能采集,守住诚信与安全底线。
二、知识点短列表
- 不采电话、住址、身份证号、精确成绩单等敏感字段。
- 不伪造数据刷正确率。
- 数据不公可能导致结果不公。
- 最终是否采用结果,人主决定。
- 「can_collect」:采集前的合规开关。
- 敏感名单可随规范加长;加长后旧项目要重新审核字段。
- 返回 False 表示规范不允许,不是“技术做不到”。
三、机器学习在说什么
指南与课堂规范把隐私、诚信放在技术前面。没有合规数据,再漂亮的准确率也不该展示。函数把规范变成可执行检查,避免只停留在口号。
偏见与隐私常结伴:乱采敏感信息,既侵权,也可能引入不相关特征伤害公平。能用“喜欢的运动”就够时,就不要碰电话号码。
全书收束四原则再念一遍:数据说话、例子教学、检验为准、人主决定。外加一句承诺:采集合规、标注诚实、检验认真、选型合理。
把 can_collect 当成校门口的门禁:字段想进来,先刷合规卡。False 不是“技术做不到”,而是“规范不允许”。把电话改成“喜欢的运动”这类低风险字段,项目仍然能做特征,只是更干净。
全册终点不是“会背四大类型”,而是遇到新校园任务时能:五问诊选型→准备合规数据→写或改小函数→用测试说话→人主决定。学完隐私门禁后,下一课再打开一次真实工具箱 sklearn,把 「训练模型」/「模型预测」/正确率与本册手工函数对照——规范在前,库在后。
四、相关积木怎么用
- 「sensitive = ["家庭住址", "电话", "身份证号", "精确成绩单"]」。
- 「return field not in sensitive」。
- 迷你例子:喜欢的运动→True;电话→False。
走查:输入 「can_collect」 → 「True」,因为不在 sensitive 名单。输入 「can_collect」 → 「False」,因为 「field not in sensitive」 为假。
家庭住址、精确成绩单同样 False。可采示例再补:兴趣社团名称。结业抽查:字段表、can_collect 勾选记录、承诺签字,三件缺一不结业。
想一想:字段“身份证号”应返回 True 还是 False?依据是哪份名单?
应返回 False,依据 sensitive 名单。合规流五步再默写:列字段、can_collect、删 False、只采 True、再标注。全书承诺五句齐声:采集合规、标注诚实、检验认真、选型合理、人主决定——与 can_collect 函数一起作为结业门禁。
操作流:列字段→can_collect→删 False→只采 True→再标注训练。电话住址身份证精确成绩单禁止;喜欢的运动等低风险才可进方案。禁止伪造刷分,也禁止先偷采再承诺删除。
要点串讲:敏感字段不采;不造假刷分;偏见可能导致不公;can_collect 是合规门禁;全书落点是选型+合规数据+小函数+测试+人主决定。本课过关标准:字段清单全部过 can_collect,并签署承诺。加练:审核一份含“电话+喜欢的运动”的字段表,用 can_collect 逐项打勾叉,只保留合规字段进入项目。
五、操作步骤
六、解题思路
任务:判断哪些字段能采集,守住诚信与安全底线。 生活情景:条件不安全时系统拒绝动作并报警——像电梯超载保护,先保安全再干活。 先想清楚:输入是什么、处理后得到什么、屏幕上应出现什么。
本课主要用到:屏幕输出。
- 1明确任务「判断哪些字段能采集,守住诚信与安全底线。」:运行后你希望看到什么结果(文字、图形或计算结果)。
- 2用「打印」积木把结果说出来,确认屏幕上出现预期内容。
- 3把可复用的一段动作做成函数,主程序里调用它。
- 4对照参考积木(或代码)跑通后,只改一个参数,观察结果如何变化。
流程示意(可对照左侧文字)
七、图形块功能讲解
本课用到的 Mixly 图形块均已在前面的课讲过。请直接对照编程练习搭积木;若有遗忘,回到该积木首次出现的课页复习。
即时验算:喜欢的运动→True;电话→False;身份证号→False。字段表含电话时必须删掉再采集。签署承诺后抽查:有伪造标签或偷采敏感项,项目星章取消。False 是门禁不是建议。承诺五句齐声。可采字段示例包含兴趣社团名称。
sensitive 四项点名:家庭住址、电话、身份证号、精确成绩单。可讨论采集的示例:喜欢的运动、兴趣社团。False=门禁;人主决定=模型结果采不采纳仍由人说了算。两道闸门一起守。
八、课堂练习
先完成两道正误判断,再做其余题目;选出后点「检查」。
判断:偷偷采集同学家庭电话;或伪造标签刷正确率。
判断:敏感字段不采;数据真实;结果由人决定是否采用。
判断:可以偷偷采集同学家庭电话训练模型。
判断:数据不公可能导致结果不公。
判断:不能伪造数据来刷高正确率。
判断:最终是否采用模型结果,应由人决定。
判断:喜欢的运动这类非敏感字段通常可讨论采集。
九、知识点讲解
- 能用自己的话复述:输入是什么、按什么规则变、输出应怎样。
- 练习时改一处、看一处,确认现象和概念对得上。
先弄清本课输入与输出,再进编程练习对照现象。
十、编程练习
用下拉列表切换题目;下方 Mixly 默认显示图形化积木。请在 Mixly 工具栏点「运行」;「检查」读取 Mixly 代码自动判题。
参考代码(对照抄写到下方 Mixly)
def can_collect(field):
sensitive = ["家庭住址", "电话", "身份证号", "精确成绩单"]
return field not in sensitive
print(can_collect("喜欢的运动"))
print(can_collect("电话"))
正在载入编程环境
正在载入 Mixly 图形化编程环境…
我承诺:采集合规、标注诚实、检验认真、选型合理、人主决定。
十一、本节小结
你现在能实现 can_collect:敏感字段返回 False,合规字段返回 True,并坚持不造假、人主决定;sensitive 四项能点名;门禁与人主两道闸。测。