单元二 · 文本的智能生成
第5课 文本处理的基本单位

一、学习目标
- 理解人工智能处理自然语言时的基本单位。
- 了解人与机器分词的差异。
- 了解一种自动构建词表的算法思想。
- 了解一种自动分词算法的实现过程。
二、情境导入
人工智能是如何理解人类语言的呢?
要理解这一问题,就要先来了解人工智能理解人类语言的基本单位。
情境导入尝试利用下面卡片中的词语,组成不同的句子。
三、核心讲解
本课学习路径:
1词与分词
2自动构建词表
3自动分词
1.词与分词
把文本切分成基本单位的过程,就是分词。人对句子分词,主要依靠自
算法:把任务拆成可执行的步骤:弄清输入、处理、输出,再按顺序验证。
- 身的语言能力。
- 文本:像刚睡醒一样,眼都张开了,一切欣欣然的样子。
- 分词:像/刚/睡醒/一样/,/眼/都/张开/了/,/一切/欣欣然/的/样子/。
- 机器分词的结果可能差异很大。
- 得到适合人理解的词,如绘制词云时的词;
弄清以上要点后,再进入下方动手体验,用实际操作验证。
四、动手体验 · MixAI 组件
请在下列组件中完成操作,至少体验一个并记录现象。
组件 model_word_segmentation — 在框内完成操作
五、课堂总结
- 人工智能处理文本时的基本单位为记号(token),日常称其为词或词元。
- 基于词频统计的分词方法,广泛应用于现代人工智能语言模型中。
- 机器并不是“理解”句子的意思,而是通过统计和计算词语出现的可能性来完成分词。
六、拓展提升
拓展:假如你是一名人工智能研究员,现在遇到了一个有趣的挑战:有一段来自古代的神秘文字,没人知道它的语言规则,也没有现成的词表可以参考。任务是想办法从这段陌生文本中找出可能的“词”,进而建立初步的词表。
测评
完成练习后作答;选出后点「检查」。答错会显示简短说明。
下列哪一项更接近本课学习目标?
本课课堂总结强调的是?
本课主题最贴近下列哪一项?
完成本课后,优先应该做什么来证明学会了?
判断:教学指南中的学习活动可以全部跳过。
拓展提升部分的作用是?
本节小结
回顾本课要点,完成动手体验与测评。记住:文本处理的基本单位。