单元二 · 文本的智能生成

第5课 文本处理的基本单位

任务场景
任务场景:文本处理的基本单位

一、学习目标

  • 理解人工智能处理自然语言时的基本单位。
  • 了解人与机器分词的差异。
  • 了解一种自动构建词表的算法思想。
  • 了解一种自动分词算法的实现过程。

二、情境导入

人工智能是如何理解人类语言的呢?

要理解这一问题,就要先来了解人工智能理解人类语言的基本单位。

情境导入尝试利用下面卡片中的词语,组成不同的句子。

三、核心讲解

本课学习路径:

1词与分词
2自动构建词表
3自动分词

1.词与分词

把文本切分成基本单位的过程,就是分词。人对句子分词,主要依靠自

算法:把任务拆成可执行的步骤:弄清输入、处理、输出,再按顺序验证。
  • 身的语言能力。
  • 文本:像刚睡醒一样,眼都张开了,一切欣欣然的样子。
  • 分词:像/刚/睡醒/一样/,/眼/都/张开/了/,/一切/欣欣然/的/样子/。
  • 机器分词的结果可能差异很大。
  • 得到适合人理解的词,如绘制词云时的词;

弄清以上要点后,再进入下方动手体验,用实际操作验证。

四、动手体验 · MixAI 组件

请在下列组件中完成操作,至少体验一个并记录现象。

组件 model_word_segmentation — 在框内完成操作

五、课堂总结

  • 人工智能处理文本时的基本单位为记号(token),日常称其为词或词元。
  • 基于词频统计的分词方法,广泛应用于现代人工智能语言模型中。
  • 机器并不是“理解”句子的意思,而是通过统计和计算词语出现的可能性来完成分词。

六、拓展提升

拓展:假如你是一名人工智能研究员,现在遇到了一个有趣的挑战:有一段来自古代的神秘文字,没人知道它的语言规则,也没有现成的词表可以参考。任务是想办法从这段陌生文本中找出可能的“词”,进而建立初步的词表。

测评

完成练习后作答;选出后点「检查」。答错会显示简短说明。

  1. 下列哪一项更接近本课学习目标?

  2. 本课课堂总结强调的是?

  3. 本课主题最贴近下列哪一项?

  4. 完成本课后,优先应该做什么来证明学会了?

  5. 判断:教学指南中的学习活动可以全部跳过。

  6. 拓展提升部分的作用是?

本节小结

回顾本课要点,完成动手体验与测评。记住:文本处理的基本单位。