单元二 · 文本的智能生成

第7课 文本的语义编码

任务场景
任务场景:文本的语义编码

一、学习目标

  • 掌握通过语义编码反映语义的方法。
  • 掌握动态调整语义编码的方法。
  • 理解相似度的计算方法及其意义。

二、情境导入

这些数字只是编号,无法反映词的含义,因此无法帮助模型理解语义。

该怎么解决这个问题呢?

大语言模型在处理文本时,会先将文本分解为基本单位——词,而分词的结果会对应不同的数字编号。

三、核心讲解

本课学习路径:

1语义与编码
2文本语义编码与相似度

1.语义与编码

用一个数字编号无法充分表示语义特征,研究人员就想到了用一组数

算法:把任务拆成可执行的步骤:弄清输入、处理、输出,再按顺序验证。
  • 字(语义编码)来表示语义特征,进而实现语义上的区分,如表所示。
  • 词 语义编码 词 语义编码
  • 猫 (3,0) 狗 (3,1)
  • 汽车 (2,1) 飞机 (1,3)
  • 参照表格,把语义编码视为二维坐标,绘制在坐标系中。

弄清以上要点后,再进入下方动手体验,用实际操作验证。

四、动手体验 · MixAI 组件

请在下列组件中完成操作,至少体验一个并记录现象。

组件 model_sentiment_analysis — 在框内完成操作

组件 model_word_segmentation — 在框内完成操作

五、课堂总结

  • 可以用一组数表示词语的语义特征,形成语义编码。
  • 如果词的语义编码固定不变,那就无法解决多义词问题。
  • 因此会根据上下文,动态调整语义编码。
  • 获得文本的语义编码后就可以进行多种运算,如相似度运算。
  • 我们可以通过计算距离来衡量相似度,一般来说,距离越小表示文本越相似。

六、拓展提升

拓展:请基于文本语义编码和相似度计算方法设计一个软件,用于自动判断多语种文稿内容的一致性。说出软件的设计思路即可。

测评

完成练习后作答;选出后点「检查」。答错会显示简短说明。

  1. 下列哪一项更接近本课学习目标?

  2. 本课课堂总结强调的是?

  3. 本课主题最贴近下列哪一项?

  4. 完成本课后,优先应该做什么来证明学会了?

  5. 判断:教学指南中的学习活动可以全部跳过。

  6. 拓展提升部分的作用是?

本节小结

回顾本课要点,完成动手体验与测评。记住:文本的语义编码。