单元二 · 文本的智能生成
第7课 文本的语义编码

一、学习目标
- 掌握通过语义编码反映语义的方法。
- 掌握动态调整语义编码的方法。
- 理解相似度的计算方法及其意义。
二、情境导入
这些数字只是编号,无法反映词的含义,因此无法帮助模型理解语义。
该怎么解决这个问题呢?
大语言模型在处理文本时,会先将文本分解为基本单位——词,而分词的结果会对应不同的数字编号。
三、核心讲解
本课学习路径:
1语义与编码
2文本语义编码与相似度
1.语义与编码
用一个数字编号无法充分表示语义特征,研究人员就想到了用一组数
算法:把任务拆成可执行的步骤:弄清输入、处理、输出,再按顺序验证。
- 字(语义编码)来表示语义特征,进而实现语义上的区分,如表所示。
- 词 语义编码 词 语义编码
- 猫 (3,0) 狗 (3,1)
- 汽车 (2,1) 飞机 (1,3)
- 参照表格,把语义编码视为二维坐标,绘制在坐标系中。
弄清以上要点后,再进入下方动手体验,用实际操作验证。
四、动手体验 · MixAI 组件
请在下列组件中完成操作,至少体验一个并记录现象。
组件 model_sentiment_analysis — 在框内完成操作
组件 model_word_segmentation — 在框内完成操作
五、课堂总结
- 可以用一组数表示词语的语义特征,形成语义编码。
- 如果词的语义编码固定不变,那就无法解决多义词问题。
- 因此会根据上下文,动态调整语义编码。
- 获得文本的语义编码后就可以进行多种运算,如相似度运算。
- 我们可以通过计算距离来衡量相似度,一般来说,距离越小表示文本越相似。
六、拓展提升
拓展:请基于文本语义编码和相似度计算方法设计一个软件,用于自动判断多语种文稿内容的一致性。说出软件的设计思路即可。
测评
完成练习后作答;选出后点「检查」。答错会显示简短说明。
下列哪一项更接近本课学习目标?
本课课堂总结强调的是?
本课主题最贴近下列哪一项?
完成本课后,优先应该做什么来证明学会了?
判断:教学指南中的学习活动可以全部跳过。
拓展提升部分的作用是?
本节小结
回顾本课要点,完成动手体验与测评。记住:文本的语义编码。