单元三 · 图像声音与视频的智能生成

第13课 根据文字生成图像

任务场景
任务场景:根据文字生成图像

一、学习目标

  • 了解图文语义对齐的作用。
  • 理解图文语义对齐的基本原理。
  • 知道图文语义对齐在“文生图”过程中的作用。

二、情境导入

利用文字描述搜索图像,思考实现这一功能的思路。

情境导入方法二:由智能系统“理解”图像与文字,然后根据计算得出的相似度,找出符合的图像。

方法一:事先为图像做好文字标注,然后查看用户的输入是否在标注中,从而找出图像。

三、核心讲解

本课学习路径:

1图文语义对齐
2图文语义对齐的应用

1.图文语义对齐

下页表是图文对齐前的相似度

算法:把任务拆成可执行的步骤:弄清输入、处理、输出,再按顺序验证。
  • 得分。为了便于理解,语义编
  • 码简化成了二维坐标形式。
  • “理解”图像与文字,简单来说就是让
  • 表示相同含义的图像和文字更贴近,这
  • 个过程称为图文语义对齐。

弄清以上要点后,再进入下方动手体验,用实际操作验证。

四、动手体验 · MixAI 组件

请在下列组件中完成操作,至少体验一个并记录现象。

组件 model_diffusion_image_generation — 在框内完成操作

组件 model_image_style_features — 在框内完成操作

五、课堂总结

  • 图文语义对齐的过程,可以简单理解为调整文字和图像的语义编码,使其在语义空间中更贴近。
  • 完成图文语义对齐后,就可以对文字和图像的语义编码进行计算,从而实现对文字和图像的理解与匹配。
  • 图文语义对齐有广泛的应用场景,例如用文字搜索图像、根据文字描述生成图像等。

六、拓展提升

拓展:在“传统文化进校园”活动中,同学们参观了传统服饰展览。一位同学对明代女子服饰很感兴趣,但不知道如何准确查找相关图像。

测评

完成练习后作答;选出后点「检查」。答错会显示简短说明。

  1. 下列哪一项更接近本课学习目标?

  2. 本课课堂总结强调的是?

  3. 本课主题最贴近下列哪一项?

  4. 完成本课后,优先应该做什么来证明学会了?

  5. 判断:教学指南中的学习活动可以全部跳过。

  6. 拓展提升部分的作用是?

本节小结

回顾本课要点,完成动手体验与测评。记住:根据文字生成图像。