XMC-GAN：从文本到图像的跨模态对比学习

Posted 2021-06-28 LiveVideoStack_

tags:

篇首语：本文由小常识网(cha138.com)小编为大家整理，主要介绍了XMC-GAN：从文本到图像的跨模态对比学习相关的知识，希望对你有一定的参考价值。

Google提出了一个跨模态对比学习框架来训练用于文本到图像合成的 GAN 模型，用于研究解决生成的跨模态对比损失问题。

文 / Han Zhang, Research Scientist and Jing Yu Koh, Software Engineer, Google Research

原文 / https://ai.googleblog.com/2021/05/cross-modal-contrastive-learning-for.html

从文本到图像的自动生成，如何训练模型仅通过一段文本描述输入就能生成具体的图像，是一项非常具有挑战性的任务。

与其它指导图像创建的输入类型相比，描述性句子是一种更直观、更灵活的视觉概念表达方式。强大的自动文本到图像的生成系统可以成为快速、有效的内容生产、制作工具，用于更多具有创造性的应用当中。

在CVPR 2021中，Google提出了一个跨模态对比生成对抗网络（XMC-GAN），训练用于文本到图像合成的 GAN 模型，通过模态间与模态内的对比学习使图像和文本之间的互信息最大化，解决文本到图像生成的跨模态对比损失问题。

XMC-GAN 文本到图像合成模型中的模态间和模态内对比学习

XMC-GAN 被成功应用于三个具有挑战性的数据集：一个是MS-COCO 图像描述集合，另外两个是用Localized Narratives注释的数据集，一个是包括MS-COCO 图像（称为LN-COCO) ，另一个描述开放图像数据 (LN-OpenImages)。结果显示 XMC-GAN生成图像所描绘的场景相比于使用其它技术生成的图像质量更高，在每个方面都达到了最先进的水平。