您所在的位置:首页 新闻资讯

新闻资讯

数据工程与知识工程教育部重点实验室德科讲坛第六期成功举办

image.png

近日,以色列特拉维夫大学教授、ACM Fellow Daniel Cohen-Or在中国人民大学信息楼学术报告厅作题为“On-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion Transformers”的讲座。本次讲座是数据工程与知识工程教育部重点实验室德科讲坛系列讲座第六期,吸引众多师生到场聆听。讲座由重点实验室副主任汪云海教授主持。

image.png

Cohen-Or教授首先回顾了计算机图形学向生成式AI的演进历程。他从早期全CG电影、2009年《阿凡达》的技术突破,讲到2021年进入文本生成图像时代,指出扩散模型实现了从文本提示直接生成高质量图像的技术革命,能够合成训练数据中从未见过的概念。他还分享了自己在个性化概念生成与风格迁移方面的早期探索。

随后,Cohen-Or教授重点剖析了扩散模型生成多样性不足的技术瓶颈。他指出,当前模型在相同提示词下往往产生构图、背景极度相似的图像,存在严重的模式坍塌问题。利用大语言模型生成多样化提示词的方法效果不佳,而传统在潜在空间施加排斥力的方法会导致样本偏离图像流形,造成图像模糊或质量下降。他进一步分析,扩散模型在去噪过程早期阶段就已基本确定图像结构,后续步骤难以对构图进行根本性改变,这限制了多样性生成的窗口期。

image.png

针对上述问题,Cohen-Or教授介绍了团队提出的上下文空间优化方案。他提出在扩散变换器中,文本标记在传播过程中会吸收图像信息,形成一种既包含语义又感知图像的上下文空间。在该空间中对不同样本施加排斥力,仅需在早期步骤进行轻微扰动,即可显著影响最终生成结果。实验表明,该方法在保持图像质量的同时显著提升了生成多样性,涵盖不同视角、季节、构图等,且生成速度极快,无需昂贵的反向传播计算。该方法还具有良好的架构通用性,可应用于图像编辑架构,在编辑任务中实现更丰富的变体。

image.png

在自由交流环节,现场师生就多样性的定义与控制、模型崩溃问题的解决、上下文空间对视频生成等复杂AI应用的推广价值等话题与Cohen-Or教授展开深入交流,现场气氛热烈。

image.png

Cohen-Or教授的报告既有对生成式AI技术瓶颈的深刻剖析,又有对可控生成与创意边界的务实探索,为师生理解扩散模型多样性增强的前沿方法提供了全新视角,也为生成式AI在创意应用中的落地注入了新的思路。