1.论文标题: Generative Image Dynamics

论文作者:

Zhengqi Li, Richard Tucker, Noah Snavely, Aleksander Holynski (Google Research)

论文链接:

https://arxiv.org/pdf/2309.07906

内容简介:

提出了一种创新方法,用于从单张RGB图像中生成自然振荡动态,如树木、花朵和衣物随风摆动。研究者们通过学习真实视频序列中提取的运动轨迹,在傅里叶域中建立一个称为“光谱体积”的密集、长期运动表示。利用这一表示,结合扩散模型,可以从单张图像预测出整个视频的运动纹理,进而通过图像基础渲染技术生成动画。该方法不仅能创建无缝循环视频,还能实现用户与真实图像中对象的交互式动态模拟,显著提升了从静态图像生成动态内容的逼真度和应用范围。

方法论:

作者提出了一种基于图像空间先验的场景运动建模方法。

该先验从真实视频序列中提取的运动轨迹中学习得到,并在傅里叶域中将长期运动建模为光谱体积(spectral volumes),这种表示方法适合于扩散模型进行预测。给定单张图像,训练好的模型使用频率协调的扩散采样过程来预测光谱体积,然后可以将其转换为跨越整个视频的运动纹理。

光谱体积:光谱体积是一种运动表示方法,它将每个像素的运动轨迹表示为频域中的复数傅里叶系数。这种方法对于表现出振荡动态的场景非常适用,如风中的树木和花朵。作者发现,这种表示方法也非常适合作为扩散模型输出,用于模拟场景运动。

 

扩散模型:

作者使用潜在扩散模型(LDM)来预测输入图像的光谱体积。该模型通过迭代去噪过程,从高斯噪声中逐步恢复出预测的光谱体积。在训练过程中,模型学习如何从噪声中恢复出真实的光谱体积,而在推理过程中,则使用这一能力来从单张图像预测运动。

图像基础渲染:

预测出的光谱体积通过逆傅里叶变换转换为时域运动纹理,然后使用神经图像基础渲染技术(IBR)来渲染未来帧。这种方法可以处理前向变形可能导致的空洞问题,并能够根据预测的运动场对输入图像进行变形。

 

应用:

该方法不仅可以从单张图片生成无缝循环视频,还可以通过图像空间模态基底实现对真实图像中对象的交互式动态模拟,响应用户输入,如拖动和释放点。

实验与结果:

作者在多个下游应用中展示了训练模型的使用,包括创建无缝循环视频、编辑生成的运动以及通过图像空间模态基底启用交互式动态图像。与基于原始RGB像素的先验相比,基于运动的先验能够更有效地解释像素值的长期变化,从而实现更连贯的长期生成和对动画的更细粒度控制。

2.论文标题: Rich Human Feedback for Text-to-Image Generation

论文作者:

Youwei Liang, Junfeng He, Gang Li, Peizhao Li, Arseniy Klimovskiy, Nicholas Carolan, Jiao Sun, Jordi Pont-Tuset, Sarah Young, Feng Yang, Junjie Ke, Krishnamurthy Dj Dvijotham, Katherine M. Collins, Yiwen Luo, Yang Li, Kai J Kohlhoff, Deepak Ramachandran, Vidhya Navalpakkam

论文链接:

Liang_Rich_Human_Feedback_for_Text-to-Image_Generation_CVPR_2024_paper.pdf

内容简介:

这篇论文针对文本到图像(T2I)生成模型在生成高分辨率图像时存在的问题,如图像失真、与文本描述不一致以及审美质量问题,提出了一种新的解决方案。研究者们通过收集丰富的人类反馈来增强对生成图像的评价,并利用这些反馈来改进图像生成过程。

详细介绍:

1.数据收集(RichHF18K):

研究者们收集了18,000张生成图像的丰富人类反馈,包括:

  • 标记图像中不合理或与文本描述不一致的区域。

  • 标注文本提示中在图像中未被表现或表现错误的单词。

  • 提供图像合理性、文本-图像对齐、审美以及整体评分的细粒度评分。

这些反馈通过一个网络界面收集,由三个标注者对每张图像-文本对进行标注,以提高反馈的可靠性。

2.模型设计(RAHF):

  • 论文提出了一个基于视觉-语言模型的多模态变换器(RAHF),该模型结合了Vision Transformer (ViT) 和 T5X模型。

  • 模型使用自注意力机制来融合图像和文本信息,预测不合理和不一致的区域、关键词不匹配序列以及细粒度评分。

 

3.预测应用:

使用RAHF模型预测的丰富人类反馈来改进图像生成,具体方法包括:

  • 利用预测的热图作为掩码进行区域修复(inpainting),以改善问题区域的图像质量。

  • 使用预测的评分来帮助微调图像生成模型,例如通过选择或过滤微调数据,或作为奖励指导。

4.模型优化:

  • 模型训练使用了像素级均方误差(MSE)损失函数,用于热图预测和评分预测。

  • 对于关键词不匹配序列预测,模型使用教师强制交叉熵损失函数。

  • 最终损失函数是这些损失的加权组合。

 

 

5.实验结果:

  • 实验结果表明,RAHF模型在预测丰富人类反馈方面表现优异,与人类标注高度相关。

  • 通过预测的丰富人类反馈改进的图像生成质量得到了提高,证明了RAHF模型的泛化能力,即使在与训练集不同的模型上也能取得改进。

结论与局限性:

尽管论文中提出的方法取得了令人兴奋的结果,但也存在一些局限性,例如模型在预测文本-图像不一致热图方面的表现不如预测不合理热图,可能由于不一致区域的标注噪声较大。此外,论文提出的方法主要基于Pick-a-Pic数据集,未来工作可以探索在更多类型的生成模型上应用这些方法,并探索如何利用预测的热图或评分作为奖励信号来微调生成模型。论文希望RichHF-18K数据集和提出的模型能够激发未来在这一领域的研究。

希望这些论文能帮到你!如果觉得有用,记得点赞关注哦~ 后续还会更新更多论文合集!!

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐