读点论文 —— ControlNet
Kelmory 2/18/2023 计算机视觉扩散模型
以门外之人的身份,回到许久未见的图像生成领域,去遇见惊艳的ControlNet。
# 背景 扩散模型在近两年的大热里向世人展示了AI绘画的强大潜能。这一领域的发展,从前期通过CLIP实现多模态学习,让模型能够根据图片内容输出文本或是根据文本寻找最接近描述的图片;到OpenAI、Google等组织借助扩散模型、VAE的理念,相继产出文本到图片的生成模型;再到Midjourney、SD-WebUI等应用把AI绘画带入人们的视野;到现在很有潜力的ControlNet;给了我们丰富的畅想空间。也许在不久之后,这些应用就能够真正地成为画师们得力的辅助工具,大大减少中作画花费的精力(被正确使用的前提下)。
论文第一作者Lvmin Zhang此前在图像生成、数字绘画领域已有一系列文章,本次带来的ControlNet更上一层楼。ControlNet在文本到图像的基础上实现了对图像内容的更直观、更明确的控制。通过参考图片,ControlNet使人们能够通过简单直观的操作实现更容易满足目标的AI作画。
# 论文开读
# 引言
ControlNet要解决的问题是什么?
# 相关工作
已有工作有哪些进步和不足