← 研究方向DEEPSHARE / RESEARCH

AIGC时代下GAN与Diffusion的多领域研究

AIGC 生成式 图像重建 Diffusion

课题简介

随着人工智能技术的蓬勃发展,深度学习被应用到越来越多的科学领域。近些年随着AIGC概念的兴起,图像智能迎来了一轮新的发展,围绕着Diffusion图像生成衍生出了更多的学术方向和机会。但在当下学术环境中更看重论文的故事性,因此如何选择合适的故事成为了发表论文最重要的一环。在本课程中将结合现实世界中的问题切入引申为学术问题从而引入模型和解决方案,从故事的改变看AIGC时代下的论文如何撰写。

本课程创新性的将GAN与Diffusion模型放在一起进行讨论,正如同CNN和Transofmer作为工具都可以发论文一样,Diffusion的出现也不会阻碍GAN发论文。同时每种架构都可以在不同的领域产出论文,本课程通过引入实例对比分析的方式突出学术故事的重要性和学习论文发表的技巧,让大家除了学习到最前沿的论文同时思考在当下如何针对不同的领域进行更优质的创新。

除了常见的GAN引申出来的任务可以用Diffusion进行做,AIGC时代下数据的生成和下游任务(目标检测,语义分割,行人识别等)的应用也逐渐显露头角,本课程也会针对如何将生成式模型和下游任务结合进行探讨和分析,包括不限于传统的图像任务(检测,分割,姿态估计,生成式)以及视频类任务。真正意义上追寻AIGC时代下GAN与Diffusion的多领域研究!

导师介绍

[资历与方向]
新兴独角兽企业高级视觉算法研究员,主要研究领域包括图像和视频的目标检测,姿态估计,图像分割,GAN,AIGC和大视觉模型LVM 等多个前沿视觉算法研究,兼顾业务落地的同时发觉算法痛点转化为学术论文探索,目前主导AIGC相关的产品设计和研发。
科研论文/审稿人:包括但不限于在ICCV、ACM MM,AAAI,TIP,TMM等顶级刊物上发表多篇论文,并持有多项发明专利。
指导经验:为深度之眼论文指导明星导师,累计指导30期左右的小班,10位左右的1V1学员。在教学上针对不同基础、不同阶段的学员,有着丰富的指导经验。在研究上,对于主流视觉算法皆有授课经验,主要指导目标检测,姿态估计,GAN,Diffusion,AIGC、视频生成等研究与课程。
招收学生方向:深度学习中主流的各类课题,包括但不限于大视觉模型、图像视频、目标检测、图像分割、姿态估计等任务。

[教学特点]
吉米老师有丰富多样化的教学经验,对于不同基础的同学有成熟的指导体系,同时擅长将不同任务与视觉任务进行结合,讲授除了课程任务之外的技术,匹配不同方向上的同学课题。同时每期课程会随着学术界的发展动态调整内容,保证学生在学到基础科研和idea的时候,还能追踪学术前沿并且针对问题进行分析探讨,防止过时或“撞idea”的情况。
同时授人以渔,教会大家掌握如何发现idea、迁移idea的要领,而不是单纯拘泥于一两个具体的idea。

[指导成果]
主攻深度之眼小班指导,研究方向为深度学习在目标检测,姿态估计,GAN,AIGC生成式的学术论文以及落地应用。学员们的文章投稿至各类方向包括不限于医学,农学,遥感和计算机等方向,投稿的区位基本在1-4区,包括但不限于TGRS、ICCV,ECCV等顶刊顶会。

吉米老师 · 新兴独角兽企业高级视觉算法研究员 ↗

可选创新点

a)利用GAN&扩散模型进行超分辨率任务的创新
b)利用GAN&扩散模型进行图像修复任务的创新
c)利用GAN&扩散模型进行去雨去雾任务的创新
d)通过生成式模型的生成数据促进下游任务的发展(未来热点)
e)免训练的生成式模型(今年热点)
f)语义理解更强的生成式模型
g)更可控的视频生成

课程亮点

(1)非常多实用的Idea,现在其实单看模型差距很小,但这些技术却源源不断的中论文,核心因素便是故事的构成驱动模型的设计。在课程里也是主要以已经发表的论文切入分析没做好以及还没做的事情,将这些事情转化为技术构成,最终产出论文;
(2)在课程的引导下会基于相关研究方向和其他子方向的baseline组成一个有故事的pipeline也是课程的主要特色;
(3)课程力求避开繁琐的数学公式和过于空洞的原理,结合近两年顶会顶刊结合现实问题的角度,利用故事驱动模型;
(4)课前一次1h左右的详细meeting,提前帮同学解答选题问题和解答疑问,阐述授课风格;线上课程主要利用论文发掘故事和模型设计,帮助同学规划好论文框架,讲好论文故事;
(5)私人群有问必答,结合案例、文字、语音条等形式,偶尔也会利用短时间的线上meeting解决同学们的疑问。

科研咨询 LET'S TALK RESEARCH

聊聊你的科研计划

微信扫码,与我们沟通研究方向和目标。

请使用微信扫描科研咨询二维码查看二维码原图 ↗
放大图片打开原图 ↗