← 研究方向DEEPSHARE / RESEARCH

大模型与视觉任务的通用创新范式

视觉大模型 图像/视频生成 图像处理 免训练

课题简介

从微观的技术来看当下的模型在CNN和Transformer架构下实际上网络的创新已经停滞了,通过更大的参数量和数据集换来更优秀的效果和落地其实更多的是对任务的设计和拓展,而通过在一个成熟的baseline里塞attention或者简单的改造即使涨点了我们也难以将它变成从工程代码变成一个学术研究论文。

因此作为一个科研人, 我们要从宏观网络的架构思考为什么同样的技术可以在不同的方向里持续产生论文,一个好的idea对应的是应该是故事而不是代码。这也就是为什么有些工作可以拼接中顶会,为什么有些论文不训练也可以中稿,如果这样的思路拿到我们自己的任务中那必定是一个很高级别的创新。因为我们的目标是学着成为产出这样创新方式的人群。

本课程在设计时主要希望以更宏观且新颖的角度理解深度学习所谓的“贡献”和任务之间的关系,一门课理清视觉任务之间的爱恨情仇和贡献,而上述问题的答案和套路也将在本课程中去传递给同学们。

同时在课程的论文安排上,除了经典论文,会最大化引入近期顶会中的论文以及Arxiv放出来的相关论文,以最新的论文内容讲解创新点的产生,以及论文的书写范式,确保每期课程和每个同学的idea都紧跟前沿。

导师介绍

【学校/研究方向/工作】
新兴独角兽企业高级视觉算法研究员,主要研究包括大视觉模型LVM、AIGC、图像和视频处理等多个前沿领域,兼顾产业落地的同时,发掘研究上的痛点转化为学术论文探索,目前在业内主导AIGC相关的产品设计和研发。

【科研论文/审稿人】
在ICLR、NIPS、ICCV、ACM MM,AAAI,TIP,TMM等顶级刊物上发表10余篇论文,持有多项发明专利,并持续参与一线的科研工作。

【指导经验】
深度之眼明星导师,累计指导30期左右的小班,10余位1V1学员。在教学上能够针对不同基础、不同阶段的学员做出个性化、有针对性的指导,曾指导小班学员中稿CVPR、ECCV、ICML等顶会、本科学员中稿顶刊TGRS、0基础学员中稿PG等顶级刊物。

【指导特点】
吉米老师教学经验丰富,擅长将不同任务与视觉任务进行结合,挖掘特性,发表文章。老师的授课内容会随着学术界最新研究进展进行动态更新,讲解课程任务之外的技术,确保学生在掌握课程内容的同时,还能追踪到学术前沿,同时针对问题进行分析探讨,避免过时或“撞idea”的情况。带领同学们在新的领域进行探索,发现更多更有创意更有价值的idea。能够做到授人以渔,教会大家掌握如何发现idea、迁移idea的技巧。

吉米老师 · 新兴独角兽企业高级视觉算法研究员 ↗

可选创新点

(1)免训练的可控、个性化文生图模型
(2)扩散模型下的图像编辑任务
(3)扩散模型下的图像重建任务(去雨,去雾,超分辨率等)
(4)扩散模型下的虚拟换装任务
(5)从数据生成角度看下游任务(目标检测,语义分割)

课程亮点

(1)锁定领域前沿:
解锁《CVPR》《AAAI》《TIP》《ICCV》等顶会顶刊青睐的AI研究新范式,用思想驱动idea覆盖各种视觉任务。
(2)科研实战导向:
用全新的授课方式带大家梳理何为idea,14周课程全程串连,从横向的任务技术创新到纵向的迁移创新,带大家体会科研大组的文章产出速度:在没有模型的时候论文前三章已经定稿的效率。
课程摆脱传统经典论文和老论文的研读,而是以最新中的顶会顶刊结合最新的Arxiv论文配合,既分析顶会论文如何中和做的事,又可以看到没中的新论文是如何做创新的,总是处在领域的最前沿,每一期课程都是独特的。
(3)定制化答疑
除了课堂上的内容答疑,会针对每个学生在初次meeting后提前制定一个学习计划,将课堂上的改进提前和同学沟通,在此期间每个同学既可以学到宽泛前沿的知识,也可以体会到如何将新东西拿到自己领域落实创新的方式。

科研咨询 LET'S TALK RESEARCH

聊聊你的科研计划

微信扫码,与我们沟通研究方向和目标。

请使用微信扫描科研咨询二维码查看二维码原图 ↗
放大图片打开原图 ↗