课题简介
本课程紧扣 CVPR 2025 高频关键词—“多模态大模型”与“扩散模型”,聚焦多模态大模型(如 CLIP、BLIP-2、Sora)与扩散模型(Stable Diffusion、DiT、VideoPoet、DreamGaussian4D)的协同创新,实现文本、图像、视频、三维数据及4D的跨模态生成与深度融合。课程一方面直击最学术前沿的挑战,如模糊指令下的精准图像/视频生成、定制化空间约束下长视频生成、4D生成时空一致性优化、多模态理解与模仿生成等,另一方面以用户角度,挖掘电商、动漫、医疗影像、工业设计、交通场景等真实垂直领域的潜在新任务。学习路径涵盖理论基础、框架创新、模型微调到顶级期刊论文产出的完整流程,直击《CVPR》《ICML》《ACL》等国际顶会的研究前沿范式。
导师介绍
【学校/研究方向/工作经历】国内Top2博士后,计算机科学与技术。海外高层次人才。主要从事机器人视觉感知、大模型应用、多模态智能体等算法研究。曾在上市公司担任算法研发负责人,负责多项低速无人驾驶与机器智能感知项目,均已落地推入市场。
【科研论文/审稿人】:发表多篇ICCV,ACL,MM,ESWA等顶会与期刊论文,第一作者和通讯作者的论文数量二十余篇。担任ESWA,ICCV,CVPR等的审稿工作。
【指导经验】具有丰富的科研项目指导经验,指导师弟、学生中稿ACM MM,ACL,ICCV等会议期刊共7篇,指导硕士毕业论文6篇。
可选创新点
1.定制化空间约束下长视频生成 CCF A/B
2.不定模态下的语义对齐任务 CVPR/ICCV
3.模糊指令下的精准图像/视频生成 CCF A/B
4.4D生成时空一致性优化 CCF A/B
5.多模态理解与模仿生成 ACL/EMNLP(CCF-A)
课程亮点
(1)解锁生成式AI技术栈:系统掌握Diffusion与多模态大模型(如CLIP、BLIP-2、Sora)的融合架构与训练策略,深入实战攻克诸如模糊指令理解、不定模态下的语义对齐任务、4D生成时空一致性优化、定制化空间约束下长视频生成等真实场景下的技术难题,构建面向产业与科研的生成式AI能力体系。
(2)顶会顶刊成果导向:贯通“数据-算法-实验-写作-投稿”,以CVPR/ICLR/NeurIPS等顶级会议录用的标准为标杆,提供从数据预处理、模型创新、实验设计、结果分析到论文撰写与投稿策略的一站式科研实战指导。
(3)科研资源独占性:开放多种垂直领域多模态数据集(医疗、显微镜、暗光、交通、建筑设计等)。
