← 研究方向DEEPSHARE / RESEARCH

多模态大模型与扩散模型:可控生成的前沿与应用

多模态大模型 扩散模型 视频生成 3D/4D

课题简介

本课程紧扣 CVPR 2025 高频关键词—“多模态大模型”与“扩散模型”,聚焦多模态大模型(如 CLIP、BLIP-2、Sora)与扩散模型(Stable Diffusion、DiT、VideoPoet、DreamGaussian4D)的协同创新,实现文本、图像、视频、三维数据及4D的跨模态生成与深度融合。课程一方面直击最学术前沿的挑战,如模糊指令下的精准图像/视频生成、定制化空间约束下长视频生成、4D生成时空一致性优化、多模态理解与模仿生成等,另一方面以用户角度,挖掘电商、动漫、医疗影像、工业设计、交通场景等真实垂直领域的潜在新任务。学习路径涵盖理论基础、框架创新、模型微调到顶级期刊论文产出的完整流程,直击《CVPR》《ICML》《ACL》等国际顶会的研究前沿范式。

导师介绍

【学校/研究方向/工作经历】国内Top2博士后,计算机科学与技术。海外高层次人才。主要从事机器人视觉感知、大模型应用、多模态智能体等算法研究。曾在上市公司担任算法研发负责人,负责多项低速无人驾驶与机器智能感知项目,均已落地推入市场。
【科研论文/审稿人】:发表多篇ICCV,ACL,MM,ESWA等顶会与期刊论文,第一作者和通讯作者的论文数量二十余篇。担任ESWA,ICCV,CVPR等的审稿工作。
【指导经验】具有丰富的科研项目指导经验,指导师弟、学生中稿ACM MM,ACL,ICCV等会议期刊共7篇,指导硕士毕业论文6篇。

Bengt老师 · 国内Top2博士后 ↗

可选创新点

1.定制化空间约束下长视频生成 CCF A/B
2.不定模态下的语义对齐任务 CVPR/ICCV
3.模糊指令下的精准图像/视频生成 CCF A/B
4.4D生成时空一致性优化 CCF A/B
5.多模态理解与模仿生成 ACL/EMNLP(CCF-A)

课程亮点

(1)解锁生成式AI技术栈:系统掌握Diffusion与多模态大模型(如CLIP、BLIP-2、Sora)的融合架构与训练策略,深入实战攻克诸如模糊指令理解、不定模态下的语义对齐任务、4D生成时空一致性优化、定制化空间约束下长视频生成等真实场景下的技术难题,构建面向产业与科研的生成式AI能力体系。
(2)顶会顶刊成果导向:贯通“数据-算法-实验-写作-投稿”,以CVPR/ICLR/NeurIPS等顶级会议录用的标准为标杆,提供从数据预处理、模型创新、实验设计、结果分析到论文撰写与投稿策略的一站式科研实战指导。
(3)科研资源独占性:开放多种垂直领域多模态数据集(医疗、显微镜、暗光、交通、建筑设计等)。

科研咨询 LET'S TALK RESEARCH

聊聊你的科研计划

微信扫码,与我们沟通研究方向和目标。

请使用微信扫描科研咨询二维码查看二维码原图 ↗
放大图片打开原图 ↗