← 研究方向DEEPSHARE / RESEARCH

Graph Mamba进阶与应用

多模态大模型 视觉基础模型 世界模型 参数高效微调 Mamba 图神经网络 视频理解 动作识别 行人重识别 智慧医疗 AI4Science

课题简介

虽然Transformer作为基础模型架构在各深度学习任务中获得大量应用,但其二次的推理复杂度限制了其在大模型等长序列输入场景下的实际部署。作为一种改进,以Mamba为典型样例的选择性状态空间模型(Selective State Space Model, SSM)近期获得了广泛关注。作为一种新型网络结构,其替换了Transformer中的自注意层,能够实现线性的推理复杂度。然而,鉴于其建模能力的有限,纯Mamba网络结构依然难以在各种任务的精度上超过Transformer,如何在保持线性复杂度下提高Mamba的建模能力成为了一大挑战。另一方面,如何将Mamba更好得应用到视觉、图结构、时序等非文本数据上的探索依然不多。本课题面向Mamba结构与图神经网络(Graph Neural Network, GNN)的结合,探索新一代Graph Mamba网络结构,并扩展其在各类模态下游任务中的应用。

本课程将带领同学们深入学习选择性状态空间模型、图神经网络的基础与进阶知识,讲解Graph Mamba相关的现有论文,鼓励学生通过新的思路和方法对Graph Mamba进行改进并应用于特定领域,力求在学术顶会和期刊上发表高质量论文。

导师介绍

【学校/研究方向】
毕业于Top2高校;上海AI Lab青年研究员、某初创公司CTO,主要研究方向包括多模态大模型、计算机视觉等。牵头开展CAD大模型、医疗多模态大模型、视频理解大模型、AI4Science大模型等领域研究研发。曾在字节跳动参与抖音推荐系统工作,录制《视觉大模型》课程。
【科研论文/审稿人】在计算机视觉和人工智能国际会议/期刊发表论文10余篇,其中在AI领域最高影响因子期刊TPAMI上发表论文数篇,并担任TPAMI、TIP、TMM、CVPR、ICCV、ACM MM、MICCAI等期刊会议审稿人。
【指导经验】累计已指导30余名学员,曾指导学员发表CVPR,多名学员论文在投CCF-A类顶会及SCI顶刊。

【招收学生方向】包括不限于多模态大模型、视觉基础模型、世界模型、参数高效微调、Mamba、图神经网络、视频理解、动作识别、行人重识别、智慧医疗、AI4Science、CAD、事件相机;鼓励学员开展当前最火热和前沿方向的研究。

Jaxton老师 · 上海AI Lab青年研究员 ↗

可选创新点

(1)基于改进动态Graph Mamba网络结构
(2)基于改进异构Graph Mamba网络结构
(3)基于Graph Mamba的视觉基础模型
(4)Graph Mamba在特定图结构任务中的应用
(5)Graph Mamba在特定视觉任务中的应用

课程亮点

(1)非常多宏观的Idea,具体Idea可以依据同学调研情况给出,实际上有相当多可以去尝试的Idea,也会教会大家如何挖掘Idea。
(2)针对每位同学实际做的方向和任务,给出基础baseline,只需要在此基础上修改即可。
(3)课程力求避开繁琐的数学公式和过于空洞的原理,整体来说只要拥有深度学习基础即可入手。核心是帮助大家入门当前炙手可热的Graph Mamba方向,逐步具备科研能力。
(4)课程群有问必答,结合案例、文字、语音等形式,偶尔也会利用线上meeting,用较短时间,较高效率解决同学们的疑问。

科研咨询 LET'S TALK RESEARCH

聊聊你的科研计划

微信扫码,与我们沟通研究方向和目标。

请使用微信扫描科研咨询二维码查看二维码原图 ↗
放大图片打开原图 ↗