← 研究方向DEEPSHARE / RESEARCH

多模态大模型核心技术与研究应用

命名实体识别 信息抽取 知识图谱 多模态大模型 智能体 RAG

课题简介

在生成式人工智能迅猛发展的浪潮中,多模态大模型正逐渐成为下一阶段通用智能系统的关键支柱。CVPR、ACL、ICLR 等顶级会议近年来集中涌现了大量聚焦图文、音视频、3D感知和交互智能的多模态研究成果。以GPT-4V、Gemini和 LLaVA等系统为代表的多模态大模型,正在从“感知驱动”向“推理驱动”演进,不仅成为大厂竞逐的核心技术路线,也带动了学术界对多模态对齐、提示学习、思维链推理与模型幻觉等问题的深入探索。

这一方向具备高度的研究潜力和现实价值。同时,随着医疗、教育、金融、法律等垂直行业对多模态能力的需求爆发,该方向也具备良好的产业落地预期,是未来几年AI科研与落地的交叉结合点。

本课程采用小班制研讨+系统课程框架+研究选题辅导的教学形式,覆盖从基础模型理解到高级建模范式,帮助学生建立起系统的研究视野与方法论。课程将提供多条高潜力研究方向与选题建议,结合文献阅读、研究拆解和选题孵化,辅导学生完成具备投稿潜力的论文草稿或实验系统。课程中,学员将具备独立分析、提出和推进多模态大模型相关研究问题的能力,为后续投稿、项目申请或博士/硕士课题打下扎实基础。

导师介绍

【学校/研究方向】国内Top高校计算机博士,研究方向为多模态表示学习及智能体决策。
在命名实体识别、信息抽取、知识图谱、多模态大模型、智能体、RAG等方向均有实战经验。
工作经历/实习经历:深度参与大语言模型、多模态大模型研究,有稳定且长期的一线大厂多模态大模型研究经验

【科研论文/审稿人】参与多项国家级课题,发表各类论文30余篇,在ACL、CVPR、IJCAI等会议上以第一作者身份发表多篇文章。担任CVPR、ACL、NeurIPS、IJCAI、ICML、ICLR、KDD、ACM MM、IJCAI等会议及期刊的审稿人

【指导经验】
拥有超过2年的深度之眼指导经验及多位师弟师妹的指导经验,累计指导学生超30余人

Skyler老师 · 国内Top高校计算机博士 ↗

可选创新点

(1)基于跨模态注意力融合的图文实体对齐增强机制研究
(2)多模态上下文增强的嵌套实体识别与层次化表示建模
(3)解码过程控制下的多模态幻觉检测与事实纠偏机制
(4)引入结构感知提示的多模态思维链自动生成方法
(5)结合语言+结构提示引导扩散模型的结构可控性研究
(6)基于语义解耦的多模态提示自动生成与精调策略研究

课程亮点

(1)直击多模态领域顶刊核心问题,选题覆盖图文对齐、跨模态生成、推理链建模等方向,紧跟当前生成式AI主流演进路径。
(2)结合真实科研流程,采用“小班精讲+高频研讨+选题指导”机制,在14周内完成从“任务识别→技术路线拆解→实验搭建→论文撰写→投稿策略制定”的科研闭环训练,支持学员完成高质量研究输出或顶会初稿准备。
(3) 提供精选高潜力研究方向清单与选题推荐,可作为博士/硕士课题、顶会投稿、竞赛项目储备。

科研咨询 LET'S TALK RESEARCH

聊聊你的科研计划

微信扫码,与我们沟通研究方向和目标。

请使用微信扫描科研咨询二维码查看二维码原图 ↗
放大图片打开原图 ↗