课题简介
伴随数字化与智能化加速落地,通用目标检测正在为城市、工业、医疗、交通等行业创造实在价值;同时正与扩散模型(可生成“难例”做数据增强)、混合专家模型(不同“专家”各司其职)和多模态大模型(同时理解图像与文字/传感器)深度融合,应用空间持续放大。各行业都在用“检测 + 场景 + 新技术”升级,新的问题、数据与需求不断涌现。
本课程围绕“通用检测框架 + 多场景实战 + 科研规范”。我们将跑通遥感/船舶(SAR:合成孔径雷达;可见光)、安检 X 光、医学影像、交通/自动驾驶、工业质检与多模态(RGB–IR/Depth/LiDAR/文本)等代表性场景,聚焦小目标、遮挡、跨域、低对比、长尾、端侧实时等常见痛点,统一评测协议与强基线,做可复现的场景化实验,帮助你尽快确定选题与技术路线。
同步引入前沿能力:Diffusion 扩散模型(难例合成/小样本增强)、MoE 混合专家模型路由(多场景分工协作)、视觉–语言模型融合、AI Agent(代理模型)(自动化检索/实验/评测协同)、时空与 BEV 鸟瞰表征;并配套蒸馏/量化/剪枝等部署技巧与可解释性/一致性评测。课程将从方法与实验两端结合可解释性与一致性视角,着力提升模型在真实环境中的鲁棒性,帮助同学明确兴趣方向、形成研究选题,并产出具有可复现性的研究与应用成果。
导师介绍
【资历和方向】
世界TOP10高校,资深算法研究员,担任工信部项目评审专家,兼任某500强央企区域首席AI算法培训专家。作为一线导师,亲自动手写代码,带领团队开源了多个在GitHub上拥有1K+星的项目。研究方向包括AIGC图像/视频生成与编辑(包括对抗生成网络GAN、变分自动编码器VAE、扩散模型Diffusion Model)、开放世界目标检测/分割(包括医学、遥感、SAR图像等)、以及大模型安全、多模态定位检索(包括行人/车辆重识别、图文语音互搜)等领域。
【科研论文/审稿人】
在国内外期刊会议上发表了超过50篇论文,包括TPAMI、TIP、ICML、CVPR、NeurIPS、ACM MM、AAAI、ICLR等顶刊顶会,同时担任CVPR、ECCV、ICCV、ICLR、NIPS、TIP、TMAPI、TNNLS等多个期刊和会议的TPC/审稿人。有丰富的学术期刊和会议资源。
【指导经验和成果】
Taylor老师是深度之眼的明星导师,与深度之眼合作已有5年之久。他具有丰富的1V1科研论文指导和竞赛指导经验,同时深耕于深度之眼科研小班,包括AIGC生成式、目标检测、语义分割、遥感图像、多模态大模型的理解与安全等领域的学术论文以及落地应用。
学员们的文章投稿至各类方向,包括不限于大模型、CV、AIGC、医学、农学、遥感和计算机等方向成功辅导深度之眼的学生发表了超过200篇论文,涵盖了ICLR、TIP、ICML、CVPR、ICCV、TGRS、ECCV、TIP、ICME、TMM、PRCV、ICIP、ICTAI、CIBM、TMI等顶级期刊和会议。
曾指导学生获得省级优秀硕士学位论文,并帮助学生在国际、国家、省部级竞赛中获得了超过60项TOP名次,包括带领学员拿下Kaggle第一名和iFLYTEK第一名等。
此外,他还提供写作模板、学术避坑指南、辅助代码指导、润色/重写服务,以及会议期刊推荐等服务。
【教学特点】
Taylor老师有丰富多样化的教学经验,教学严谨,对待科学问题,不放过每一个细节,经常彻夜给学员重写润色手稿。虽然科研上要求严格,但是对于认真想学的同学都会有非常大的收获。
对于不同基础的同学有成熟的指导体系,同时擅长将不同任务与视觉任务进行结合,讲授除了课程任务之外的技术,匹配不同方向上的同学课题。Taylor老师的写作套路永远是让学员眼前一亮。
可选创新点
上述场景下多尺度特征选择融合的目标检测探索
上述场景下注意力和Transformer机制的目标检测探索
上述场景下结合扩散(Diffusion)模型的目标检测探索
上述场景下结合大语言(LLM)模型/图神经网络的目标检测探索
上述场景下结合多模态(MLLM)大模型的目标检测探索
上述场景下结合代理(Agent)模型的目标检测探索
上述场景下结合强化学习(RL)模型的目标检测探索
上述场景下结合路由混合专家(MOE)模型的目标检测探索
课程亮点
技术方法包括:深度学习基础网络、YOLO系列、RCNN系列、FPN系列、扩散(Diffusion)模型、大语言(LLM)模型、多模态(MLLM)大模型、代理(Agent)模型、强化学习(RL)模型、路由混合专家(MOE)模型等。
