课题简介
随着人工智能技术的不断进步,大语言模型在各个领域展现出了强大的能力。然而,大模型的安全性和鲁棒性也面临着前所未有的挑战。对抗攻击作为一种特殊的攻击手段,通过精心设计的输入数据,能够误导模型做出错误的预测,从而威胁到人工智能系统的安全性和可靠性。因此,研究大模型的对抗攻击与防御机制,对于确保人工智能技术的健康和可持续发展至关重要。在本课程中,我们将深入探讨大模型在对抗攻击下的脆弱性,并探索有效的防御策略。课程内容将分为两个主要部分:对抗攻击技术和防御机制。
第一部分将从对抗攻击的历史和基本原理入手,分析当前对抗攻击的主要类型和攻击方法。我们将讨论如何通过微小的、难以察觉的输入扰动来欺骗深度学习模型,以及这些攻击在图像识别、自然语言处理等领域的具体应用。此外,我们还将探讨对抗攻击的自动化生成技术,以及如何评估模型在对抗攻击下的鲁棒性。
第二部分将聚焦大模型,深入理解和探索大模型的对抗攻击方法。我们会从文本大模型和多模态大模型两个方面进行介绍,分析大模型的特点,理解针对大模型的新方法。针对各种攻击方式,我们也会探讨对应的防御策略。分析攻击方法的不足和防御方法的缺点之后,我们会探讨改进的方向。
导师介绍
【学校/研究方向】
CV强校计算机科学博士生;top3本硕毕业后在国际CV强校读博深造,深耕AI与电路设计领域,曾在知名编程教育机构担任多年讲师,所带学生获得多次国际竞赛奖项,与国内大厂有丰富的合作和实习经历。
研究领域:深度计算机视觉、生成模型、大语言模型、图神经网络的算法与应用。
【科研论文/审稿人】
在国际会议/期刊发表论文共30篇(其中一作10+篇),包括TCAD、DAC、ISCAS、IJCNN等等;担任多个会议/期刊审稿人。
【指导经验】
指导多个硕士研究生的AI方向毕业论文;个别学生研究内容获丘成桐科学奖(北美赛区获奖)
可选创新点
(1)大模型的黑盒攻击方法(NeurIPS、ACL、EMNLP、ICML、ICLR、AAAI等顶会)
(2)基于解码优化的大模型防御方法(NeurIPS、ACL、EMNLP、ICML、ICLR、AAAI等顶会)
(3)通过注入对抗样本污染检索增强生成结果(NeurIPS、ACL、EMNLP、ICML、ICLR、AAAI等顶会)
(4)基于交叉验证的大模型防御方法(WACV、ACCV、ACML、NLPCC、ICANN、IJCNN等)
(5)对大模型多步决策进行对抗攻击的方法(WACV、ACCV、ACML、NLPCC、ICANN、IJCNN等)
(6)大模型安全性诊断方法(NeurIPS、ACL、EMNLP、ICML、ICLR、AAAI、WACV、ACCV、ACML、NLPCC、ICANN、IJCNN等)
课程亮点
(1)课程中会涉及多个方面的idea,覆盖大模型的对抗攻击与对抗防御,也会探讨大模型应用中导致安全性受损的外部因素,比如检索增强生成的数据库、多部决策的流程等。
(2)在课程的引导下会基于相关研究方向和其他子方向的baseline,帮助同学基于已有的方法进行开发。
(3)课程力求避开繁琐的数学公式和过于空洞的原理,也避免对计算资源的高要求,结合近两年顶会顶刊结合现实问题的角度,利用故事驱动模型。
(4)私人群有问必答,结合案例、文字、语音条等形式,偶尔也会利用额外的线上meeting,用较短时间,较高效率解决同学们的疑问。
