课题简介
课题研究黑盒场景下的大模型与智能体安全研究通过研究对抗性交互从而挖掘出大模型可能的误用威胁和场景,从而让大模型整体变得更加安全。该领域已在提示注入、越狱攻击、智能体操控等任务中展现出重要的研究价值。
近年来,斯坦福、MIT、UC Berkeley等顶尖高校和OpenAI、Anthropic、Google DeepMind等领先企业在NeurIPS、ICML、ICLR等顶级会议中发表了大量相关研究成果。该方向具有研究周期相对较短、实验验证相对便捷的特点,既适合学术研究又具备实际应用转化潜力,已被多家AI安全公司和大型科技企业广泛采用。
本课程将从基础的对抗攻击理论出发,逐步深入到红队测试、安全对齐、鲁棒性评估、多模态攻防以及真实世界部署等前沿内容。以黑盒攻防技术为核心,聚焦大模型在实际应用中面临的安全挑战,帮助学员掌握提示注入、越狱攻击、智能体操控、后门攻击等关键技术,培养从理论到实践的全方位安全研究能力,最终指导学员从0到1完成一项高质量的科研选题并产出具有影响力的学术论文。
通过系统性的理论学习与实践操作,学员将深入理解大模型安全的核心挑战,掌握前沿的攻防技术,并具备独立开展相关研究的能力,为未来在AI安全领域的深入发展奠定坚实基础。
导师介绍
【简介】中科院博士,专注于大语言模型(LLM)安全、网络犯罪、AI与社会科学的交叉研究。具有扎实的科研积累和对抗实验经验,致力于推动可信AI与真实世界安全系统的结合。在AI创业公司、政府数据分析部门实习。
【科研论文/审稿人】
在国际会议发表论文7篇(其中一作5篇),包括ACL、DASFAA、ICASSP等。曾担任WWW、ACM MM、ECML-PKDD、ICASSP等国际会议审稿人。
可选创新点
1.更鲁棒的攻击评估方式
2.针对Web Agent攻击
3.黑灰产视角下的大模型安全
4.多模态大模型的攻击
5.大模型的模因偏见与幻觉
6.知识密集型的有害问题测评
课程亮点
1.解锁NeurIPS、ICML、ICLR、CCS、USENIX Security、S&P、NDSS、JMLR等顶会顶刊青睐的人工智能安全、对抗机器学习、大模型安全研究新范式。
2.本课程构建了大模型安全与黑盒攻防、红队测试任务结合的科研训练体系 —— AI-SAFE 教学框架,从Attack Foundations、Agent security、Safety Alignment、Attack & Defense、Formal Evaluation、Ethics-centered Insight六个方面系统支持学生科研与实践能力的发展:
3.科研全过程覆盖:科研实战导向,用14周完成“课题设计→实验优化→论文写作→投稿策略”全流程闭环学习。
4.前沿话题嵌入式讲授:引入基础对抗攻击算法结合Multi-Agent Systems、Reinforcement Learning Security、Autonomous Agent Safety、Human-AI Interaction Security等最新研究热点,拓宽学生视野。
5.项目驱动式学习:课程不以技术堆砌为目标,而以完成一项可投论文为导向,提升“做成一件事”的科研成就感。
