研究领域
大模型安全 多智能体 大模型对抗攻防 大模型隐私安全 大模型安全微调
导师介绍
【学校/研究方向/经历】
世界TOP20博士,研究兴趣聚焦于大型语言模型与生成模型的可解释性、安全与隐私,曾在 RIKEN AIP、IBM Research、UIUC 等国际机构进行访问与合作研究,主要做大型语言模型解释性、对抗鲁棒性、安全微调、数据删除与概念移除、任务向量攻击与防御相关研究。
【科研论文/审稿人/会议&期刊任职】
在NeurIPS、ICLR、ICCV、ICASSP等顶会上发表近10篇,担任NeurIPS、ICLR的审稿人
【指导特点】
(1)强调研究中的「创新威胁模型」与「攻防思维」
(2)注重严谨数学与理论基础,结合理论与实验
(3)有国际研究合作经验,熟悉顶会论文撰写与审稿要求
招生方向
(1)LLM 安全与隐私
(2)扩散模型概念删除与对抗攻击
(3)机器学习解释性与公平性
(4)Multi-agent的记忆中毒与任务向量研究
