研究领域
大模型攻防 自然语言处理 网络安全 大模型安全 Agent
导师介绍
【资历/研究方向】中科院博士,专注于大语言模型(LLM)安全、网络犯罪、AI与社会科学的交叉研究。具有扎实的科研积累和对抗实验经验,致力于推动可信AI与真实世界安全系统的结合。在AI创业公司、政府数据分析部门实习。
【科研论文/审稿人】
在国际会议发表论文7篇(其中一作5篇),包括ACL、DASFAA、ECAI、ICASSP等。曾担任WWW、ACM MM、ECML-PKDD、ICASSP等国际会议审稿人。
招生方向
AI安全、大模型攻防、自然语言处理、网络安全、LLM 安全、多模态社交网络数据分析
(1)大语言安全性/Agent的对抗研究:包括模型越狱攻击检测与防御、毒化样本生成与规避机制建模、大模型/智能体对抗性响应规律分析等方向
(2)模因传播对AI模型输出影响的仿真研究:聚焦于社交网络中语言模因(如梗图、俚语、隐喻)对语言模型输出结果的干扰机制,结合文本分析与社交语料仿真,构建语言风格与立场偏移的影响模型,可结合新闻传播、数据科学等进行创新
(3)AI内容合规与模型对抗技术:围绕大语言模型输出内容的安全合规问题,结合政策审查机制、技术规避路径与模型防御方法,进一步延申的课题有立场检测,偏见检测,谣言检测等课题
