课题简介
本课程以 强化学习与大模型为技术引擎,深度融合2025年AI领域最新突破(深度推理模型,智能体),聚焦模型逻辑推理能力,讨论模型在数学,编程,竞赛,以及工具使用,多轮强化学习等场景下的创新解决方案。课程从经典推理链,强化学习,大模型训练等基础,拓展到test time scaling,tool integrated reasoning,agentic reasoning等前沿方向,涵盖代码讲解,直击ICLR, ICML, Neurips, ACL等顶会研究范式。
导师介绍
【工作经历/实习经历】QS50博士高年级在读,主要研究语言大模型的预训练,后训练优化,包括目前前沿的强化学习,agent for code。在多个国内一线大厂基础大模型实习,了解工业界前沿的技术和发展。
【科研论文/审稿人】在中科院一区TOP,IEEE Trans系列以及CCF A类会议等共发表文章10余篇(其中第一作者近5篇),包括ICML, ICLR, ACL, EMNLP, NAACL等。同时,担任ICML, ICLR, NIPS, ARR顶会审稿人。
【指导经验】指导学生投稿ICLR文章1篇, ACL, EMNLP 4篇。
可选创新点
1.推理模型训练的数据筛选
2.强化学习的数据利用率提升
3.强化学习在竞赛数学的算法改进
4.强化学习在工具使用的应用与拓展
5.智能体场景下的多轮强化学习
6.在无显示奖励场景下的强化学习
课程亮点
论文生命周期全流程个性化的指导
数据处理:导师协助完成对数据集的选定和分析,也可利用已有数据集开展研究
实验协助:根据同学反馈1对1的讨论实验方案和实验指标,确认创新性
初稿协助:帮助一对一审核论文初稿并给出修改意见
投稿协助:帮助审核论文对应可发表级别、筛选可发表期刊、讲解对应期刊论文发表技巧
审稿协助:成功投稿后收到审稿人意见的同学,可随时与主讲老师沟通应对审稿人问题技巧和策略。
