课题简介
在Deepseek等国产大语言模型迅速发展的背景下,进行大语言模型相关课题的研究显得尤为重要。Deepseek-R1模型的成功,展现了预训练后规模化技术的核心地位和强大功能。首先,经过充分预训练的大模型只有经过高质量数据的微调后,才能转化为一个强大的助手模型,具备良好交互能力,指令遵循能力和安全性。这一步骤也是Deepseek-R1中重要的一环。然后,强化对齐技术是大语言模型获得更强大推理能力和任务解决能力的核心。Deepseek-R1-zero直接通过强化对齐技术,展现出了美妙的顿悟时刻。最后,推理时,大模型,特别是较轻量的大模型需要更优质的提示和示例学习,才能激发其100%的潜能。
本课程分为四大部分:
第一部分,在Deepseek的推理数据构建层面,主要探讨:
(a)指令微调和强化对齐数据的挖掘与构建方法,特别是数据自动构建方法。
(b)数据筛选方法,使得大模型优化过程更高效。
(c)合成数据的局限性和安全性问题分析。
第二部分,在Deepseek的冷启动微调层面,主要探讨:
(a) 最具代表性的高效微调方法,LoRA微调方法的改进;
(b) 有监督微调的优化目标改进,为强化对齐提供更优质的初始模型。
第三部分,在Deepseek的强化对齐优化层面,主要探讨:
(a)强化学习优化技术如何更好收敛:GRPO及其发展;
(b)基于直接偏好微调的方法(DPO),及其改进思路。
(c)多模态大模型的强化对齐优化。
第四部分,在Deepseek的推理阶段规模化层面,主要探讨:
(a)现有过程奖励方法和树搜索方法,及其未来发展
(b)面向推理的提示优化与示例学习优化方法。
导师介绍
【学校/研究方向】
985高校计算机博士,博士期间研究NLP方向和序列建模方向,具体为大模型微调技术,大模型对齐技术,大模型agent,多模态大模型,时间序列基础模型。
在互联网大厂从事算法专家岗位,主要负责前沿算法的快速落地,模型在业务中的表现的调优。
Google scholar引用累计800+。Github star累计超过1700+。发表的一作/通讯论文获得社区的认可,如数据集文章被huggingface的使用,成为RLHF领域的标杆。
【科研论文/审稿人】
目前已经发表了论文50余篇,其中CCFA类会议与期刊18篇,包括ICML,NeurIPS,ACL,WWW,EMNLP,NAACL,COLING,DASFAA,ICASSP等等,且长期担任这些顶级会议与期刊的审稿人。
【指导经验】
指导了众多学弟学妹在ACL,EMNLP,WWW,NAACL等顶级会议上发表文章,共计10篇。指导众多学员发表顶会文章/SCI文章,共计18篇。
可选创新点
(1)Deepseek模型的推理数据构建与优化(ACL,EMNLP, AAAI 等顶会;JMLR,TASLP,NN等顶级期刊)
(2)Deepseek模型的冷启动微调优化(ACL,EMNLP, AAAI 等顶会;JMLR,TASLP,NN等顶级期刊)
(3)Deepseek模型的强化对齐优化方法(ACL,EMNLP, AAAI 等顶会;JMLR,TASLP,NN等顶级期刊)
课程亮点
(1)课程导师对大语言模型,多模态模型和时间序列都有非常深入的研究,发表过50多篇包括ICML,ACL,WWW, EMNLP,DASFAA,CIKM等顶会顶刊论文,能够站在研究最前沿和多个研究方向交叉的角度,分析问题,提出领先的创新课题。
(2)非常多实用的Idea,现在其实单看模型差距很小,但这些技术却源源不断的中论文,核心因素便是故事的构成驱动模型和方法的设计。在课程里也是主要以已经发表的论文切入分析没做好以及还没做的事情,将这些事情转化为技术构成,最终产出论文。
(3)在课程的引导下会基于相关研究方向和其他子方向的baseline组成一个有故事的pipeline也是课程的主要特色。
(4)课程力求避开繁琐的数学公式和过于空洞的原理,结合近两年顶会顶刊结合现实问题的角度,利用故事驱动模型。
(5)课前一次详细meeting,提前帮同学解答选题问题和疑问,阐述授课风格;线上课程主要利用论文发掘故事和模型设计,帮助同学规划好论文框架,讲好论文故事。
(6)私人群有问必答,结合案例、文字、语音条等形式,偶尔也会利用额外的线上meeting,用较短时间,较高效率解决同学们的疑问。
