课题简介
这门课程,“AIGC背景下的音频理解与合成”,将深入探索使用大规模深度学习模型进行音频理解和合成的各个方面。
随着计算能力的提高和大数据的积累,人工智能的发展已经进入一个新的阶段。在此背景下,深度学习模型,尤其是大规模深度学习模型,正在被广泛用于处理复杂的现实问题,尤其是近期一系列AIGC任务。这门课程将带领学生们进入这个充满挑战和机遇的领域,深入理解和掌握大型语音音频深度学习模型在AIGC背景下的设计、实施和优化。本课程尤其侧重在语音信息处理:语音识别和语音合成是人工智能的重要应用领域,已经被广泛应用于AIGC领域,包括智能语音助手、自动语音转录、人机交互等方面。通过这门课程,你将学习到如何应用大规模深度学习模型来进行高准确度的语音识别和自然的语音合成,进而构建出实用的语音交互系统。
因此,无论你是想深入学习语音处理技术,还是希望了解最新的音频深度学习模型如何被应用到现实问题中,这门课程都将为你提供宝贵的学习机会和实践经验。
导师介绍
【学校/研究方向】
美国Top10计算机PhD,主要研究方向包括不同语音任务(编码、识别、合成、理解、翻译等)。
工作经历/实习经历:曾在国内、北美大厂多家担任科研实习生,研究内容涉及会议信息处理、语音翻译和语音大模型。
学术荣誉/奖项:Google Scholar引用2000+,Github上参与设计、维护多个相关知名语音研究工具,总Star超过20k。
科研论文/审稿人:在NLP/speech方向顶会/期刊发表八十余篇,其中第一作者超过20篇;并担任ICLR/ACL/ACMMM/EMNLP/AAAI/ICASSP等审稿人。
指导经验:指导学生发表语音、NLP方向顶会论文18篇。
可选创新点
(1)使用MoE、模型蒸馏手段提升语音、音频离散模块的泛化性能(ICASSP,Interspeech,ACL,ISMIR,ACMMM等语音音频或NLP方向顶会)
(2)通过语音表征学习的融合和解耦实现可控制的语音、音频表征(ICASSP,Interspeech,ACL,ISMIR,ACMMM等语音音频或NLP方向顶会)
(3)通过考虑更多维度层级的特征来强化语音音频表征学习的泛用性(ICASSP,Interspeech,ACL,ISMIR,ACMMM等语音音频或NLP方向顶会)
(4)设计针对语音音频语言模型的评测方法(ASRU,SLT,WASPAA等领域方向会议)
(5)基于已有的音频相关语言模型在复杂语音任务上的使用与分析(ASRU,SLT,WASPAA等领域方向会议)
(6)探究语音音频离散化在具体任务上的优化和完善(ASRU,SLT,WASPAA等领域方向会议)
课程亮点
(1)课程老师在相关领域深耕多年,有丰富的研究和指导经验。
(2)能够提供丰富科研idea和方向(6+),适合于希望在语音或音频领域顶会发表文章的同学。
(3)课程老师有丰富开源框架开发、实践经验,并了解相关内容的文献,可以提供相关baseline代码,帮助同学复现baseline并专注于具体的科研想法。
(4)相比CV、NLP,语音与音频处理技术的相关知识具有资料少、门槛高的相关特点,本次课程可以极大程度上提供最前沿的语音知识和方法论,有助于同学迅速了解相关的知识与框架,并上手科研。
(5)课程老师在相关领域顶会发表论文八十余篇, 有丰富的论文写作、投稿经验,可以帮助同学更好学习论文写作方法。
