课题简介
随着人工智能领域大语言模型的飞速发展,通用型 Agents 在各类应用场景中的价值日益凸显。近期,字节跳动发布的 UI Agent、OpenAI 推出的 Operator,以及中国 Manus AI 研发的 Manus General Agent,均展示了通用型 Agents 在自动化任务执行、智能决策和多模态交互方面的巨大潜力和广阔市场。2025 年甚至被誉为 “Agent 元年”,标志着通用型智能体进入大规模应用和深度优化的新阶段。
然而,随着通用型 Agents 的不断演进,基于 2023 年学界提出的多智能体协同合作框架,并结合 Deepseek 等先进大语言模型(LLM)的突破性能力,行业也逐渐暴露出一系列新的挑战和技术难题,主要体现在以下几个方面:
① 多模态融合与复杂推理的瓶颈
尽管当前模型在处理文本、图像、音频、视频等多模态数据方面取得了显著进展,但通用型 Agents 在跨模态信息的语义对齐、深层推理和多模态知识融合上仍然面临挑战。一方面,不同模态间的语义鸿沟需要更丰富的外部知识填补;另一方面,多模态数据的分布差异可能导致推理过程的不一致性,影响任务的稳定性和准确性。因此,如何突破多模态任务的认知瓶颈,仍然是推动通用型 Agents 发展的关键问题。
② 协同合作与可解释性的平衡
当前主流的多智能体协同框架在一定程度上提升了 Agents 之间的协作能力,但在复杂场景下,仍然存在协同效率低、通信开销大、决策过程难以解释等问题。特别是在医疗、金融等对安全性和可解释性要求极高的领域,如何确保 Agents 之间的协同推理透明可控,避免“黑箱化”决策,仍是通用型 Agents 落地应用的核心挑战。
③ 低延迟与资源受限环境下的部署难题
随着通用型 Agents 向移动端、边缘设备等低算力环境扩展,对模型的推理速度和计算资源提出了更高的要求。然而,当前大模型的参数规模往往达到数十亿甚至上千亿级别,如何在不牺牲性能的前提下,实现高效的模型轻量化和快速推理,成为了制约通用型 Agents 大规模部署的关键技术难题。
本课程将从通用型 Agents 的发展历史入手,带领学员回顾 2023 年以来该领域的演进脉络,并系统性分析里程碑式的代表性论文,深入剖析主流通用型 Agents 的技术路线。在夯实基础知识的同时,课程将结合最新的 Agent 框架,指导学员从代码层面部署一个轻量级 Agent,掌握核心技术,实现从理论到实践的无缝衔接。
在此基础上,课程将进一步结合大语言模型的发展路径,详细解析前述三大核心挑战,并从学术研究的角度探讨潜在的优化方向和改进算法。通过理论讲解、实验实操和案例分析的多维度学习方式,学员将不仅能够理解通用型 Agents 的现状和局限,还能从学术发表和产品落地的角度把握 “Agent 元年” 带来的技术变革和产业机遇。
导师介绍
【学校/研究方向】
新二博士学位,现研究方向为 Agentic AI, Vision-Language Models (VLMs) 及其他 机器学习 (ML) 相关领域。
工作经历:自博士期间起,已指导 10 名本科,硕士,及博士生,皆成功发表 CCF-A 类国际会议论文
学术成果:在 机器学习三大会议(NeurIPS, ICML, ICLR)累计发表 10+ 篇论文,其中第一作者7篇。
【科研论文/审稿人】担任机器学习三大会,CVPR,TPAMI,TIP,TNNLS审稿人。
可选创新点
VLM 强化学习框架在特定任务的应用 CCF-A CVPR/ACL
任务执行的可解释性与稳健性 CCF-A ICRA/ICLR
课程亮点
1. 能根据学生的不同领域给出针对性的 idea。
2. 可以提供一些质量好的 baseline。
3. 老师有耐心,教学经验丰富。
4. 课前和同学进行预先沟通,提前帮同学解答选题问题和解答疑问。
5. 线上私人群留言回复,结合案例、文字、语音条等形式,也会利用额外的线上meeting,用较短时间,较高效率解决同学们的疑问。
