← 研究方向DEEPSHARE / RESEARCH

大语言模型智能体(LLM Agents)

通用型agent 知识增强 多模态融合 高效token和剪枝策略

课题简介

随着人工智能领域大语言模型的飞速发展,通用型 Agents 在各类应用场景中的价值日益凸显。近期,字节跳动发布的 UI Agent、OpenAI 推出的 Operator,以及中国 Manus AI 研发的 Manus General Agent,均展示了通用型 Agents 在自动化任务执行、智能决策和多模态交互方面的巨大潜力和广阔市场。2025 年甚至被誉为 “Agent 元年”,标志着通用型智能体进入大规模应用和深度优化的新阶段。

然而,随着通用型 Agents 的不断演进,基于 2023 年学界提出的多智能体协同合作框架,并结合 Deepseek 等先进大语言模型(LLM)的突破性能力,行业也逐渐暴露出一系列新的挑战和技术难题,主要体现在以下几个方面:

① 多模态融合与复杂推理的瓶颈

尽管当前模型在处理文本、图像、音频、视频等多模态数据方面取得了显著进展,但通用型 Agents 在跨模态信息的语义对齐、深层推理和多模态知识融合上仍然面临挑战。一方面,不同模态间的语义鸿沟需要更丰富的外部知识填补;另一方面,多模态数据的分布差异可能导致推理过程的不一致性,影响任务的稳定性和准确性。因此,如何突破多模态任务的认知瓶颈,仍然是推动通用型 Agents 发展的关键问题。

② 协同合作与可解释性的平衡

当前主流的多智能体协同框架在一定程度上提升了 Agents 之间的协作能力,但在复杂场景下,仍然存在协同效率低、通信开销大、决策过程难以解释等问题。特别是在医疗、金融等对安全性和可解释性要求极高的领域,如何确保 Agents 之间的协同推理透明可控,避免“黑箱化”决策,仍是通用型 Agents 落地应用的核心挑战。

③ 低延迟与资源受限环境下的部署难题

随着通用型 Agents 向移动端、边缘设备等低算力环境扩展,对模型的推理速度和计算资源提出了更高的要求。然而,当前大模型的参数规模往往达到数十亿甚至上千亿级别,如何在不牺牲性能的前提下,实现高效的模型轻量化和快速推理,成为了制约通用型 Agents 大规模部署的关键技术难题。

本课程将从通用型 Agents 的发展历史入手,带领学员回顾 2023 年以来该领域的演进脉络,并系统性分析里程碑式的代表性论文,深入剖析主流通用型 Agents 的技术路线。在夯实基础知识的同时,课程将结合最新的 Agent 框架,指导学员从代码层面部署一个轻量级 Agent,掌握核心技术,实现从理论到实践的无缝衔接。

在此基础上,课程将进一步结合大语言模型的发展路径,详细解析前述三大核心挑战,并从学术研究的角度探讨潜在的优化方向和改进算法。通过理论讲解、实验实操和案例分析的多维度学习方式,学员将不仅能够理解通用型 Agents 的现状和局限,还能从学术发表和产品落地的角度把握 “Agent 元年” 带来的技术变革和产业机遇。

导师介绍

【学校/研究方向】
新二博士学位,现研究方向为 Agentic AI, Vision-Language Models (VLMs) 及其他 机器学习 (ML) 相关领域。
工作经历:自博士期间起,已指导 10 名本科,硕士,及博士生,皆成功发表 CCF-A 类国际会议论文
学术成果:在 机器学习三大会议(NeurIPS, ICML, ICLR)累计发表 10+ 篇论文,其中第一作者7篇。
【科研论文/审稿人】担任机器学习三大会,CVPR,TPAMI,TIP,TNNLS审稿人。

王泽文老师 · 新二博士 ↗

可选创新点

VLM 强化学习框架在特定任务的应用 CCF-A CVPR/ACL
任务执行的可解释性与稳健性 CCF-A ICRA/ICLR

课程亮点

1. 能根据学生的不同领域给出针对性的 idea。
2. 可以提供一些质量好的 baseline。
3. 老师有耐心,教学经验丰富。
4. 课前和同学进行预先沟通,提前帮同学解答选题问题和解答疑问。
5. 线上私人群留言回复,结合案例、文字、语音条等形式,也会利用额外的线上meeting,用较短时间,较高效率解决同学们的疑问。

科研咨询 LET'S TALK RESEARCH

聊聊你的科研计划

微信扫码,与我们沟通研究方向和目标。

请使用微信扫描科研咨询二维码查看二维码原图 ↗
放大图片打开原图 ↗