MLNLP 社区是国内外知名机器学习与自然语言处理社区,受众覆盖国内外NLP硕博生、高校老师以及企业研究人员。 社区的愿景 是促进国内外自然语言处理,机器学习学术界、产业界和广大爱好者之间的交流,特别是初学者同学们的进步。MLNLP 2026学术研讨会 是由 MLNLP社区、中国中文信息学会青年工作委员会 和 中国中文信息学会大模型与生成专业委员会 联合举办的学术活动。社区会定期举办学术研讨会并邀请国内外机器学习与自然语言处理领域知名青年学者进行报告交流,旨在加强国内外学者之间的交流。
MLNLP社区将在7月26日于线上举办第四十一次学术研讨会,由MLNLP学术委员上海交通大学助理教授张林峰和香港科技大学助理教授潘玲共同担任本期程序委员会主席。本期研讨会分为上下两半场:上半场由张林峰主持;下半场由潘玲主持。具体而言,社区很荣幸邀请到上海交通大学杨一博副教授,上海交通大学温睦宁研究助理教授,香港中文大学(深圳)刘圳助理教授,腾讯混元陈江海高级研究员做专题报告。
召开时间:
主办单位:
MLNLP社区
中国中文信息学会青年工作委员会
中国中文信息学会大模型与生成专业委员会
嘉宾简介:张林峰,上海交通大学人工智能学院助理教授,研究方向为高效人工智能。他博士毕业于清华大学交叉信息研究院,曾获世界人工智能大会云帆奖、微软学者,北京市优秀毕业生,担任ACL、NeurIPS、ICLR等会议的领域主席。他以第一作者、通讯作者发表在CCF-A类高水平会议期刊上发表论文百余篇,研究成果和工作经历曾被人民日报专题报导,曾获CCF-腾讯犀牛鸟等基金。
嘉宾简介:潘玲,香港科技大学电子及计算机工程学系和计算机科学及工程学系助理教授,研究方向为深度强化学习与多智能体系统,包括理论分析、算法设计及其在大模型后训练等领域的应用,多篇工作发表于AI/ML顶级会议并入选Oral/Spotlight口头报告。她曾在Mila担任博士后研究员,师从图灵奖得主Yoshua Bengio教授,曾获微软学者、AAAI New Faculty Highlights等荣誉,并多次担任ICML/NeurIPS/ICLR/KDD/RLC (Reinforcement Learning Conference)等会议领域主席。
二、分享嘉宾:
嘉宾简介:杨一博,现任上海交通大学人工智能学院长聘教轨副教授,博士毕业于北京大学,博士毕业后曾在KAUST、牛津大学开展研究工作。研究方向为大模型/智能体、终身学习和可信AI。他在受限条件下的模型训练/微调、缓解模型遗忘等方向取得了代表性成果,相关成果发表于NeurIPS、ICML、ICLR、CVPR、TPAMI、Science Advances,并多次获得Spotlight、Oral。曾多次在国际学术竞赛获第一名、最佳方法奖。曾获2025年祖冲之奖人工智能前沿创新奖突出成果奖、2023年吴文俊人工智能科学技术奖自然科学一等奖、2021年吴文俊人工智能科学技术奖优秀博士学位论文奖。担任NeurIPS、ICML、ICLR区域主席和TMLR Action Editor。
报告题目:面向终身学习的抗遗忘、安全与个性化
报告简介:随着人工智能系统从静态模型向持续交互、自主适应的智能体演进,如何在不断学习新知识与新任务的同时保持已有能力、维持安全边界,并形成面向用户的长期个性化,成为终身学习面临的核心问题。本报告围绕“抗遗忘、安全与个性化”三个相互关联的维度,介绍我们近期在大模型持续适应与智能体长期记忆方面的研究进展。首先,针对大模型适配过程中预训练知识易被遗忘的问题,我们探索基于上下文感知参数分解的方法,在学习新任务的同时降低对已有世界知识的破坏。 进一步地,针对持续微调可能导致安全对齐能力退化的问题,我们从安全敏感子空间与受约束优化出发,在保持下游任务适应能力的同时维持模型原有安全行为。 在此基础上,研究进一步从模型参数扩展到智能体记忆,关注多模态、多参与者长期交互中的记忆构建与利用,以及共享环境下的访问控制、主动遗忘和记忆治理。 最后,我们探讨如何通过长期用户画像、工作记忆与经验记忆,使智能体在持续交互中逐步理解并适应个体偏好。 这些工作试图从“学新而不忘旧”进一步走向“持续学习而保持可信,并在长期交互中因人而异”,为构建安全、可靠、个性化的终身学习智能系统提供新的思路。
温睦宁
上海交通大学研究助理教授/助理研究员
嘉宾简介:温睦宁,上海交通大学人工智能学院研究助理教授/助理研究员。他的主要研究方向为强化学习、大模型智能体以、多智能体系统及其在工业领域的应用。在过往的学术生涯中,温睦宁致力于开发先进的强化学习算法,以提升语言智能体或多智能体系统在动态环境中的自我进化能力,他在NeurIPS、ICML、ICLR等顶级学术会议上发表论文二十余篇,谷歌学术引用量2500余次,并自2023年起持续参与相应会议/期刊的领域主席或审稿工作。
报告题目:欢迎来到自进化的时代
报告简介:本报告围绕“自进化智能体”这一前沿方向,系统介绍其核心思想、关键技术及在国产硬件算子生成中的实际应用。报告首先从AI落地“最后一公里”问题出发,引出传统大模型在垂域场景中面临的泛化不足与高成本迭代瓶颈,进而介绍自进化智能体的常见技术范式与实践技巧。在此基础上,报告会进一步结合国产GPU算子生成与优化场景,展示自进化智能体在实际任务中的应用。通过真实实验结果,说明该方法如何突破算子开发依赖专家、效率低下等瓶颈,实现高正确率与显著性能提升。最后,报告将讨论这一范式在算力生态、AI for AI及未来智能系统中的潜在价值与发展方向。
嘉宾简介:刘圳现为香港中文大学(深圳)数据科学学院的助理教授与校长青年学者。他博士毕业于蒙特利尔大学及Mila研究所的计算机博士学位,师从图灵奖得主Yoshua Bengio。他本科与硕士毕业于佐治亚理工学院获得计算机硕士和学士学位,并曾于访问德国马克思普朗克智能系统研究所,在Bernhard Schölkopf与Michael J. Black的指导下从事研究工作。他目前的主要研究方向是大模型后训练与三维视觉。他在NeurIPS、ICML、ICLR等顶级学术会议上发表论文近三十篇,谷歌学术引用量3500余次,并多次获得顶会的Spotlight与Oral。
报告题目:视觉生成模型的高效后训练
报告简介:视觉生成模型通过大规模预训练获得了强大的生成能力,但如何进一步利用不同形式的反馈信号,对模型进行有效后训练,仍然是生成模型发展的重要问题。本报告将围绕视觉生成模型介绍我们近期在后训练与适应方面的探索。首先,针对如何利用可微奖励优化生成模型的问题,我们研究基于奖励梯度的后训练方法,并进一步将其应用于视觉和三维生成任务。其次,我们探索基于偏好反馈的生成模型优化方法,包括面向扩散模型的偏好优化算法,以及面向图像局部偏好的微调算法。最后,针对单步生成模型的后训练问题,我们提出基于漂移模型的优化方法,实现对单步生成模型的有效微调。
嘉宾简介:腾讯混元高级研究员,硕士毕业于香港大学,本科毕业于南开大学。主要研究方向包括高性能大模型训练系统,多模态模型强化学习框架。曾参与ColossalAI, PaddlePaddle等多个主流大模型训练框架的核心开发工作,贡献包括自动并行,Colossal-AI Inference等Feature。目前在腾讯混元负责多模态大模型后训练与强化学习基础设施研发。主导开发了面向统一多模态强化学习框架UniRL,支持LLM,VLM,Diffusion Model及Unified Model的强化学习后训练。
报告题目:HunYuan UniRL: 面向统一多模态模型的强化学习框架
报告简介:随着大模型从单一文本推理加速向多模态理解、工具调用、图像/视频生成及复杂任务执行演进,智能体(Agent)模型的训练已突破传统语言模型RL后训练的边界,亟需适配跨模态、跨模型、跨阶段的完整行为轨迹处理能力。在此背景下,腾讯混元团队开源了UniRL统一多模态强化学习框架,面向大语言模型、视觉语言模型、扩散/流匹配生成模型、提示词增强模型及原生统一多模态模型,提供标准化的RL后训练完整回路:采样生成、奖励打分、优势计算、策略更新与权重回传。UniRL可将文本推理、视觉理解、图像/视频生成、工具执行反馈及多维度奖励信号统一纳入同一训练闭环,为端到端训练具备多模态感知与生成能力的通用智能体提供核心基础设施支撑。框架采用分层可组合架构,通过Hydra实验配置体系连接各领域专属训练器,集成FSDP2/VeOmni分布式训练后端、SGLang/vLLM-Omni高性能推理引擎、独立可扩展奖励服务及全品类RL算法模块;底层基于Ray与Transfer Queue实现训练与推理解耦,支持trainside、separate、colocate三种灵活部署模式。同时,团队自研的Flow-DPPO与DRPO算法分别针对流匹配生成模型和大语言模型优化了策略更新机制,解决了传统算法在多模态场景下的信任域偏差与训练不稳定问题。目前UniRL已全面适配SD3/3.5、FLUX.2-Klein、HunyuanVideo、HunyuanImage3、Qwen3等主流模型,能够覆盖从多模态生成模型对齐到统一智能体训练的全链路后训练需求。
会议报名可以直接扫描下方二维码进入交流群。会议的观看地址等信息都会在群里通知。已经加入MLNLP交流群的同学请不用重复添加!
扫描二维码进入MLNLP交流群
关于我们
MLNLP 社区是由国内外机器学习与自然语言处理学者联合构建的民间学术社区,目前已经发展为国内外知名的机器学习与自然语言处理社区,旨在促进机器学习,自然语言处理学术界、产业界和广大爱好者之间的进步。社区可以为相关从业者的深造、就业及研究等方面提供开放交流平台。欢迎大家关注和加入我们。