基本信息

朱圆恒  男    中国科学院自动化研究所
电子邮件: yuanheng.zhu@ia.ac.cn
通信地址: 北京市中关村东路95号
邮政编码: 100190

个人简历

朱圆恒,中科院自动化所研究员。围绕多智能体博弈决策智能长期开展基础性与原创性研究,建立复杂博弈的通用纳什均衡理论,提出面向开放场景的多智能体强化学习算法,构建融合大语言模型的认知博弈决策框架,在虚拟仿真对抗、实体无人系统以及特殊领域强对抗场景中显著提升博弈决策智能。发表IEEE汇刊论文32篇,CCF A类论文11篇,ESI高被引及热点论文9篇,获IEEE汇刊年度唯一杰出论文奖2项,出版专著获得国家重点出版物出版专项规划项目支持。成果被DeepMind Nature论文引用。主持国家自然科学基金重大项目课题和中科院战略A类先导专项课题,主要完成人参与国家自然科学基金重点项目和“新一代人工智能”重大专项。研究成果荣获北京市与天津市自然科学二等奖(均排名第二)。


我目前的研究方向有:机器人运动控制,多具身智能,LLM智能体与强化学习后训练

招生信息

我的研究主题包括:


  • 机器人运动控制与多具身智能
  • 基于深度强化学习实现机器人的运动控制,相比于传统启发规则和最优控制的方法相比,在端到端学习、适应性、泛化性和鲁棒性方面具有显著优势。我们面向视觉驱动的运动控制以及敏捷高动态的运动控制开展研究,提升在复杂非结构化场景的运动能力。
  • 具身智能作为机器人学与现代人工智能结合的最新方向,强调一个具身智能体(如机器人、虚拟角色)在物理或模拟环境中自主感知、决策和行动。相比与单个具身智能体,一组同构或异构的多具身智能体能够在共享环境中协同或竞争性地完成任务,在交流、协作或博弈过程中共同适应复杂动态的环境,显著提升任务效率、系统鲁棒和群体智能。
  • 我们以轮式和轮足式实体机器人为载体,建立起能够从虚拟游戏->室内环境->室外开放的多具身智能体系统,协同完成包括追捕、巡逻、搜救、搬运的具身任务,推动通用人工智能的落地。
  • 多智能体强化学习
  • 多智能体强化学习(MARL)作为AlphaGo,AlphaStar的关键技术,取得了长足的成功。与单智能体强化学习相比,MARL会动态环境、部分观测、信誉分配、规模化等挑战。尤其是在虚拟封闭的游戏环境训练的多智能体系统,在现实开放世界会额外面临系统内部和环境外部联合动态和不确定性的因素。因此需要将MARL与先进的人工智能技术,包括元学习、世界模型、持续学习、大模型等结合,以提升开放环境的自主决策能力。
  • 大模型强化学习后训练和智能体
  • ChatGPT,DeepSeek等大语言模型的成功,极大推动了人工通用智能的发展。其中强化学习在大语言模型不论是偏好对齐,还是后训练中发挥了巨大作用。同时以大语言模型为基础构造通用智能体,也成为了人工智能最前沿的领域。如何提高RL后训练的效率,降低训练难度,同时在除数学、代码等领域外产生更多的智能,是我们关心的重点。此外,如何提升LLM智能体通用性能和应用范围,也是我们正在解决的问题。

我每年招收硕士研究生1-2名,欢迎具有人工智能、机器人、自动控制、计算机、电子、数学专业的考生联系报考, 可与我邮件联系 yuanheng.zhu@ia.ac.cn 。

NEWS~


ACL2026 一篇Finding论文录用

  • 曜程的 CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic

ICLR2026 三篇论文录用

NeurIPS2025 二篇论文录用

  • 润宇的 Equilibrium Policy Generalization: A Reinforcement Learning Framework for Cross-Graph Zero-Shot Generalization in Pursuit-Evasion Games
  • 子杰的 Learning and Planning Multi-Agent Tasks via an MoE-based World Model [https://github.com/zhaozijie2022/m3w-marl]

DAI2025 一篇论文录用

  • 若川的 ARAC: Adaptive Regularized Multi-Agent Soft Actor-Critic in Graph-Structured Adversarial Games

EMNLP2025 一篇论文录用

曜程获得前沿交叉学院比亚迪奖学金

IEEE TITS2025 一篇论文录用

  • 斌斌的 CMIP: Combining Constructive Model With Improvement Policy for Large-Scale Min-Max Multiple Traveling Salesman Problem [https://github.com/1hhix/CMIP ]

润宇获得国家奖学金

润宇获得IEEE CIS学会的Graduate Student Research Grant (每年全球5位)

ICLR2025 三篇论文录用

  • 润宇的Divergence-Regularized Discounted Aggregation: Equilibrium Finding in Multiplayer Partially Observable Stochastic Games
  • 宇千的INS: Interaction-aware Synthesis to Enhance Offline Multi-agent Reinforcement Learning
  • 嘉骏的Empowering LLM Agents with Zero-Shot Optimal Decision-Making through Q-learning [https://github.com/laq2024/MLAQ]

ICML2025 两篇论文录用

  • 润宇的Constrained Exploitability Descent: An Offline Reinforcement Learning Method for Finding Mixed-Strategy Nash Equilibrium
  • 凯旋的 DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy

TNNLS2025 一篇论文录用


教育背景

2010-09--2015-07   中国科学院自动化研究所   博士学位
2006-09--2010-07   南京大学   学士学位

工作经历

2017-10~现在, 中国科学院自动化研究所, 副研究员
2017-12~2018-12,美国罗德岛大学, 访问学者
2015-07~2017-10,中国科学院自动化研究所, 助理研究员

社会兼职
2024-01-01-今,IEEE Transactions on Games Associate Editor, Associate Editor
2024-01-01-今,IEEE Computational Intelligence Society, Education Competition Subcommittee Chair
2022-12-31-2028-04-30,IEEE TNNLS Associated Editor, Associated Editor
2022-08-20-2022-08-23,2022 IEEE Conference on Games, Program Co-Chair
2019-04-22-今,中国自动化学会 数据驱动控制、学习与优化专业委员会, 委员
2017-09-29-今,中国自动化学会 自适应动态规划与强化学习专业委员会, 委员

合作情况

   
项目协作单位

电科院, 航天二院, 华为,沈飞601,航天二院未来实验室,超参数,阿里

指导学生

已指导学生

刘元勋  硕士研究生  081203-计算机应用技术  

黄上京  硕士研究生  081104-模式识别与智能系统  

陈文章  硕士研究生  081101-控制理论与控制工程  

现指导学生

傅宇千  博士研究生  081104-模式识别与智能系统  

左斌斌  硕士研究生  081101-控制理论与控制工程  

赵梓轩  硕士研究生  081203-计算机应用技术  

王茗菲  硕士研究生  081203-计算机应用技术  

赵中岳  硕士研究生  081104-模式识别与智能系统  

协助指导学生

学生        学位     时间                     毕业去向

邵坤        硕博     2014.9/2019.7     华为

唐振韬     直博     2016.9/2022.7     华为

李伟凡     普博     2018.9/2023.7     智能研究院

刘元勋     硕士     2020.9/2023.7     外交部

胡光政     普博     2019.9/2024.7     美团

刘民颂     硕博     2018.9/2024.7     军科院

黄上京     硕士     2021.9/2024.7     快手

柴嘉骏     直博     2019.9/2025.7     美团(北斗计划)

陈文章     硕士     2022.9/2025.7     英特尔

陆润宇     直博     2021.9/至今

赵子杰     直博     2022.9/至今

徐凯旋     直博     2023.9/至今