基本信息

张启超  男  中国科学院自动化研究所

职称:项目研究员、博士生导师

电子邮件: zhangqichao2014@ia.ac.cn

通信地址: 北京市海淀区中关村东路95

最新消息

一、Agent+RL

  • 4篇论文被ACL录用,2篇mian (1 oral, 1 poster),2篇findings, 祝贺明辉、敬博和雯玥等 (2026.4.7)
  • 视觉无监督强化学习论文被CVPR 2026接收,祝贺敬博 (2026.02)
  •  大语言模型自主快慢思考的工作AutoThink被NeurIPS 2025接收,祝贺崧峻,中文解读(2025.09)
  • 1篇大语言模型多轮迭代DPO的工作被COLM 2025接收,祝贺崧峻(2025.07)
  • 1篇无监督强化学习论文被ICLR 2025接收,祝贺敬博,中文解读(2025.01)


二、Phycial AI+RL

  • 2篇论文被ACM MM录用,Latent-WAM和DriveVLA-M0,祝贺林博和泽斌(2026.07)
  • 2篇论文被ECCV录用,DreamerAD 和 BeyondImitation,祝贺鹏轩和君礼 (2026.06)
  • Meanfuser被CVPR录用(获CVPR Compute Transparency Champion award),祝贺君礼,中文解读 ,论文PrelAD被IEEE RAL接收,祝贺胤峰(2026.2.22/3.8)
  • PlanAgent被IEEE TCDS接受 中文解读,2篇论文被ICRA 2026接收,中文解读(2026.1)
  • 2篇端到端自动驾驶+强化学习后训练的工作Mimir和TakeAD被IEEE RAL接收,祝贺泽斌和德庆,中文解读(2025.11)
  • 1篇强化学习用于端到端自动驾驶微调的工作WorldRFT被AAAI 2026接收,祝贺鹏轩,中文解读(2025.11)
  • 1篇VLA用于端到端自动驾驶的的工作ReasonPlan被CoRL 2025接收,祝贺学义,中文解读(2025.08)
  • 1篇世界模型的端到端自动驾驶论文World4Drive被ICCV 2025接收,祝贺宇鹏,中文解读 (2025.06)
  • 1篇集成预测与规划自动驾驶论文IP3被IEEE TVT接收,祝贺李丁,(2025.05)
  • 1篇端到端自动驾驶论文Goalflow被CVPR 2025接收祝贺泽斌,中文解读 (2025.03)
  • 1篇端到端自动驾驶论文UncAD被ICRA 2025接收,祝贺鹏轩,中文解读(2025.01)
  • 3篇强化学习相关论文被AAMAS 2025接收,祝贺敬博、方兴和崧峻(2024.12)!
  • 凃崧峻同学的在线偏好强化学习被AAAI 2025会议接收,祝贺崧峻,中文解读(2024.12)!

研究方向

我在自动化所、前沿交叉学院、未来技术学院可以招收计算机类、人工智能类、自动化类方向的直博生、硕士生。主要聚焦于两个方向:

Agent+RL方向:聚焦于 面向大模型和智能体的RL技术,目前完全收束在文本+Coding任务,聚焦Agent 自学习记忆、自进化Skill方向,目前代表性工作有Learn when to think(NeurIPS 25)、DVFB(ICLR 25), DTR(AAAI 25)、Spec-O3(ACL Oral 26)等。

Physical AI+RL方向:聚焦于视觉语言动作大模型和世界模型的自动驾驶/具身智能大脑,涉及视觉语言大模型、世界模型和强化学习后训练,目前代表性工作有World4Drive(ICCV 25), ReasonPlan(CoRL 25), WorldRFT(AAAI 26)、DearmerAD(ECCV 26)等。

近几年来,我们小组在快速发展,聚焦在最前沿的技术领域,有充足的企业合作项目和计算资源,期待有兴趣、有目标、会计划、能执行的同学加入我们,一起迈入高水平。

    招收对相关方向感兴趣的实习生和联培生,有意者请联系zhangqichao2014@ia.ac.cn

    关于实习:支持参与项目合作的同学去企业实习,目前有小米汽车、长安汽车、哈罗、美团等企业项目。

工作经历

2025.02-现在,中国科学院自动化研究所, 项目研究员

2019-10~2025.02, 中国科学院自动化研究所, 副研究员

2017-07~2019-09,中国科学院自动化研究所, 助理研究员

2019年,中国人工智能学会 优秀博士论文提名奖;

2017年, 中国科学院院长优秀奖;

2017-06   中国科学院自动化研究所   博士生

2014-06   东北大学   研究生

学术工作

2026年:

1. Jia M, Zhang Q, Luo A, et al. Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection, ACL Oral 2026.

2.Sun J, Chong W, Tu S, et al. AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning, ACL Finding 2026.

3. Sun J, Zhang Q, Tu S, et al. Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning, CVPR 2026.

4.Wang J, Zheng Y, Liu X, et al. Meanfuser: Fast one-step multi-modal trajectory generation and adaptive reconstruction via meanflow for end-to-end autonomous driving, CVPR 2026.

5.Yang P, Lu B, Xia Z, et al. Worldrft: Latent world model planning with reinforcement fine-tuning for autonomous driving, AAAI 2026.

6. Zheng Y, Yang P, Xia Z, et al. Data Scaling Laws for Imitation Learning-Based End-to-End Autonomous Driving, ICRA 2026.

7.Zhang Q, Fang X, et al. ConsistencyPlanner: Real-time Planning withFast-Sampling Consistency Models, ICRA 2026.

8. Gao Y, Zhang Q, Liu D, et al. Perlad: Towards enhanced closed-loop end-to-end autonomous driving with pseudo-simulation-based reinforcement learning, IEEE RAL 2026.

9.Liu D, Gao Y, Qian D, et al. TakeAD: Preference-Based Post-Optimization for End-to-End Autonomous Driving With Expert Takeover Data, IEEE RAL 2026.

10.Xing Z, Zheng Y, Zhang Q, et al. Mimir: Hierarchical goal-driven diffusion with uncertainty propagation for end-to-end autonomous driving, IEEE RAL 2026.

11.Gao Y, Liu D, Zheng Y, et al. SoAD: Safety-Oriented Value Estimation for Enhanced Closed-Loop End-to-End Autonomous Driving, IEEE TSMC, 2026.

12.Zheng Y, Xing Z, Zhang Q, et al. Planagent: A multi-modal large language agent for closed-loop vehicle motion planning, IEEE TCDS, 2026.

13.Yang P, Zheng Y, Qian D, et al. Dreamerad: Efficient reinforcement learning via latent world model for autonomous driving, ECCV 2026.

14.Wang J, Hua Z, et al. Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives, ECCV 2026.

15.Wang J, Hua Z, et al. Hammer: Hierarchical Attention Generation Meets Mixture-of-Experts Evaluation for End-to-End Autonomous Driving, IEEE RAL 2026.

合作情况

   
团队人员

在读硕士生:

1. 邢泽斌,研二,端到端自动驾驶,本科北京邮电大学,长安项目实习, 2024/09   

2.陈庆,研二,大模型搜索工具调用,本科重庆大学(士兵计划),美团项目实习,2024/09

3.胡益铭,研一,扩散模型+强化学习,本科山东大学,哈罗项目实习, 2025/09

4.聂冰言,研一,大模型蒸馏技术,本科贵州大学,哈罗项目实习 2025/09

5.于米提瓦尔·努尔拉,大四,本科国科大人工智能学院, 2026/09

6.熊敬崧,大四,本科南理工(士兵计划), 2026/09


在读博士生:

一、Physical AI

1. 郑宇鹏,自动驾驶感知与预测算法,本科中国科学院大学,博士生,(硕士国奖) (长安项目实习)

2. 刘学义,视觉语言模型的自动驾驶,本科西北工业大学,推免型直博生,(长安项目实习)2023.09

3. 杨鹏轩,RL驱动端到端自动驾驶,本科中国科学院大学,推免硕士+前沿交叉学院转博 (长安项目实习)2024.09

4. 刘德庆,RL驱动端到端自动驾驶,本科山东大学,推免型直博生,(哈罗项目实习)2025.09

5.张一宸,世界模型,本科四川大学,推免型直博生(自动化所),(长安项目实习)2026/09

6.王林博,Physcial AI,本科北京师范大学,推免型直博生(中关村学院),(长安项目实习) 2026/09

二、Agent

1. 涂崧峻,Agent Memory,本科中南大学,推免型直博生(鹏程联合培养),2023.09

2.贾明辉,Agent for Science,前沿交叉学院,2025.09

3.崇雯玥,Agent for Search,前沿交叉学院,2025.09

4.田翔宇,大模型科学发现,本科国科大人工智能学院,推免型直博生(自动化所),(美团项目实习) 2026/09

5.马一文,大模型科学发现,本科天津大学,推免型直博生(前沿交叉学院) 2026/09


博士毕业生:

1. 王俊杰,基于深度强化学习的超车换道决策方法,本科重庆大学,硕博连读(IEEE TNNLS/TII/JAS等),2023年入职百度自动驾驶

2. 刘育琦,自动驾驶路口通行决策算法,硕士空天院(IEEE TCDS/JFI等),2024年入职小米机器人

3. 李丁,自动驾驶联合预测与决策算法,硕士天大(IEEE TNNLS/TIV/TVT/AI Review, 4篇SCI 1区),2024年入职北航卓百博士后

4.孙敬博,强化学习泛化性算法,硕士北理工(CVPR/ICLR/ACL/AAMAS,3篇CCF-A+1篇CCF-B),2026入职美的集团研究院

5.高胤峰,强化学习自动驾驶策略,北科大联合培养(IEEE TIV/TSMC/TITS/RAL,4篇SCI 1区),2026入职Momenta (Mstar顶尖人才计划)


硕士毕业生:

1. 张志远,基于用户行为预测和强化学习的广告推荐策略研究,本科中国科学院大学,2024年港科大(广州)博士深造; (已发表:WWW 24/ ICONIP 24,算法成功落地美团推荐系统)

2. 方兴,离线强化学习算法,本科电子科技大学,2025年入职美团; (已发表:ITSC22/AAMAS 24/IJCNN 25/ICRA 26)

3. 王君礼,基于扩散生成模型的城市场景端到端驾驶策略,本科四川大学,2026年入职它石智航(已发表:CVPR/ECCV/IEEE RAL26)