近日,前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索。
公开资料显示,孙鹏博士毕业于清华大学,先后在康奈尔大学和罗格斯大学从事博士后研究,长期专注强化学习、智能体及多智能体强化学习研究。他在腾讯AI Lab与Robotics X期间曾任智能体中心负责人,利用深度强化学习和对抗博弈训练轮式机器人,实现端到端主动目标跟随,并研发了《星际争霸》AI智能体TStarBots和TStarBotX。加入字节跳动后,他主导开发了核心强化学习基础设施ByteRL,支撑多款自研游戏AI训练;其团队曾夺得IEEE CoG 2023策略卡牌AI竞赛冠军。在大模型技术快速迭代过程中,孙鹏将强化学习经验延伸至后训练领域,以项目负责人身份主导研发强化微调方法ReFT及数学推理智能体DeltaProver,并在Seed团队参与模型预训练与RLHF对齐工作。
强化学习成为具身智能关键环节
孙鹏的技术积累始终围绕智能体如何通过环境交互与反馈持续优化策略。随着AI能力进入真实物理世界,具身智能的评判标准正从“能不能做任务”转向“能不能稳定反复做好”。模仿学习解决“怎么做”,强化学习解决“做错了怎么改”。当任务成功率推进到一定程度后,开放环境下的自适应与纠偏能力成为瓶颈,强化学习后训练因此成为具身智能不可绕开的核心环节。
星尘智能自成立起坚持Design for AI,主张机器人身体、数据与AI模型协同设计,逐步形成基座模型、前端Agent与强化学习后训练三者联动的全栈技术体系。基座模型Lumo系列负责环境与动作的理解、预测和生成,其中Lumo-1关注动作背后的意图逻辑,Lumo-2引入Latent World Dynamics,让机器人“先想后做”。前端Agent Philia承担长期记忆、任务管理、多机器人协同与自然交互等功能。孙鹏加入后,将进一步强化机器人在真实环境中持续学习与进化的能力,公司也将扩充机器人强化学习团队,推动相关技术落地。




