}


8月19日至23日,2026世界机器人大会在北京举行。大会期间,眸深智能联合创始人、首席科学家陈涛教授发表主题演讲,围绕“具身智能4.0:端侧原生的机器人世界运动模型”,系统分享眸深智能在机器人运动智能、三维空间感知、端侧部署与模型自进化等方向的最新探索。


“我们团队从2019年开始,就在针对机器人的智能大脑做相关工作。”演讲中,陈涛回顾了眸深智能在具身智能领域的技术积累。从2022年的MLD,到2023年的MotionGPT,再到MotionChain、MotionStream、MotionGPT3,以及后续的LL3DA、HL3DWM和STIWMM,眸深智能持续围绕机器人“运动”这一核心问题展开研究。从最初的动作生成,到长程动作交互、三维空间理解,再到时空一体的世界动作建模,团队逐步形成了从“理解”到“生成”、从“规划”到“执行”的技术体系。

基于这一系列积累,眸深智能进一步提出第四代模型——World Motion Model(世界运动模型)。陈涛介绍,与以语言预测为核心的传统大模型不同,World Motion Model希望利用Next Token Prediction能力,进一步预测机器人下一步的隐式状态与动作,将世界理解、运动规划与动作生成连接起来。

“我们希望做的是一个机器人原生的大脑。”在陈涛看来,具身智能的关键并不只是把模型做得更大,而是让模型真正理解机器人所处的世界,并能够把这种理解转化为可执行的运动。

围绕这一目标,陈涛重点介绍了眸深智能在数据与空间智能方面的探索。在数据层面,真实机器人数据的获取成本一直是制约具身智能规模化训练的重要因素。眸深智能没有完全依赖大规模真机数据,而是探索将互联网视频、关节动捕和真机数据结合起来,通过不同类型的数据完成世界知识学习、动作学习和机器人本体对齐。

在空间智能方面,眸深智能希望让机器人真正“看懂”三维世界。以LL3DA为代表的三维空间理解技术,以及EgoExoLLM、Ego-affordance Estimation等工作,分别从三维环境理解、第一视角与第三视角协同推理、机器人可交互区域理解等方向进行探索。

这些技术最终指向同一个目标:机器人不仅能够生成一个动作,更能够理解“为什么这样动、在哪里动,以及下一步应该做什么。

如果说模型能力解决的是“机器人能不能做”,那么端侧部署解决的则是“机器人能不能真正用起来”。

陈涛在演讲中重点介绍了眸深智能长期积累的模型轻量化与端侧推理能力。针对具身模型参数规模大、推理成本高的问题,团队持续开展模型压缩、算力适配和芯片编译层优化,相关成果包括PAGCP、MADTP、MADTP++等。据介绍,相关技术最高可实现75%的参数压缩、62倍计算量降低,以及端侧20倍推理加速。

与此同时,团队也在探索机器人智能的持续进化。最新的T2VLA工作尝试利用模型自身的置信度,通过Test-time RL实现无需外部奖励的自举策略优化,并在多个机器人操作benchmark中验证跨架构、跨场景的性能提升。

陈涛表示,未来机器人智能不应只依赖训练阶段不断增加数据,也需要具备在运行过程中持续优化的能力。

在演讲最后,陈涛将话题落到机器人产业化。在他看来,通用具身大脑最终需要进入真实的机器人、真实的工厂和真实的生活场景,而不是停留在实验室里的Demo。因此,眸深智能正在通过不同机器人本体和应用场景持续验证模型的泛化能力。

原标题:《2026世界机器人大会:眸深智能首席科学家陈涛分享具身智能4.0技术路线》