}


新智元报道


8 月 19 日,宇树科技在科创板敲钟上市,市值约 610 亿元。

同一天,英伟达 CEO 黄仁勋的女儿黄敏珊飞抵北京逛 WRC 世界机器人大会。


而就在第二天北京时间凌晨,硅谷机器人公司 Generalist AI 发布了新一代基础模型 GEN-1.5。

两个月前,斯坦福教授李飞飞刚以个人身份投了 Generalist AI 的 4 亿美元融资,同轮天使投资人还有小米联合创始人林斌和 Zoom 创始人袁征。英伟达也是股东。聪明钱和聪明人同时涌向同一个方向。

GEN-1.5 给出了它们投资的理由:给机器人看一段 3 到 12 秒的动作演示,不训练、不微调,当场执行,10 个操作任务平均成功率 59%。


以前教一个机器人拧瓶盖,工程师要编程三个月。现在需要的全部投入是一段三秒钟的演示,和零行代码。

多位顶尖研究者将这一刻类比为 2020 年 GPT-3 的发布,认为具身智能走到了自己的 GPT-3 时刻。

完整官方演示视频:

https://www.youtube.com/watch?v=1cllCVK-9lo


没人教过的策略
从预训练中涌现

GEN-1.5 最让研究者震动的能力不是模仿,关键在于即兴发挥。

Generalist AI 做了一个实验:用 5 分钟的人类演示数据(只做了 1 个梯度步骤的微调),教机器人用刷子把积木扫进碗里,然后替换工具。

给它一根香蕉,它把香蕉当成刷子,横扫积木入碗——这不奇怪,香蕉的形状和接触策略与刷子类似。


给它一个簸箕,它放弃了「扫」的策略,用另一只手把积木推上簸箕,抬起簸箕,把积木倒进碗里。


「扫」和「铲起来倒」是两种完全不同的接触序列,训练数据里没有教过这套动作。

Generalist AI 用最近邻语言搜索在约 189 万段预训练场景中检索,没有找到类似的簸箕用法。

没有人在任何阶段告诉模型应该这样做。

类似的即兴行为在测试中反复出现:碗被一张纸盖住了,模型自己掀开纸再放积木,有时还会把纸盖回去,但训练数据里没有这个场景。


一块乐高积木粘在机械手指尖上,模型用另一只手把它拨下来。


训练数据只演示了用一只手旋转罐盖,模型在某些尝试中自发切换到双手操作,采用了完全不同的抓取和旋转策略。


一个只被训练放一块积木进一个碗的模型,开始自发按颜色分拣多块积木。

这些能力有一个共同来源:大规模预训练。

GEN-1.5 已经连续预训练超过 8 个月,经历了三个训练阶段。

Generalist AI 公布的验证集曲线显示,模型的「下一步动作预测误差」持续下降,至今没有出现收敛的迹象。

用大语言模型领域的术语说,这就是具身智能的 Scaling Law(缩放定律):随着物理交互数据的规模增大和训练时间的延长,模型的泛化能力在持续增强。

一个反直觉的发现让这条线索更加清晰:微调的梯度步骤越少,即兴发挥能力越强。

Generalist AI 的解释是,轻度微调让模型更接近预训练积累的广泛行为库,保留了更多可调用的「物理经验」。

10 个梯度步骤只改变了模型参数的 0.15%。

Generalist AI 的说法是:这已经接近于「提醒模型一些它几乎已经知道的事情」。

GEN-1.5 还跨越了两道长期困扰机器人领域的鸿沟。

在模拟器里录制一段演示(尽管预训练数据中不包含任何仿真数据),塞进上下文窗口,真实机器人直接执行任务,并且能泛化到不同的机械手和新的物体位置。

在部分测试中,一个人直接用自己的双手在机器人摄像头前演示动作,机器人随后用机械手复现了任务。

Generalist AI 表示,所有这些能力都不是刻意设计的结果:没有专门促进上下文学习的架构改动,没有元学习循环,没有鼓励即兴发挥的辅助训练目标。

这些能力从大规模物理数据的预训练中自行出现。

「操作学习的圣杯」

其他研究团队此前也展示过类似的上下文学习能力,但仅限于少数任务类型,GEN-1.5 的新颖之处在于覆盖面;所有结果均为 Generalist AI 自行报告,尚未经过独立验证。

任务本身是简单的短程操作(拧瓶盖、拉拉链),距离真实场景中的长程复杂任务仍有很大距离。

GPT-3 发布于 2020 年 6 月,从 GPT-3 到 ChatGPT 过了两年半(是的,两年半)。

GEN-1.5 现在的位置与 2020 年的 GPT-3 类似:能力粗糙但方向明确,任务简单但 Scaling 趋势清晰。

Generalist AI 在官方博客中写了一段引人深思的话:

过了某个预训练阈值之后,适配一个新任务的成本变得可以忽略不计。

涌现的上下文学习、几秒钟的数据、或者一个梯度步骤加一分钟的演示,已经不再是传统意义上的任务特定训练,更接近于提醒模型一些它几乎已经知道的事情。


如果具身智能的 Scaling 曲线确实没有收敛的迹象(Generalist AI 说他们还没有看到),那么下一轮竞争的核心资源就变成了谁拥有足够多的物理交互数据来喂给这台引擎。

这和 2021 年大语言模型进入数据争夺战的剧本,如出一辙。

看一遍就能学会

59% 和 83% 两组数字背后的拐点

2020 年 6 月,OpenAI 发布 GPT-3。

这个模型做了一件当时没人做到的事:不需要重新训练,只要在对话框里给几个例子,它就能完成新的语言任务——给一组「红→苹果,黄→香蕉」的例子,再问「绿→?」,它能答出「西瓜」。

这种能力叫 in-context learning(上下文学习),是大语言模型从「专用工具」变成「通用平台」的分水岭。

GEN-1.5 把同样的事搬进了物理世界。

Generalist AI 称之为 Physical Prompting(物理提示)。

操作方法很直接:一段真实的动作演示(包含传感器数据和动作轨迹)塞进模型的 30 秒上下文记忆窗口,剩余空间用来接收实时环境观测。

模型立刻尝试执行,整个过程没有任何训练步骤。

这里需要解释一个对理解 GEN-1.5 至关重要的概念:梯度步骤(gradient step)。

传统做法中,教机器人学新任务需要数万步梯度下降,每一步都是对模型内部参数的一次微调——这个过程通常需要大量数据和大量算力。

GEN-1.5 的 one-shot 模式(只演示一次的模式)跳过了全部梯度步骤,模型参数纹丝不动。

Generalist AI 在 10 个不同的操作任务上测了 GEN-1.5 的表现:拧开玻璃罐盖、拉开笔袋拉链、从钱包里取钱、叠纸、叠杯子、翻手机、用刷子扫积木、打开书本封面、撕开真空垫、清扫垃圾。

结果分两组:

one-shot(看一遍,零梯度步骤):10 个任务平均成功率 59%(标准差 ±10%)。

few-shot(少样本,5 分钟数据、约 50 次演示、10 个梯度步骤):平均成功率 83%(标准差 ±9%)。


2020 年 GPT-3 在语言任务上的数字拿来对照:one-shot 约 45%,few-shot(约 100 个例子)约 65%。

两组数字的结构高度相似。

这组数字的含义可以这样理解:在大语言模型出现之前,让 AI 做一个新的语言任务(比如翻译一种没见过的格式),需要专门采集数据、训练一个新模型,周期以月计。

GPT-3 之后,这件事变成了「在输入框里写几个例子」,时间成本从数月压缩到数秒。

GEN-1.5 在物理操作领域做了同样的压缩。

以前教机器人拧瓶盖,需要工程师编程数月或者喂数万条训练数据反复调参。

现在,一段 3 到 12 秒的演示就够了。

Generalist AI 在官方博客中写道:这改变了两件事:机器人变有用的速度(从数月到数秒),以及谁能使用机器人(从专家到任何人)。


机器人沸腾的一周:宇树上市
机器人大会与运动会同时开幕

GEN-1.5 发布的时间点,落在整个具身智能行业最密集的一周。

8 月 19 日开始,WRC 世界机器人大会在北京亦庄开幕,300 余家企业、超过 2000 件展品、150 余款全球首发新品集中亮相。

三天后的 8 月 22 日,第二届世界人形机器人运动会在国家速滑馆「冰丝带」开赛——666 支队伍携 2056 台机器人参加 51 个项目的 1301 场比赛,队伍数量比首届增长 138%。

运动会首次设置 21 个场景赛项,要求人形机器人在工厂、酒店、家庭服务等真实环境中完成长程任务,机器人「上岗实测」成为主题。

刚敲钟的宇树科技,2025 年人形机器人出货量超过 5500 台,全球第一,营收 17 亿元,毛利率 60%,DeepSeek 也参与了战略配售。

但宇树的招股书里藏着一组反差数据:2026 年一季度营收增速从上年同期的 332.64% 回落至 68.49%,扣非后净利润同比下降 52.55%。增速放缓的核心原因是研发投入大幅增加。

宇树在追赶的,正是它还没有的东西:具身智能大模型。

「新立场Pro」在一篇分析(《宇树科技的招股书里,藏着对工程奇迹“保质期”的焦虑》)中写过宇树面临的结构性困境:宇树造出了全球出货量第一的躯体,但「大脑缺席」。

2026 年被称为具身智能的「上市大年」,超过 20 家公司明确了上市计划,但驱动上市潮的很大程度上是资金压力。

大量竞争对手依赖一轮接一轮融资维持运转,研发节奏被融资窗口牵着走。


图源:晚点LatePost《具身智能的金钱游戏》

宇树创始人王兴兴在 WRC 上公开表示,限制人形机器人发展的主要瓶颈是具身智能大模型,「预计未来快则两到三年,慢则五到十年,有望实现机器人的 ChatGPT 时刻」。

GEN-1.5 的发布,可以视为对这个判断的第一个实证回应。

Scaling Law 在具身智能领域存在,大规模预训练能让新任务适配的边际成本趋近于零。

这个结论对宇树这类躯体厂商有直接的产业含义:一旦大脑层面的通用模型成熟,躯体的价值将取决于它能多快接入这颗大脑,而不仅仅是硬件参数和出货规模。

Generalist AI 的团队背景与这条技术路线高度一致。

联合创始人 Pete Florence 和 Andy Zeng 来自谷歌 DeepMind 机器人团队,Andrew Barry 来自波士顿动力。


从左至右分别为:Pete Florence, Andrew Barry, Andy Zeng

公司 2026 年 6 月完成 4 亿美元融资,Radical Ventures 领投,英伟达和 Bezos Expeditions 参投,投后估值 20 亿美元。

Generalist AI 正在以 30 亿美元估值洽谈新一轮融资。

硅谷大佬们

迎来久违的集体沸腾时刻

这次发布在机器人研究社区引发了强烈反应。

联合创始人 Pete Florence 在 X 上写道:

自从开始研究机器人基础模型以来,广泛的 one-shot 上下文学习一直是我心中最清晰的目标。

现在我看到了将近十年的想象走进现实世界。


https://x.com/peteflorence/status/2090165901509411299

Florence 提到,他和 Andy Zeng 在研究生阶段就讨论过一种「Ctrl-C-Ctrl-V」式的能力:看到一个动作,机器人就能复制——但实现它极其困难,因为「你想粘贴的那个世界,和你复制的那个世界永远不一样」。

卡内基梅隆大学机器人研究者 Chris Paxton 在 X 上称 GEN-1.5「可能是真正的 GPT 时刻」,并写道:

操作学习的圣杯,毫无疑问,就是 one-shot learning。


https://x.com/chris_j_paxton/status/2090270734816092334


https://x.com/chris_j_paxton/status/2090210797125611972

美国东北大学具身智能研究者 Jimmy Yang 转发时说:

作为具身 AI 研究者,这对这个领域来说是一个真正特别的时刻。


https://x.com/JimmyTYYang1/status/2090202923632366073

英伟达机器人技术总监 Jim Fan 的评论提供了一个深入的技术观察视角。

他指出 GEN-1.5 涌现能力的两个关键因素:

一是训练数据中自然存在的对称重复动作模式,比如组装家具时反复拧螺丝,第二颗螺丝就是第一颗的「上下文学习样本」;

二是数据中人类失误后的恢复动作,东西掉了捡起来继续,这种「失败-恢复-继续」的完整弧线让模型在测试时自然展现出纠错能力。

Jim Fan 还指出,Generalist AI 使用的 UMI 数据采集方式(人直接戴着机器人夹爪操作)保留了人类的「物理直觉」,传统遥操作中经过 VR 设备的中转会让这种直觉大量流失。


https://x.com/DrJimFan/status/2090465981240086992

当然,理性的冷水也同样存在。

Jim Fan 在同一条推文的评论区里写道:

演示目前仍然有点太简单了,还不能下结论。


https://x.com/DrJimFan/status/2090469108764823587

参考资料:

https://generalistai.com/blog/gen-1.5

编辑:马可