当前位置 > 散户吧 > 财经要闻 > 经营管理 > 不只强在硬件!宇树6B具身大脑拿下7项开源SOTA,对标GPT-6 Astra

不只强在硬件!宇树6B具身大脑拿下7项开源SOTA,对标GPT-6 Astra

发布时间:2026-09-20 03:47来源:全球财经散户吧字号:

不只强在硬件!宇树6B具身大脑拿下7项开源SOTA,对标GPT-6 Astra

本文来自散户吧WWW.SANHUBA.COM

不只强在硬件!宇树6B具身大脑拿下7项开源SOTA,对标GPT-6 Astra

本文来自散户吧WWW.SANHUBA.COM

图片

本文来自散户吧WWW.SANHUBA.COM

  中国具身智能抢“安卓时刻”!作者 | 江宇

本文来自散户吧WWW.SANHUBA.COM

  编辑 | 漠影

本文来自散户吧WWW.SANHUBA.COM

  全球具身智能的竞争,正从本体的比拼延伸到“大脑之战”。谷歌Gemini Robotics 2喊出“一个大脑,适用于任何机器人”,英伟达Jim Fan更是抛出“VLA已死,世界动作模型当立”。谁能成为具身智能的新一代通用模型底座?国内,宇树科技正在把这件事往前推一步。近日,宇树新一代通用人形机器人基础模型UnifoLM-WLA-1.0亮相,6B参数、约2500小时真机训练,具身推理直接拿下7项开源SOTA,多项空间理解任务还反超GPT-6 Astra。同时,宇树宣布将开放模型、代码和数据集。 本文来自散户吧WWW.SANHUBA.COM

图片 本文来自散户吧WWW.SANHUBA.COM

  对于机器人而言,模型能力还是要落到真实任务中。人形机器人什么时候能进入更多真实场景,实现“通用劳动力”?宇树正在试图回答这一灵魂一问。UnifoLM-WLA-1.0单模型即可统筹64项任务,从叠毛巾、收纳餐具,到铺床、倒垃圾、把衣服放进洗衣机,验证了其强大的模型泛化能力。

本文来自散户吧WWW.SANHUBA.COM

不只强在硬件!宇树6B具身大脑拿下7项开源SOTA,对标GPT-6 Astra

本文来自散户吧WWW.SANHUBA.COM

  这背后藏着行业多年未解的老问题。过去的Demo多是单一任务、单一场景、高度定制,演示起来漂亮,换个环境就难复用,始终难以规模化。而一套模型能否覆盖更多任务、更多场景,恰恰是机器人走向通用的重要一步。宇树此举,正试图让国产厂商成为“具身智能大脑”的定义者。 本文来自散户吧WWW.SANHUBA.COM

  01.拿下7项开源SOTA,比肩GPT-6 Astra:国产厂商抢“具身大脑”定义权

  先看具身推理能力。UnifoLM-WLA-1.0的具身推理底座是UnifoLM-ER-1-4B。该模型基于Qwen3-VL-4B训练,使用超过500万条具身推理样本,在16项多模态感知与理解基准中有7项领先表中参评的开源模型。 本文来自散户吧WWW.SANHUBA.COM

图片

本文来自散户吧WWW.SANHUBA.COM

不只强在硬件!宇树6B具身大脑拿下7项开源SOTA,对标GPT-6 Astra 本文来自散户吧WWW.SANHUBA.COM

  其中部分空间理解能力已经逼近甚至超过头部闭源模型。 在Where2Place、BLINK、CV-Bench和EmbSpatial等基准中,UnifoLM-ER-1-4B的部分成绩高于GPT-6 Astra。以Where2Place为例,UnifoLM-ER-1-4B得分82.0,GPT-6 Astra得分69.0;在EmbSpatial上,两者分别得分88.9和83.3。 对机器人来说,空间理解比单纯聊天能力关键得多。看得懂东西在哪、怎么摆、下一步会发生什么,才谈得上做得对,也才具备走进真实世界的资格。 再看执行能力。UnifoLM-WLA-1.0把感知、推理、未来变化预测和动作生成连接起来,一个模型覆盖64项任务,包括54项桌面操作和10项全身操作,并支持二指夹爪和多种五指灵巧手。 桌面侧,它能叠衣服、收纳餐具、给电池充电、整理铅笔盒; 本文来自散户吧WWW.SANHUBA.COM

不只强在硬件!宇树6B具身大脑拿下7项开源SOTA,对标GPT-6 Astra 本文来自散户吧WWW.SANHUBA.COM

  全身侧,它会倒垃圾、铺床、整理鞋、把文件夹放进柜子。 本文来自散户吧WWW.SANHUBA.COM

不只强在硬件!宇树6B具身大脑拿下7项开源SOTA,对标GPT-6 Astra

本文来自散户吧WWW.SANHUBA.COM

 

本文来自散户吧WWW.SANHUBA.COM

  把这些能力合起来看,宇树正在尝试把“具身智能大脑”概念变成一套可以在真机上验证的模型体系。这家公司不再只是本体强者,而是在抢开源生态话语权,对标“安卓之于手机”:底层能力保持开放,开发者围绕其适配不同设备和场景,最终形成一个不断扩大的生态。 本文来自散户吧WWW.SANHUBA.COM

  02.先预测“哪里变”,再生成“怎么动”让世界模型落到动作上

  要取得这样的成果并不容易。过去的VLA更像“看图做动作”,看到物体、理解指令,再生成动作。但真实世界高度动态,一个动作往往会改变下一秒的环境,只对眼前这一帧做判断,往往不够。为此,宇树把“具身推理+未来变化预测+动作学习”放进同一体系,让机器人在动手之前,对动作可能带来的变化形成判断。其中一个关键设计,就是把“哪里会发生变化”单独拿出来学习。宇树首先利用光流,对机器人执行动作前后的画面进行比较。 本文来自散户吧WWW.SANHUBA.COM

图片

本文来自散户吧WWW.SANHUBA.COM

(小编:财神)

专家一览机构一览行业一览