ARTICLE VIEW

聚焦重点内容,深入理解赛事与行业变化

文章页面围绕阅读效率、重点识别与内容延展进行设计,让用户在更清晰的节奏中完成浏览、分享与继续探索。

深度阅读模式
一场户外烧烤直播,乐享科技把具身智能大模型拉进了“真刀真枪”时代页面视觉图

一场户外烧烤直播,乐享科技把具身智能大模型拉进了“真刀真枪”时代

本篇体育资讯由安博体育整理:

机器人烧烤真正值得看的,不是烤串。

9月16日,乐享科技把搭载以太大模型的机器人拉到上海街头,进行了一场近1小时的户外直播。

现场设置3桌、6位顾客,机器人需要完成从点单、任务规划、烧烤到上菜的完整流程。

按照乐享科技的说法,全程无遥操、无剪辑、无预设脚本;

据其披露,线上围观人数超过550万,现场还有超过30位行业媒体, 一起见证了全球首次机器人完全自主的户外烧烤直播。

如果只看结果,这似乎是一场“机器人又学会了一项新技能”的展示。

但真正让这场直播有别于以往 Demo 的,不是机器人最终把串烤了出来,而是整个过程被放进了一个明显不友好的环境里:没有实验室般的恒定条件,没有提前清场,没有为机器人保留一条绝对顺畅的行动路线,甚至现场的顾客也不是来配合演出的,而是来“添乱”的。

顾客可以临时改单、追加需求、挪动物品、打断任务;

原定一位顾客未能到场后,现场没有停播,也没有重写流程,而是直接从围观人群中随机请了一位补位。

换句话说,乐享没有让机器人演一场“完美烧烤秀”,而是把它扔进了一个更接近真实服务场景的开放环境:人会变卦,物体会移位,流程会被打断,计划会失效。

这也解释了为什么“烧烤”只是一个载体。

真正被检验的,是具身智能在真实世界里的几个硬问题:长时序任务能不能持续推进?

环境变化后能不能重新判断?

被打断后能不能记得回来继续?

失败后能不能恢复?

没有人工接管时,系统还能不能自己把任务做完?

一、一场把不确定性变成了演示本身的直播 过去两年,具身智能行业并不缺少惊艳视频。

机器人叠衣服、冲咖啡、翻跟头、擦桌子,镜头越来越精致,节奏越来越紧凑,配乐越来越燃。

但这类内容也始终伴随着同一种质疑:我们看到的是第几次成功?

镜头之外失败了多少次?

如果现场突然有人走过去,如果道具被挪动,如果任务中途被打断,机器人还能不能继续?

演示视频的价值在于证明“做到过”,却很难回答“能不能持续做到”。

这正是乐享这场直播试图改变的叙事方式。

它没有把不确定性剪掉,反而把如何解决各种不确定性变成了演示本身。

从直播呈现看,几个片段颇具代表性。

服务机器人在点单过程中被顾客临时要求“拿瓶水”,它没有卡在原地,也没有继续机械完成当前流程,而是先完成送水,再回到点单任务。

负责烧烤和负责服务的两台机器人本体不同,却能围绕同一任务自主协作、交接任务。

还有一个细节是,机器人在没有人吩咐的情况下,主动为顾客递上纸巾。

这些瞬间之所以重要,是因为它们不再是简单的“指令—执行”。

尤其是递纸巾这类动作,并不在任何明确指令里,它更像是机器人基于“人在吃烧烤”这一场景做出的自主推导。

工具等待命令,智能则需要理解场景。

二者之间的差别,不在于动作是否漂亮,而在于系统能不能从环境、任务和人的状态里推出下一步该做什么。

当然,直播里也并非没有瑕疵。

机器人像人一样,第一次操作的时候,需要个了解的过程,没那么流畅,但可贵的是,失误的经验会直接成为下一次成功的执行基底。

但恰恰是这些没有被藏起来的过程,让这场直播比一支精修视频更具价值。

对于具身智能来说,真正拉开差距的未必是不犯错,而是犯错或者遇到未知挑战的时候,能不能持续自进化,最终解决掉问题。

乐享想证明的,也正是以太大模型在遭遇计划外情况时,能否仍能维持任务状态并继续推进。

二、以太大模型,被放在 VLA、WAM 之外的“第三条路” 支撑这些表现的,是以太大模型背后一套全新的具身大模型的思路。

根据乐享提供的资料,以太大模型是全球首个跨本体通用具身大模型,核心不是简单回答“下一步该做什么”,而是试图解决一个更接近真实世界的问题:当环境突然变化、原计划失效时,机器人能否自己发现问题、重新判断、调整策略,通过自主智能、自进化,继续完成任务。

在路线选择上,以太大模型被放在 VLA、WAM 之外的“第三条路”来叙述。

VLA 更强调从视觉、语言和状态到动作的映射,回答“看到场景后下一步怎么做”;

about image

WAM 或世界模型路线进一步引入对未来变化的预测,回答“动作之后世界会怎样”。

而乐享进一步追问的是:预测出来的动作,最终能不能被一副真实的身体做出来。

因为机器人面对的不是屏幕里的下一帧,而是一个会持续反作用于身体的物理世界。

重量、摩擦、碰撞、人的突然介入,都可能让原本合理的动作在执行时失效。

因此,以太大模型采用了以神经元分配为核心的能量驱动架构,把目标完成度、动力学一致性、记忆一致性和物理约束放进同一套连续机制中。

更通俗地说,机器人不是机械回放训练过的动作,而是在“感知—判断—行动—反馈”的闭环里持续修正自己。

现实世界的每一次反馈,都会重新进入模型,影响它下一步的判断和行动。

乐享给出的关键数据是:200小时人类视频、0小时真机训练数据、4B参数。

这组数据的意义不在于证明以太大模型已经到达通用智能,而在于它试图探索一条不完全依赖海量真机数据和参数堆叠的 Physical

更多体育热点,关注安博体育。

上一篇:《交锋》大结局:蒋在珍没死,才知,吴声来为何用林看山交易礼卿... 下一篇:难怪不准中方借道,越南专机抵美,将与美国签协议,两波争端打响...

推荐阅读