7月15日,通用具身基础模型公司智在无界BeingBeyond正式发布Being-M0.7——全球首个全身移动操作隐式世界动作模型(Latent WAM)。这不是一个只能让机器人"看到"世界的模型,而是一个能让机器人"理解"世界如何运转、并据此做出全身移动操作的模型。它打通了从视觉感知到全身移动、再到灵巧操作的完整链路,让机器人不再局限于桌面及操作任务,而是成为真正具备人类全身协调能力的智能体。
论文链接:https://research.beingbeyond.com/being-m07/being-m07.pdf
► 从Being-H到Being-M,智在无界持续引领隐式世界动作模型范式
Being-M0.7是这一隐式世界动作模型路线的最新成果,也是全球首个将隐式世界动作模型能力从"桌面灵巧操作"扩展到"全身移动操作"的模型。隐式世界动作模型让机器人建立对物理世界的"内心推演":不只是识别眼前的物体,还要预判它们会如何运动、如何相互作用、自己的动作会对环境产生什么后果。这些推演不需要生成任何像素画面。模型在表征里直接"感知"到物理规律的存在,从而精准输出动作完成任务。

视频说明:机器人走到鱼缸前,手持渔网从水中捞鱼。液体没有固定形状,会对浸入的物体产生浮力和阻力。机器人通过判断水、渔网和鱼之间的相互作用,协调手臂完成捞鱼动作。
视频说明:机器人抱着箱子穿越障碍物,在第一人称视角被箱子遮挡的情况下,依然能够预测规划行走路线,并自主决策,侧身通过狭小区域,体现多方向移动、避障和负载感知操作的闭环。


三、可扩展的多模态融合范式,通往更通用的具身智能
这只是起点。未来,随着文本、音频、触觉等多模态数据的持续引入,模型对物理世界的理解将更加立体和完整。文本可以提供高层任务语义,音频可以捕捉环境声音线索,触觉可以反馈接触力与材质信息——这些信号与视觉、运动数据在 MoT 架构中分层融合,将让机器人不仅能"看到"和"动起来",还能"听懂指令"、"感知材质"、"理解语境"。随着数据规模的持续Scale Up,这套范式的能力边界将持续向外拓展。