通过一段视频,就可以生成物理正确的3D场景布局,包含空间中墙壁、门、窗等空间结构元素,以及带有语义类别的定向物体边界框。
今天,群核科技在英伟达GTC2025全球大会上宣布开源空间理解模型SpatialLM。这是一个基于大语言模型的3D场景语义生成框架,它突破了传统大语言模型对物理世界几何与空间关系的理解局限,赋予机器类似人类的空间认知和解析能力。
通俗地讲,给SpatialLM“刷”一段视频,它就能生成物理正确的3D场景布局。相当于为具身智能领域提供了一个基础的空间理解训练框架,企业可以针对特定场景对SpatialLM模型微调,降低具身智能训练门槛。
群核科技SpatialLM模型开源页面
机器人真的“看懂”物理世界了吗?
通过一个具备三维空间感知理解能力的多模态大模型,让机器“看懂”这个世界。近一年来,多模态大模型如何赋能具身智能是行业热议话题。简单地说,在机器人正式“上岗”前,都要先“上学”。
SpatialLM模型就相当于一位老师。
不同于传统大语言模型,SpatialLM突破了对物理世界几何与空间关系的理解局限,赋予机器类人的空间认知和解析能力。就像人类看一段视频能一眼看出视频中的3D场景结构一样,SpatialLM模型能够基于从视频中提取的点云数据,准确认知和理解其中的结构化场景信息。
目前,SpatialLM已在HuggingFace、GitHub、魔搭社区等平台面向全球开发者开源。
群核科技相关技术负责人透露,此次开源仅是开始,接下来SpatialLM模型将继续迭代如自然语言和场景交互等功能。
SpatialLM运行原理
“我们希望打造一个从空间认知理解到空间行动交互闭环的具身智能训练平台。本次开源的SpatialLM空间理解模型旨在帮助具身智能机器人完成在空间认知理解上的基础训练。去年群核科技发布的空间智能解决方案SpatialVerse,则希望进一步通过合成数据方案为机器人搭建最接近物理真实的‘数字道场’,实现机器人在仿真环境中的行动交互训练。”群核科技董事长黄晓煌说。
为什么要让机器人“看懂”物理世界?
为什么让机器人“看懂”物理世界如此重要?
事实上,空间认知是机器人与现实交互的基础能力。但是在训练机器人的过程中,如果用真机进行数据采集存在难度大、周期长和成本高等问题,合成数据成了目前训练机器人最高效的一种方式,而且具有多样性和泛化能力强的特点。
一个有趣的例子是,几年前群核科技跟一家扫地机器人公司合作,完成了机器人对宠物粪便识别的训练。
早期扫地机器人通过碰撞实现转向,最怕碰到的一个极端场景,就是家里宠物的粪便。因为扫地机器人的激光雷达不会识别宠物粪便,碰到之后也不会停下来,常常把家里拖得到处都是。
扫地机器人公司试图用摄像头替换激光雷达来识别宠物粪便,但训练的时候几乎不可能找到一个充满猫屎狗屎的真实场景做实验。于是,找到群核科技通过合成数据来训练。当时,群核科技做合成数据的设计师研究了好几天各种形状的猫屎和狗屎,由于过于逼真,以至于被其他设计师在微博吐槽:猫屎有必要做得这么逼真吗……最后通过合成数据,完美地解决了这个问题。
“我相信全球很快会迎来具身智能机器人的爆发性发展,在具身智能背后,是算力、算法、工程和训练数据四个板块的协同进化,这需要全行业合力推动。”黄晓煌说。
除了发布和开源SpatialLM模型,本次GTC大会上,群核科技展出了空间智能解决方案SpatialVerse。
去年群核科技发布的SpatialVerse,拥有海量室内场景认知深度学习数据,这些参数化场景数据不仅物理正确,同时具备了可交互性。机器人可以在这些仿真场景中,学习人类操作,如开关冰箱门、叠被子等。
两者的区别是,SpatialLM模型通过从视频到结构化场景的转化,将现实世界的数据转化为虚拟环境中的丰富场景,而基于SpatialVerse的合成数据引擎,一个结构化场景又可泛化生成亿万级新场景。两位“老师”协同合作,机器人将获得从认知理解到行动交互的完整闭环训练:既能“看懂”世界,又能学会行动决策,进而在真实世界里顺利“上岗”,更好地完成人类指令。
在空间和具身智能训练上,目前群核科技已与硅谷头部科技企业等在内的一批国内外具身智能企业达成合作。