富士通将在2026年1月6日至9日在拉斯维加斯举行的CES 2026上展示其空间世界模型技术。富士通还计划在2026财年期间在其总部进行技术演示。.

空间世界模型技术的特点

1. 利用三维场景图构建环境空间模型,重点关注人、机器人和物体之间的交互作用

在物理环境中,空间情境会随着空间中存在的参与者(例如人、机器人等)的移动和互动而动态变化。尽管人们已经探索了利用摄像头采集的数据来理解这些空间动态的技术,但不同摄像头的视野范围存在显著差异,以及固定摄像头和移动摄像头在图像表现(例如图像失真)上的差异,阻碍了这些技术在实时应用中的发展。.

因此,富士通没有采用对外观差异高度敏感的像素级集成方法,而是开发了一种利用摄像头通过三维场景图来评估空间的技术;也就是说,它使用一种分层数据结构,将物理空间中的所有物体组织成图中的节点。这种方法最大限度地减少了视野和畸变的影响,从而能够实时理解复杂且不断变化的现实世界环境。.

2. 通过对人、机器人和物体之间交互的建模来预测未来状态和行为

为了实现人机无缝协作,机器人必须能够理解人类行为背后的意图并预测未来的行为。目前,能够让机器人预判变化并根据周围环境采取行动的世界模型技术正被广泛研究,但迄今为止,这些技术仅限于对近距离环境进行建模,无法捕捉整个空间中发生的动态变化。.

富士通公司开发的新方法通过解读空间内行动者和物体之间各种交互产生的因果关系,能够精确估算行为意图。利用这些数据预测未来行为,该技术有助于避免碰撞,并为多个自主机器人生成最佳协作行动方案。.

使用公开引用的学术数据集进行的测试证实,该技术可以将行为意图估计的准确性提高三倍。 [1].

语境

人工智能技术此前主要在数字环境中发展,如今正开始应用于现实世界。物理人工智能是人工智能的一个分支,它训练人工智能理解物理定律并自主行动,将在解决自动驾驶、智能工厂等各种现实挑战中发挥关键作用。这种方法因其有望缓解日本日益严重的劳动力短缺问题并提高工业生产率而备受关注。.

然而,目前物理人工智能的应用主要局限于具有明确路线的结构化环境,例如制造工厂或物流仓库。在家庭和办公室等人员活动难以预测且物品摆放频繁变化的场所,人工智能难以评估空间动态,导致现有解决方案不切实际。此外,在需要大量人员和机器人协作的环境中,协作仍然十分复杂,因为人工智能无法理解彼此行动背后的意图。.

这项新技术基于富士通的计算机视觉技术,该技术主要用于分析商业场所的行人流量并检测异常行为以预防犯罪;同时还融合了富士通的数字人工智能技术,包括能够与人类协同自主执行任务的富士通小津人工智能代理。它是富士通空间机器人研究中心研究成果的一部分。该中心成立于2025年4月,旨在加强富士通在构建人机共存新社会方面的研究。.

笔记

[1] JRDB-Social:用于从摄像头拍摄的图像中估计人类行为和意图的基准。