蚂蚁集团开源LingBot-Vision,赋予机器人“空间感

蚂蚁集团Robbyant开源LingBot-Vision模型家族,采用自监督视觉Transformer和创新“边界建模”方法,在密集空间感知任务中取得出色表现,多项指标超过参数规模数倍的大模型,有望突破视觉基础模型偏重物体识别的局限,推动机器人精准理解物理空间。
在具身智能的发展过程中,如何让机器人准确理解真实物理空间,一直是需要突破的关键问题。近日,蚂蚁集团旗下具身智能公司Robbyant正式开源LingBot-Vision模型家族。该系列模型采用自监督视觉Transformer架构,并引入“边界建模”方法,在密集空间感知任务中取得了突出表现,多项指标甚至超过了参数规模数倍于自身的顶尖模型。
从识别物体转向理解空间
当前不少视觉基础模型主要解决“画面中有什么”这一识别问题,但对于机器人开展物理交互而言,物体的边界、轮廓和深度信息同样至关重要。LingBot-Vision重新调整了视觉建模的重点,将“边界”直接纳入原生预训练信号。
借助掩码边界建模技术,LingBot-Vision能够定位图像中信息密度较高的边界区域,并将这些区域作为训练重点。通过这种方式,模型不仅能够完成语义层面的理解,还进一步形成了较强的几何空间感知能力。
较小参数规模也能实现高性能
在具体测试中,LingBot-Vision旗舰模型ViT-g/16的参数量为11亿,但在NYU-Depth v2等深度估计任务中取得了最佳表现。其性能不仅超过了参数规模达到70亿的DINOv3,训练所使用的语料库规模也只有后者的大约三分之一。
针对实际部署中算力资源有限的场景,LingBot-Vision还提供了从3亿参数到更小规模的蒸馏版本。借助不同尺寸的模型配置,该系列能够适配多种硬件条件,同时保持较强的密集预测性能。
同步升级深度补全系统
为进一步体现这项技术的应用价值,研发团队还同步推出了升级版深度补全系统LingBot-Depth 2.0。测试结果显示,在透明物体等长期困扰传统视觉感知系统的场景中,该系统的准确率有了明显提升。
随着训练数据规模扩大,LingBot-Vision的性能仍在持续提升,没有出现传统模型中较为常见的性能饱和现象。这表明,以边界信息为核心的空间感知架构,在应对复杂现实环境方面具备较大的发展潜力。
面向开发者开放
目前,LingBot-Vision已在Hugging Face平台按照Apache-2.0协议完全开源,提供从giant到small四种尺寸的模型权重及推理代码。随着相关技术进一步普及,开发者有望以更低的算力成本,为机器人构建更加敏锐的物理空间感知能力,推动具身智能向更精准的交互方向发展。
