蚂蚁集团Robbyant开源LingBot-Vision视觉模型家族

蚂蚁集团旗下具身智能公司Robbyant近日开源LingBot-Vision模型家族。该系列自监督视觉Transformer以“边界”作为预训练信号,采用掩码边界建模,面向机器人密集空间感知、深度估计等任务。其旗舰ViT-g/16约11亿参数,在NYU-Depth v2等任务中表现优于70亿参数DINOv3,训练语料规模约为后者三分之一。团队同时升级LingBot-Depth 2.0,提升透明物体等场景的深度补全准确率。目前模型已在Hugging Face以Apache-2.0协议开源,提供giant至small四种尺寸权重及推理代码。

上一篇:

下一篇:

发表回复

登录后才能评论