李飞飞团队发布 ESI-Bench,揭示多模态模型具身智能关键短板

李飞飞团队推出具身空间智能评测基准 ESI-Bench,基于 OmniGibson 平台构建,涵盖10类29子类共3081个任务,强调“感知-行动回路”。测试显示,GPT-5、Gemini 等模型在最优视角下准确率可达95.1%,但自主探索时显著下降,暴露动作策略不足问题。同时,不完美3D重建会因几何误差降低推理效果,甚至劣于2D输入。研究还指出模型存在“元认知缺陷”,难以判断信息充分性。该基准推动评测从被动感知转向真实交互,为具身智能发展提供新方向。

上一篇:

下一篇:

发表回复

登录后才能评论