微软推出MindTopo评测框架,暴露多模态AI空间推理短板

8月12日,微软研究院公布新的多模态AI评测框架MindTopo,重点测试视觉语言模型对空间拓扑关系的理解与规划能力。测试内容包括路径连通、区域封闭、物体顺序、分离关系以及绳结等任务。

研究结果显示,目前多模态模型在观察单张静态图片时已经具备一定空间识别能力,但一旦任务变成连续操作和多步骤规划,模型更容易丢失前面的空间关系,甚至给出违反物理约束的操作方案。

这类能力直接关系到机器人、具身智能和计算机操作Agent的发展。相比单纯“看懂图片”,未来AI还需要在环境持续变化的情况下记住物体之间的结构关系,并根据变化完成连续决策。MindTopo的出现,也说明AI评测正在从问答准确率进一步转向真实环境中的推理和执行能力。


上一篇:

发表回复

评论列表

    Loading...

    联系我们

    在线咨询: QQ交谈

    微信:叁叁

    邮件:794033364@qq.com

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信