大模型现在已经能够非常准确地识别出目标对象, 也能够弄明白具体要执行的操作含义是什么了, 不过, 当大模型真正去驱动机械臂把这整个任务从头到尾完整地做完的时候, 那个最终成功的几率也就大概只有百分之五十的样子罢了。

VA-Bench这个基准最近是正式发布出来了, 它所做的努力, 就是想要把从“看清楚、弄懂了”到真的能够“给做好了这件事”之间的那段距离, 做一个具体的量化出来。

空间理解与精确执行的落差

在目标识别以及定位这个方面, 目前最强的模型其得分都已经达到了百分之百的程度, 而对于操作语义的理解能力, 其表现也稳定在百分之九十九点六到百分之百之间这样一个区间范围之内。

但是, 从简单的“找到瓶子”这一动作指令, 过渡到“夹爪在正确高度闭合”这样一个具体的操作细节的过程当中, 现有的模型依然频繁地出现失误的情况, 由此我们可以看出, 精确执行各项具体任务的能力, 仍然是当前模型系统中一个非常明显且突出的短板所在。

现在存在的空间推理基准测试, 大多数都是由评测的人预先设定好的问题。在这种情况下, 模型只需要给出一个答案就可以了。但是VA-Bench这个评估方式要求不一样。

它需要模型进入到一个真正的机器人所在的环境之中。然后模型要自己去判断手上的信息是否足够充足。根据这个判断结果, 再决定接下来是选择继续去观察, 还是说直接就去采取行动。

闭环测试的设计逻辑

VA-Bench涵盖14类机器人操作任务, 包括11类单臂和3类双臂, 每类包含20个物理验证场景, 总共提供280个基础场景。在测试之前, 模型只会观看示范视频。该过程不包含坐标与轨迹参数。

在测试的过程中, 模型有机会主动去切换观察的视角, 但是每一次进行这种视角的切换, 都会消耗掉一定的交互步数, 这就需要模型必须在仔细观察现状和采取具体行动之间做一个取舍。

到了最后这一步的时候, 模型必须直接把需要移动的具体距离数值、需要旋转的具体角度数值, 以及控制夹爪打开或者关闭的最佳时机给输出出来。

识别满分 精细阶段失分

这三个模型在目标识别以及目标定位这两个方面, 成绩都是满分百分之100。在对操作语义的理解程度上, 得分范围也达到了百分之99.6到百分之百那么。

但是, 只要一进入进行接触之前那种细小粒度的分析, 还有去做出空间关系判断的那个环节, 成绩就会变得明显变差。最后就会导致精确移动成为了一个明显的瓶颈问题。

模型有可能能够准确地把瓶子给定位好了, 但是, 它却会在那个夹爪还没有降到一个挺合适的高度的时候就提前给闭合并了;也有可能会出现一种情况是, 模型它能够理解“把东西放进容器里”这个事情, 可是它就没办法十分稳定地、非常靠谱地去判断出那个精确的高度、深度到底是什么数, 或者是那个物体究竟得接触到哪里去的这个位置。

主动观察比多看更关键

在对照实验环节里, 模型从那个可主动切换视角的状态改变成直接获取5个固定视角的情况之后, 4个被测试出来的模型其成功率全部都出现了下降的状况。这里需要明确的一个关键点就是关于主动观察这件事情, 它的核心所在在于要清楚知道目前缺少的是什么信息以及接下来的一眼视线应当投向哪里。

这个结果表明, 在将来, 系统设计的主要着眼点或许会发生变化, 由原来的“提供给人们更多的画面”, 转变为去让模型学会去判断在什么时刻应该停下来并去执行相应的操作, 这个时候, 观察策略这一方面本身就会成为核心能力。

双臂协同与长任务瓶颈

Qwen3.8-max模型在执行单臂任务时, 其成功率达到了65.61%, 然而在执行双臂任务时, 该指标仅为11.11%。

这主要是因为模型需要去判断应当由哪一只手臂操作哪一个物体, 同时还要确定两只手臂之间的相对位置以及动作进行的先后顺序。只要在这一过程中出现任何一点空间上的偏差, 都很可能导致后续任务的执行被迫中断。

在针对长时序所进行的组合测试过程之中, GPT-5.6-sol这一模型成功完成了五十三个于一百次的放置操作情况。与此同时, Qwen3.8-max这一模型完成了六十一于一百次的放置操作情况。

但是, 完全没有哪一个模型能够把全部步骤完整地进行跑完这一动作。所以来看, 长任务稳定性这一块内容至今仍然是一个存在难题的情况。

从理解到行动的距离

子任务完成率达到百分之六十五点九至百分之六十八点六, 这个数值远远高于完整任务大约百分之五十的成功率。大多数失败的原因并非是完全不会做, 而是在完成了部分步骤之后, 无法保持稳定收尾, 从而导致误差逐步累积起来。

VA-Bench并不打算给那个问题一个要么行或者就不行的简单答案, 它要把空间理解能力和物理执行能力之间那条界限具体地测出来。这么做, 是为了让从事具身智能研究的人能够拿到可以量化的用来做检查诊断的根据。

如果你的机器人任务里面, 涉及到好多个步骤串在一起进行的这种操作的话, 那你觉得最应该先去想办法把那个做得特别细的在空间里面的定位给突破掉?

还是说, 应该优先去把那个能自己实时改正错误的这种能力给提升起来? 欢迎大家在下面留言来进行讨论一下, 然后再点个赞。也欢迎把它分享给那些同样很关注具身智能这个领域的朋友。