ScrambleToolBench:智能体手里有正确的旧地图,却选择挨家挨户敲门
工具名被打乱后前沿模型仍能试探出行为,但中途置换四分之一标识符就让完成率从 93% 掉到 32%,三种扰动叠加更是掉到 3%——不是遗忘,是拒绝用旧地图做演绎。
标签
工具名被打乱后前沿模型仍能试探出行为,但中途置换四分之一标识符就让完成率从 93% 掉到 32%,三种扰动叠加更是掉到 3%——不是遗忘,是拒绝用旧地图做演绎。
人工重读全部 500 道题,68 道的题面与标准答案不对应。剔掉它们重排,131 个智能体里 64.1% 名次改变。
一则厂商稿称首个桌面 agent 突破 90%。解析 OSWorld 官方评测表核对:成绩属实,但记录同时显示它是智能体框架、启用代码动作、步数上限 100——这三项决定该数字的解读边界。