返回博客
·AI安全

让 AI 连做 20 次同样的活:微软 ThinkingBox 测出了智能体最真实的短板

微软用 507 个业务流程各跑 20 次,发现最强的 Claude Opus 5.5 也只通过了 241 个——而且约八成失败来自「工具使用」,不是推理。

#AI智能体#评测#可靠性#微软

# 让 AI 连做 20 次同样的活:微软 ThinkingBox 测出了智能体最真实的短板

10 月上旬,微软 Copilot Studio 团队在 Hugging Face 博客上发布了他们的新基准 **ThinkingBox**。这个评测之所以值得单独拿出来说,是因为它**换掉了过去测 AI 的方式**。

一、它测的不是「回答」,而是「结果」

传统基准大多看模型**最后吐出来的那段话**。ThinkingBox 不一样:

  • 它准备了 **507 个真实的业务流程**;
  • 让每个模型**把同一个流程跑 20 遍**;
  • 然后**检查数据库最终留下的状态**,而不是模型说了什么。
  • 一句话:**它不看 AI 怎么说,只看它把事做没做对**。这个标准要苛刻得多,也真实得多。

    二、结果有点扎心

    微软公布的结论:

  • Claude Opus 5.5 在「单次尝试」准确率上最高,达到 67.16%;
  • 但要求**连续 20 次全部通过**时,它只完成了 **241 个任务**(总共 507 个);
  • 更关键的是——**约五分之四的失败,来自「工具处理」,而不是「推理」**。
  • 最后这一条,是整个评测里最有价值的发现。

    三、为什么「工具使用」才是瓶颈

    我们总以为 AI 做不好事,是因为「不够聪明」。但 ThinkingBox 说:**不是,是因为它不会用工具**。

  • 参数传错、格式不对、超时没处理、报错没重试;
  • 工具链之间的状态没同步;
  • 一个环节出问题,整条流程就断。
  • 这恰好印证了 2026 年下半年行业反复出现的一个判断:**Agent 的天花板,取决于它周围的「脚手架」,而不是它自己的「智商」**。也正因如此,那段时间「决策模型」「工具路由」「RRSI 自动优化脚手架」会集中爆发——大家都在往同一个痛点上使劲。

    四、对做产品的人意味着什么

  • 别再用单次跑分挑模型:一次能答对,和每次都答对,是两回事;
  • 可靠性要压测:用「重复 N 次 + 校验最终状态」的方式,才能真正暴露问题;
  • 重点投在工具层:把边界处理、重试、校验、幂等做扎实,收益远超换一个更贵的模型。
  • 小结

    ThinkingBox 给整个行业提了个醒:**当 AI 从「聊天」走向「干活」,评价它的方式必须同步升级**。67% 的单次准确率看着还行,但连做 20 次只成 241 个——这才是它走进真实业务时的真实成绩单。