·AI安全
让 AI 连做 20 次同样的活:微软 ThinkingBox 测出了智能体最真实的短板
微软用 507 个业务流程各跑 20 次,发现最强的 Claude Opus 5.5 也只通过了 241 个——而且约八成失败来自「工具使用」,不是推理。
#AI智能体#评测#可靠性#微软
# 让 AI 连做 20 次同样的活:微软 ThinkingBox 测出了智能体最真实的短板
10 月上旬,微软 Copilot Studio 团队在 Hugging Face 博客上发布了他们的新基准 **ThinkingBox**。这个评测之所以值得单独拿出来说,是因为它**换掉了过去测 AI 的方式**。
一、它测的不是「回答」,而是「结果」
传统基准大多看模型**最后吐出来的那段话**。ThinkingBox 不一样:
一句话:**它不看 AI 怎么说,只看它把事做没做对**。这个标准要苛刻得多,也真实得多。
二、结果有点扎心
微软公布的结论:
最后这一条,是整个评测里最有价值的发现。
三、为什么「工具使用」才是瓶颈
我们总以为 AI 做不好事,是因为「不够聪明」。但 ThinkingBox 说:**不是,是因为它不会用工具**。
这恰好印证了 2026 年下半年行业反复出现的一个判断:**Agent 的天花板,取决于它周围的「脚手架」,而不是它自己的「智商」**。也正因如此,那段时间「决策模型」「工具路由」「RRSI 自动优化脚手架」会集中爆发——大家都在往同一个痛点上使劲。
四、对做产品的人意味着什么
小结
ThinkingBox 给整个行业提了个醒:**当 AI 从「聊天」走向「干活」,评价它的方式必须同步升级**。67% 的单次准确率看着还行,但连做 20 次只成 241 个——这才是它走进真实业务时的真实成绩单。