返回博客
·端侧与硬件

llama.cpp 支持「决策模型」:本地跑 AI,多了一种新「物种」

llama.cpp 引入「决策模型」新类型、Mistral 放话万亿参数开源、Reflection AI 的 Beam 501B 预告——10 月 5 日,本地与开源两条线同时加速。

#llama.cpp#本地推理#决策模型#开源

# llama.cpp 支持「决策模型」:本地跑 AI,多了一种新「物种」

10 月 5 日,「本地 AI」社区有个不大但重要的更新:**llama.cpp 引入了「决策模型(Decision Models)」这一新的模型类型**。消息是从 Hacker News 传出来的。

一、为什么这是个信号

llama.cpp 是本地跑开源模型最主流的引擎之一。**它支持一种「新的模型类型」,意味着本地能跑的东西,多了一类**。

「决策模型」前面已经出现过(Amazon 的 Strands Decider 2B、Cloudflare 的 Clef 都是这一类):**它们不生成文字,只输出选择、概率或分数**,用于路由、分流、工具选择、护栏判断。现在,这类模型也能在本地通过 llama.cpp 跑起来。

需要提醒的是:llama.cpp 官方并没有一次说清楚**这些模型怎么工作、哪些文件兼容、需要多少显存**。所以想尝鲜的人,**最好先看源讨论再更新**,别盲目上。

二、同一天的另外两条:旗舰也在往前跑

  • Mistral Large 4(预览):一个 **1 万亿参数、490 亿激活**的多模态 MoE,跑在 Mistral 自家的 3800 块 NVIDIA Grace Blackwell 集群上训练。现在可通过 API 使用,**开放权重「月底发布」**。有意思的细节:它只提供两档推理设置(none / high),在测试里 **high 模式反而比 none 模式用的输出 token 更少**(2717 对 3275)。
  • Reflection AI 的 Beam:一个 **5010 亿参数的 MoE 开源推理模型**(23B 激活),针对编码与 Agent 任务,权重本月晚些时候以 **Apache 2.0** 放出。
  • 三、一个很现实的分层

    把这几条放在一起,能看出 2026 年下半年一个清晰的**分层**:

  • 本地 / 端侧:2B 级决策模型、小 MoE,跑在 Mac 或消费级显卡上;
  • 中量级开源:几十到几百 B,用于编码、Agent;
  • 旗舰级:500B 到 1T,只能在集群上跑,通常先 API 后开源。
  • **同一个「开源」,在不同规模上,已经是完全不同的东西**。而 llama.cpp 的角色,是尽量把其中最小、最能本地化的那一层,做到「下载就能跑」。

    小结

    llama.cpp 支持「决策模型」,看起来只是加了一个模型类型,但它反映的是更本质的趋势:**模型正在按「大小」和「职责」分化,而本地推理引擎的使命,就是把最小的那一层变得触手可及**。对开发者来说,能在本地跑一个「替你做选择」的 2B 模型,本身就是一种新的自由。