llama.cpp 支持「决策模型」:本地跑 AI,多了一种新「物种」
llama.cpp 引入「决策模型」新类型、Mistral 放话万亿参数开源、Reflection AI 的 Beam 501B 预告——10 月 5 日,本地与开源两条线同时加速。
# llama.cpp 支持「决策模型」:本地跑 AI,多了一种新「物种」
10 月 5 日,「本地 AI」社区有个不大但重要的更新:**llama.cpp 引入了「决策模型(Decision Models)」这一新的模型类型**。消息是从 Hacker News 传出来的。
一、为什么这是个信号
llama.cpp 是本地跑开源模型最主流的引擎之一。**它支持一种「新的模型类型」,意味着本地能跑的东西,多了一类**。
「决策模型」前面已经出现过(Amazon 的 Strands Decider 2B、Cloudflare 的 Clef 都是这一类):**它们不生成文字,只输出选择、概率或分数**,用于路由、分流、工具选择、护栏判断。现在,这类模型也能在本地通过 llama.cpp 跑起来。
需要提醒的是:llama.cpp 官方并没有一次说清楚**这些模型怎么工作、哪些文件兼容、需要多少显存**。所以想尝鲜的人,**最好先看源讨论再更新**,别盲目上。
二、同一天的另外两条:旗舰也在往前跑
三、一个很现实的分层
把这几条放在一起,能看出 2026 年下半年一个清晰的**分层**:
**同一个「开源」,在不同规模上,已经是完全不同的东西**。而 llama.cpp 的角色,是尽量把其中最小、最能本地化的那一层,做到「下载就能跑」。
小结
llama.cpp 支持「决策模型」,看起来只是加了一个模型类型,但它反映的是更本质的趋势:**模型正在按「大小」和「职责」分化,而本地推理引擎的使命,就是把最小的那一层变得触手可及**。对开发者来说,能在本地跑一个「替你做选择」的 2B 模型,本身就是一种新的自由。