返回博客
·端侧与硬件

端侧 AI 的「iPhone 时刻」:Antigravity SDK 把 Gemma 4 跑在本地,Transformers 直接加载 GGUF

Google 给 Antigravity SDK 补上本地模型支持,Transformers 也能直接加载 llama.cpp 的 GGUF 量化包,端侧推理又往前挪了一步。

#端侧AI#Gemma#GGUF#Apple Silicon

# 端侧 AI 的「iPhone 时刻」:Antigravity SDK 把 Gemma 4 跑在本地,Transformers 直接加载 GGUF

9 月 23 日这天,两条不显眼但很关键的消息凑到了一起:Google 给自家的 Antigravity SDK 加上了本地模型支持,而 Hugging Face 则让 Transformers 可以直接加载 llama.cpp 的 GGUF 量化包。一个是「让 AI Agent 脱离云端跑」,一个是「让 Python 生态直接吃现成的本地权重」——两条线都在往同一个方向拱:把模型从数据中心拽回到你自己的机器上。

一、Antigravity SDK 开始支持本地模型

Google 在 9 月 23 日为 Antigravity SDK 增加了离线运行能力,第一个被支持的是 **Gemma 4 26B A4B**,跑在 LiteRT 运行时上。官方给的门槛也很直白:**建议 24GB 以上的显存或统一内存**。

这意味着什么?过去你要做一个「会自己规划、会调工具」的 Agent,基本默认它得连着云端的 API。现在这套 SDK 除了能接本地模型,还能连 Ollama、LM Studio、vLLM 这些本地推理服务器——也就是说,**Agent 的「大脑」可以完全待在你自己的机器里**。

对于有数据合规要求、或者干脆就是想省钱的人,这条路的意义不用多解释。

二、Transformers 能直接跑 GGUF 了

同一天的另一条消息,是 Hugging Face 宣布:**GGUF 检查点现在可以直接传给 from_pretrained**,并且权重以压缩打包的形式运行,底层调用 ggml 的 Metal 内核。

翻译成大白话:

  • 以前想用 llama.cpp 的量化模型,你得离开 Python 生态,去用它的命令行工具;
  • 现在你在 PyTorch/Transformers 里就能直接加载量化后的模型,**不用先解压成完整精度**;
  • 目前覆盖 **Qwen3.5 稠密与 MoE 架构,以及兼容的 Qwen3.8 检查点**。
  • Hugging Face 也很诚实地补了一句:在它测的三个检查点上,结果已经接近 llama.cpp,但两次测量并非在同一条件下进行;如果首要目标是极致的本地推理效率,**还是推荐直接用 llama.cpp**。

    三、为什么这两件事值得放在一起看

    它们背后是同一个趋势:**端侧推理的「最后一公里」正在被打通**。

  • 运行时统一:以前是 llama.cpp / MLX / LiteRT / transformers 各跑各的,现在边界在模糊,权重和工具开始互认;
  • 门槛下降:24GB 内存能跑 26B 的 MoE,已经是「一台高配 Mac / 一张消费级卡」的水平,而不是机房级;
  • 隐私与成本:本地跑意味着数据不出门、按次计费变成一次性投入,对中小团队尤其友好。
  • 当然,别高兴太早。**本地跑得动不等于跑得好**:量化必然带来精度损失,MoE 的显存占用仍是硬约束,长上下文一开内存就吃紧。端侧 AI 的「iPhone 时刻」还没到,但至少,它第一次看起来不像 PPT 了。

    小结

    9 月 23 日的这两条更新,本质是在给「本地 AI」补基础设施:一边让 Agent 能在本地思考,一边让 Python 开发者能直接复用现成的量化权重。接下来真正决定体验的,不会是模型参数,而是**内存够不够、量化够不够聪明、工具链够不够顺**。想提前下注的人,可以从装一个 Ollama、再试着用 Transformers 加载一个 GGUF 开始。