端侧 AI 的「iPhone 时刻」:Antigravity SDK 把 Gemma 4 跑在本地,Transformers 直接加载 GGUF
Google 给 Antigravity SDK 补上本地模型支持,Transformers 也能直接加载 llama.cpp 的 GGUF 量化包,端侧推理又往前挪了一步。
# 端侧 AI 的「iPhone 时刻」:Antigravity SDK 把 Gemma 4 跑在本地,Transformers 直接加载 GGUF
9 月 23 日这天,两条不显眼但很关键的消息凑到了一起:Google 给自家的 Antigravity SDK 加上了本地模型支持,而 Hugging Face 则让 Transformers 可以直接加载 llama.cpp 的 GGUF 量化包。一个是「让 AI Agent 脱离云端跑」,一个是「让 Python 生态直接吃现成的本地权重」——两条线都在往同一个方向拱:把模型从数据中心拽回到你自己的机器上。
一、Antigravity SDK 开始支持本地模型
Google 在 9 月 23 日为 Antigravity SDK 增加了离线运行能力,第一个被支持的是 **Gemma 4 26B A4B**,跑在 LiteRT 运行时上。官方给的门槛也很直白:**建议 24GB 以上的显存或统一内存**。
这意味着什么?过去你要做一个「会自己规划、会调工具」的 Agent,基本默认它得连着云端的 API。现在这套 SDK 除了能接本地模型,还能连 Ollama、LM Studio、vLLM 这些本地推理服务器——也就是说,**Agent 的「大脑」可以完全待在你自己的机器里**。
对于有数据合规要求、或者干脆就是想省钱的人,这条路的意义不用多解释。
二、Transformers 能直接跑 GGUF 了
同一天的另一条消息,是 Hugging Face 宣布:**GGUF 检查点现在可以直接传给 from_pretrained**,并且权重以压缩打包的形式运行,底层调用 ggml 的 Metal 内核。
翻译成大白话:
Hugging Face 也很诚实地补了一句:在它测的三个检查点上,结果已经接近 llama.cpp,但两次测量并非在同一条件下进行;如果首要目标是极致的本地推理效率,**还是推荐直接用 llama.cpp**。
三、为什么这两件事值得放在一起看
它们背后是同一个趋势:**端侧推理的「最后一公里」正在被打通**。
当然,别高兴太早。**本地跑得动不等于跑得好**:量化必然带来精度损失,MoE 的显存占用仍是硬约束,长上下文一开内存就吃紧。端侧 AI 的「iPhone 时刻」还没到,但至少,它第一次看起来不像 PPT 了。
小结
9 月 23 日的这两条更新,本质是在给「本地 AI」补基础设施:一边让 Agent 能在本地思考,一边让 Python 开发者能直接复用现成的量化权重。接下来真正决定体验的,不会是模型参数,而是**内存够不够、量化够不够聪明、工具链够不够顺**。想提前下注的人,可以从装一个 Ollama、再试着用 Transformers 加载一个 GGUF 开始。