返回博客
·AI技术

Google 开源 EmbeddingGemma 2:740M 参数,把文本、图像、音视频塞进同一个向量空间

Google 开源 740M 的 EmbeddingGemma 2,统一文本、代码、图像、音频、视频的嵌入;同日 Mistral Large 4 亮相、Anthropic 开放网络安全访问层级——「检索」这一层正在被重写。

#嵌入模型#多模态#Google#检索

# Google 开源 EmbeddingGemma 2:740M 参数,把文本、图像、音视频塞进同一个向量空间

如果说大模型是 AI 的「大脑」,那**嵌入模型(Embedding)就是它的「索引」**——所有 RAG、搜索、推荐、去重,都建立在这一层之上。10 月 6 日,Google 带来了 **EmbeddingGemma 2**,一个只有 **7.4 亿参数**的开源嵌入模型,却把**文本、代码、图像、音频、视频**统一到了同一个向量空间。

一、它做了什么

  • 参数规模 7.4 亿,上下文 8K;
  • 把**五种模态**(文本、代码、图像、音频、视频)编码到**共享的向量空间**;
  • Apache 2.0 许可;
  • 能在手机上运行。
  • 最后这一点很关键:**一个多模态嵌入模型,小到可以跑在端侧**。这意味着「跨模态检索」不再必须依赖云端。

    二、同期还有人在重写「检索」

  • Perplexity 的 pplx-embed-v2 系列,用「**后期交互(late-interaction)**」的嵌入方式,**不用 OCR、不用分块**就能检索渲染后的页面,号称能搜 **1.9 亿份文档**,每个 token 保留 128 维向量——这个思路对处理**复杂版式文档**(报表、扫描件)特别有用。
  • 早些时候,**Unsloth** 也把一个 0.8B 模型训练成了**决策引擎**,在 4GB 显存上把分类准确率从 20.7% 提到 74.3%。
  • 检索这一层,正在从「把文本切块向量化」这种粗糙做法,走向**多模态、免 OCR、更少预处理**的方向。

    三、同一天的其他两件大事

  • Mistral Large 4 继续刷存在感:**1T 参数、49B 激活、1M 上下文**的多模态 MoE,公开预览,**在 DeepSWE v1.1 上评分 61.7%**,开放权重月底见。
  • Anthropic 把 Project Glasswing 与 Cyber Verification Program 合并,推出**三档网络安全访问权限**(Defense / Red Team / Specialized Access),经过验证的安全团队能拿到**更少安全限制**的 Claude。这是一个很务实的做法:**能力不对普通人开放,但给专业人士开一条通道**。
  • 四、为什么嵌入模型值得关注

    很多人盯着「下一个 GPT」,却忽略了**检索层**。但现实是:

  • 企业知识库、代码搜索、多模态检索——**需求巨大且高频**;
  • 嵌入模型**小、便宜、可本地**,落地阻力远小于大模型;
  • 谁能把**多模态嵌入**做好,谁就握住了「AI 找信息」的入口。
  • 小结

    EmbeddingGemma 2 的出现,说明**「检索」这一层正在被重新发明**:从纯文本到多模态,从云端到端侧,从「切块塞向量」到「后期交互免 OCR」。当所有人都在追大模型的时候,**把「找信息」这件小事做到极致,可能才是更快的落地路径**。