·AI技术
Google 开源 EmbeddingGemma 2:740M 参数,把文本、图像、音视频塞进同一个向量空间
Google 开源 740M 的 EmbeddingGemma 2,统一文本、代码、图像、音频、视频的嵌入;同日 Mistral Large 4 亮相、Anthropic 开放网络安全访问层级——「检索」这一层正在被重写。
#嵌入模型#多模态#Google#检索
# Google 开源 EmbeddingGemma 2:740M 参数,把文本、图像、音视频塞进同一个向量空间
如果说大模型是 AI 的「大脑」,那**嵌入模型(Embedding)就是它的「索引」**——所有 RAG、搜索、推荐、去重,都建立在这一层之上。10 月 6 日,Google 带来了 **EmbeddingGemma 2**,一个只有 **7.4 亿参数**的开源嵌入模型,却把**文本、代码、图像、音频、视频**统一到了同一个向量空间。
一、它做了什么
最后这一点很关键:**一个多模态嵌入模型,小到可以跑在端侧**。这意味着「跨模态检索」不再必须依赖云端。
二、同期还有人在重写「检索」
检索这一层,正在从「把文本切块向量化」这种粗糙做法,走向**多模态、免 OCR、更少预处理**的方向。
三、同一天的其他两件大事
四、为什么嵌入模型值得关注
很多人盯着「下一个 GPT」,却忽略了**检索层**。但现实是:
小结
EmbeddingGemma 2 的出现,说明**「检索」这一层正在被重新发明**:从纯文本到多模态,从云端到端侧,从「切块塞向量」到「后期交互免 OCR」。当所有人都在追大模型的时候,**把「找信息」这件小事做到极致,可能才是更快的落地路径**。