EmbeddingGemma 2 将多模态检索迁至端侧
谷歌推出开放权重模型 EmbeddingGemma 2,参数量 740M,可将文字、图像、视频帧和音频映射至同一向量空间,支持端侧多模态语义搜索,开发者可通过 MediaPipe 与 LiteRT-LM 接入,An...
EmbeddingGemma 2 是一个开放权重模型,参数量为 740M。它能够把文字、图像、视频帧和音频映射到同一个向量空间,为多模态检索提供统一的表示基础。这种统一映射使得跨模态相似度计算可以直接在设备本地完成。
该模型适合本地语义搜索与隐私敏感应用。原始数据不必上传到云端,向量化和检索都在端侧进行,从而减少对网络和中心化服务的依赖。对需要处理用户照片、语音或视频片段的场景,这一能力降低了数据外泄风险。
开发者目前可通过 MediaPipe 与 LiteRT-LM 接入 EmbeddingGemma 2。两个方案都允许按设备资源选用合适的编码器和向量维度,这意味着在不同硬件上需要在推理精度和性能之间做出权衡。具体配置会影响模型占用和检索质量,需要结合目标设备测试。
Android ML Kit 的集成仍计划在未来几周推出,现阶段还不具备可用性,开发者需先采用 MediaPipe 或 LiteRT-LM 方案。另外,模型许可证类型、推理延迟和内存占用等细节尚未披露,选型前可能需要进一步评估。
