四种模态,
一个向量空间。
搜索意图:embedding gemma multimodal
EmbeddingGemma 2 原生把文本、图像、视频与音频嵌在一起。任务前缀只用于文本;媒体在文本流里用 <|image|> 等占位符。
各模态共用 8,192 token 窗口。模型卡默认:每张图约 280 token,每视频帧约 140,音频约每秒 25 token(单声道 16 kHz)。视频默认约 1 FPS 过视觉编码器。交错示例:文本里放 `<|image|>` / `<|video|>` / `<|audio|>`,由并行列表填充。用 `config_kwargs` 关掉不用的编码器以省内存(纯文本 vs 完整 740M)。
相对偏文本的 EmbeddingGemma 1,第 2 版增加原生多模态评测(模型卡上的 MIEB、MMEB、MSEB/MAEB)。「当前最好的嵌入模型」取决于你的模态组合、延迟,以及要开源端侧权重还是托管 API——请在自有语料上重测。
截到 128 维时多模态质量下降比纯文本更明显。混合模态会挤占各自可用长度。本站不跑演示;可试 AI Edge 博客链接的 Gallery / Foresight。
EmbeddingGemma 2 首页笔记。