2026年8月25日,腾讯微信视觉团队正式开源WeMM-Embedding——一款通用多模态Embedding检索与表示模型。它基于Qwen3.5训练,将文本、图像、视频与视觉文档(PDF、网页截图)统一编码到同一向量空间,可用于多模态检索、RAG召回与内容理解。模型提供2B/4B/9B三档规模,采用Apache-2.0协议,并已在微信视频号、公众号与微信搜索的检索场景完成落地验证。在MMEB-v2评测中,9B档取得80.6分,位列同规模前列。
一、统一编码:让检索跨越模态边界
WeMM-Embedding与偏重生成的Qwen3.8-Flash等多模态模型不同,它的重心在“表示”而非“生成”——把不同模态的内容投射到同一个可比较的向量空间,让一条查询就能在文本、图片、视频与文档之间跨模态召回。
以Qwen3.5为骨干,通过大规模多模态对齐训练,模型把文本、图像、视频帧与视觉文档映射到统一向量空间。在工程层面,统一向量空间的直接好处是“一次编码、处处可用”:同一份向量既能服务文本检索,也能服务以图搜文、以文搜视频等跨模态查询,不必为每种模态单独维护一套索引。
模型同时支持Matryoshka表示学习,允许把高维向量截断到更小维度而不明显损失检索质量,方便在存储与算力受限的场景下降本。2B/4B/9B三档覆盖从端侧到服务端的部署需求,9B档推理约需20GB显存,2B档可降至约6GB,适合端侧或轻量服务。
对于搭建RAG系统的开发者而言,WeMM-Embedding提供了一个比文本Embedding更完整的检索起点——当知识库中同时存在PDF、网页截图、产品图和文字说明时,统一向量空间意味着只需要一次检索就能跨所有模态召回相关内容,而不是分别为文本和图片维护两套索引。在AI工具导航的框架下,它属于“多模态检索基础设施”而非终端应用,但它的输出可以直接接入各类上层应用——从企业知识库到电商搜索,从视频推荐到文档问答。在AI办公软件推荐的语境中,这意味着一套向量索引就能支撑PPT配图检索、文档引用查找、会议截图回溯等多种办公场景,无需为每个场景单独构建模态对齐方案。
二、四项关键能力与微信生态验证
多模态统一编码:文本/图像/视频/视觉文档映射到同一空间,跨模态检索免额外对齐
Matryoshka弹性维度:支持截断到更小维度,降低向量存储与检索的计算成本
长文档与视觉文档:直接编码PDF、网页截图类视觉文档,适配文档型RAG检索
已落地微信生态:视频号、公众号、微信搜索的检索链路已做接入验证
三、与主流多模态Embedding模型的对比
| 对比维度 | WeMM-Embedding | Gemini Embedding 2 | Nemotron 3 Embed |
|---|---|---|---|
| 所属团队 | 腾讯微信视觉团队 | Google DeepMind | 英伟达 |
| 发布时间 | 2026年8月25日 | 2025年 | 2025年 |
| 支持模态 | 文本/图像/视频/视觉文档 | 文本/图像 | 文本为主 |
| 模型规模 | 2B/4B/9B | 未公开多档 | 多档文本向量 |
| 关键基准 | MMEB-v2 9B 80.6 | MMEB-v2前列 | MTEB文本检索前列 |
| 开源协议 | Apache-2.0 | 闭源API | 开源 |
WeMM-Embedding是少数把“视频+视觉文档”也纳入统一编码的开源多模态Embedding模型。如果你的业务以文本检索为主,Nemotron 3 Embed等文本向量方案已足够;但当检索对象扩展到截图、视频帧或带版式的PDF时,WeMM-Embedding的统一编码会显著减少跨模态对齐的工程负担——这也是它相对Gemini Embedding 2等闭源方案更值得关注的原因。
四、应用场景与适用人群
多模态文档检索:企业知识库把PDF、网页截图与文本统一向量化,用一条查询跨模态召回
视频内容理解与搜索:视频/短视频平台用帧+字幕联合编码,实现以图搜视频、以文搜片段
RAG增强问答:把长文档的视觉与文本信息统一进检索池,降低多模态问答的漏召率
适用人群:搭建多模态RAG的算法工程师、企业知识库与搜索团队、内容平台检索架构师、做跨模态推荐的算法同学,以及需要把图像/视频纳入向量检索的高校研究者。对中文场景与微信生态内的检索需求尤为契合。
五、如何使用
WeMM-Embedding以Apache-2.0协议完全开源,2B/4B/9B三档权重与推理代码已在GitHub、Hugging Face与ModelScope同步开放。Python 3.10+与PyTorch 2.1+环境下,通过pip安装transformers和accelerate,从Hugging Face或ModelScope拉取对应档位权重,即可将文本、图像、视频帧与视觉文档统一送入模型得到同维度向量,接入FAISS/Milvus等向量库后按相似度召回完成多模态检索。研究、学习与商业集成均可免费下载使用,商用无授权费。
