PuppyIP 资源中心
AI 工具动态 11 分钟 发布于 2026-09-05

腾讯 WeMM-Embedding 开源:模型选型、下载与多模态检索验证

腾讯 WeChat Vision 团队已开源 WeMM-Embedding 2B、4B、9B 模型与代码。准备试用的团队应先固定仓库和模型版本,用自己的文本、图片、视频和视觉文档样本比较召回质量、向量维度、延迟与资源占用,再决定是否进入服务化。

WeMM-Embedding 多模态检索 向量模型 Hugging Face 模型部署

本文要点

  • 腾讯 AI 官方账号于北京时间 2026 年 9 月 4 日 21:55 宣布 WeMM-Embedding 开源,并称模型已用于微信真实流量;这些是腾讯披露,不等同于第三方生产验证。
  • 官方仓库提供 2B、4B、9B 三档模型,支持文本、图片、视频、视觉文档和交错多模态输入;当前不支持音频。
  • 2B 模型在官方 MMEB-v2 评测中,256 维保留完整维度图像与视频表现的 98.7%;业务选型仍要用自己的查询和文档复测。
  • 下载前固定 Git commit、Hugging Face revision 与文件哈希;远程模型代码应先审查并在隔离环境运行。
  • 固定出口能让仓库和模型下载更容易复现,但不能修复显存不足、依赖不兼容、预处理差异或召回质量问题。
  • 上线前同时保留旧向量索引与旧模型,先影子评测、再小流量切换,避免直接覆盖不可逆的大规模索引。

官方边界:21:55 宣布开源,性能数字先当作发布方结果

腾讯 AI 官方账号在北京时间 2026 年 9 月 4 日 21:55 发布消息,称 WeMM-Embedding 每天在微信处理 10 亿次请求并已开源;原帖同时给出 9B 在 MMEB-v2 的 80.6 分和 2B 在 256 维保留 98.7%表现。官方仓库现提供模型权重、推理示例、服务化示例和评测代码。

这些数字来自腾讯原帖、仓库与论文,不能直接换算成你的准确率、吞吐、成本或服务等级。MMEB-v2 不等于业务数据,微信线上流量也不等于开源部署配置;立项时应明确写成“腾讯报告”,并把是否采用交给本地基准和灰度结果。

先选输入边界,再选 2B、4B 或 9B

官方仓库列出 2B、4B、9B 三档模型,完整向量维度分别为 2048、2560 和 4096。三档都支持文本、图片、视频、视觉文档和按顺序交错的多模态输入;音频目前不支持。先确认任务是文本到图片、图片到商品、视频片段、视觉文档还是混合内容检索,不要因为模型叫“通用”就把所有数据源一次接入。

用同一批脱敏样本先跑 2B 全维度基线,再判断是否需要 4B 或 9B。记录模型权重、输入尺寸与帧采样、批量大小、峰值显存、单条与批量延迟、索引体积、召回指标和失败率;没有这些同口径结果时,只比较参数量或公开榜单不能形成选型结论。

可信下载:固定 revision、哈希与代码审查

只从腾讯官方 GitHub 组织和 Hugging Face 的 tencent 组织获取代码与权重。保存 Git commit、模型 revision、下载时间、文件清单与 SHA-256,并把模型缓存设为只读构建输入;不要在每次启动时自动拉取浮动的 main 或最新模型文件。仓库说明腾讯代码默认使用 Apache License 2.0,第三方组件保留各自许可,商业使用前仍要核对模型卡、LICENSE 和依赖许可。

模型加载链路可能执行仓库随附的 Python 代码。先在无生产密钥、无客户数据、网络权限受限的隔离环境审查并运行固定 revision,再制作内部镜像或制品。Hugging Face token、代理凭据和对象存储凭据只放在密钥管理中,不写进脚本、镜像层、日志或工单。

下载网络与推理环境分层排查

仓库或权重下载失败时,记录目标域名、文件、revision、已下载字节、HTTP 状态、DNS、TLS、超时和代理认证结果;使用断点续传与本地缓存,并在重试前确认临时文件和最终哈希。需要跨地区稳定访问 GitHub 或 Hugging Face 时,可进入<a href="/resources/proxy-connection-troubleshooting-checklist">代理连接排查清单</a>逐层验证。固定出口用于一致访问与复现,不应用来绕过平台条款、模型许可或地区限制。

模型已经下载完整但加载失败时,应检查 Python、PyTorch、CUDA、transformers、显存和预处理代码。官方仓库为可复现性推荐 transformers==5.2.0,并说明更新版本可能出现预处理差异;显存不足、算子不兼容、形状错误或检索分数异常都不是换代理能解决的网络问题。

Matryoshka 维度要用召回、延迟和索引成本一起测

官方支持从完整向量前部截取列出的 Matryoshka 维度,并在截取后重新做 L2 归一化。2B 支持 64、128、256、512、1024、2048 维;4B 最高 2560 维;9B 还支持 4096 维。不要截取任意未列出的长度,也不要忘记重新归一化,否则相似度分布和阈值会失去可比性。

建立两阶段实验:先用 64 或 256 维做大候选集快速召回,再用 1024、2048 或完整维度重排同一候选;同时与单阶段全维度方案比较 Recall@K、NDCG、误召回、索引内存、查询延迟和重建时间。官方的 98.7%是特定 MMEB-v2 图像与视频结果,不保证你的商品、广告、文档或中文查询也保留同等比例。

服务化前先验证输入顺序、帧采样和接口契约

对文本、图片、视频和视觉文档分别准备正例、难负例和空缺输入,再增加交错多模态样本,确认输入顺序变化是否符合业务预期。向量写入索引前保存模型版本、维度、归一化方式、预处理版本和内容版本;不同模型或维度的向量不要混进同一个未分区索引。

官方仓库给出 Transformers、Sentence Transformers、vLLM 0.27.0 和 SGLang 0.5.9 的示例,但“官方测试过”不等于你的硬件和网关已兼容。服务端至少要有 readiness、超时、批量上限、输入大小、视频帧数、队列长度、显存水位和版本响应;对失败请求保留脱敏 request ID,不要把自动重试放大成推理队列拥塞。

灰度与回滚:旧模型、旧索引和查询日志同时保留

先离线回放一批脱敏查询,让旧模型与 WeMM-Embedding 并行生成结果但不影响用户;通过人工标注和业务指标确认收益后,再让小比例只读搜索流量进入新索引。推荐、搜索或电商链路还要检查热门内容偏置、语言与地区分布、重复内容、冷启动、延迟尾部和无结果率。

切换时保留旧模型制品、旧索引快照、版本化路由和可逆开关。出现哈希不一致、远程代码未经审查、维度混写、召回下降、延迟或显存越界、队列持续增长、输入顺序错误或日志包含敏感内容时立即停止扩容;先回切旧路由,再隔离问题版本,不要在事故中原地覆盖整个向量库。

资料来源

常见问题

WeMM-Embedding 支持哪些输入?

官方说明支持文本、图片、视频、视觉文档和交错多模态输入,当前不支持音频。具体格式、尺寸和视频采样仍应按固定版本的模型卡与代码验证。

应该直接选择 9B 吗?

不应只按公开榜单决定。先用 2B 在自己的脱敏数据上记录召回、延迟、显存和索引成本;只有 4B 或 9B 的增益超过资源与运维成本时才升级。

256 维一定能保留 98.7%效果吗?

不能。98.7%是腾讯在 MMEB-v2 图像和视频任务上报告的 2B 结果。你的数据、查询分布、指标和阈值不同,必须本地复测并在截断后重新归一化。

远程模型代码可以直接在生产使用吗?

不建议直接加载浮动版本。应固定 revision、审查代码、在隔离环境测试,再制作内部可复现制品并最小化网络和密钥权限。

下载失败时先换代理吗?

先记录 HTTP、DNS、TLS、超时、代理认证、revision 和文件哈希。只有证据落在网络层时才调整出口;依赖、CUDA、显存、预处理或向量质量问题需要在推理环境处理。

上线时为什么要保留旧索引?

不同模型、维度和预处理生成的向量不可随意混用。保留旧模型、旧索引和路由开关,才能在召回下降、维度混写或性能越界时快速回切。