微信 AI 于 9 月 4 日开源通用多模态嵌入模型 WeMM-Embedding,提供 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档及任意交错多模态输入。微信视觉团队表示,该模型用于将文字、图片和视频映射到同一语义空间进行比较与检索,已落地朋友圈搜索、视频号推荐、公众号推荐和微信电商等场景,日调用量达 10 亿次,并在 MMEB-v2 榜单上排名第一。论文已发布于 arXiv,代码和模型分别上线 GitHub 与 Hugging Face。
微信 AI 于 9 月 4 日开源通用多模态嵌入模型 WeMM-Embedding,提供 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档及任意交错多模态输入。微信视觉团队表示,该模型用于将文字、图片和视频映射到同一语义空间进行比较与检索,已落地朋友圈搜索、视频号推荐、公众号推荐和微信电商等场景,日调用量达 10 亿次,并在 MMEB-v2 榜单上排名第一。论文已发布于 arXiv,代码和模型分别上线 GitHub 与 Hugging Face。