微信开源多模态嵌入模型 WeMM-Embedding,已在多场景日调用 10 亿次

微信 AI 于 9 月 4 日开源通用多模态嵌入模型 WeMM-Embedding,提供 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档及任意交错多模态输入。微信视觉团队表示,该模型用于将文字、图片和视频映射到同一语义空间进行比较与检索,已落地朋友圈搜索、视频号推荐、公众号推荐和微信电商等场景,日调用量达 10 亿次,并在 MMEB-v2 榜单上排名第一。论文已发布于 arXiv,代码和模型分别上线 GitHub 与 Hugging Face。

上一篇:

下一篇:

发表回复

登录后才能评论