微信视觉团队近日宣布,正式开源通用多模态嵌入模型WeMM-Embedding。该模型支持文本、图像、视频、视觉文档及任意交错的多模态输入,提供2B、4B、9B三个版本。模型采用统一多模态架构,通过两阶段训练和知识蒸馏技术,显著提升了内容区分能力和大规模部署效率。目前,WeMM-Embedding已在微信推荐与搜索系统中大规模部署,线上日调用量达十亿量级,为AI应用开发提供了强大的技术支撑,推动AI技术在更多领域的创新应用。