AI Radar
Команда WeChat открыла семейство WeMM-Embedding для сведения текста, изображений, видео, визуальных документов и смешанного контента в общее векторное пространство. Опубликованы модели на 2, 4 и 9 млрд параметров под лицензией Apache 2.0.
WeMM-Embedding построено на Qwen3.5 и предназначено для мультимодального поиска и рекомендаций: запрос в одной модальности можно сопоставить с объектом в другой. Младшая версия формирует нормализованный вектор размерностью 2048, старшая — 4096. Благодаря Matryoshka Representation Learning эти представления можно обрезать уже при применении модели, выбирая компромисс между качеством, памятью и стоимостью поиска. Tencent утверждает, что версия 2B после сокращения вектора до 256 измерений сохраняет 98,7% исходного качества на задачах с изображениями и видео.
Старшая модель получила 80,6 балла на MMEB-v2 — заявленный лучший совокупный результат теста, а версия 2B обошла Qwen3-VL-Embedding, несмотря на вчетверо меньший размер. Семейство уже применяют в поиске и рекомендациях WeChat для каналов, аккаунтов и электронной коммерции; команда сообщает о стабильных улучшениях в 14 онлайновых A/B-тестах. Для запуска предусмотрена совместимость с Transformers, vLLM и SGLang.
Текущая версия не поддерживает аудио, поэтому для голосовых сообщений, музыки и аудиодорожек видео понадобится отдельная модель или предварительное преобразование в текст. Остальные заявленные модальности можно индексировать единообразно, а сокращаемая размерность особенно полезна в больших коллекциях, где объем векторной базы и задержка поиска становятся существенной частью стоимости системы.
WeMM позволяет строить единый поиск по текстам, картинкам, видео и сложным документам без отдельного индекса для каждой модальности. Возможность сократить вектор до 256 измерений может заметно уменьшить память и стоимость ANN-поиска. При выборе модели важно учитывать отсутствие аудио и самостоятельно проверить заявленное сохранение качества на данных конкретного продукта.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.