DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarAugust 27, 2026

    AI Radar

    Tencent открыла мультимодальные эмбеддинги WeMM для поиска и рекомендаций

    Команда WeChat открыла семейство WeMM-Embedding для сведения текста, изображений, видео, визуальных документов и смешанного контента в общее векторное пространство. Опубликованы модели на 2, 4 и 9 млрд параметров под лицензией Apache 2.0.

    August 27, 2026·2 min read·Источник: AI, Machine Learning, Big Data
    00

    Что изменилось

    WeMM-Embedding построено на Qwen3.5 и предназначено для мультимодального поиска и рекомендаций: запрос в одной модальности можно сопоставить с объектом в другой. Младшая версия формирует нормализованный вектор размерностью 2048, старшая — 4096. Благодаря Matryoshka Representation Learning эти представления можно обрезать уже при применении модели, выбирая компромисс между качеством, памятью и стоимостью поиска. Tencent утверждает, что версия 2B после сокращения вектора до 256 измерений сохраняет 98,7% исходного качества на задачах с изображениями и видео.

    Старшая модель получила 80,6 балла на MMEB-v2 — заявленный лучший совокупный результат теста, а версия 2B обошла Qwen3-VL-Embedding, несмотря на вчетверо меньший размер. Семейство уже применяют в поиске и рекомендациях WeChat для каналов, аккаунтов и электронной коммерции; команда сообщает о стабильных улучшениях в 14 онлайновых A/B-тестах. Для запуска предусмотрена совместимость с Transformers, vLLM и SGLang.

    Текущая версия не поддерживает аудио, поэтому для голосовых сообщений, музыки и аудиодорожек видео понадобится отдельная модель или предварительное преобразование в текст. Остальные заявленные модальности можно индексировать единообразно, а сокращаемая размерность особенно полезна в больших коллекциях, где объем векторной базы и задержка поиска становятся существенной частью стоимости системы.

    Почему это важно

    WeMM позволяет строить единый поиск по текстам, картинкам, видео и сложным документам без отдельного индекса для каждой модальности. Возможность сократить вектор до 256 измерений может заметно уменьшить память и стоимость ANN-поиска. При выборе модели важно учитывать отсутствие аудио и самостоятельно проверить заявленное сохранение качества на данных конкретного продукта.

    Primary and supporting sources

    Telegram

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    August 27, 2026
    1. 01Nvidia договорилась купить Hugging Face за $12,9 млрд
    2. 02Z.ai открыла GLM-5.3-Flash с мультимодальностью и контекстом в миллион токенов
    3. 03Nvidia и крупнейшие инвестфонды хотят превратить AI-вычисления в класс активов
    4. 04Meta представила MTIA 400 для обучения LLM и рекламного инференса
    Back to AI Radar