AI Radar
SenseTime опубликовала веса SenseNova-Vision — модели, которая решает несколько задач компьютерного зрения через генерацию текста, изображений или смешанного ответа. Вместе с ней выпущен набор SN-VC-50M из 50 млн обучающих примеров.
Модель выдаёт координаты объектов и распознанный текст в текстовом виде, глубину и нормали поверхностей — как изображения, а сегментацию — как сочетание легенды и цветовой маски. Она создана дообучением Bagel-7B-MoT без изменения архитектуры.
По представленным тестам SenseNova-Vision сильна в детекции, локализации текста и поиске ключевых точек, но уступает специализированным системам в многовидовой 3D-геометрии. Русский текст модель распознаёт хуже английского; лицензия CC-BY-NC-4.0 ограничивает коммерческое применение.
Почему важно: единый генеративный интерфейс может заменить набор специализированных CV-моделей в исследовательских прототипах. Открытые веса и крупный корпус позволяют проверять подход, а опубликованные ограничения помогают оценить его применимость.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.