AI Radar
Новый тест показал разрыв между людьми и мультимодальными моделями в понимании сцен
Scale Labs и Elorian представили Humanity's Sixth Sense, тест на понимание социальных и пространственных сигналов в изображениях и видео. По опубликованным результатам, люди заметно опередили протестированные мультимодальные модели.
Что изменилось
Scale Labs и Elorian представили Humanity's Sixth Sense для задач, где недостаточно назвать объекты в кадре: нужно понять, например, смогут ли разъехаться автомобили или что подсказывает поведение людей. По опубликованному описанию, тест включает 522 вопроса по 288 статичным сценам и 234 видеофрагментам. Авторы проверили на нём 25 мультимодальных моделей.
Как сообщает источник, контрольная группа людей ответила верно в 93,1% случаев, а лучший результат среди моделей, GPT-6 Astra, составил 53,6%; медиана моделей – 30,9%. В приведённом разборе более 8,5 тысячи неудачных ответов 94% ошибок отнесены к первичному зрительному восприятию: модель пропускала детали или теряла контекст. Дополнительные токены на рассуждение и попытка приблизить внимание модели к нужному участку изображения почти не помогли. Эти выводы относятся к описанному тесту, а не ко всем задачам компьютерного зрения.
Почему это важно
Если модель должна оценивать ситуацию по фото или видео, проверяйте не только её рассуждение, но и то, какие детали она заметила. Увеличение числа токенов ответа может не исправить пропущенный визуальный сигнал.
Мнение редакции
Scale Labs проверяет не только распознавание объектов, но и понимание ситуаций по изображению или видео. На фоне развития мультимодальных моделей этот бенчмарк смещает внимание с длины рассуждений на качество зрительного восприятия. Пока о результатах известно из пересказа, без деталей методики в источнике.
Первоисточники и подтверждения
TelegramПодборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.