AI Radar

Новый тест показал разрыв между людьми и мультимодальными моделями в понимании сцен

Scale Labs и Elorian представили Humanity's Sixth Sense, тест на понимание социальных и пространственных сигналов в изображениях и видео. По опубликованным результатам, люди заметно опередили протестированные мультимодальные модели.

11 октября 2026 г.2 мин чтенияИсточник: TG · AI/ML/Big Data
моделимультимодальностьинфраструктура
02

Что изменилось

Scale Labs и Elorian представили Humanity's Sixth Sense для задач, где недостаточно назвать объекты в кадре: нужно понять, например, смогут ли разъехаться автомобили или что подсказывает поведение людей. По опубликованному описанию, тест включает 522 вопроса по 288 статичным сценам и 234 видеофрагментам. Авторы проверили на нём 25 мультимодальных моделей.

Как сообщает источник, контрольная группа людей ответила верно в 93,1% случаев, а лучший результат среди моделей, GPT-6 Astra, составил 53,6%; медиана моделей – 30,9%. В приведённом разборе более 8,5 тысячи неудачных ответов 94% ошибок отнесены к первичному зрительному восприятию: модель пропускала детали или теряла контекст. Дополнительные токены на рассуждение и попытка приблизить внимание модели к нужному участку изображения почти не помогли. Эти выводы относятся к описанному тесту, а не ко всем задачам компьютерного зрения.

Почему это важно

Если модель должна оценивать ситуацию по фото или видео, проверяйте не только её рассуждение, но и то, какие детали она заметила. Увеличение числа токенов ответа может не исправить пропущенный визуальный сигнал.

Мнение редакции

Scale Labs проверяет не только распознавание объектов, но и понимание ситуаций по изображению или видео. На фоне развития мультимодальных моделей этот бенчмарк смещает внимание с длины рассуждений на качество зрительного восприятия. Пока о результатах известно из пересказа, без деталей методики в источнике.

Первоисточники и подтверждения

Telegram

Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.

11 октября 2026 г.
  1. 01OpenAI выложила сотни математических результатов, полученных с помощью модели
  2. 02Препринт о 3SUM предлагает пересмотреть давнюю гипотезу о сложности задачи
  3. 03AI-лаборатории, по сообщениям СМИ, готовят планы на случай крупного инцидента
  4. 04Первые токены ответа заметно меняют точность математических решений моделей