AI Radar
Исследователи Meta, Stanford, Токийского университета и École Normale Supérieure разработали EgoBabyVLM Challenge для оценки того, как мультимодальные модели понимают мир по реалистичным видеозаписям от лица детей.
Испытание использует около тысячи часов видео с камер, закреплённых на младенцах и маленьких детях. Модели должны описывать происходящее в шумной среде, где речь, жесты, направление взгляда и видимые предметы часто не совпадают во времени.
По описанию исследователей, современные vision-language модели плохо справляются с такими данными. Тест призван отделить распознавание закономерностей в больших очищенных датасетах от способности учиться на ограниченном, неоднозначном и физически обусловленном опыте.
EgoBabyVLM предлагает новый тип проверки мультимодального обучения, особенно важный для роботов и воплощённых агентов. Он показывает ограничения моделей, обученных на курируемых интернет-данных, когда им приходится интерпретировать естественный поток наблюдений.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.