AI Radar
Андрей Карпати предложил перейти от простых графических задач к генерации полноценных интерактивных сцен как способу оценки ИИ. В демонстрации модель Opus 5 превратила абзац из «Властелина колец» в браузерный проект на Three.js.
Результатом стали около 5500 строк кода для интерактивной трёхмерной сцены. Генерация заняла примерно два часа, потребовала около миллиона токенов и стоила порядка $10; звуковое сопровождение было создано отдельно с помощью ElevenLabs. Такой тест одновременно проверяет понимание текста, пространственное представление, программирование, работу с графикой и способность удерживать структуру крупного проекта.
По мнению Карпати, прежние проверки пространственного мышления — например, просьба нарисовать пеликана на велосипеде в SVG — стали слишком лёгкими для современных мультимодальных моделей. Генерация интерактивного мира через код создаёт более сложную цепочку требований: объектам нужно назначить геометрию и поведение, согласовать сцену с исходным описанием и сохранить работоспособность результата.
Главное ограничение эксперимента — модель не могла анализировать собственный видеовыход и оценивать сцену в динамике. Для обратной связи ей приходилось опираться на отдельные скриншоты, из-за чего часть ошибок рендера оставалась незамеченной. Поэтому предложенный подход пока измеряет не только способности модели, но и качество доступного ей цикла визуальной проверки.
Интерактивные сцены могут стать более содержательным испытанием для моделей, которые уже насыщают простые визуальные бенчмарки. Такой формат приближает оценку к разработке игр, симуляторов и интерфейсов, но потребует воспроизводимых критериев: одного впечатляющего ролика недостаточно для сравнения систем.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.