AI Radar
Epoch AI расширила FrontierMath: Open Problems до 50 значимых задач, которые уже выдержали серьёзные попытки решения профессиональными математиками. Три задачи из набора пока удалось решить с помощью ИИ.
FrontierMath: Open Problems отличается от математических тестов с заранее известными ответами: здесь модели получают задачи, которые на момент включения остаются открытыми для исследовательского сообщества. Все 50 вопросов отобраны как значимые и достаточно трудные, а на сайте Epoch AI их можно фильтровать по области происхождения, типу и уровню известности. Поэтому результат оценивает не воспроизведение изученного решения, а способность продвинуться там, где готового эталона ещё нет.
Высокая сложность меняет и процедуру оценки. Для обычного бенчмарка ответ модели можно автоматически сопоставить с правильным, но новая теорема требует экспертного разбора: нужно проверить каждый аргумент, убедиться, что доказательство закрывает исходную постановку, и определить, действительно ли в нём есть новое знание. Epoch AI сообщает о трёх решённых с помощью ИИ задачах из пятидесяти, то есть большая часть набора всё ещё остаётся за пределами продемонстрированных возможностей систем.
Организаторы особенно заинтересованы в том, сможет ли ИИ выйти за рамки применения известных приёмов. Даже наиболее впечатляющие прежние вклады моделей в математику, по оценке Epoch AI, в основном сводились к использованию уже существующих техник в новых комбинациях. Настоящим качественным сдвигом стало бы создание теории или метода «с нуля», без которого выбранная открытая задача не поддаётся решению.
Именно с этой целью в редакционный совет FM:OP вошли действующие исследователи. Участник совета и научный сотрудник Royal Society Томас Блум рассчитывает, что многие задачи окажутся настолько трудными, что для прогресса ИИ придётся изобретать новые техники. В экспертной работе также участвуют Дэниел Литт из Университета Торонто и профессор Калифорнийского университета в Дейвисе Дэн Ромик — их роль важна для содержательной оценки результатов, которую нельзя свести к одному числовому баллу.
FM:OP даёт разработчикам более строгую цель, чем соревнование на задачах с известными решениями и риском попадания ответов в обучающие данные. Для исследовательских команд особенно полезно различие между корректным применением известного метода и появлением действительно новой техники. При этом прогресс на таком наборе неизбежно будет измеряться медленнее: каждый заявленный успех требует полноценной математической экспертизы.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.