AI Radar
OpenAI выложила сотни математических результатов, полученных с помощью модели
По сообщению SeeAllochnaya, OpenAI опубликовала результаты прогона внутренней модели по тысячам открытых задач: заявлено 372 основных результата и 719 подготовленных текстов. Часть доказательств записана на Lean, но публикация уже включает отозванные и исправленные работы.
Что изменилось
По сообщению канала SeeAllochnaya, OpenAI запустила внутреннюю модель на наборе примерно из 4000 открытых задач. Автор публикации оценивает затраты на каждую как сравнительно небольшие: порядка трёх часов работы GPT Pro, а не запуск тысяч параллельных агентов. Это оценка из пересказа, а не воспроизводимая спецификация эксперимента.
Как утверждается в том же сообщении, модель получила 372 основных результата, после чего с её помощью подготовили 719 текстов: решения, дополнительные аргументы, следствия и альтернативные доказательства. Результаты выложили на GitHub. Примерно для 63% основных результатов, по данным публикации, есть также доказательства на Lean. Эта система проверяет, следует ли формальный вывод из заданных посылок; для оценки всей работы всё равно важно проверить формулировки и соответствие формализации исходной задаче.
Массив уже меняется: автор сообщения указывает, что три статьи были отозваны, а ещё 14 исправлены. Поэтому число опубликованных решений не стоит читать как число окончательно подтверждённых теорем. У отдельных результатов разная степень проверки, и исследователям предстоит разбирать их по одному, прежде чем опираться на них в новых работах.
Почему это важно
Для исследователей это потенциальный источник новых доказательств и идей, но не готовый список проверенных теорем. При использовании результата стоит отдельно сверять постановку задачи, текст доказательства и формальную версию, если она есть.
Мнение редакции
OpenAI известна прежде всего своими языковыми моделями; теперь она проверяет, могут ли они массово участвовать в математических исследованиях. В отличие от публикации одного результата, открытый архив из сотен работ ставит вопрос о том, как организовать независимую проверку такого объёма доказательств.
Первоисточники и подтверждения
TelegramПодборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.