An editorial selection of the latest AI news from around the world
DSML.KZ / AI RADAR
August 1, 20264
Today in 30 seconds
Главный сдвиг дня — ИИ всё увереннее пробуют не на задачах с готовыми ответами, а на настоящей исследовательской границе. OpenAI заявила о десяти результатах Astra в открытых задачах и приложила формализации доказательств в Lean, но научному сообществу ещё предстоит проверить постановки, новизну и корректность.
Одновременно Epoch AI расширила FrontierMath: Open Problems до 50 задач, из которых при помощи ИИ пока решены три: такой бенчмарк будет двигаться медленнее привычных рейтингов, зато лучше покажет, способны ли модели создавать новые методы.
Параллельно становится практичнее и работа с внутренностями моделей и агентной инфраструктурой. Anthropic обнаружила в Claude пространство J-space со словами, которые не попадают в ответ, но связаны с дальнейшим ходом решения; это полезный канал для причинных экспериментов, а не буквальное чтение мыслей. DataFlow-Harness показал, как направлять coding-агента к сохраняемым workflow вместо одноразовых скриптов, достигнув 93,3% сквозной успешности на небольшом наборе задач. А stateless-режим MCP убирает обязательную сессию и позволяет вызвать инструмент одним HTTP-запросом, упрощая горизонтальное масштабирование сервисов.
Пользовательские инструменты тем временем получают больше контекста и контроля. Imagine Video научилась удерживать персонажей, предметы, локации и голоса между сценами с помощью референсов, а Gemini на Mac теперь принимает голосовые команды прямо в активном окне и вставляет готовый результат у курсора. Обе идеи сокращают переключения и повторную настройку, хотя доступность языков, голосовых функций и API пока неодинакова.
Чем глубже модели входят во внутренние процессы компаний, тем важнее происхождение весов, движение данных и полная история действий агентов. Конгресс США потребовал от DoorDash раскрыть использование китайских моделей и результаты проверок безопасности после эксперимента с Kimi. На этом же фоне groundcover привлекла $100 млн на observability-архитектуру, которая оставляет растущую телеметрию приложений и агентов внутри облака заказчика.
Numbers of the day
Внутренняя модель OpenAI Astra получила десять результатов в математике и теоретической информатике, включая задачи, остававшиеся открытыми десятилетиями. Компания приложила формализации доказательств в Lean, но сами результаты ещё нуждаются в проверке научным сообществом.
Google начала глобально запускать для англоязычных пользователей Gemini на Mac функцию Speak to Window. Долгое нажатие Fn включает голосовой ввод, а готовый результат появляется у курсора прямо в текущем приложении.
Два комитета Палаты представителей запросили у DoorDash перечень используемых китайских моделей и результаты их проверок безопасности. Поводом стал эксперимент компании с open-weight-моделью Kimi от китайского стартапа Moonshot AI.
AI RADAR
Epoch AI расширила FrontierMath: Open Problems до 50 значимых задач, которые уже выдержали серьёзные попытки решения профессиональными математиками. Три задачи из набора пока удалось решить с помощью ИИ.
Новый метод интерпретации Claude выявил J-space — внутреннее пространство слов, которые не появляются в ответе, но связаны с ходом решения задачи. Наблюдение открывает дополнительный способ исследовать вычисления модели, хотя не превращает их в буквальное чтение мыслей.
Стартап groundcover закрыл раунд на $100 млн под руководством One Peak и довёл общий объём финансирования до $160 млн. Компания предлагает хранить и обрабатывать растущий поток эксплуатационных данных внутри облачной среды заказчика — в том числе телеметрию ИИ-агентов.
Саймон Уиллисон присоединился к Брайану Кэнтриллу и Адаму Левенталю в подкасте Oxide and Friends, чтобы разобрать стремительное развитие open-weight-моделей. Центральной темой стало сокращение разрыва между открытыми и закрытыми передовыми системами.