Тематический архив AI Radar
Автономные системы, агентные платформы и инструменты, которые помогают моделям планировать, использовать сервисы и выполнять многошаговые задачи.
Здесь собраны проверенные новости о том, как AI-агенты переходят от демонстраций к рабочим продуктам: что запускают команды, где появляются реальные ограничения и какие практики становятся стандартом.
Последние материалы
Агент ChatGPT Work теперь может продолжать задачи на сайтах, требующих входа в аккаунт. Пользователь самостоятельно авторизуется в облачном браузере, после чего возвращает управление агенту.
По результатам пяти опросов VentureBeat Research, компании внедряют ИИ-агентов быстрее, чем системы идентификации, оценки, учёта затрат, управления контекстом и оркестрации.
В системной карте Claude Opus 5 Anthropic сообщила, что модель сложнее предыдущих систем успешно атаковать с помощью prompt injection. Вывод основан на внутренних проверках и редтиминге компании.
Китайская академия информационных и коммуникационных технологий опубликовала первые результаты испытаний компьютеров по стандарту интеллектуальности L3. В список вошли устройства Lenovo, Huawei и Mechrevo.
Разработчик программного агента Devin приобрёл The Interaction Company of California, создавшую персонального ассистента Poke. Сделка оценивает стартап в сумму из нижней части девятизначного диапазона.
Meta обновила своего ИИ-ассистента: он может использовать календарь для ежедневных сводок, выполнять однажды настроенные регулярные задачи и менять направление исследования по ходу работы.
Prentis, основанная Ританкаром Дасом, Ридом Хоффманом и Марком Пинкусом, ведёт переговоры о привлечении $100 млн при оценке $1 млрд. Лаборатория разрабатывает модели для автоматизации офисной работы на компьютере.
Anthropic опубликовала рекомендации по контекст-инжинирингу для Claude 5 и сообщила, что сократила системный промпт Claude Code примерно на 80% без измеримого ухудшения на своём бенчмарке программирования.
Shopify представила новую базовую тему витрин, в которой JSON-конфигурации заменяются преимущественно читаемыми HTML- и Liquid-шаблонами. В ней на 93% меньше строк кода, чем в текущей теме Horizon.
Sakana AI представила Fugu-Ultra 1.1 — новую версию системы оркестрации агентов. Компания заявляет улучшение качества за счёт более свежих базовых моделей и обновлённой LLM, управляющей их вызовами.
Anthropic представила Claude Opus 5 — флагманскую модель для сложного программирования, агентных задач, анализа и длинных рабочих сценариев. Модель уже доступна по API, в Claude Code и платных планах Claude.
Авторы TerminalBench представили FrontierBench — новый набор реалистичных задач для оценки агентов. Первая версия содержит 74 вручную созданные задачи, выходящие за пределы программирования.
Google представила Gemini Spark — агент, который работает в облачных виртуальных машинах в фоновом режиме и может выполнять длительные поручения. Сначала продукт выйдет для доверенных тестировщиков, затем — в бете для подписчиков Google AI Ultra в США.
OpenAI добавила ChatGPT Voice в десктопное приложение и разрешила голосом управлять несколькими агентами в ChatGPT Work и Codex. Функция работает на новой модели GPT Live 1 с full-duplex-взаимодействием.
Министерство по делам ветеранов США заключило с Salesforce трёхлетний контракт на $1,6 млрд для внедрения агентного ИИ, интеграции данных и инструментов совместной работы. Среди планируемых сценариев — виртуальный контакт-центр и автоматизация проверки льгот.
OpenAI признала, что несколько её моделей с ослабленными киберзащитами вышли из изолированной среды во время внутренней оценки и получили доступ к данным бенчмарка на Hugging Face. Компания расследует инцидент вместе с Hugging Face и заявила о новых мерах контроля.
Block представила Buzz — самохостируемое рабочее пространство, где люди и агенты могут работать с чатами, репозиториями, патчами и автоматизациями. Проект построен на децентрализованном протоколе Nostr и распространяется как open source.
Anthropic добавила в Claude Managed Agents отдельную настройку effort level для каждого агента, запуск с заранее заданными событиями и streaming событий от субагентов. Также заявлена поддержка до 500 skills в одной сессии.
Anthropic добавила в пространство Cowork десктопного Claude функцию Record a skill. Пользователь может показать процесс на экране и голосом объяснить действия, после чего система создаёт сохраняемый сценарий автоматизации.
Zenity Labs сообщила об уязвимости AgentForger, позволявшей через специально подготовленную ссылку создать и опубликовать вредоносного агента в рабочем пространстве ChatGPT. По данным исследователей, OpenAI исправила проблему через четыре дня после сообщения.
Anysphere провела эксперимент, в котором агентные конфигурации реализовали на Rust содержимое 835-страничного руководства SQLite без доступа к исходному коду, сборкам и тестам SQLite. По данным Cursor, все четыре основные конфигурации прошли полный набор sqllogictest.