AI Radar

Google и Кембридж открыли VeriHarness для проверки результатов AI-агентов

Google AI Research и Кембриджский университет открыли VeriHarness — систему, которая проверяет и исправляет результаты долгих агентных задач с помощью той же модели, что выполняла работу. Вместе с кодом опубликованы трейсы запусков агентов.

8 октября 2026 г.2 мин чтенияИсточник: TG · AI/ML/Big Data
агентымоделиоткрытые модели
01

Что изменилось

Google AI Research и Кембриджский университет открыли код VeriHarness под лицензией Apache 2.0. Система рассчитана на долгие агентные задачи, где несколько попыток дают разные отчёты, таблицы, документы или патчи. Вместо простого голосования она сверяет варианты с файлами рабочего пространства, выбирает основу для ответа, исправляет найденные ошибки и сохраняет журнал проверок. Проверяющий при этом не получает эталонного ответа или готовых критериев оценки.

Проверка разделена на два направления: в одном контексте модель ищет способ разрешить расхождения между попытками, в другом — перепроверяет утверждения, с которыми согласились все прогоны. Это важно потому, что единодушие не гарантирует правильности: в приведённых результатах APEX-Agents ошибочной оказалась примерно треть ответов, совпавших во всех десяти попытках. Для таблиц, PDF, документов, презентаций и патчей предусмотрены 18 навыков с инструкциями и скриптами; система работает внутри Gemini CLI, Claude Code и Codex.

В опубликованной сводке испытаний на пяти бенчмарках средний результат с проверкой и правками вырос с 47,2 до 53,4 балла для Gemini 3.5 Flash и с 49,6 до 56,1 для Claude Opus 4.8. Вместе с кодом авторы выложили около 26 тысяч трейсов агентов. Эти числа относятся к указанным тестовым задачам: для своего рабочего процесса разработчику всё равно потребуется проверить, насколько полезны такие проверки и правки.

Почему это важно

Если агент создаёт несколько вариантов файла или патча, VeriHarness даёт способ сверить их с рабочими данными и исправить ошибки, а не полагаться на голосование. Код и трейсы доступны для проверки подхода на собственных задачах.

Мнение редакции

Google AI Research — исследовательское направление Google в AI, а Кембриджский университет — крупный академический партнёр. Агенты уже умеют создавать документы и правки, но выбор лучшего результата из нескольких попыток остаётся отдельной задачей; другие команды тоже ищут способы проверять ответы моделей. VeriHarness интересен тем, что одной и той же модели поручают не только выполнить работу, но и предметно проверить её по исходным файлам.

Первоисточники и подтверждения

Telegram

Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.

8 октября 2026 г.
  1. 01Microsoft выпустила Agent Lightning 1.0 для обучения уже работающих AI-агентов
  2. 02Claude Haiku 5.5 стала дешевле и получила настройку глубины рассуждений
  3. 03В ChatGPT приходят GPT-6 и ответы с интерактивными интерфейсами
  4. 04Microsoft добавила защищённые среды для агентов в Windows и показала ПК на RTX Spark