AI Radar
На приглашение в закрытое тестирование DeepSeek Harness откликнулись сотни разработчиков открытых агентных проектов. Их заявки показали, какие компоненты нужны агентам помимо сильной модели: устойчивое выполнение длинных задач, память, безопасные инструменты и реалистичная оценка качества.
Руководитель команды DeepSeek Agent Harness Цуй Тяньи 1 августа пригласил в закрытое тестирование разработчиков, участвовавших в создании и сопровождении открытых агентных проектов. От кандидатов требовалось приложить репозиторий с показательным результатом. К утру 3 августа сторонний подсчёт обнаружил 769 заявок и 712 уникальных репозиториев из 18 категорий; суммарно они набрали более 1,2 млн звёзд на GitHub. Обычный набор тестировщиков таким образом превратился в масштабную, хотя и неформальную витрину открытой агентной инфраструктуры.
Harness в этом контексте — исполнительный слой между моделью и реальной средой. Модель интерпретирует задачу и предлагает шаги, а обвязка управляет терминалом, файлами, внешними инструментами, контекстом и восстановлением после ошибок. DeepSeek уже применяла Harness при тестировании финальной версии V4-Flash: выбранные испытания охватывали операции в терминале, кибербезопасность, вызов множества инструментов и сложную full-stack-разработку. Все эти сценарии требуют не разового ответа, а длинной последовательности действий с корректировкой плана по результатам выполнения.
Самыми крупными категориями среди заявок стали агентные фреймворки и программирующие агенты: вместе в них оказалось 242 проекта, около трети выборки. Ещё 56 проектов занимались памятью и контекстом, набрав в сумме 194 тысячи звёзд. Разработчики экспериментируют с Git, базами данных и графами знаний, пытаясь сохранить состояние многочасовой задачи, учитывать историю репозитория и возвращать агенту нужную информацию без переполнения контекстного окна. Единого архитектурного решения для такой памяти у сообщества пока нет.
Меньше проектов было посвящено исследованиям и оценке качества, а также безопасности — по 24 в каждой категории, — но именно эти направления определяют готовность агента к производственной эксплуатации. Когда система получает право выполнять код и изменять файлы, ей нужны разграничение полномочий, изоляция файловой системы и надёжная песочница. Среди заявителей были разработчики с опытом поиска уязвимостей в Codex, Claude Code и Cursor, а также авторы среды, которая на TerminalBench 2.1 с V4-Flash в режиме высокой интенсивности рассуждений показала результат 70,8%.
Вокруг Harness уже возникло предположение, что DeepSeek готовит собственного агента для программной инженерии с автономным планированием, выполнением кода, памятью и пониманием репозитория — потенциального конкурента Claude Code и Codex. Компания этого не подтверждала. Из известных шагов можно говорить лишь о поддержке Responses API, адаптации V4-Flash для Codex и постепенном тестировании распознавания изображений, полезного для чтения архитектурных схем и скриншотов ошибок.
Сами цифры набора нужно воспринимать осторожно. Комментарии содержали не только заявки, но и обсуждения, формат отправки не был унифицирован, некоторые ссылки не работали, а отдельные проекты попали не в те категории. Кроме того, популярный репозиторий мог предложить не его основной автор, а участник, сделавший лишь один pull request. Поэтому список хорошо показывает разнообразие инженерных подходов, но не является ни рейтингом проектов, ни точным срезом всей открытой экосистемы агентов.
Для команд, создающих агентов, набор DeepSeek даёт практичную карту областей, которые следует тестировать отдельно от качества базовой модели. Долгие задачи, управление контекстом, восстановление после сбоев и изоляция инструментов могут определять надёжность продукта сильнее, чем прирост нескольких пунктов в модельном бенчмарке. Пока, однако, не стоит воспринимать заявки как подтверждение характеристик будущего продукта DeepSeek.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.