AI Radar
Открытый фреймворк DataFlow-Harness направляет LLM-агента при сборке структурированных и визуально редактируемых workflow вместо генерации одноразовых скриптов. На бенчмарке из 12 задач система показала 93,3% сквозных успешных запусков при снижении стоимости и задержки относительно Claude Code.
Современный coding-агент обычно хорошо пишет отдельный Python-скрипт, но производственный data-пайплайн предъявляет другие требования. Ему нужно обработать реальные схемы данных, использовать доступные в конкретной платформе операторы, обращаться к зарегистрированным датасетам и модельным сервисам, сохранять зависимости между этапами и оставить после себя артефакт, который сможет понять и изменить другой инженер. Свободно сгенерированный код часто игнорирует эти ограничения или придумывает несуществующие зависимости.
Исследователи из Пекинского университета, Zhongguancun Academy и шанхайского Institute for Advanced Algorithms Research называют это разрывом NL2Pipeline. Пользователь формулирует процесс на естественном языке, а рабочая платформа ожидает нативный граф из разрешённых компонентов — постоянный, проверяемый и совместимый с её семантикой. DataFlow-Harness меняет доступное агенту пространство действий: вместо произвольного написания кода тот пошагово собирает workflow из актуальных для среды строительных блоков.
Масштаб проблемы виден в сравнении режимов Claude Code. Получив контекст всей кодовой базы и возможность писать обычные свободные скрипты, агент достиг 94,2% успешных решений. Когда его ограничили платформенными компонентами и потребовали создать нативный граф workflow, показатель упал до 83,3% — разрыв составил 10,9 процентного пункта. Иными словами, корректно выполнить вычисление заметно проще, чем встроить его в управляемую производственную систему.
DataFlow-Harness сократил этот разрыв: на наборе из 12 data-engineering-задач зафиксирована сквозная успешность 93,3%, почти на уровне агента, которому разрешён свободный код. По сравнению со стандартным Claude Code исследователи также сообщают о снижении API-затрат до 72,5% и задержки ответа до 49,9%. Результат относится к небольшому экспериментальному набору, поэтому цифры ещё не доказывают такую же эффективность на произвольных корпоративных стеках, однако показывают преимущество платформенно ориентированного управления агентом.
Практический продукт системы — не только выполненная задача, но и сохраняемый граф, который можно визуально просматривать, редактировать и включать в существующую архитектуру. Это особенно важно для подготовки данных для RAG, синтетической генерации и обучения моделей: такие процессы регулярно меняются, проходят аудит и должны воспроизводиться. Одноразовый скрипт может дать правильный результат сегодня, но без явной структуры быстро превращается в технический долг.
DataFlow-Harness предлагает MLOps-командам способ использовать coding-агентов, не отказываясь от управляемости, аудита и повторного редактирования workflow. Подход особенно полезен там, где платформа имеет собственный каталог операторов и строгие правила интеграции. Перед внедрением стоит отдельно проверить качество на внутренних схемах, сервисах и нестандартных зависимостях, поскольку опубликованный бенчмарк включает лишь 12 задач.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.