AI Radar
Авторы TerminalBench представили FrontierBench — новый набор реалистичных задач для оценки агентов. Первая версия содержит 74 вручную созданные задачи, выходящие за пределы программирования.
В набор вошли сценарии с эксплуатацией и заменой сервисов без исходного кода, расчётом банковского капитала и диспетчеризацией логистики с изменяющимися ограничениями. Задачи ориентированы на проверку экономически значимой работы, а не на изолированные coding-тесты.
Согласно приведённым результатам, лучшие модели решают около трети задач. Авторы также отмечают, что сходное качество может достигаться существенно разными стратегиями — с разным числом действий и расходом токенов.
FrontierBench расширяет оценку агентов на задачи, близкие к реальным операционным процессам. Это помогает сравнивать не только точность моделей, но и их практическую эффективность в сложных многошаговых сценариях.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.