AI Radar
Саймон Уиллисон представил smevals — компактный CLI-инструмент для создания и запуска наборов тестов над несколькими конфигурациями LLM. Он отделяет генерацию ответов от их проверки и позволяет сравнивать не только модели, но и системные промпты, параметры и агентные harness-ы.
Smevals появился в результате работы Уиллисона с лабораторией прикладных AI-исследований Prime Radiant Джесси Винсента. Инструмент предназначен для небольших, сфокусированных eval-наборов, которые отвечают на конкретный вопрос о возможностях системы: например, насколько хорошо разные модели генерируют SVG или справляются с заданным форматом текста. Сам Уиллисон называет smevals своей третьей попыткой выстроить удобный подход к оценке моделей.
Базовая структура хранится в каталоге с YAML-файлами. Eval объединяет несколько задач, а каждая задача формулирует отдельное испытание — от генерации SVG с заданным сюжетом до написания хайку. Испытания запускаются против одной или нескольких конфигураций: конфигурация обязательно указывает модель, но также может фиксировать системный промпт, параметры инференса или конкретную агентную обвязку. Благодаря этому сравнение не сводится к таблице «модель против модели»: можно изолированно проверять влияние остальных частей приложения.
Рабочий цикл собран вокруг команд, которые можно запускать через uvx без отдельной установки пакета. Команда `uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6` выполняет один набор задач на нескольких моделях, причём результат каждой пары «конфигурация — задача» сохраняется как отдельный run. Для быстрого знакомства предусмотрена команда `uvx smevals docs`, выводящая README; Уиллисон предлагает дать её coding-агенту, а затем поручить ему собрать подходящий eval-набор.
Выполнение задач намеренно отделено от выставления оценок. После накопления запусков команда `uvx smevals grade path-to-eval/` применяет к ним заданные grader-ы, каждый из которых состоит из последовательности проверок. Простые проверки могут искать нужную строку или подтверждать валидность XML. Для более содержательных критериев поддерживаются пользовательские скрипты-checker-ы, в том числе обращающиеся к другой модели, чтобы оценить результат. Такое разделение позволяет повторно прогонять изменившиеся критерии по уже полученным ответам, не смешивая инференс с процедурой оценки.
Результаты можно изучать локально через `uvx smevals serve path-to-eval/`. Альтернативная команда `smevals build` формирует статический HTML-отчёт, который разрешается разместить на любом хостинге и передать коллегам без развёртывания отдельного сервиса. В качестве демонстрации Уиллисон подготовил набор для оценки того, насколько хорошо модели пишут хайку; это одновременно показывает предполагаемый масштаб инструмента — небольшие понятные эксперименты вместо тяжёлой универсальной платформы.
Smevals даёт командам воспроизводимый способ проверить, действительно ли новая модель, промпт или агентная обвязка улучшает конкретный сценарий. Разделение запусков и оценивания помогает менять критерии без повторной оплаты инференса, а статические отчёты упрощают обсуждение результатов. При этом качество вывода по-прежнему зависит от того, насколько удачно составлены задачи, проверки и модельные grader-ы.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.