DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesPrivacyTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarAugust 1, 2026

    AI Radar

    Smevals упрощает сравнение моделей, промптов и агентных обвязок из командной строки

    Саймон Уиллисон представил smevals — компактный CLI-инструмент для создания и запуска наборов тестов над несколькими конфигурациями LLM. Он отделяет генерацию ответов от их проверки и позволяет сравнивать не только модели, но и системные промпты, параметры и агентные harness-ы.

    August 1, 2026·3 min read·Источник: Simon Willison's Weblog
    00

    Что изменилось

    Smevals появился в результате работы Уиллисона с лабораторией прикладных AI-исследований Prime Radiant Джесси Винсента. Инструмент предназначен для небольших, сфокусированных eval-наборов, которые отвечают на конкретный вопрос о возможностях системы: например, насколько хорошо разные модели генерируют SVG или справляются с заданным форматом текста. Сам Уиллисон называет smevals своей третьей попыткой выстроить удобный подход к оценке моделей.

    Базовая структура хранится в каталоге с YAML-файлами. Eval объединяет несколько задач, а каждая задача формулирует отдельное испытание — от генерации SVG с заданным сюжетом до написания хайку. Испытания запускаются против одной или нескольких конфигураций: конфигурация обязательно указывает модель, но также может фиксировать системный промпт, параметры инференса или конкретную агентную обвязку. Благодаря этому сравнение не сводится к таблице «модель против модели»: можно изолированно проверять влияние остальных частей приложения.

    Рабочий цикл собран вокруг команд, которые можно запускать через uvx без отдельной установки пакета. Команда `uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6` выполняет один набор задач на нескольких моделях, причём результат каждой пары «конфигурация — задача» сохраняется как отдельный run. Для быстрого знакомства предусмотрена команда `uvx smevals docs`, выводящая README; Уиллисон предлагает дать её coding-агенту, а затем поручить ему собрать подходящий eval-набор.

    Выполнение задач намеренно отделено от выставления оценок. После накопления запусков команда `uvx smevals grade path-to-eval/` применяет к ним заданные grader-ы, каждый из которых состоит из последовательности проверок. Простые проверки могут искать нужную строку или подтверждать валидность XML. Для более содержательных критериев поддерживаются пользовательские скрипты-checker-ы, в том числе обращающиеся к другой модели, чтобы оценить результат. Такое разделение позволяет повторно прогонять изменившиеся критерии по уже полученным ответам, не смешивая инференс с процедурой оценки.

    Результаты можно изучать локально через `uvx smevals serve path-to-eval/`. Альтернативная команда `smevals build` формирует статический HTML-отчёт, который разрешается разместить на любом хостинге и передать коллегам без развёртывания отдельного сервиса. В качестве демонстрации Уиллисон подготовил набор для оценки того, насколько хорошо модели пишут хайку; это одновременно показывает предполагаемый масштаб инструмента — небольшие понятные эксперименты вместо тяжёлой универсальной платформы.

    Почему это важно

    Smevals даёт командам воспроизводимый способ проверить, действительно ли новая модель, промпт или агентная обвязка улучшает конкретный сценарий. Разделение запусков и оценивания помогает менять критерии без повторной оплаты инференса, а статические отчёты упрощают обсуждение результатов. При этом качество вывода по-прежнему зависит от того, насколько удачно составлены задачи, проверки и модельные grader-ы.

    Primary and supporting sources

    • smevals - a small eval suite for evaluating models, prompts, and harnessesOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    August 1, 2026
    1. 01OpenAI заявила о десяти новых результатах Astra в открытых математических задачах
    2. 02FrontierMath теперь проверяет ИИ на 50 нерешённых исследовательских задачах
    3. 03Исследователи Anthropic обнаружили в Claude скрытое пространство влияющих на рассуждение слов
    4. 04DataFlow-Harness превращает сгенерированные ИИ скрипты в управляемые data-пайплайны
    Back to AI Radar