AI Radar
OpenAI применила GPT‑5.6 Sol и Codex для оптимизации собственного production-стека: изменения в GPU-ядрах, маршрутизации и декодировании снизили стоимость обслуживания запросов и увеличили пропускную способность. Отдельный эксперимент показал, что возможности агентной модели могут радикально зависеть от обвязки, которая управляет памятью между шагами.
Sol работала не только как пользовательская модель, но и как инженерный агент внутри инфраструктуры OpenAI. Через Codex она анализировала реальный трафик, искала дисбаланс загрузки, проверяла новые правила маршрутизации и переписывала низкоуровневый код вычислений в Triton и Gluon. Оптимизация охватила несколько уровней: распределение запросов между регионами и кластерами, назначение работы конкретным ускорителям, конфигурацию KV-кэша и GPU-ядра, выполняющие математические операции модели. В совокупности эти изменения уменьшили сквозную стоимость production-инференса на 20% без замены аппаратной платформы.
Еще одним направлением стало спекулятивное декодирование. В этой схеме небольшая черновая модель заранее предлагает последовательность токенов, а основная модель проверяет их параллельно и при успешной проверке принимает сразу несколько. Sol провела сотни сравнительных экспериментов с размером и архитектурой такой модели, запускала ее обучение и самостоятельно реагировала на сбои оборудования или нестабильность процесса. Результатом стал рост общей эффективности генерации токенов более чем на 15%. Дополнительный резерв OpenAI ищет в подборе конфигураций под фактическую длину запросов, объем ответов, размеры батчей и долю попаданий в кэш — параметров слишком много, чтобы надежно настраивать их только вручную.
В агентном стеке компания отдельно занялась потерями, которые возникают между последовательными вызовами модели. Один сеанс Codex может включать десятки обращений к модели, чтение файлов, запуск тестов и другие инструменты, поэтому даже небольшая задержка и повторная обработка контекста быстро накапливаются. Обвязка теперь загружает MCP-инструменты и интеграции только по необходимости, по умолчанию ограничивает их вывод 10 тысячами токенов и сохраняет историю в режиме append-only. Последнее важно для prompt caching: неизменный префикс можно не пересчитывать на каждом следующем шаге.
Насколько критична такая обвязка, продемонстрировал ARC‑AGI‑3 — интерактивный тест, где агент должен исследовать двумерную среду и учиться на последствиях собственных действий. На стандартном универсальном harness Sol первоначально получила лишь 7,8%. После каждого действия система удаляла приватные рассуждения модели, а скользящее окно постепенно скрывало ранние ходы. Это противоречило режиму, под который Sol обучали: модель должна сохранять рассуждения между вызовами и накапливать опыт проб и ошибок.
Исследователи включили сохранение reasoning между шагами и заменили грубое отсечение истории на сжатие контекста — аналогичные приемы используются в ChatGPT и Codex. На публичном наборе ARC‑AGI‑3 результат вырос с 13,3% до 38,3%, то есть почти втрое, а расход выходных токенов уменьшился в шесть раз; средний человеческий результат для сравнения составляет 48%. При этом снижение эксплуатационной стоимости Sol не следует путать с розничной ценой API: отдельно OpenAI в пять раз удешевила Luna до $0,2/$1,2 за миллион входных и выходных токенов и на 20% — Terra до $2/$12, тогда как базовая цена Sol не изменилась. Для Sol появился ускоренный режим, работающий в 2,5 раза быстрее за удвоенную плату.
Для команд, эксплуатирующих модели, это наглядный пример того, что заметная экономия достигается совместной настройкой кода модели, GPU-ядер, кэшей и маршрутизации, а не одним локальным ускорением. Разработчикам агентов также важно тестировать модель вместе с production-подобным harness: удаление reasoning или неудачное управление историей способно одновременно ухудшить качество и увеличить расход токенов.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.