AI Radar
DeepSeek вывела V4-Flash-0731 в публичное тестирование через API, не меняя архитектуру и размер модели. Новое постобучение заметно подняло официальные результаты в агентных задачах, а поддержка Responses API упростила подключение к Codex и другим инструментам разработки.
V4-Flash-0731 сохранила разреженную MoE-архитектуру предварительной версии: 284 млрд параметров в общей сложности и 13 млрд активных при обработке токена. Не изменился и заявленный контекст до 1 млн токенов. Вместо нового претренинга или наращивания модели DeepSeek заново провела постобучение — этап, на котором модель учат следовать инструкциям, пользоваться инструментами и последовательно выполнять многошаговые задания. Компания не раскрыла состав данных, методы вознаграждения и сам тренировочный процесс, поэтому связать прирост с каким-либо конкретным техническим приёмом пока нельзя.
Главный эффект виден в тестах, где недостаточно просто дописать функцию. В Terminal Bench 2.1 модель получила 82,7 балла, в DeepSWE — 54,4, в NL2Repo — 54,2, а в DSBench-FullStack — 68,7. Такие испытания требуют от агента изучить репозиторий, работать с терминалом, изменить несколько файлов, запустить тесты и исправить ошибки по результатам выполнения. По опубликованным цифрам Flash обходит прежнюю V4-Pro-Preview в ряде кодовых и агентных сценариев, хотя сама Flash задумывалась как более компактный и экономичный вариант семейства.
Сравнения требуют осторожности. Часть результатов получена с пока не опубликованным DeepSeek Harness и высоким бюджетом рассуждений, а DSBench-FullStack и DSBench-Hard — внутренние наборы самой компании. Итог агентного теста зависит не только от весов, но и от системного промпта, числа доступных шагов, инструментов и логики управляющего фреймворка. Поэтому результаты подтверждают сильный прогресс V4-Flash в окружении DeepSeek, но ещё не доказывают такой же отрыв при запуске через независимые агенты и с равным вычислительным бюджетом.
Вторая часть обновления относится именно к интеграции. Модель теперь нативно поддерживает формат Responses API, параллельные вызовы инструментов и уровни рассуждения low, high и max, а также адаптирована для Codex. Responses API объединяет ответы модели, состояние рассуждения, команды инструментам и их результаты в более удобный для агентов интерфейс. Он сам по себе не повышает интеллект модели, но сокращает объём прослойки, необходимой для подключения к Codex CLI, расширению VS Code и совместимым рабочим процессам.
DeepSeek сохранила агрессивные тарифы: миллион некэшированных входных токенов стоит 1 юань, выходных — 2 юаня, а вход при попадании в кеш — 0,2 юаня. В пересчёте источники приводят примерно $0,14 за вход и $0,28 за выход. Однако обновление пока доступно только через API: веса V4-Flash-0731 не опубликованы, модели в приложении и веб-интерфейсе не заменены, а API V4-Pro остаётся на прежней версии. Выпуск обновлённой V4-Pro ожидается в начале августа.
Для команд, строящих кодовых агентов, V4-Flash предлагает редкое сочетание низкой цены, длинного контекста и готовой интеграции с распространённым API. Но перед переносом рабочих нагрузок стоит воспроизвести тесты в собственном фреймворке: официальные баллы частично зависят от закрытого harness, режима рассуждений и внутренних наборов данных.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.