AI Radar
Reflection анонсировала открытую MoE-модель Beam на 501 млрд параметров
Reflection представила Beam — свою первую открытую модель с архитектурой Mixture-of-Experts на 501 млрд параметров. Компания делает ставку на код, многошаговое рассуждение и агентные сценарии, обещая конкурентное качество при заметно меньших затратах на инференс.
Что изменилось
Beam — разреженная MoE-модель: из 501 млрд общих параметров при каждом шаге задействуются 23 млрд. Такая конструкция нужна, чтобы приблизить возможности очень крупных моделей без пропорционального роста стоимости каждого сгенерированного токена. Reflection позиционирует новинку прежде всего как рабочую модель для программирования, рассуждений и агентов, а не как универсальный чат-бот. Пока веса не опубликованы: модель проходит финальный red-teaming и оценку, а ранний доступ предлагается по заявке. Веса, технический отчёт, model card и инструменты для разработчиков компания обещает выпустить позже в октябре.
В основе обучения — 23,8 трлн отобранных токенов из веба и лицензированных проприетарных наборов данных, но ключевой акцент сделан на постобучении с подкреплением. Для этого Reflection собрала около миллиона сред с задачами по коду, агентным действиям и STEM-дисциплинам. За четыре недели на 10,5 тыс. GPU NVIDIA GB300 система сгенерировала более 100 млн rollout’ов при максимальном контексте 256 тыс. токенов; обучение и проверка результатов задействовали около 1,3 млрд песочниц. В такой схеме модель может пробовать длинные цепочки действий, пользоваться инструментами и получать сигнал от среды, а не только предсказывать следующий фрагмент текста.
По собственным тестам Reflection, Beam сопоставима с GLM-5.2 на сложных задачах рассуждения, но использует в три—четыре раза меньше вычислений при инференсе. В задачах программирования и агентного исполнения компания называет её конкурентом крупных открытых моделей и говорит о приближении к Qwen 3.8-Max, хотя признаёт преимущество Kimi K3 по «сырой» способности. Эти результаты следует читать именно как заявления разработчика до выхода полного технического отчёта и независимых репликаций. Тем не менее выбранная метрика важна: для агентных систем стоимость определяется не одним ответом, а множеством вызовов модели в цикле планирования, проверки и работы с инструментами.
Релиз вписывается в более широкий курс Reflection на локально разворачиваемые решения для компаний и государств. Компания хочет предлагать «AI factories»: заказчик сможет дообучать базовую модель на собственных данных и запускать настроенную систему в своём контуре. Это объясняет сочетание открытых весов, фокуса на эффективности и агентных нагрузках: организациям нужны не только сильные бенчмарки, но и предсказуемая цена эксплуатации, контроль данных и возможность адаптации под внутренние процессы. Основанный выходцами из DeepMind стартап ранее работал над RL-агентами для кода, а теперь переносит эту специализацию в открытую модельную линейку.
Почему это важно
Beam показывает, что соревнование открытых моделей всё сильнее смещается от размера к стоимости полезного агентного шага. Если заявленная экономия на инференсе подтвердится, команды смогут дешевле запускать длинные циклы кодинга и работы с инструментами. Но до публикации весов и независимых тестов сравнения с GLM, Qwen и Kimi остаются предварительными.
Первоисточники и подтверждения
Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.