AI Radar
Microsoft представила второе поколение собственного ИИ-ускорителя и начала устанавливать Maia 200 в регионе Azure US Central. Чип предназначен прежде всего для инференса крупных моделей и должен обслуживать GPT-5.2, Microsoft Foundry и Microsoft 365 Copilot.
Maia 200 производится TSMC по 3-нм техпроцессу и содержит более 100 млрд транзисторов. Microsoft позиционирует его как ускоритель для крупных современных моделей с запасом под более тяжёлые будущие системы. Это продолжение линии Maia 100, представленной в 2023 году, но на этот раз компания делает прямые заявления о производительности относительно специализированных чипов других облачных платформ.
По собственным измерениям Microsoft, Maia 200 обеспечивает втрое более высокую производительность FP4, чем Amazon Trainium третьего поколения, а по FP8 превосходит TPU Google седьмого поколения. Низкая точность FP4 и FP8 позволяет уменьшать объём данных и ускорять матричные операции, необходимые нейросетям, хотя итоговое качество и скорость зависят от конкретной модели, реализации ядер и допустимой квантизации. Заявленные сравнения пока следует воспринимать как показатели поставщика: независимых тестов и подробной методики в доступных данных нет.
Главный аргумент Microsoft связан не только с пиковой скоростью, но и с экономикой эксплуатации. Компания называет Maia 200 своей наиболее эффективной системой для инференса и заявляет на 30% лучшую производительность на доллар по сравнению с новейшим оборудованием, уже работающим в её парке. Для облачного провайдера, который постоянно обслуживает модели в Copilot и через API, такое соотношение непосредственно влияет на стоимость каждого ответа и доступную пропускную способность дата-центров.
Первым внутренним пользователем ускорителя станет команда Microsoft Superintelligence. На Maia 200 также планируется размещать GPT-5.2 от OpenAI и другие модели, доступные через Microsoft Foundry и Microsoft 365 Copilot. Таким образом, чип входит не в экспериментальный стенд, а в вертикально интегрированный стек: Microsoft контролирует облачную инфраструктуру, программный слой и сервисы, под реальные нагрузки которых можно оптимизировать оборудование.
Развёртывание началось в Azure US Central, после чего Maia 200 должен появиться и в других регионах. Одновременно Microsoft приглашает исследователей, разработчиков, ИИ-лаборатории и участников проектов открытых моделей в раннюю программу знакомства с SDK. Доступность программных инструментов критична для любого нового ускорителя: даже сильные аппаратные характеристики мало помогают, если модели трудно переносить, профилировать и эффективно запускать вне нескольких внутренних сценариев.
Конкурентная картина при этом продолжает меняться. Google и Amazon уже готовят следующие поколения собственных ускорителей, а Amazon работает с Nvidia над интеграцией будущего Trainium4 с NVLink 6 и стоечной архитектурой MGX. Поэтому сегодняшнее превосходство Maia 200 над указанными поколениями TPU и Trainium нельзя автоматически переносить на ещё не выпущенное оборудование или на все виды обучения и инференса.
Maia 200 даёт Microsoft ещё один способ снижать себестоимость массового инференса и меньше зависеть от закупок универсальных GPU. Для клиентов Azure практический эффект проявится в доступности моделей, ценах и задержках, но сначала ускоритель должен выйти за пределы одного региона и получить зрелый программный стек. Заявленные преимущества над TPU и Trainium требуют сопоставимых независимых тестов.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.