AI Radar
SpaceXAI выпустила новую speech-to-speech модель для голосовых агентов, улучшив скорость первого ответа, распознавание и выполнение задач с инструментами. Think Fast 2.0 стоит $0,08 за минуту аудио и 5 августа станет версией по умолчанию для алиаса grok-voice-latest.
Think Fast 2.0 обрабатывает речь и сразу формирует голосовой ответ, не разбивая взаимодействие на явно заметную для пользователя цепочку «распознавание — текстовая модель — синтез». Среднее время до первого аудио сократилось с 1,25 до 0,70 секунды. На момент замера это был единственный результат быстрее секунды среди пяти верхних моделей рейтинга Artificial Analysis: для сравнения, GPT‑Realtime‑2 High показала 1,14 секунды, а GPT‑Realtime‑2.1 High — 1,21 секунды. Такая разница особенно ощутима в телефонном разговоре, где длинная пауза легко воспринимается как обрыв связи или непонимание.
В совокупном Speech-to-Speech Index модель набрала 82,9% против 75,7% у Think Fast 1.0. Это выше указанных в сравнении результатов GPT‑Realtime‑2.1 — 79,1% — и Gemini 3.1 Flash — 69,5%, хотя в расширенном рейтинге Think Fast 2.0 уступает Qwen Audio 3.0 Realtime Plus с 84,1%. На разговорном Full Duplex Bench результат составил 95,1%: заметно выше прежних 77,8%, но немного ниже 95,7% у GPT‑Realtime‑2.1. Иными словами, лидерство зависит от конкретной метрики, а не распространяется автоматически на все аспекты голосового общения.
Основной акцент релиза сделан на агентных сценариях. На Tau Voice Think Fast 2.0 получила 56,5% — против 52,1% у предыдущей версии, 45,7% у GPT‑Realtime‑2.1 и 37,7% у Gemini 3.1 Flash. Модель рассуждает параллельно с произнесением ответа, а медианный расход reasoning-токенов снизился до 40% от уровня предшественницы. По данным SpaceXAI, благодаря этому production-вызов инструмента обычно успевает начаться до того, как агент закончит первую фразу. Обучение с подкреплением также настроило модель на более короткие реплики, один вопрос за раз и меньше повторов при сопровождении сложного процесса.
Компания отдельно улучшала транскрибацию на тысячах коротких фраз в 24 языках. В собственных тестах SpaceXAI заявляет рост точности примерно в 1,4 раза относительно Think Fast 1.0 и в 1,5–2 раза относительно Deepgram Nova 3 и ElevenLabs Scribe v2. При сильном фоновом шуме и телефонном сжатии заявленный разрыв по ошибкам достигает десятикратного. Это внутреннее сравнение производителя, поэтому переносить множитель на произвольные длинные диалоги, акценты и отраслевую лексику без отдельной проверки не стоит.
Модель доступна разработчикам в Agent Builder по цене $0,08 за минуту аудио, то есть $4,80 за час. Это дороже указанной для предыдущей версии ставки $3 в час, но примерно в 2,2 раза дешевле GPT‑Realtime‑2.1 High при $10,75 в час. В демонстрациях разработчики уже подключали ее к телефонному агенту и терминальному интерфейсу с командами управления приложением; SpaceXAI также сообщает о росте конверсии продаж и доли самостоятельно закрытых обращений в A/B-тесте телефонной службы Starlink. Эти показатели пока приведены без подробного дизайна эксперимента.
С 5 августа алиас grok-voice-latest автоматически переключится с Think Fast 1.0 на 2.0. Промпты, по заявлению компании, менять не потребуется, но командам с жестко валидированным поведением стоит закрепить идентификатор версии 1.0 или заранее провести регрессионные тесты. Более короткие фразы, новая логика вопросов и изменившееся время вызова инструментов могут повлиять на сценарии разговора даже при совместимом API.
Задержка менее секунды и параллельный запуск инструментов делают голосового агента ближе к естественному собеседнику и сокращают время выполнения телефонных операций. Для контакт-центров важны также цена и заявленная устойчивость к шуму, но качество на собственных языках, линиях связи и бизнес-сценариях необходимо проверять отдельно до автоматического перехода на новую версию.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.