AI Radar
Google представила Gemini 3.5 Transcribe — модель для голосового ввода, которая не только распознаёт речь, но и сразу превращает её в отредактированный текст. Она уже работает на Pixel 11 и в приложении Gemini для macOS, а разработчикам доступна через Gemini API и инструменты Google.
В отличие от обычного speech-to-text, Gemini 3.5 Transcribe пытается восстановить не буквальную последовательность звуков, а законченную формулировку. Модель убирает слова-паразиты и паузы вроде «эм», учитывает исправления, сделанные говорящим по ходу фразы, и может обращаться к пользовательскому словарю для корректной записи профессиональной терминологии. Такой подход делает голосовой ввод ближе к черновому редактору: на выходе пользователь получает уже очищенный текст, а не дословную стенограмму.
По данным Google, путь от произнесённой фразы до итогового текста стал примерно на 70% быстрее по сравнению с прежним движком Chirp 3. Частота ошибок при распознавании живой речи снизилась с 7,32% до 5,5%. Разница в точности выглядит умеренной, однако при голосовом наборе даже небольшое сокращение числа опечаток важно: исправлять их без клавиатуры заметно сложнее, чем в обычном текстовом редакторе.
Модель поддерживает 85 языков. Для заранее записанного аудио она способна обрабатывать разговор с участием до трёх человек, что расширяет сценарии от диктовки до расшифровки небольших интервью и встреч. При этом «очистка» речи остаётся содержательным преобразованием: Gemini может изменить исходную формулировку, чтобы передать предполагаемый смысл. Поэтому результат не стоит считать дословной записью там, где принципиальны точные цитаты, юридические формулировки или каждое произнесённое слово.
Первым массовым воплощением технологии стала функция Rambler в Gboard, пока ограниченная смартфонами Pixel 11. Google обещает распространить её на другие устройства с Gemini Intelligence позднее в этом году. С 26 августа новый движок также используется для голосового ввода в приложении Gemini на macOS, а в дальнейшем должен появиться в Chrome и позволить диктовать текст в любое поле на веб-странице.
Разработчики уже могут обращаться к Gemini 3.5 Transcribe через Gemini API. Модель также добавлена в Antigravity, где с разрешения пользователя ей доступны контекст экрана и история чата, и в среду создания приложений AI Studio. Таким образом, Google позиционирует транскрибацию не только как клавиатурную функцию, но и как общий голосовой интерфейс для программирования, работы с агентами и взаимодействия с веб-приложениями.
Модель сокращает промежуток между диктовкой и готовым текстом, что полезно для мобильной работы, программирования голосом и приложений без клавиатурного интерфейса. Но автоматическая редактура меняет сам смысл транскрибации: для протоколов, исследований и юридически значимых записей потребуется отдельный дословный режим или обязательная сверка с аудио.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.