DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarAugust 27, 2026

    AI Radar

    Gemini 3.5 Transcribe превращает голосовой ввод в отредактированный текст

    Google представила Gemini 3.5 Transcribe — модель для голосового ввода, которая не только распознаёт речь, но и сразу превращает её в отредактированный текст. Она уже работает на Pixel 11 и в приложении Gemini для macOS, а разработчикам доступна через Gemini API и инструменты Google.

    August 27, 2026·3 min read·Источник: Ars Technica
    00

    Что изменилось

    В отличие от обычного speech-to-text, Gemini 3.5 Transcribe пытается восстановить не буквальную последовательность звуков, а законченную формулировку. Модель убирает слова-паразиты и паузы вроде «эм», учитывает исправления, сделанные говорящим по ходу фразы, и может обращаться к пользовательскому словарю для корректной записи профессиональной терминологии. Такой подход делает голосовой ввод ближе к черновому редактору: на выходе пользователь получает уже очищенный текст, а не дословную стенограмму.

    По данным Google, путь от произнесённой фразы до итогового текста стал примерно на 70% быстрее по сравнению с прежним движком Chirp 3. Частота ошибок при распознавании живой речи снизилась с 7,32% до 5,5%. Разница в точности выглядит умеренной, однако при голосовом наборе даже небольшое сокращение числа опечаток важно: исправлять их без клавиатуры заметно сложнее, чем в обычном текстовом редакторе.

    Модель поддерживает 85 языков. Для заранее записанного аудио она способна обрабатывать разговор с участием до трёх человек, что расширяет сценарии от диктовки до расшифровки небольших интервью и встреч. При этом «очистка» речи остаётся содержательным преобразованием: Gemini может изменить исходную формулировку, чтобы передать предполагаемый смысл. Поэтому результат не стоит считать дословной записью там, где принципиальны точные цитаты, юридические формулировки или каждое произнесённое слово.

    Первым массовым воплощением технологии стала функция Rambler в Gboard, пока ограниченная смартфонами Pixel 11. Google обещает распространить её на другие устройства с Gemini Intelligence позднее в этом году. С 26 августа новый движок также используется для голосового ввода в приложении Gemini на macOS, а в дальнейшем должен появиться в Chrome и позволить диктовать текст в любое поле на веб-странице.

    Разработчики уже могут обращаться к Gemini 3.5 Transcribe через Gemini API. Модель также добавлена в Antigravity, где с разрешения пользователя ей доступны контекст экрана и история чата, и в среду создания приложений AI Studio. Таким образом, Google позиционирует транскрибацию не только как клавиатурную функцию, но и как общий голосовой интерфейс для программирования, работы с агентами и взаимодействия с веб-приложениями.

    Почему это важно

    Модель сокращает промежуток между диктовкой и готовым текстом, что полезно для мобильной работы, программирования голосом и приложений без клавиатурного интерфейса. Но автоматическая редактура меняет сам смысл транскрибации: для протоколов, исследований и юридически значимых записей потребуется отдельный дословный режим или обязательная сверка с аудио.

    Primary and supporting sources

    • Google announces Gemini 3.5 Transcribe for AI-powered speech-to-textOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    August 27, 2026
    1. 01Nvidia договорилась купить Hugging Face за $12,9 млрд
    2. 02Z.ai открыла GLM-5.3-Flash с мультимодальностью и контекстом в миллион токенов
    3. 03Tencent открыла мультимодальные эмбеддинги WeMM для поиска и рекомендаций
    4. 04Nvidia и крупнейшие инвестфонды хотят превратить AI-вычисления в класс активов
    Back to AI Radar