DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesPrivacyTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarJuly 30, 2026

    AI Radar

    OpenAI выпустила GPT Transcribe для файлов и потоковой расшифровки

    OpenAI представила две API-модели распознавания речи: GPT Transcribe ускоренно обрабатывает готовые аудиофайлы, а GPT Live Transcribe рассчитана на потоковый звук с малой задержкой. Обе поддерживают несколько языков, текстовый контекст и подсказки ключевыми словами.

    July 30, 2026·2 min read·Источник: AI, Machine Learning, Big Data
    02

    Что изменилось

    GPT Transcribe обрабатывает аудио примерно в 34 раза быстрее его реальной длительности, что подходит для архивов звонков, интервью и пакетной индексации записей. GPT Live Transcribe предназначена для субтитров, голосовых интерфейсов и других сценариев, где текст должен появляться во время разговора. Стоимость заявлена на уровне $0,0045 за минуту для файловой модели и $0,017 за минуту для потоковой.

    На тесте Artificial Analysis AA-WER файловая GPT Transcribe получила WER 3,3% — на 0,7 процентного пункта лучше GPT-4o Transcribe. WER показывает долю замененных, пропущенных и лишних слов, поэтому меньшее значение лучше. При этом модель OpenAI не стала лидером приведенного рейтинга: Fun-Realtime-ASR-Preview от Alibaba показала 1,7%, ElevenLabs Scribe v2 — 2,2%, MAI-Transcribe-1.5 — 2,4%, а Mistral Voxtral Small и Gemini 3.1 Pro — по 2,8%.

    Контекст и ключевые слова могут помочь с именами, профессиональными терминами и тематической лексикой, но единый результат бенчмарка не гарантирует такого же качества на конкретных языках, акцентах и шумных записях. Поскольку сведения о релизе представлены одним вторичным источником, перед миграцией стоит проверить документацию API, фактическую задержку Live Transcribe и качество на собственном наборе аудио.

    Почему это важно

    Файловая и потоковая модели закрывают разные архитектуры продукта, не заставляя разработчиков приспосабливать один режим ко всем сценариям. Снижение ошибки относительно предшественницы полезно, но выбор ASR-сервиса по-прежнему требует тестов на целевых языках и расчета полной стоимости при реальной нагрузке.

    Primary and supporting sources

    Telegram

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    July 30, 2026
    1. 01GPT‑5.6 Sol сократила стоимость инференса на 20%, а новый harness утроил результат на ARC‑AGI‑3
    2. 02Gemini Robotics 2 научилась управлять всем телом робота и координировать несколько машин
    3. 03Dream‑Cubed генерирует редактируемые Minecraft-миры с точностью до отдельного блока
    4. 04Grok Voice Think Fast 2.0 отвечает голосом за 0,7 секунды и запускает инструменты во время речи
    Back to AI Radar