AI Radar
OpenAI представила две API-модели распознавания речи: GPT Transcribe ускоренно обрабатывает готовые аудиофайлы, а GPT Live Transcribe рассчитана на потоковый звук с малой задержкой. Обе поддерживают несколько языков, текстовый контекст и подсказки ключевыми словами.
GPT Transcribe обрабатывает аудио примерно в 34 раза быстрее его реальной длительности, что подходит для архивов звонков, интервью и пакетной индексации записей. GPT Live Transcribe предназначена для субтитров, голосовых интерфейсов и других сценариев, где текст должен появляться во время разговора. Стоимость заявлена на уровне $0,0045 за минуту для файловой модели и $0,017 за минуту для потоковой.
На тесте Artificial Analysis AA-WER файловая GPT Transcribe получила WER 3,3% — на 0,7 процентного пункта лучше GPT-4o Transcribe. WER показывает долю замененных, пропущенных и лишних слов, поэтому меньшее значение лучше. При этом модель OpenAI не стала лидером приведенного рейтинга: Fun-Realtime-ASR-Preview от Alibaba показала 1,7%, ElevenLabs Scribe v2 — 2,2%, MAI-Transcribe-1.5 — 2,4%, а Mistral Voxtral Small и Gemini 3.1 Pro — по 2,8%.
Контекст и ключевые слова могут помочь с именами, профессиональными терминами и тематической лексикой, но единый результат бенчмарка не гарантирует такого же качества на конкретных языках, акцентах и шумных записях. Поскольку сведения о релизе представлены одним вторичным источником, перед миграцией стоит проверить документацию API, фактическую задержку Live Transcribe и качество на собственном наборе аудио.
Файловая и потоковая модели закрывают разные архитектуры продукта, не заставляя разработчиков приспосабливать один режим ко всем сценариям. Снижение ошибки относительно предшественницы полезно, но выбор ASR-сервиса по-прежнему требует тестов на целевых языках и расчета полной стоимости при реальной нагрузке.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.